Radar do FAROL35 notas

sábado, 30 de maio de 2026

Modelos

Google libera Deep Research e Deep Research Max em preview na API Gemini

Construidos sobre Gemini 3.1 Pro, os dois novos agentes de pesquisa autonoma trazem suporte a MCP, visualizacoes nativas e qualidade analitica para workflows enterprise em finance, life sciences e market research. Transforma o Deep Research de motor de sumarizacao em base para fluxos longos com fontes customizadas — concorrencia direta a Claude Skills + Files API e ao Researcher do M365 Copilot.

Modelos · blog.google · google, gemini, deep-research, mcp, agentes, enterprise

SubQ — primeiro LLM frontier com arquitetura subquadratica e 12M de contexto

Startup Subquadratic saiu do stealth no inicio de maio com $29M de seed lancando SubQ, LLM construido sobre Subquadratic Sparse Attention (SSA) — mecanismo de atencao esparsa content-dependent que escala linearmente. Janela nativa de 12M tokens, custo ~1/5 dos frontiers em long context, atencao ate 52x mais rapida em escala. Inclui SubQ Code para carregar codebases inteiros em uma unica chamada.

Modelos · subq.ai · subq, subquadratic, long-context, arquitetura, frontier

DeepSeek-V4-Pro vira modelo aberto mais baixado de maio na HuggingFace

Nova geracao do flagship da DeepSeek (V4-Pro) com quantizacao FP8 nativa, ja com 5,9M de downloads e 4,4k likes na HuggingFace. Consolida a DeepSeek como referencia de modelo aberto de fronteira capaz de rivalizar com fechados em raciocinio e codigo. vLLM 0.21 ja estabilizou o V4 em Blackwell com backend TOKENSPEED_MLA respeitando reasoning budgets.

Modelos · huggingface · deepseek, open-source, huggingface, fp8, frontier-aberto

Qwen3.6-27B vira cavalo-de-trabalho open-source multimodal

Geracao 3.6 da familia Qwen (lancada em abril/2026), agora multimodal (image-text-to-text), com 5M de downloads. Base que esta gerando variantes (GGUF, MTP, fine-tunes uncensored). Vira o "cavalo de trabalho" open-source do momento para agentes e VLMs, especialmente em mercados nao-americanos.

Modelos · huggingface · qwen, alibaba, multimodal, huggingface, open-source

Gemini 3 Deep Think recebe atualizacao focada em ciencia e engenharia

Google empurrou um update grande do modo Deep Think do Gemini 3, desenvolvido em parceria com pesquisadores para problemas duros de ciencia e engenharia. Disponivel imediatamente para assinantes do Google AI Ultra dentro do app Gemini. Movimento paralelo ao lancamento do Deep Research e Deep Research Max na API — Gemini 3 vira a familia "raciocinio + agentes" do Google.

Modelos · blog.google · google, gemini-3, deep-think, ciencia, engenharia, raciocinio

Liquid AI lanca LFM2.5-8B-A1B — MoE 8B com 1B ativo para edge

MoE de 8B com apenas 1B ativo da Liquid AI (maio/2026), pensado para edge. Multilingue, com versao GGUF ja entre os trending. Um dos exemplos mais maduros da arquitetura LFM (nao-Transformer) chegando ao mainstream — ao lado de SubQ subquadratic e Sapient HRM, parte do movimento de pos-Transformer em producao.

Modelos · huggingface · liquid-ai, lfm, moe, edge, on-device, arquitetura-nova

StepFun libera Step-3.7-Flash: VLM MoE de 198B com 11B ativos, 256k contexto e 3 niveis de raciocinio

StepFun lancou Step-3.7-Flash, VLM MoE de 198B parametros com ~11B ativos por token, vision encoder 1.8B nativo, 256k contexto e tres niveis selecionaveis de raciocinio (low/medium/high). Foco em agentes que combinam percepcao + busca + raciocinio. Em ClawEval-1.1: 67,07% vs DeepSeek V4 Flash 57,80% e V4 Pro 59,80%. Disponivel em HF, OpenRouter e NVIDIA Build.

Modelos · huggingface.co · stepfun, step-3-7-flash, moe, vision-language, 198b, agentic

OpenAI expande GPT-Rosalind via programa Rosalind Biodefense para devs verificados e governo dos EUA

Em 29/mai, OpenAI anunciou expansao do acesso ao GPT-Rosalind (modelo especializado em bio/life sciences) via novo programa Rosalind Biodefense — voltado para devs vetados e parceiros do governo americano em biodefesa, saude publica e preparacao para pandemias. No mesmo dia, OpenAI publicou playbook para avaliacoes de terceiros confiaveis dentro do Frontier Governance Framework.

Modelos · openai.com · openai, rosalind, biodefense, frontier-governance, biotech, gpt-rosalind

Sapient HRM-Text-1B — Hierarchical Reasoning Model textual trending na HF

Implementacao textual do Hierarchical Reasoning Model da Sapient (maio/2026) — arquitetura alternativa a Transformers focada em raciocinio em multiplos niveis. 138k downloads em poucas semanas. Sinal de apetite real por experimentos fora do paradigma autoregressivo padrao.

Modelos · huggingface · sapient, hrm, hierarchical-reasoning, arquitetura-nova, pos-transformer

Ferramentas e código

Microsoft 365 Copilot Researcher orquestra GPT + Claude em pipeline

O agente Researcher do M365 Copilot agora gera respostas com GPT da OpenAI e usa Claude da Anthropic para revisar acuracia, completude e citacoes antes de finalizar. Marca o fim oficial da era single-model em enterprise AI dentro da Microsoft. Pipeline gerador + verificador entre frontier labs concorrentes vira pattern de producao mainstream.

Ferramentas e código · microsoft.com · microsoft, copilot, m365, claude, openai, multi-model

Ollama 0.24 ganha suporte ao Codex app da OpenAI e MTP speculative decoding para Gemma 4

Ollama saltou de 0.23 para 0.24 em 11 dias adicionando suporte ao Codex desktop app (basta "ollama launch codex-app"), bypass de configuracoes manuais e MTP speculative decoding via MLX para Gemma 4 31B com ganho >2x em coding. Cache de /api/show melhorou latencia mediana ~6.7x, deixando integracoes como VS Code dramaticamente mais rapidas.

Ferramentas e código · x.com/ollama · ollama, codex, openai, gemma, mtp, speculative-decoding

OpenAI lanca experiencia de Personal Finance no ChatGPT

A OpenAI ativou o feature Finances no ChatGPT (web e iOS) em 29/05. Rastreia gastos, contas, assinaturas, investimentos, patrimonio e metas. Aproveita o raciocinio do GPT-5.5 para perguntas financeiras complexas. Primeiro passo serio da OpenAI em productivity vertical — modelo de produto se aproxima do que o Copilot faz para trabalho, agora para vida pessoal.

Ferramentas e código · openai.com · openai, chatgpt, finance, vertical, produto-consumidor

xAI lanca Custom Skills e novos conectores para Grok (incluindo MCP server proprio)

Custom Skills permite criar tarefas reutilizaveis e personalizaveis em segundos. Grok ganhou conectores para SharePoint, Outlook, OneDrive, Google Workspace, Notion, GitHub e Linear, alem de suporte a MCP server proprio. Movimento para fechar a lacuna agentic contra Claude e ChatGPT — expansao a partir dos conectores anunciados em 25/05 (Vercel, Canva, Gamma, S&P Global).

Ferramentas e código · x.ai · xai, grok, custom-skills, mcp, agentes

Entusiasta roda Kimi K2.5 (1 trilhao de parametros) com 768GB de Optane DIMM + 1 RTX 3060 a 4 tok/s

Usuario chamado APFrisco no Reddit mostrou setup de ~US$ 1.900-2.500 rodando Kimi K2.5 (MoE 1T de parametros, Moonshot AI) localmente a ~4 tok/s. Hardware: Xeon Gold 6246, RTX 3060 12GB, 192GB DDR4 ECC, 6x128GB Intel Optane DCPMM no modo Memory. Latencia 2-3x pior que DRAM mas muito melhor que NVMe — abre caminho serio para LLMs de trilhao em servidor caseiro.

Ferramentas e código · tomshardware.com · optane, kimi-k2-5, local-llm, moonshot, persistent-memory, low-cost

Audit viral: 76% das tool calls de agentes nao tem guards (16 repos)

Show HN escaneou 16 repositorios de AI agents e encontrou que 76% das tool calls nao tem guards (validacao de input/output, rate limiting, sandboxing). Alimenta debate atual sobre seguranca de agentes — especialmente relevante apos CVE-2026-39987 no Marimo, onde atacante usou LLM agent para post-exploitation e exfiltrou credenciais AWS.

Ferramentas e código · news.ycombinator.com · agent-security, tool-calls, guards, show-hn, sandboxing, ai-security

Anthropic prepara AI Fluency Scorecard pessoal dentro do Claude

Anthropic esta testando uma tela dentro do Claude (Settings) onde o usuario pode rodar um scan retroativo das proprias conversas em Chat, Cowork e Claude Code e receber um scorecard pessoal de IA fluency. Baseado no paper AI Fluency Index (11 comportamentos observaveis, estudo de 9.830 conversas no Claude.ai). Sem data de rollout ampla.

Ferramentas e código · testingcatalog.com · anthropic, claude, ai-fluency, ux, settings, metricas-uso

llama.cpp e vLLM 0.21 mergeiam MTP speculative decoding

Mes pesado para runtimes locais. llama.cpp mergeou Multi-Token Prediction speculative decoding (modo "draft-mtp"). vLLM 0.21 estabilizou DeepSeek V4 em Blackwell com novo backend TOKENSPEED_MLA respeitando reasoning budgets. Caveat reportado: llama.cpp crasha apos ~20min servindo com MTP; vLLM rodou 24/7 estavel. Recomendacao da comunidade: vLLM para producao, llama.cpp para single-user com 2x+ throughput.

Ferramentas e código · onebonsai.com · llama-cpp, vllm, mtp, speculative-decoding, deepseek, blackwell

Show HN: Thaw — fork primitive para vLLM que pula prefill em forks de agentes

Thaw (Apache-2.0, PyPI) tira snapshot de uma sessao vLLM em execucao e gera N filhos divergentes que pulam prefill — pensado para tool-call fan-out, best-of-N codegen, tree-of-thought e MCTS sobre agentes. 0,88s por fork round em H100 com modelo 8B. Versao hosted ForkPool API tambem ja disponivel (fork.thaw.sh). Show HN ativo nesta noite.

Ferramentas e código · github.com · vllm, thaw, agentes, fork, tree-of-thought, mcts

NousResearch publica Hermes-Agent — agente open-source com 173k estrelas "que cresce com voce

NousResearch publicou Hermes-Agent: agente open-source posicionado como "agente que cresce com voce" — memoria persistente, skills auto-acumulativas. Foi atualizado hoje (22:41 UTC) e ja entrou no top trending GitHub com 173.684 estrelas. Concorrente direto de OpenHands e Dify para casos de "daily driver" pessoal.

Ferramentas e código · github.com · nousresearch, hermes, agente, open-source, memoria-persistente, trending

Statewright (Show HN) — state machines visuais para agentes confiaveis

Show HN de Ben Cochran (20+ anos full-stack, ex-NVIDIA/AMD) propoe state machines visuais como camada de confiabilidade para agentes de IA. Insere-se em discussao maior do HN de que o gargalo em 2026 deixou de ser geracao de codigo e virou capacidade de verificacao — desenvolvedores que extraem valor estao orquestrando multiplos workflows bounded ao inves de delegar tarefas grandes.

Ferramentas e código · news.ycombinator.com · statewright, state-machines, agentes, confiabilidade, show-hn

Datasette 1.0a31 traz write queries e stored queries

Simon Willison publicou em 29/05 o release alpha 1.0a31 do Datasette com duas funcionalidades headline: execucao de write queries (INSERT/UPDATE/DELETE) e suporte a stored queries reutilizaveis. A nova interface oferece templates para usuarios com permissao de edicao, pavimentando caminho para o 1.0 final.

Ferramentas e código · simonwillison.net · datasette, simon-willison, sqlite, dados

Arch-Decision: ferramenta de arquitetura multi-agente para Claude Code

Show HN (22:45 UTC) lancou Arch-Decision: ferramenta multi-agente que opera dentro do Claude Code para acelerar o processo de Architecture Decision Records — varios agentes especializados debatem opcoes, registram trade-offs, e geram ADRs. Mostra padrao crescente de tooling vertical em cima do Claude Code Skills.

Ferramentas e código · github.com · claude-code, arquitetura, multi-agente, show-hn, decision-records

Pesquisa

Paper LeJEPA — quando alinhamento + Gaussiana recuperam world models linearmente

Paper de 25/05 de LeCun, Balestriero e Klindt prova formalmente as condicoes sob as quais LeJEPA (alignment + regularizacao Gaussiana) recupera linearmente as variaveis latentes do mundo a partir de observacoes nao-lineares. Resultado principal: a Gaussiana e a unica distribuicao latente para a qual essa garantia de linear identifiability vale em mundos com latentes evoluindo sob transicoes estacionarias com ruido aditivo. Base teorica para a aposta de LeCun em world models.

Pesquisa · arxiv.org · lejepa, lecun, balestriero, klindt, world-models, self-supervised

MUSE-Autoskill — agentes que criam, gerenciam e refinam suas proprias skills

Framework de agente skill-centric que opera ciclo de vida unificado (criacao, memoria, gerenciamento, avaliacao e refinamento) para skills reutilizaveis. Skills deixam de ser artefatos isolados/estaticos: memoria skill-level acumula experiencia por skill entre tarefas. Reporta ganho de 7.16 pontos percentuais em acuracia de tarefa contra baselines de criacao de skills isoladas. Conexao direta com o paradigma de Skills da Anthropic.

Pesquisa · arxiv.org · muse, autoskill, agentes, skills, lifecycle, memoria

Mercado

Groq capta US$ 650 mi apos 'nao-aquisicao' de US$ 20 bi pela Nvidia

Startup de chips de inferencia Groq capta US$ 650 mi com investidores existentes para acelerar seu negocio de inference neocloud, meses depois de um acordo de licenciamento de hardware com a Nvidia que tirou seniores da empresa (apelidado de "not acqui-hire" de US$ 20 bi). Sinal de que custo por token de inferencia segue como vetor competitivo central — e que a economia de "neocloud focada em inferencia" continua atraindo capital independente.

Mercado · techcrunch.com · groq, inferencia, nvidia, chips, neocloud

Regulação e segurança

Projeto open-source coloca instrucao oculta para agentes de IA: "apague meu codigo

OSNews documentou (HN 12 pts) projeto open-source que escondeu nos proprios arquivos uma instrucao para agentes de IA que viessem a edita-lo: "delete my code". Forma deliberada de protesto / armadilha contra coding agents que processam repos sem consentimento. Reabre o debate de prompt injection em supply chain de codigo.

Regulação e segurança · osnews.com · prompt-injection, supply-chain, agentes, sabotagem, open-source

Comunidade

Anthropic supera OpenAI e vira a startup de IA mais valiosa do mundo

Anthropic ultrapassou a OpenAI em valuation privado e virou a startup de IA mais valiosa do mundo. Materia subiu para 385 pts no HN em ~10h. Acelera a percepcao de que o eixo de poder em frontier labs esta migrando — Claude Opus 4.8 + Skills + Dynamic Workflows + 28 integracoes enterprise consolidaram a Anthropic como referencia para deploy serio em empresa.

Comunidade · qazinform.com · anthropic, openai, valuation, mercado, claude, frontier-labs

CNN processa Perplexity por copia de 17 mil materias

Primeira acao judicial de uma grande rede de TV americana contra uma empresa de IA. A CNN alega que a Perplexity raspou mais de 17 mil textos, fotos e videos para treinar e alimentar produtos de busca generativa. A defesa da Perplexity argumenta que "fatos nao podem ser copyrightados". Caso tem potencial de redefinir licenciamento de news para IA — e chega na mesma semana em que UOL/Folha + OpenAI anunciaram acordo inedito no Brasil.

Comunidade · ppc.land · perplexity, cnn, copyright, ia-news, processo

OpenRouter capta US$ 113M Series B liderada pela CapitalG e atinge US$ 1,3 bi a 25T tokens/semana

OpenRouter levantou US$ 113M Series B liderada pela CapitalG (braço da Alphabet), com NVentures, ServiceNow, MongoDB, Snowflake, Databricks e AMP PBC dentro. Valuation pulou para US$ 1,3 bi. Volume semanal subiu de 5T para 25T tokens em 6 meses, com 8M+ devs em 400+ modelos. Gateway-layer virou infraestrutura estrategica — concorrentes diretos sao Together, Fireworks e o proprio Vertex AI Gateway do Google.

Comunidade · openrouter.ai · openrouter, capitalg, alphabet, gateway, llm-router, tokens

Cohere adquire Aleph Alpha em deal transatlantico de ~US$ 20 bi

A Cohere comprou a alema Aleph Alpha formando uma empresa de IA transatlantica avaliada em ~US$ 20 bi, com lastro do Schwarz Group e dos governos do Canada e da Alemanha. Une expertise europeia em small language models com o foco enterprise large-model da Cohere. Resposta da Europa aos hyperscalers americanos e movimento de consolidacao de fronteira nao-frontier (camada enterprise/sovereign).

Comunidade · llm-stats.com · cohere, aleph-alpha, enterprise-ai, europa, ma

EY Canada retira relatorio de ciberseguranca apos GPTZero encontrar 16 de 27 citacoes alucinadas

GPTZero auditou relatorio da EY Canada "Points of Attack: Uncovering Cyber Threats and Fraud in Loyalty Systems" e identificou 16 de 27 fontes fabricadas, mal atribuidas ou com links quebrados. Quase todas as URLs da tabela de referencias estavam quebradas. EY retirou o relatorio e abriu revisao interna. Topico foi top do HN nesta tarde e gerou onda de discussao sobre governanca de IA em Big Four.

Comunidade · news.ycombinator.com · ey, ernst-young, alucinacao, big-four, governanca-ia, gptzero

Empresa misteriosa gastou US$ 500 mi em Claude AI num unico mes por nao limitar licencas

Reportagem da Axios (replicada em Tom's Hardware, Fortune via Boing Boing) afirma que uma empresa nao-nomeada estourou US$ 500 mi em Claude num mes apos esquecer de configurar limite de uso nas licencas dos funcionarios. Boatos no X apontam Amazon, onde funcionarios estariam inflando tokens para bater metas internas — pratica apelidada de tokenmaxxing. Em paralelo, Microsoft cancelou maior parte das licencas internas de Claude Code — primeiro recuo enterprise visivel de 2026.

Comunidade · tomshardware.com · finops, claude, enterprise, custos, tokenmaxxing, governanca

Fortunas dos sete cofundadores da Anthropic mais que dobram para US$ 16,6 bi cada

Apos o salto de valuation da Anthropic (que ultrapassou OpenAI), a Forbes recalculou que os 7 cofundadores agora valem US$ 16,6 bi cada. Reforca o ponto da virada de poder entre frontier labs.

Comunidade · forbes.com · anthropic, cofundadores, valuation, dario-amodei, daniela-amodei

Starbucks abandona ferramenta de IA para contagem de inventario apos 9 meses (caso NomadGo)

Starbucks aposentou esta semana o agente de contagem automatica de inventario desenvolvido pela NomadGo (sensor LiDAR + camera de tablet) apos 9 meses em operacao na America do Norte. Baristas reportavam erros frequentes de contagem e confusao entre itens parecidos. Volta pro metodo manual. Caso vira referencia em discussoes de deploy de IA em varejo.

Comunidade · fortune.com · starbucks, nomadgo, computer-vision, deploy-fail, varejo, lidar

Accenture adquire Ookla para puxar dados de rede para enterprise CX com IA

Accenture comprou a Ookla (Speedtest, Downdetector, Ekahau, RootMetrics) para puxar telemetria de rede para dentro de Communications Service Providers e hyperscalers — otimizando Wi-Fi e 5G como spine para operacoes movidas a IA. Plataforma processa 250 milhoes de testes/mes, 1.000+ atributos por teste.

Comunidade · newsroom.accenture.com · accenture, ookla, speedtest, downdetector, ekahau, network-intelligence