Construidos sobre Gemini 3.1 Pro, os dois novos agentes de pesquisa autonoma trazem suporte a MCP, visualizacoes nativas e qualidade analitica para workflows enterprise em finance, life sciences e market research. Transforma o Deep Research de motor de sumarizacao em base para fluxos longos com fontes customizadas — concorrencia direta a Claude Skills + Files API e ao Researcher do M365 Copilot.
Startup Subquadratic saiu do stealth no inicio de maio com $29M de seed lancando SubQ, LLM construido sobre Subquadratic Sparse Attention (SSA) — mecanismo de atencao esparsa content-dependent que escala linearmente. Janela nativa de 12M tokens, custo ~1/5 dos frontiers em long context, atencao ate 52x mais rapida em escala. Inclui SubQ Code para carregar codebases inteiros em uma unica chamada.
Nova geracao do flagship da DeepSeek (V4-Pro) com quantizacao FP8 nativa, ja com 5,9M de downloads e 4,4k likes na HuggingFace. Consolida a DeepSeek como referencia de modelo aberto de fronteira capaz de rivalizar com fechados em raciocinio e codigo. vLLM 0.21 ja estabilizou o V4 em Blackwell com backend TOKENSPEED_MLA respeitando reasoning budgets.
Geracao 3.6 da familia Qwen (lancada em abril/2026), agora multimodal (image-text-to-text), com 5M de downloads. Base que esta gerando variantes (GGUF, MTP, fine-tunes uncensored). Vira o "cavalo de trabalho" open-source do momento para agentes e VLMs, especialmente em mercados nao-americanos.
Google empurrou um update grande do modo Deep Think do Gemini 3, desenvolvido em parceria com pesquisadores para problemas duros de ciencia e engenharia. Disponivel imediatamente para assinantes do Google AI Ultra dentro do app Gemini. Movimento paralelo ao lancamento do Deep Research e Deep Research Max na API — Gemini 3 vira a familia "raciocinio + agentes" do Google.
MoE de 8B com apenas 1B ativo da Liquid AI (maio/2026), pensado para edge. Multilingue, com versao GGUF ja entre os trending. Um dos exemplos mais maduros da arquitetura LFM (nao-Transformer) chegando ao mainstream — ao lado de SubQ subquadratic e Sapient HRM, parte do movimento de pos-Transformer em producao.
StepFun lancou Step-3.7-Flash, VLM MoE de 198B parametros com ~11B ativos por token, vision encoder 1.8B nativo, 256k contexto e tres niveis selecionaveis de raciocinio (low/medium/high). Foco em agentes que combinam percepcao + busca + raciocinio. Em ClawEval-1.1: 67,07% vs DeepSeek V4 Flash 57,80% e V4 Pro 59,80%. Disponivel em HF, OpenRouter e NVIDIA Build.
Em 29/mai, OpenAI anunciou expansao do acesso ao GPT-Rosalind (modelo especializado em bio/life sciences) via novo programa Rosalind Biodefense — voltado para devs vetados e parceiros do governo americano em biodefesa, saude publica e preparacao para pandemias. No mesmo dia, OpenAI publicou playbook para avaliacoes de terceiros confiaveis dentro do Frontier Governance Framework.
Implementacao textual do Hierarchical Reasoning Model da Sapient (maio/2026) — arquitetura alternativa a Transformers focada em raciocinio em multiplos niveis. 138k downloads em poucas semanas. Sinal de apetite real por experimentos fora do paradigma autoregressivo padrao.
O agente Researcher do M365 Copilot agora gera respostas com GPT da OpenAI e usa Claude da Anthropic para revisar acuracia, completude e citacoes antes de finalizar. Marca o fim oficial da era single-model em enterprise AI dentro da Microsoft. Pipeline gerador + verificador entre frontier labs concorrentes vira pattern de producao mainstream.
Ollama saltou de 0.23 para 0.24 em 11 dias adicionando suporte ao Codex desktop app (basta "ollama launch codex-app"), bypass de configuracoes manuais e MTP speculative decoding via MLX para Gemma 4 31B com ganho >2x em coding. Cache de /api/show melhorou latencia mediana ~6.7x, deixando integracoes como VS Code dramaticamente mais rapidas.
A OpenAI ativou o feature Finances no ChatGPT (web e iOS) em 29/05. Rastreia gastos, contas, assinaturas, investimentos, patrimonio e metas. Aproveita o raciocinio do GPT-5.5 para perguntas financeiras complexas. Primeiro passo serio da OpenAI em productivity vertical — modelo de produto se aproxima do que o Copilot faz para trabalho, agora para vida pessoal.
Custom Skills permite criar tarefas reutilizaveis e personalizaveis em segundos. Grok ganhou conectores para SharePoint, Outlook, OneDrive, Google Workspace, Notion, GitHub e Linear, alem de suporte a MCP server proprio. Movimento para fechar a lacuna agentic contra Claude e ChatGPT — expansao a partir dos conectores anunciados em 25/05 (Vercel, Canva, Gamma, S&P Global).
Usuario chamado APFrisco no Reddit mostrou setup de ~US$ 1.900-2.500 rodando Kimi K2.5 (MoE 1T de parametros, Moonshot AI) localmente a ~4 tok/s. Hardware: Xeon Gold 6246, RTX 3060 12GB, 192GB DDR4 ECC, 6x128GB Intel Optane DCPMM no modo Memory. Latencia 2-3x pior que DRAM mas muito melhor que NVMe — abre caminho serio para LLMs de trilhao em servidor caseiro.
Show HN escaneou 16 repositorios de AI agents e encontrou que 76% das tool calls nao tem guards (validacao de input/output, rate limiting, sandboxing). Alimenta debate atual sobre seguranca de agentes — especialmente relevante apos CVE-2026-39987 no Marimo, onde atacante usou LLM agent para post-exploitation e exfiltrou credenciais AWS.
Anthropic esta testando uma tela dentro do Claude (Settings) onde o usuario pode rodar um scan retroativo das proprias conversas em Chat, Cowork e Claude Code e receber um scorecard pessoal de IA fluency. Baseado no paper AI Fluency Index (11 comportamentos observaveis, estudo de 9.830 conversas no Claude.ai). Sem data de rollout ampla.
Thaw (Apache-2.0, PyPI) tira snapshot de uma sessao vLLM em execucao e gera N filhos divergentes que pulam prefill — pensado para tool-call fan-out, best-of-N codegen, tree-of-thought e MCTS sobre agentes. 0,88s por fork round em H100 com modelo 8B. Versao hosted ForkPool API tambem ja disponivel (fork.thaw.sh). Show HN ativo nesta noite.
NousResearch publicou Hermes-Agent: agente open-source posicionado como "agente que cresce com voce" — memoria persistente, skills auto-acumulativas. Foi atualizado hoje (22:41 UTC) e ja entrou no top trending GitHub com 173.684 estrelas. Concorrente direto de OpenHands e Dify para casos de "daily driver" pessoal.
Show HN de Ben Cochran (20+ anos full-stack, ex-NVIDIA/AMD) propoe state machines visuais como camada de confiabilidade para agentes de IA. Insere-se em discussao maior do HN de que o gargalo em 2026 deixou de ser geracao de codigo e virou capacidade de verificacao — desenvolvedores que extraem valor estao orquestrando multiplos workflows bounded ao inves de delegar tarefas grandes.
Simon Willison publicou em 29/05 o release alpha 1.0a31 do Datasette com duas funcionalidades headline: execucao de write queries (INSERT/UPDATE/DELETE) e suporte a stored queries reutilizaveis. A nova interface oferece templates para usuarios com permissao de edicao, pavimentando caminho para o 1.0 final.
Ferramentas e código · simonwillison.net · datasette, simon-willison, sqlite, dados
Show HN (22:45 UTC) lancou Arch-Decision: ferramenta multi-agente que opera dentro do Claude Code para acelerar o processo de Architecture Decision Records — varios agentes especializados debatem opcoes, registram trade-offs, e geram ADRs. Mostra padrao crescente de tooling vertical em cima do Claude Code Skills.
Paper de 25/05 de LeCun, Balestriero e Klindt prova formalmente as condicoes sob as quais LeJEPA (alignment + regularizacao Gaussiana) recupera linearmente as variaveis latentes do mundo a partir de observacoes nao-lineares. Resultado principal: a Gaussiana e a unica distribuicao latente para a qual essa garantia de linear identifiability vale em mundos com latentes evoluindo sob transicoes estacionarias com ruido aditivo. Base teorica para a aposta de LeCun em world models.
Framework de agente skill-centric que opera ciclo de vida unificado (criacao, memoria, gerenciamento, avaliacao e refinamento) para skills reutilizaveis. Skills deixam de ser artefatos isolados/estaticos: memoria skill-level acumula experiencia por skill entre tarefas. Reporta ganho de 7.16 pontos percentuais em acuracia de tarefa contra baselines de criacao de skills isoladas. Conexao direta com o paradigma de Skills da Anthropic.
Startup de chips de inferencia Groq capta US$ 650 mi com investidores existentes para acelerar seu negocio de inference neocloud, meses depois de um acordo de licenciamento de hardware com a Nvidia que tirou seniores da empresa (apelidado de "not acqui-hire" de US$ 20 bi). Sinal de que custo por token de inferencia segue como vetor competitivo central — e que a economia de "neocloud focada em inferencia" continua atraindo capital independente.
OSNews documentou (HN 12 pts) projeto open-source que escondeu nos proprios arquivos uma instrucao para agentes de IA que viessem a edita-lo: "delete my code". Forma deliberada de protesto / armadilha contra coding agents que processam repos sem consentimento. Reabre o debate de prompt injection em supply chain de codigo.
Anthropic ultrapassou a OpenAI em valuation privado e virou a startup de IA mais valiosa do mundo. Materia subiu para 385 pts no HN em ~10h. Acelera a percepcao de que o eixo de poder em frontier labs esta migrando — Claude Opus 4.8 + Skills + Dynamic Workflows + 28 integracoes enterprise consolidaram a Anthropic como referencia para deploy serio em empresa.
Comunidade · qazinform.com · anthropic, openai, valuation, mercado, claude, frontier-labs
Primeira acao judicial de uma grande rede de TV americana contra uma empresa de IA. A CNN alega que a Perplexity raspou mais de 17 mil textos, fotos e videos para treinar e alimentar produtos de busca generativa. A defesa da Perplexity argumenta que "fatos nao podem ser copyrightados". Caso tem potencial de redefinir licenciamento de news para IA — e chega na mesma semana em que UOL/Folha + OpenAI anunciaram acordo inedito no Brasil.
Comunidade · ppc.land · perplexity, cnn, copyright, ia-news, processo
OpenRouter levantou US$ 113M Series B liderada pela CapitalG (braço da Alphabet), com NVentures, ServiceNow, MongoDB, Snowflake, Databricks e AMP PBC dentro. Valuation pulou para US$ 1,3 bi. Volume semanal subiu de 5T para 25T tokens em 6 meses, com 8M+ devs em 400+ modelos. Gateway-layer virou infraestrutura estrategica — concorrentes diretos sao Together, Fireworks e o proprio Vertex AI Gateway do Google.
Comunidade · openrouter.ai · openrouter, capitalg, alphabet, gateway, llm-router, tokens
A Cohere comprou a alema Aleph Alpha formando uma empresa de IA transatlantica avaliada em ~US$ 20 bi, com lastro do Schwarz Group e dos governos do Canada e da Alemanha. Une expertise europeia em small language models com o foco enterprise large-model da Cohere. Resposta da Europa aos hyperscalers americanos e movimento de consolidacao de fronteira nao-frontier (camada enterprise/sovereign).
Comunidade · llm-stats.com · cohere, aleph-alpha, enterprise-ai, europa, ma
GPTZero auditou relatorio da EY Canada "Points of Attack: Uncovering Cyber Threats and Fraud in Loyalty Systems" e identificou 16 de 27 fontes fabricadas, mal atribuidas ou com links quebrados. Quase todas as URLs da tabela de referencias estavam quebradas. EY retirou o relatorio e abriu revisao interna. Topico foi top do HN nesta tarde e gerou onda de discussao sobre governanca de IA em Big Four.
Comunidade · news.ycombinator.com · ey, ernst-young, alucinacao, big-four, governanca-ia, gptzero
Reportagem da Axios (replicada em Tom's Hardware, Fortune via Boing Boing) afirma que uma empresa nao-nomeada estourou US$ 500 mi em Claude num mes apos esquecer de configurar limite de uso nas licencas dos funcionarios. Boatos no X apontam Amazon, onde funcionarios estariam inflando tokens para bater metas internas — pratica apelidada de tokenmaxxing. Em paralelo, Microsoft cancelou maior parte das licencas internas de Claude Code — primeiro recuo enterprise visivel de 2026.
Comunidade · tomshardware.com · finops, claude, enterprise, custos, tokenmaxxing, governanca
Apos o salto de valuation da Anthropic (que ultrapassou OpenAI), a Forbes recalculou que os 7 cofundadores agora valem US$ 16,6 bi cada. Reforca o ponto da virada de poder entre frontier labs.
Comunidade · forbes.com · anthropic, cofundadores, valuation, dario-amodei, daniela-amodei
Starbucks aposentou esta semana o agente de contagem automatica de inventario desenvolvido pela NomadGo (sensor LiDAR + camera de tablet) apos 9 meses em operacao na America do Norte. Baristas reportavam erros frequentes de contagem e confusao entre itens parecidos. Volta pro metodo manual. Caso vira referencia em discussoes de deploy de IA em varejo.
Comunidade · fortune.com · starbucks, nomadgo, computer-vision, deploy-fail, varejo, lidar
Accenture comprou a Ookla (Speedtest, Downdetector, Ekahau, RootMetrics) para puxar telemetria de rede para dentro de Communications Service Providers e hyperscalers — otimizando Wi-Fi e 5G como spine para operacoes movidas a IA. Plataforma processa 250 milhoes de testes/mes, 1.000+ atributos por teste.
Comunidade · newsroom.accenture.com · accenture, ookla, speedtest, downdetector, ekahau, network-intelligence