Andrej Karpathy começou na Anthropic em maio/2026, sob Nick Joseph, montando um time que vai usar o Claude para acelerar pesquisa de pré-treino. Em update pessoal, disse que segue apaixonado por educação e pretende retomá-la no futuro.
Google entra de cabeça na era agentic: Gemini Spark (agente pessoal beta para AI Ultra), Gemini 3.5 Flash GA (frontier-level a 4× a velocidade, $1.5/$9 por 1M tokens, contexto 1M, 76.2% Terminal-Bench 2.1) e Gemini Omni para geração/edição de vídeo. AI Ultra cai de $250 → $200 e ganha tier de $100.
DeepMind apresenta a família Gemma 4 como a coleção open-weight mais capaz por byte do Google, com variantes para diferentes orçamentos de inferência e foco em multilíngue/multimodal.
DeepSeek lança a V4 com contexto efetivo de 1M tokens otimizado para uso por agentes — não só o número grande, mas tooling e benchmarks que mostram que ele se sustenta em tarefas longas reais.
ByteDance liberou em 19-21/05 o Lance — modelo multimodal unificado de 3B parâmetros ativos, Apache 2.0, que cobre entendimento e geração de imagem e vídeo + edição num único framework. Arquitetura dual-stream MoE sobre sequências interleaved, treinado do zero com 1B pares imagem-texto e 140M vídeo-texto (1.5T tokens) em 128 A100s.
NVIDIA lança o Nemotron 3 Nano Omni: modelo multimodal pequeno com contexto longo desenhado para agentes que precisam ler documentos, áudio e vídeo no mesmo turno.
Goldman Sachs anunciou rollout do Claude (Anthropic) para automatizar funções de contabilidade e compliance — integração de IA generativa em operações financeiras de alto risco. Sinaliza maturidade do mercado enterprise para uso de LLMs em workflows com requisitos regulatórios. Caso relevante para discutir governança e auditabilidade de agentes.
Anthropic divulgou primeiro update do Project Glasswing — programa de acesso restrito ao Claude Mythos Preview para ~50 organizações de infraestrutura crítica. Em um mês: 1.000+ projetos open source varridos, 6.202 candidatos a vulnerabilidade alta/crítica sinalizados, 1.726 exploits confirmados (1.094 high/critical). Caso emblemático: exploit no wolfSSL permitindo forjar certificados bancários. Gargalo passou de descoberta para patching — menos de 100 patches deployados. Importa porque dá peso empírico ao argumento dual-use que justifica não liberar Mythos publicamente, e redefine economia de segurança ofensiva/defensiva.
OpenAI e Dell anunciam parceria para levar Codex (e GPT-5.5 para agentes de código) a ambientes híbridos e on-premise de grandes empresas — resposta direta a Claude Code/Anthropic no terreno corporativo.
Em 21/05, a Anthropic adicionou ao Claude duas peças voltadas à empresa pesada: Compliance API (integração com ferramentas de segurança/compliance para governar Claude como qualquer outro app da stack) e Managed Agents (sandboxes self-hosted em beta pública e MCP tunnels em research preview — execução de agentes e acesso a serviços privados dentro do perímetro corporativo).
Update do Codex de 22/05/2026 traz Appshots (anexar janela do macOS a uma thread via hotkey — Codex enxerga screenshot + texto sem prompt longo), Goal mode em GA pelo app/IDE/CLI (o usuário define objetivo e critério de sucesso, Codex itera até bater), e Locked Computer Use remoto para usuários elegíveis no macOS. ChatGPT Business ganha shared plugins e analytics de adoção.
Databricks passa a oferecer GPT-5.5 dentro dos workflows de agentes enterprise — combina dados governados do lakehouse com o modelo de raciocínio mais forte da OpenAI.
A partir de 15/06, a Anthropic separa uso programático do Claude da assinatura de chat. Pro recebe $20 de crédito mensal para Agent SDK, GitHub Actions e frameworks de terceiros, Max 5x ganha $100, Max 20x ganha $200 — tudo cobrado em taxa-API. O movimento responde a abusos de planos baratos rodando agentes 24/7.
Apareceu em 22/05 um repo GitHub de "karpathy-skills" — coleção de Skills para Claude Code que aplicam padrões de programação do próprio Andrej Karpathy (estilo nanoGPT/llm.c: código minimal, comentários densos, preferência por do-it-yourself sobre frameworks). É reação direta da comunidade à entrada dele na Anthropic.
IBM Research lança um leaderboard público para agentes, com tarefas reprodutíveis de tool-use e raciocínio multi-step — alternativa aberta aos benchmarks fechados de Anthropic/OpenAI.
Ferramentas e código · rss-huggingface-blog · - benchmark
HCompany lança o HoloTab, um companion de browser que age como agente: lê páginas, executa workflows e mantém memória entre abas — concorrente direto de Comet/Arc Search.
Ferramentas e código · rss-huggingface-blog · - browser
OpenAI detalha como construiu um sandbox leve para permitir que o Codex execute código no Windows com isolamento adequado — pré-requisito para uso em estações enterprise.
DeepMind apresenta o Co-Scientist, sistema multi-agente que colabora com cientistas humanos em ciclos de hipótese-experimento-revisão — primeiros casos em biologia e materiais.
Um modelo da OpenAI gerou um contraexemplo válido para uma conjectura central em geometria discreta — pequeno marco simbólico de raciocínio matemático original assistido por IA.
Google DeepMind contratou mais de 20 pesquisadores da Contextual AI e licenciou tecnologia da empresa em deal de $80-90M, com o co-fundador e CEO Douwe Kiela entre os que migraram. Não é aquisição cheia — é o formato "acquihire + licença" usado para evitar revisão antitruste, mesma jogada feita com Character.AI e Adept.
Paper publicado em 19/05/2026 (HF Papers 2605.19932) por Zhuohan Gu, Qizheng Zhang, Omar Khattab e Samuel Madden propõe PEEK — Context Map, um cache persistente de "orientação" sobre contextos externos recorrentes. Em vez de re-aprender a estrutura de um codebase ou base de docs a cada tarefa, o agente mantém um mapa programável (Distiller, Cartographer, Evictor) e cacheia política de uso. Testes contra ACE e OpenAI Codex.
Paper que ganhou tração no HN: reformular os blocos do Transformer como programas GEMM-epilogue permite fundir muitas operações em kernels mais rápidos — caminho para inferência mais barata.
Paper publicado em 06/05/2026 (HF Papers 2605.05191) introduz LongSeeker / Context-ReAct — orquestração elástica de contexto para search agents de longo horizonte. Em vez de inflar o context window indefinidamente, o agente executa operações dinâmicas (Compress, Rollback, Snippet, Delete) sobre o working memory. Resultado: mais raciocínio por token e menos drift.
Waypoint 1.5 melhora a fidelidade de world models interativos a ponto de rodar em GPUs de consumo — passo importante para simulações que treinam agentes embarcados.
IBM Research mostra, com o benchmark VAKRA, onde agentes mais quebram hoje (planejamento, recuperação de erro, escolha de ferramenta) — útil para quem está endurecendo seus pipelines agentic.
Mem0 propõe arquitetura de memória baseada em grafo para conversas longas, com extração, consolidação e recuperação eficiente. Resultados superam sistemas de memória atuais em acurácia e custo computacional. Importa para builders de agentes pessoais (Spark, ChatGPT memory, Claude memory) que ainda tratam memória como string longa. Ganhou tração na comunidade de context engineering, casando com o paper Survey of Context Engineering de Mei et al.
Em paralelo à entrada de Karpathy, a Anthropic anunciou em 18/05 a aquisição da Stainless — startup fundada em 2022 que gera SDKs automaticamente e produz conectores MCP server. O movimento dobra a aposta no Claude como plataforma agentic (Claude Code + Agent SDK + MCP) e fecha o ciclo desde modelo até integração.
Microsoft abriu o código de RAMPART (framework Pytest-native para red-team de agentes, sobre o PyRIT) e Clarity (sounding board estruturado para definir o problema antes de codar). A proposta é tirar a segurança de agentes da "lista de checagem periódica" e colocar dentro do pipeline de CI — cobrindo cross-prompt injection, exfiltração de dados e regressões comportamentais.
Cohere abriu o Command A+ sob Apache 2.0 — primeiro modelo da casa com licença totalmente aberta. É um MoE esparso de 218B parâmetros com 25B ativos, focado em workflows agentic e que roda com apenas 2 H100s. Suporta 48 idiomas, traz citações nativas via tags e ganhos de tokenização de até 20% em árabe/coreano/japonês.
Em 22/05, a ElevenLabs (valor de $11B) anunciou licenciamento de 200 mil audiobooks narrados por humanos das grandes editoras para o app ElevenReader, em assinatura de $11/mês. É um movimento "anti-Audible" — combinar catálogo humano clássico com TTS sintético próprio na mesma assinatura.
No Investor Day, Spotify anunciou ferramenta nativa de criação de audiobooks por IA dentro do Spotify for Authors, usando ElevenLabs como engine — beta em junho, convite, só inglês. Sem cláusula de exclusividade — autores podem publicar o áudio gerado em qualquer plataforma.
Reportagem do StartupHub destaca padrão emergente: quatro labs de IA fizeram aquisições estratégicas em uma janela de cinco dias em maio/2026 — sinal forte de fase de consolidação após dois anos de fragmentação (proliferação de startups de modelos, agentes, evals, infra). Mercado de IA começa a "espremer" para poucos vencedores por categoria.
Comunidade · webnews · consolidacao, ma, ai-industry, market-signal