O Departamento de Comércio dos EUA (BIS) revogou (30/jun) os controles de exportação sobre o Claude Fable 5 e o Mythos 5, encerrando um impasse de 18 dias iniciado em 12/jun — quando a Anthropic foi obrigada a suspender o acesso de estrangeiros após a Amazon reportar um jailbreak que fez o Fable 5 apontar (e num caso escrever código para abusar de) falhas de software. A carta cita compromissos de coordenação da Anthropic (detecção e reporte proativo de riscos, protocolos de release conjuntos). O Fable 5 voltou globalmente na quarta (01/jul) em Claude platform, Claude.ai e Claude Code; o Mythos 5 é reintroduzido apenas a organizações dos EUA aprovadas. A volta traz um novo classificador de cibersegurança que barra >99% do jailbreak reportado — mas usuários já relatam que ele "flaga" mais código legítimo.
A Anthropic lançou (30/jun) o Claude Sonnet 5, descrito como "o Sonnet mais agêntico" — faz planos, usa ferramentas (navegador, terminal) e roda autonomamente num nível que meses atrás exigia modelos maiores. Desempenho perto do Opus 4.8 por preço bem menor. Já é o default de Free/Pro e está em Max/Team/Enterprise, Claude Code e API. Preço promocional US$ 2/US$ 10 por milhão de tokens (in/out) até 31/ago, depois US$ 3/US$ 15.
No mesmo dia do Sonnet 5, a Anthropic lançou o Claude Science — um "workbench" de IA para pesquisa científica, pré-configurado com 60+ bases de dados e ferramentas de genômica, proteômica, biologia estrutural e química. Não é um modelo novo: é um "harness" sobre os modelos Claude existentes, que renderiza artefatos (estruturas 3D de proteínas, genome browser tracks) e mantém históricos auditáveis. Em beta para Pro/Max/Team/Enterprise, com programa de créditos de até US$ 30 mil para 50 projetos.
O Google lançou (30/jun) o Nano Banana 2 Lite (aka Gemini 3.1 Flash-Lite Image), o modelo de imagem mais rápido e barato da família: gera imagens em ~4 segundos a US$ 0,034 por mil imagens (só resolução 1k). É "feito para velocidade, não qualidade" — mira ideação rápida e pipelines de dev de alto volume. Disponível já em AI Studio, Gemini API e Gemini Enterprise Agent Platform, e chegando a Ads, AI Mode na Busca, app Gemini e Photos. A linha vira um trio: Nano Banana Pro (complexo) → Nano Banana 2 (geral) → 2 Lite (velocidade/custo). Junto, o Google abriu a devs o Gemini Omni Flash (image-to-video).
A Meituan abriu (30/jun) o LongCat-2.0, um MoE de 1,6 trilhão de parâmetros (33–56B ativos por token) para engenharia de software agêntica, com contexto de 1M e licença MIT. Marca 59,5 no SWE-bench Pro (à frente do GPT-5.5) e 70,8 no Terminal-Bench, e vinha liderando o uso no OpenRouter silenciosamente. O ponto explosivo: foi treinado num cluster doméstico de 50 mil placas, sem GPUs Nvidia/AMD de topo.
Modelos · venturebeat · meituan, longcat, open-weights, coding, moe, china
Os modelos Claude, da Anthropic, chegaram à disponibilidade geral (GA) no Microsoft Azure AI Foundry, rodando em GB300 NVL72 (Blackwell Ultra) refrigerado a líquido, com InfiniBand Quantum-X800. Benchmarks do Azure citam ~40% mais throughput na mesma latência vs. o deploy anterior (H200), além de uma variante "Claude for Agents" exclusiva do GB300. Deixa empresas Azure usarem Claude sem passar pela API da Anthropic nem pelo Bedrock.
O X passou a hospedar um MCP server oficial para que ferramentas como Claude, Cursor e Grok Build consultem a API do X usando as permissões da própria conta do usuário — sem servidor self-hosted nem auth customizada. É read-only (não posta via Write API). Mais uma grande plataforma (depois de GitHub, Slack, Notion, Stripe) publicando um MCP first-party, consolidando o MCP como padrão de integração de agentes.
O Ollama lançou a v0.31.1 melhorando o desempenho de multi-token prediction (MTP) do Gemma 4 — cerca de 90% mais rápido na geração de tokens em Apple Silicon num benchmark de coding agent — e atualizou os engines MLX e llama.cpp. Ganho relevante para quem roda agentes de código localmente no Mac.
A equipe de Harrison Chase liberou 'dynamic subagents' no deepagents, permitindo que um agente orquestre subagentes programaticamente dentro de um code interpreter para tarefas que chamadas de ferramenta não sustentam de forma confiável (processar centenas de documentos, analisar milhares de datapoints). Chase reforça 'harness engineering' e context engineering como o fosso competitivo dos agentes de longo horizonte.
O vLLM lançou a 0.24.0 com 408 commits de 200 contribuidores (63 novos), adicionando suporte ao DeepSeek-V4, expandindo o Model Runner V2 e otimizando os backends Intel XPU, CPU e TPU. É o motor de serving de LLM open-source dominante — o release sinaliza suporte a modelos novos e mais desempenho para quem faz self-hosting.
No dia do lançamento do Sonnet 5, o ecossistema de coding agents já o adotou: o Claude Code 2.1.197 passou a usá-lo como modelo padrão (contexto nativo de 1M, preço promocional US$ 2/US$ 10) e o GitHub Copilot o disponibilizou em GA. A mesma versão do Claude Code trouxe classificação mais ampla do auto-mode, rastreio de negações (denial tracking), autocomplete de paths no bash e avisos de autenticação de servidores MCP no startup.
A FactSet (NYSE:FDS) anunciou (30/jun) parceria estratégica com o Google Cloud para embutir modelos Gemini e o Google Enterprise Search no seu Workstation, via Gemini Enterprise Agent Platform. As empresas vão co-desenvolver agentes para operações de portfólio, assessoria de M&A e corporate finance. Reforça a corrida do Gemini Enterprise por verticais reguladas, onde dados auditáveis e "defensáveis" são o diferencial.
Paper (arXiv, 30/jun) propõe o WorldEvolver, um framework que dá capacidade de "previsão" (foresight) a agentes LLM de horizonte longo revisando o contexto de deployment — combinando memória episódica, memória semântica e foresight seletivo — sem treinar nenhum parâmetro do agente. O sistema filtra previsões de baixa confiança antes de integrá-las ao contexto, mitigando erros compostos em tarefas de múltiplos passos.
Em ensaio (30/jun), Harrison Chase (CEO da LangChain) defende que a memória de agentes deveria ser estruturada como uma wiki interligada e continuamente destilada — e não como logs de conversa brutos —, ecoando a tese "LLM-wiki" estilo Karpathy aplicada à memória. Pareia diretamente com o lançamento do OpenWiki no dia seguinte.
Em janela de ~12h, ~US$ 618 mi em 10 rodadas de venture, com dinheiro indo para a "infraestrutura ao redor do modelo": LeapXpert (US$ 180 mi, comunicação governada para dados de IA), Higharc (US$ 95 mi, IA para construção civil), Stathera (US$ 55 mi, timing de silício) e Omen AI (US$ 31 mi, saúde de máquinas em data centers). Capital concentrado (top 4 = 79%) — sinal de virada do "hype de modelo" para gasto operacional e vertical.
Comunidade · techstartups · venture-capital, funding, ia-operacional, leapxpert, higharc, stathera