Carta aberta com +150 executivos e líderes técnicos de cibersegurança pede a remoção das restrições. Argumento central: as capacidades não são únicas (GPT-5.5, Opus, Sonnet, Kimi 2.7 fazem o mesmo), então o banimento só tira ferramentas dos defensores.
Na manhã de 16/06, a xAI começou o lançamento público do Grok V9-Medium — cerca de 3x maior que o modelo de produção atual, treinado explicitamente em workflows do Cursor para mirar a liderança da Claude em coding. Musk diz que é 'muito melhor em código'.
A Z.ai (ex-Zhipu) liberou hoje (17/06) os pesos MIT do GLM-5.2 (MoE de 753B params, ~40B ativos, contexto de 1M) no Hugging Face e ModelScope, com a primeira tabela oficial de benchmarks: 2º no Code Arena e a ~1 ponto do Claude Opus 4.8 em coding de longo horizonte. Ressalva: a API da Z.ai sujeita os dados à Lei de Inteligência Nacional da China; self-hosting em full precision exige ~1,5 TB de VRAM.
Expectativa de lançamento do GPT-5.6 entre 22 e 28/jun (83% no Polymarket). Pela primeira vez um executivo nomeado — o cientista-chefe Jakub Pachocki — descreveu o modelo a funcionários como 'melhora significativa' sobre o GPT-5.5. Sem system card oficial. Rumores: janela de ~1,5M tokens, Codex 'UltraFast', e correção do reward hacking documentado no post-mortem 'Where the Goblins Came From'.
Em 16/06 o Claude teve sua 10ª interrupção significativa desde 5/06, com erros em Opus 4.8 e Haiku 4.5 afetando claude.ai, API, Claude Code e Cowork. O tempo médio entre falhas caiu para ~1 dia, abaixo de SLAs comerciais típicos (99,9%). Chega no dia seguinte a uma ação coletiva (Kahn v. Anthropic) que acusa o plano Max de entregar menos uso que o prometido.
A biblioteca community 'claude-skills' (Alireza Rezvani, v2.10.3 em 10/06) reúne 345 pacotes de skills MIT que rodam sem modificação em 13 agentes de coding via scripts de conversão. Inclui um bundle de 51 papéis de engenharia sênior, um 'adversarial-reviewer' contra a monocultura de autoaprovação e um 'self-improving-agent' que promove padrões a regras. Usa a especificação SKILL.md (Anthropic, dez/2025) com progressive disclosure.
Método que reproduz conversas reais (de-identificadas) através de um modelo-candidato antes do deploy, para flagrar falhas que testes tradicionais não pegam. ~1,3 mi de conversas (GPT-5 Thinking a GPT-5.4, ago/2025–mar/2026), erro multiplicativo mediano de ~1,5x. Estende-se a coding agêntico simulando 120 mil trajetórias internas. ATUALIZAÇÃO 17/06: fonte primária da OpenAI (openai.com, 16/06) confirmada na varredura noturna.
Estudo da Anthropic argumenta que, no coding agêntico (Claude Code), a expertise do desenvolvedor continua gerando retornos crescentes em vez de ser comoditizada — quem sabe mais extrai mais do agente.
Ensaio da Anthropic (publicado em 08/06, ainda não estava na base) argumenta que o gargalo dos agentes científicos não é raciocínio, e sim a falta de camadas determinísticas para consultar dados biológicos. No benchmark VirBench (120 consultas de sequências virais), até os melhores modelos variavam muito (16,9%–91,3%); com a ferramenta determinística 'gget virus' a acurácia subiu acima de 90% (99,7% no GPT-5.5) e a escolha do modelo passou a importar pouco.
Paper avalia a robustez adversarial de dois modelos de fronteira da Anthropic (Fable 5 e Opus 4.8) contra 4 famílias de jailbreak em 7.826 intents nocivas, usando o framework HackAgent. Ambos resistem à maioria dos ataques; cada 'sucesso' foi rejulgado por painel de 3 modelos juízes.
Propõe um verificador 'ciente de proveniência' para agentes LLM que usam Model Context Protocol (MCP) sobre fontes heterogêneas (busca, APIs, bancos, prontuários). Ataca a falha de 'cross-source conflation' — quando uma afirmação correta é atribuída à fonte errada.
Formaliza o problema de 'Compositional Skill Routing': dado um query complexo e uma grande biblioteca de skills/ferramentas, decompor em sub-tarefas, recuperar a skill certa para cada uma e compor um plano executável. Apresenta o framework SkillWeaver (decompose-retrieve-compose).
TechCrunch reporta que o atrito público da Anthropic com a administração Trump pode estar impulsionando vendas, com dados sugerindo aumento de demanda após a disputa — um ângulo de mercado para o cluster regulatório do dia.
Regulação e segurança · techcrunch · anthropic, sales, enterprise, fable-5
À margem da cúpula do G7, líderes discutem criar uma lista de nações aliadas e empresas aprovadas, isentas das restrições de exportação de IA que os EUA impuseram em 12/06 — diretiva que forçou a Anthropic a desligar Fable 5 e Mythos 5 globalmente.
Comunidade · g7 · g7, export-controls, anthropic, fable-5, mythos-5, lutnick
Pela primeira vez, os três CEOs rivais (OpenAI, Anthropic, Google DeepMind) aparecem juntos diante de líderes mundiais num almoço sobre 'deploy seguro, rápido e eficaz da IA'. Espera-se um pacote de compromissos voluntários no comunicado de encerramento (17/06).
Comunidade · g7 · g7, openai, anthropic, google-deepmind, trump, governance
Artigo de Vicki Boykis argumentando que o coding agêntico local amadureceu nos últimos meses viralizou no HN. Destaque para o comentário de Georgi Gerganov (llama.cpp), que atesta usar o Qwen3.6-27B como ferramenta diária em tarefas de manutenção, com harness leve e offline.
Comunidade · hackernews · local-models, llama-cpp, gerganov, qwen3-6, agentic-coding
Após o lançamento em 16/06, o GLM-5.2 assumiu o topo do ranking de modelos open-weights no Intelligence Index v4.1 do Artificial Analysis. O post viralizou no HN; o modelo é posicionado para tarefas agênticas de longo horizonte e já rankeia bem no Code Arena: Frontend.
Comunidade · zai · glm-5-2, zai, open-weights, leaderboard, long-horizon
Reportagens reconstroem o atrito entre a Anthropic e o governo Trump que culminou na diretiva de controle de exportação e na retirada de Fable 5/Mythos 5. The Atlantic detalha que o 'jailbreak' era o modelo 'funcionando como deveria' (fix this code). Anthropic mobiliza equipe a Washington para tentar reverter.
Comunidade · washingtonpost · anthropic, fable-5, white-house, export-controls, lobbying