Anthropic mantém o Claude Mythos fora do publico: o modelo descobriu autonomamente milhares de vulnerabilidades ineditas - bug de 27 anos no SACK do OpenBSD, falha no H.264 do FFmpeg, CVE-2026-4747 no NFS do FreeBSD. Acesso restrito a ~50 orgs via Project Glasswing (AWS, Google,
Modelos · The Hacker News · security, anthropic, zero-day, agentic
Reportagens indicam que Google apresentara o Gemini Omni no I/O 2026 (21/05): sistema de geracao e edicao de video via prompts conversacionais. Demos iniciais incluem geracao, remix e edicao direta. Coloca pressao imediata sobre Runway, Sora e Veo da casa.
Reed Mayhew publicou destilação do Claude 4.6 Opus para Qwen3.6-35B-A3B (MoE), com ~3000x rollouts de reasoning e empacotamento em GGUF Dynamic 2.0. Tentativa de aproximar 'Opus em casa' para inferência local em hardware razoável.
Modelo image-text-to-image baseado em qwen3_vl publicado em 08/05 ja acumula 13,6K downloads e 352 likes. Licenca MIT, transformers-compatible, endpoints prontos. Concorre com SDXL e Flux na faixa de geracao condicionada por instrucao textual + imagem-base.
TencentARC publicou Pixal3D, modelo image-to-3D que entra direto na disputa com TRELLIS (Microsoft) e Hunyuan3D (Tencent). Trending score 96 no HF em poucos dias após publicação.
Anthropic anuncia expansão da parceria com a PwC: Claude vira espinha dorsal do delivery de consultoria — desenvolvimento de tech, execução de M&A e reinvenção de funções enterprise. Big Four reposicionando-se como integrador de IA agêntica em escala corporativa.
Modelos · anthropic · anthropic, pwc, consultoria, enterprise, claude
Mistral está pitchando para bancos europeus uma alternativa soberana ao Claude Mythos da Anthropic — modelo restrito capaz de identificar vulnerabilidades em larga escala, sob jurisdição UE. ARR da Mistral cresceu 20x YoY, segundo o relato.
Zyphra liberou em 04/05 o ZAYA1-8B, modelo de reasoning base sob Apache 2.0 que ja passou de 143K downloads e 509 likes. Posicionado como alternativa eficiente para fine-tuning de raciocinio em ambientes self-hosted. Arxiv 2605.05365 detalha o metodo.
A partir de 15/05/2026 12:00 PT a xAI aposentou um conjunto de modelos legados da API, exigindo migracao imediata para Grok 4.3 e variantes. Quebra chamadas de producao que nao fizeram opt-in nos novos endpoints.
Beta do Grok Build e o primeiro coding agent do xAI: baseado em Grok 4.3 (arquitetura Heavy 16-agentes, 2M tokens), spawna ate 8 agentes concorrentes em workflow plan-search-build com 'plan mode' para revisao previa. Disponivel apenas para SuperGrok Heavy (USD 300/mes, USD 99 pro
OpenHuman (tinyhumansai) está em #1 do GitHub trending: agente desktop open-source que constrói contexto sobre o usuário antes de qualquer prompt — inverte o playbook típico, fazendo o agente 'ler' o usuário antes de ser perguntado. Versão 0.53.43 lançada em 13/05.
Na Interrupt 2026 (13-14/05 em SF), Harrison Chase anunciou LangChain/LangGraph 1.0 com docs unificada, arquiteturas de agente prontas para uso e SmithDB - banco distribuido purpose-built para observabilidade de agentes. LangGraph 1.2 alpha trouxe node-level error handlers, timeo
Anthropic rastreou a degradacao percebida do Claude Code a tres mudancas de produto sobrepostas que se reforcaram mutuamente. Postmortem detalha o processo de diagnostico, metricas usadas e correcoes aplicadas - leitura obrigatoria para quem opera agentes em producao.
Ferramentas e código · InfoQ · anthropic, claude-code, postmortem, quality
TikTok lancou servidor MCP + toolkit que permitem agentes de IA conectarem-se direto a plataforma de anuncios - criacao, gerenciamento e otimizacao de campanhas sem intervencao humana. Sinaliza adocao MCP como padrao de fato para automacao enterprise.
Ferramentas e código · Digiday · tiktok, mcp, advertising, agentic
ServiceNow tornou o Build Agent generally available com plug-in para as 4 IDEs/CLIs agênticas mais usadas: Cursor, Windsurf, Claude Code e GitHub Copilot. Levam contexto e governança ServiceNow para qualquer ambiente — movimento 'agnóstico de IDE'.
Cursor 3.4 saiu poucos dias após o 3.3: refina parallel agents assíncronos, automatiza split de PRs por slice lógico e move o Bugbot para modelo 100% usage-based. Reforça a corrida com Claude Code, Codex e Grok Build.
Anthropic apresentou 12 ferramentas/plugins do Claude voltadas a especialidades juridicas - corporativo, regulatorio, trabalhista, contratos. Aprofunda entrada no mercado legal e reforca integracao bidirecional com CoCounsel da Thomson Reuters.
Ferramentas e código · Bloomberg Law · anthropic, legal-tech, plugins, enterprise
Microsoft expandiu o Copilot Cowork (M365) com skills nativas para criação de docs, reuniões e pesquisa, mais conectores enterprise para LSEG, Miro, monday e S&P. Posicionamento direto contra Claude Cowork e agentes do ChatGPT.
Ferramentas e código · microsoft · microsoft, copilot, cowork, conectores, enterprise, m365
Paper mostra que agentes top em specs frouxas degradam fortemente quando restrições estruturais se acumulam: padrões arquiteturais, ORM, schemas de banco, convenções de domínio. Chama o fenômeno de 'constraint decay' e propõe métricas para diagnosticá-lo.
ProgramBench propõe 200 tarefas de reconstrução de programas reais (FFmpeg, SQLite, interpretador PHP). Nenhum dos 9 modelos avaliados — incluindo frontiers atuais — resolveu uma tarefa completa. Estabelece teto duro para a narrativa 'agentes substituem engenheiros'.
Sebastian Raschka publicou hoje ensaio no Ahead of AI: 'Recent Developments in LLM Architectures'. Cobre KV Sharing, mHC (multi-head compression) e Compressed Attention. Compara arquiteturas do GPT-2 (2019) ao DeepSeek V4-Pro (2026). Anúncio do livro 'Build A Reasoning Model (From Scratch)'.
SafeHarbor propõe framework training-free e plug-and-play que aprende regras de defesa via memória hierárquica e auto-evolução por entropia, balanceando safety e utilidade em agentes com tool use. Pode ser inserido sem retrainar o modelo base.
Paper formaliza constraint drift: restricoes de seguranca se enfraquecem ao atravessar memoria, delegacao, tool-use e auditoria em pipelines multi-agente. Demonstra perda mensuravel de aderencia mesmo com prompts inicialmente compliant; propoe mecanismos de reinjecao de restricoe
Formaliza manipulacao interna em consenso multi-agente como decisao sequencial onde insider atrasa ou impede acordo entre agentes benignos. Mostra que um unico agente malicioso compromete consenso em mais de 60% dos rounds em star/chain sem defesas - votacao ponderada ou mesh sao
Closing arguments do julgamento Musk v. Altman foram encerrados; jurados em Oakland começam deliberação em 18/05 sobre se Altman e Brockman violaram a lei de charitable-trust ao converter a OpenAI numa corporação de US$ 500 bi. Altman, no banco: 'Acredito que sou uma pessoa honesta.
Comunidade · washingtonpost · openai, sam-altman, elon-musk, governanca, charitable-trust, julgamento
Na AI Ascent 2026, Jim Fan (NVIDIA) apresentou o 'second pre-training paradigm': shift de next-word prediction para next-physical-state prediction. Propoe roadmap explicito de LWMs (pre-training -> alignment -> reasoning -> auto-research) e preve Physical Turing Test em 2-3 anos.
Comunidade · X/Twitter @DrJimFan · nvidia, robotics, world-models, physical-ai
Lab de Mira Murati revelou em research preview o TML-Interaction-Small: modelo full-duplex que responde em 0,40s, processa micro-turnos de 200ms e separa modelo interativo do modelo de raciocínio em background. Repercussão forte na semana.
Comunidade · techcrunch · thinking-machines, mira-murati, full-duplex, interaction-model, voz
Google Threat Intelligence reporta detecção e bloqueio do primeiro caso conhecido de zero-day desenvolvido com IA em escala — falha de bypass de 2FA em ferramenta admin open-source, com potencial de exploração em massa. Bate de frente com a narrativa Anthropic Mythos como uso defensivo.
Comunidade · thehackernews · security, zero-day, ai-misuse, google-threat-intel, cybersecurity
OpenAI lancou a OpenAI Deployment Company (DeployCo) com mais de USD 4 bilhoes de 19 parceiros - Brookfield, TPG e outros - para alocar engenheiros dentro de corporacoes e acelerar integracao de modelos de fronteira. Movimento tipico de Palantir aplicado a IA generativa.
Comunidade · Distill Intelligence · openai, enterprise, funding, go-to-market
Runway avaliada em USD 5,3 bilhoes com USD 40 mi adicionados em ARR no Q2/2026. Apos lancar primeiro world model em dezembro, planeja segundo este ano e disputa terreno com Gemini Omni do Google. Confirma que video-gen virou batalha de world-models, nao so pixels.
Comunidade · TechCrunch · runway, video-generation, funding, world-models