OpenAI auditou 27,6% do SWE-bench Verified e encontrou que 59,4% dos problemas auditados têm testes defeituosos que rejeitam soluções corretas. Além disso, como os problemas vêm de repos open-source usados em treino, todos os modelos frontier conseguem reproduzir o fix humano original — tornando o benchmark inútil para medir progresso real. OpenAI recomenda migrar para SWE-bench Pro.
xAI de Elon Musk discute parceria estratégica com Mistral AI para criar frente competitiva contra OpenAI e Anthropic. Conversas incluiriam possível envolvimento do Cursor. Também lançou Grok Voice com agente de voz de baixa latência e suporte multilíngue.
VentureBeat reporta que o GPT-5.5 da OpenAI supera por margem estreita o Claude Mythos Preview da Anthropic no Terminal-Bench 2.0 — um benchmark mais recente que substitui o controverso SWE-bench. A corrida por supremacia em coding continua acirrada.
Meta marcou a LlamaCon para 29 de abril e anunciou 10 novos recipientes do segundo ciclo do Llama Impact Grants, programa de apoio a projetos que usam modelos Llama para impacto social.
Mistral AI lançou Voxtral TTS, modelo text-to-speech com clonagem de voz zero-shot, suporte multilíngue e streaming em tempo real. Primeiro modelo de voz da Mistral, ampliando seu portfólio para além de texto.
Comparação técnica detalhada entre Opus 4.6 e 4.7 focando em effort levels e capacidade de steering via prompt. Útil para quem está decidindo qual modelo usar em pipelines de produção.
Modelos · George Liu AI Blog / Hacker News · anthropic, claude, opus, benchmarks, prompt-engineering
Google DeepMind lançou Gemini Robotics-ER 1.6 com raciocínio espacial e físico aprimorado para aplicações robóticas, melhorando capacidades de apontamento, contagem e interação com o ambiente físico.
NEC torna-se primeiro parceiro global japonês da Anthropic. 30.000 funcionários do grupo NEC terão acesso ao Claude Code. Foco em finanças, manufatura e governo local.
AWS prepara lançamento do Claude Platform — acesso direto à experiência nativa da Anthropic (console, APIs, features) via conta AWS, com billing unificado, IAM, CloudTrail e sem necessidade de conta Anthropic separada. Deepening da parceria de $5B+ entre as empresas.
Framework Neuro-Adaptive Reasoning Engine converte processos de raciocínio de LLMs em código Python executável e otimizado, prometendo performance superior para tarefas repetitivas.
Simon Willison analisa o guia oficial de prompting do GPT-5.5 da OpenAI. Destaque: não reutilizar prompts antigos — começar do zero. GPT-5.5 lida melhor com tarefas ambíguas e multi-step sem microgerenciamento.
Ferramentas e código · Simon Willison's Blog · - simon-willison
Archon v2 é o primeiro framework open-source para construir harnesses de agentes de código IA. Workflows em YAML tornam Claude Code e Codex determinísticos e reproduzíveis. 17K+ stars no GitHub.
Ferramentas e código · GitHub / coleam00 · - archon
Técnica combina hash anchors, Myers diff e single-token anchors para reduzir em 60% o consumo de tokens em edições de código assistidas por IA. Otimização prática para pipelines de AI-assisted coding.
Simon Willison apresenta o LiteParse for the Web, ferramenta que permite extrair texto de PDFs diretamente no navegador sem necessidade de servidor ou upload para APIs externas.
Ferramentas e código · Simon Willison Blog · - simon-willison
Ferramenta open-source que permite consultar pesos de redes neurais usando conceitos de bancos de dados de grafos, facilitando introspecção e análise de modelos.
Pesquisadores demonstraram abordagem que reduz consumo de energia de sistemas de IA em até 100x combinando redes neurais com raciocínio simbólico. Avanço importante para sustentabilidade de data centers.
Paper de abril de 2026 explora os desafios de agentes LLM multi-usuário: objetivos conflitantes, preservação de privacidade entre usuários e eficiência na coordenação de múltiplos agentes simultâneos.
Survey abrangente categoriza métodos de raciocínio em LLMs: inference-time scaling, learning-to-reason (SFT, RL, PPO, GRPO), e sistemas agênticos compostos com ferramentas externas e multi-agentes.
Pesquisa explora as condições sob as quais LLMs conseguem efetivamente aprender capacidades de raciocínio a partir de dados com supervisão fraca (weak supervision), com implicações para redução de custo de treinamento.
Google anunciou planos de investir até US$ 40 bilhões na Anthropic, com US$ 10 bilhões iniciais já confirmados. Maior rodada de investimento em IA da história, reforçando a aposta do Google em modelos de fronteira.
CEO da Snap Evan Spiegel anuncia demissão de ~1000 funcionários citando avanços em IA. A empresa revela que IA já gera mais de 65% do código novo e projeta economia de $500M anualizados até o 2º semestre de 2026. Caso concreto de substituição de desenvolvedores por IA.
Comunidade · Crescendo AI / múltiplas fontes · snap, demissoes, ia-codigo, impacto-emprego, automacao
Blog post no Hacker News aponta erro fundamental no argumento da Anthropic de que as melhorias do Mythos no SWE-bench são genuínas. A guerra de benchmarks entre OpenAI e Anthropic esquenta — ambos os lados questionam a validade das métricas do outro.
Geoffrey Hinton, Nobel e 'padrinho da IA', alerta na conferência DWC da ONU que IA sem regulação é como 'carro veloz sem volante'. Estima que apenas 1% do trabalho em IA é dedicado a segurança.
Comunidade · UN News / Digital World Conference · - regulacao
Tópico trending no X e Hacker News: programadores seniores estão voltando a escrever código manualmente por preocupações com confiabilidade de ferramentas de IA. Contrasta com Snap demitindo 1000 porque IA gera 65% do código.
Survey Epoch AI/Ipsos: 80% dos usuários semanais do Claude nos EUA vivem em domicílios com renda >= $100K/ano (vs. 37% do Meta AI, 50% média nacional). Claude é o assistente de IA mais 'premium'.
Suprema Corte de Nebraska suspendeu advogado Greg Lake após petição com 57 citações defeituosas, incluindo 20 alucinações de IA. No Q1 2026, tribunais dos EUA aplicaram pelo menos $145K em multas a advogados por erros de citação com IA.
Comunidade · Transparency Coalition AI · regulacao, alucinacao, juridico, etica, ia-generativa