Radar do FAROL30 notas

sábado, 16 de maio de 2026

Modelos

Claude Mythos descobre milhares de zero-days e fica restrito ao Project Glasswing

Anthropic mantém o Claude Mythos fora do publico: o modelo descobriu autonomamente milhares de vulnerabilidades ineditas - bug de 27 anos no SACK do OpenBSD, falha no H.264 do FFmpeg, CVE-2026-4747 no NFS do FreeBSD. Acesso restrito a ~50 orgs via Project Glasswing (AWS, Google,

Modelos · The Hacker News · security, anthropic, zero-day, agentic

Google deve apresentar Gemini Omni para geracao e edicao de video via prompt no I/O 2026

Reportagens indicam que Google apresentara o Gemini Omni no I/O 2026 (21/05): sistema de geracao e edicao de video via prompts conversacionais. Demos iniciais incluem geracao, remix e edicao direta. Coloca pressao imediata sobre Runway, Sora e Veo da casa.

Modelos · Sources.news · google, gemini, video-generation, io2026

Destilação Claude 4.6 Opus → Qwen3.6-35B-A3B em GGUF dinâmico

Reed Mayhew publicou destilação do Claude 4.6 Opus para Qwen3.6-35B-A3B (MoE), com ~3000x rollouts de reasoning e empacotamento em GGUF Dynamic 2.0. Tentativa de aproximar 'Opus em casa' para inferência local em hardware razoável.

Modelos · huggingface · destilacao, claude-46-opus, qwen36, gguf, reasoning, local-llm

HiDream-O1-Image entra trending no HuggingFace - geracao imagem-texto sob MIT

Modelo image-text-to-image baseado em qwen3_vl publicado em 08/05 ja acumula 13,6K downloads e 352 likes. Licenca MIT, transformers-compatible, endpoints prontos. Concorre com SDXL e Flux na faixa de geracao condicionada por instrucao textual + imagem-base.

Modelos · HuggingFace · image-generation, huggingface, open-weights, qwen3-vl

TencentARC publica Pixal3D — novo entrante em image-to-3D

TencentARC publicou Pixal3D, modelo image-to-3D que entra direto na disputa com TRELLIS (Microsoft) e Hunyuan3D (Tencent). Trending score 96 no HF em poucos dias após publicação.

Modelos · huggingface · tencent, 3d, image-to-3d, generative, hugging-face

PwC expande parceria com Anthropic: Claude no centro do delivery de consultoria

Anthropic anuncia expansão da parceria com a PwC: Claude vira espinha dorsal do delivery de consultoria — desenvolvimento de tech, execução de M&A e reinvenção de funções enterprise. Big Four reposicionando-se como integrador de IA agêntica em escala corporativa.

Modelos · anthropic · anthropic, pwc, consultoria, enterprise, claude

Mistral pitcha contraparte soberana ao Claude Mythos para bancos europeus

Mistral está pitchando para bancos europeus uma alternativa soberana ao Claude Mythos da Anthropic — modelo restrito capaz de identificar vulnerabilidades em larga escala, sob jurisdição UE. ARR da Mistral cresceu 20x YoY, segundo o relato.

Modelos · yahoo-finance · mistral, cybersecurity, soberania, ue, mythos, bancos

Zyphra publica ZAYA1-8B (Apache 2.0) - reasoning base com 143K downloads

Zyphra liberou em 04/05 o ZAYA1-8B, modelo de reasoning base sob Apache 2.0 que ja passou de 143K downloads e 509 likes. Posicionado como alternativa eficiente para fine-tuning de raciocinio em ambientes self-hosted. Arxiv 2605.05365 detalha o metodo.

Modelos · HuggingFace · open-weights, reasoning, zyphra, small-model

xAI aposenta modelos legados da API em 15/05 - clientes migram para Grok 4.3

A partir de 15/05/2026 12:00 PT a xAI aposentou um conjunto de modelos legados da API, exigindo migracao imediata para Grok 4.3 e variantes. Quebra chamadas de producao que nao fizeram opt-in nos novos endpoints.

Modelos · xAI Docs · xai, api, deprecation, grok

Ferramentas e código

xAI lanca Grok Build - CLI agentico com 8 agentes paralelos e contexto de 2M tokens

Beta do Grok Build e o primeiro coding agent do xAI: baseado em Grok 4.3 (arquitetura Heavy 16-agentes, 2M tokens), spawna ate 8 agentes concorrentes em workflow plan-search-build com 'plan mode' para revisao previa. Disponivel apenas para SuperGrok Heavy (USD 300/mes, USD 99 pro

Ferramentas e código · Bloomberg / Engadget · xai, coding-agent, cli, agentic

OpenHuman: agente desktop que aprende o usuário no dia zero (#1 GitHub trending)

OpenHuman (tinyhumansai) está em #1 do GitHub trending: agente desktop open-source que constrói contexto sobre o usuário antes de qualquer prompt — inverte o playbook típico, fazendo o agente 'ler' o usuário antes de ser perguntado. Versão 0.53.43 lançada em 13/05.

Ferramentas e código · github · agent, desktop, context-engineering, open-source, github-trending

LangChain/LangGraph 1.0 com SmithDB e arquiteturas prontas para agentes (Interrupt 2026)

Na Interrupt 2026 (13-14/05 em SF), Harrison Chase anunciou LangChain/LangGraph 1.0 com docs unificada, arquiteturas de agente prontas para uso e SmithDB - banco distribuido purpose-built para observabilidade de agentes. LangGraph 1.2 alpha trouxe node-level error handlers, timeo

Ferramentas e código · X/Twitter @hwchase17 · langchain, langgraph, agentic, observability

Anthropic publica postmortem de seis semanas de queixas sobre o Claude Code

Anthropic rastreou a degradacao percebida do Claude Code a tres mudancas de produto sobrepostas que se reforcaram mutuamente. Postmortem detalha o processo de diagnostico, metricas usadas e correcoes aplicadas - leitura obrigatoria para quem opera agentes em producao.

Ferramentas e código · InfoQ · anthropic, claude-code, postmortem, quality

TikTok abre plataforma de ads para agentes de IA via servidor MCP

TikTok lancou servidor MCP + toolkit que permitem agentes de IA conectarem-se direto a plataforma de anuncios - criacao, gerenciamento e otimizacao de campanhas sem intervencao humana. Sinaliza adocao MCP como padrao de fato para automacao enterprise.

Ferramentas e código · Digiday · tiktok, mcp, advertising, agentic

ServiceNow Build Agent GA — funciona dentro de Cursor, Windsurf, Claude Code e Copilot

ServiceNow tornou o Build Agent generally available com plug-in para as 4 IDEs/CLIs agênticas mais usadas: Cursor, Windsurf, Claude Code e GitHub Copilot. Levam contexto e governança ServiceNow para qualquer ambiente — movimento 'agnóstico de IDE'.

Ferramentas e código · servicenow · servicenow, build-agent, cross-ide, governanca, agentes

Cursor 3.4 chega com parallel agents refinados e PR splitting automático

Cursor 3.4 saiu poucos dias após o 3.3: refina parallel agents assíncronos, automatiza split de PRs por slice lógico e move o Bugbot para modelo 100% usage-based. Reforça a corrida com Claude Code, Codex e Grok Build.

Ferramentas e código · cursor · cursor, coding-agent, parallel-agents, pr-split, bugbot

Anthropic lanca 12 plugins juridicos do Claude para especialidades do direito

Anthropic apresentou 12 ferramentas/plugins do Claude voltadas a especialidades juridicas - corporativo, regulatorio, trabalhista, contratos. Aprofunda entrada no mercado legal e reforca integracao bidirecional com CoCounsel da Thomson Reuters.

Ferramentas e código · Bloomberg Law · anthropic, legal-tech, plugins, enterprise

Microsoft Copilot Cowork ganha skills nativas + conectores LSEG, Miro, monday, S&P

Microsoft expandiu o Copilot Cowork (M365) com skills nativas para criação de docs, reuniões e pesquisa, mais conectores enterprise para LSEG, Miro, monday e S&P. Posicionamento direto contra Claude Cowork e agentes do ChatGPT.

Ferramentas e código · microsoft · microsoft, copilot, cowork, conectores, enterprise, m365

Pesquisa

Constraint Decay: agentes LLM degradam quando restrições estruturais se acumulam

Paper mostra que agentes top em specs frouxas degradam fortemente quando restrições estruturais se acumulam: padrões arquiteturais, ORM, schemas de banco, convenções de domínio. Chama o fenômeno de 'constraint decay' e propõe métricas para diagnosticá-lo.

Pesquisa · arxiv · agentic-coding, constraint-decay, backend, paper, llm-fragility

ProgramBench: 9 modelos avaliados, nenhum reconstrói um programa inteiro do zero

ProgramBench propõe 200 tarefas de reconstrução de programas reais (FFmpeg, SQLite, interpretador PHP). Nenhum dos 9 modelos avaliados — incluindo frontiers atuais — resolveu uma tarefa completa. Estabelece teto duro para a narrativa 'agentes substituem engenheiros'.

Pesquisa · arxiv · benchmark, reconstrucao-programas, llm, agentic-coding, ffmpeg, sqlite

Sebastian Raschka mapeia 7 anos de LLM: KV Sharing, mHC e Compressed Attention

Sebastian Raschka publicou hoje ensaio no Ahead of AI: 'Recent Developments in LLM Architectures'. Cobre KV Sharing, mHC (multi-head compression) e Compressed Attention. Compara arquiteturas do GPT-2 (2019) ao DeepSeek V4-Pro (2026). Anúncio do livro 'Build A Reasoning Model (From Scratch)'.

Pesquisa · substack · raschka, llm-architecture, kv-sharing, attention, tutorial

SafeHarbor: guardrail training-free com memória hierárquica para agentes com tool use

SafeHarbor propõe framework training-free e plug-and-play que aprende regras de defesa via memória hierárquica e auto-evolução por entropia, balanceando safety e utilidade em agentes com tool use. Pode ser inserido sem retrainar o modelo base.

Pesquisa · huggingface-papers · safety, guardrail, training-free, tool-use, memoria-hierarquica

Constraint drift em sistemas multi-agente LLM - seguranca precisa ser mantida, nao asserida

Paper formaliza constraint drift: restricoes de seguranca se enfraquecem ao atravessar memoria, delegacao, tool-use e auditoria em pipelines multi-agente. Demonstra perda mensuravel de aderencia mesmo com prompts inicialmente compliant; propoe mecanismos de reinjecao de restricoe

Pesquisa · arXiv cs.MA · multi-agent, safety, constraint-drift, llm

Ataques de insider em consenso multi-agente LLM - um unico agente compromete topologias star/chain

Formaliza manipulacao interna em consenso multi-agente como decisao sequencial onde insider atrasa ou impede acordo entre agentes benignos. Mostra que um unico agente malicioso compromete consenso em mais de 60% dos rounds em star/chain sem defesas - votacao ponderada ou mesh sao

Pesquisa · arXiv cs.MA · multi-agent, security, consensus, adversarial

Comunidade

Musk v. Altman: closing arguments encerram, júri começa a deliberar em 18/05

Closing arguments do julgamento Musk v. Altman foram encerrados; jurados em Oakland começam deliberação em 18/05 sobre se Altman e Brockman violaram a lei de charitable-trust ao converter a OpenAI numa corporação de US$ 500 bi. Altman, no banco: 'Acredito que sou uma pessoa honesta.

Comunidade · washingtonpost · openai, sam-altman, elon-musk, governanca, charitable-trust, julgamento

Jim Fan na Sequoia AI Ascent: 2026 e o ano dos Large World Models para robotica

Na AI Ascent 2026, Jim Fan (NVIDIA) apresentou o 'second pre-training paradigm': shift de next-word prediction para next-physical-state prediction. Propoe roadmap explicito de LWMs (pre-training -> alignment -> reasoning -> auto-research) e preve Physical Turing Test em 2-3 anos.

Comunidade · X/Twitter @DrJimFan · nvidia, robotics, world-models, physical-ai

Thinking Machines lança TML-Interaction-Small: full-duplex que responde em 0,4s

Lab de Mira Murati revelou em research preview o TML-Interaction-Small: modelo full-duplex que responde em 0,40s, processa micro-turnos de 200ms e separa modelo interativo do modelo de raciocínio em background. Repercussão forte na semana.

Comunidade · techcrunch · thinking-machines, mira-murati, full-duplex, interaction-model, voz

Google Threat Intel detecta primeiro zero-day desenvolvido com IA em escala

Google Threat Intelligence reporta detecção e bloqueio do primeiro caso conhecido de zero-day desenvolvido com IA em escala — falha de bypass de 2FA em ferramenta admin open-source, com potencial de exploração em massa. Bate de frente com a narrativa Anthropic Mythos como uso defensivo.

Comunidade · thehackernews · security, zero-day, ai-misuse, google-threat-intel, cybersecurity

OpenAI cria DeployCo com USD 4 bi para embarcar engenheiros em empresas

OpenAI lancou a OpenAI Deployment Company (DeployCo) com mais de USD 4 bilhoes de 19 parceiros - Brookfield, TPG e outros - para alocar engenheiros dentro de corporacoes e acelerar integracao de modelos de fronteira. Movimento tipico de Palantir aplicado a IA generativa.

Comunidade · Distill Intelligence · openai, enterprise, funding, go-to-market

Runway atinge valuation de USD 5,3 bi e mira competir com Google em geracao de video

Runway avaliada em USD 5,3 bilhoes com USD 40 mi adicionados em ARR no Q2/2026. Apos lancar primeiro world model em dezembro, planeja segundo este ano e disputa terreno com Gemini Omni do Google. Confirma que video-gen virou batalha de world-models, nao so pixels.

Comunidade · TechCrunch · runway, video-generation, funding, world-models