# Radar do FAROL · quinta-feira, 14 de maio de 2026

54 notícias. Dados: https://radar.farolia.org/dados/dia/2026-05-14.json

## Modelos

- **[Anthropic lança Claude for Small Business](https://www.anthropic.com/news/claude-for-small-business)** (Modelos; anthropic). Anthropic anunciou o Claude for Small Business: pacote de conectores e workflows prontos que coloca Claude dentro de QuickBooks, PayPal, HubSpot, Canva, Docusign, Google Workspace e Microsoft 365. Empresas podem criar automações customizadas — ex: dashboard de receita do QuickBooks + métricas do HubSpot via Slack, com Claude disparando campanha de marketing quando vendas caem. Saiu junto com update do Agent SDK (créditos mensais de US$20–200).
- **[OpenAI Realtime-2, Realtime-Translate e Realtime-Whisper na API](https://openai.com/news/)** (Modelos; openai). Nova familia de modelos de voz com reasoning configuravel em speech-to-speech, traducao streaming e ASR streaming. Empurra agentes de voz para producao no mesmo dia em que Vapi captou US$ 50M com Amazon Ring.
- **[Anthropic anuncia Claude Mythos Preview + Project Glasswing (cybersecurity)](https://www.anthropic.com/news)** (Modelos; anthropic). Anthropic apresentou o Claude Mythos Preview, modelo especializado em identificar vulnerabilidades e falhas de segurança em software, lançado em acesso restrito sob a iniciativa Project Glasswing. Empurra o frontier para o domínio de red-team / cyber defense, área que tinha ficado para o Microsoft MDASH.
- **[Microsoft MDASH: sistema multi-modelo para descoberta autonoma de vulnerabilidades](https://thehackernews.com/)** (Modelos; thehackernews). Agentes especializados por classe de vulnerabilidade descobrem, validam e provam exploits em codebases complexos. Model-agnostic. Concorrente direto do OpenAI Daybreak anunciado 24h antes.
- **[Kimi K2.6 se confirma como melhor open-weight para devs em 2026](https://huggingface.co/blog/daya-shankar/open-source-llms)** (Modelos; hf-blog). ~1.1T parametros sob licenca MIT modificada, performance comparavel a frontier closed-source em coding e tool use. China consolida lideranca open-weight.
- **[Vazamento aponta Gemini Omni dias antes do Google I/O 2026](https://imini.com/blogs/gemini-omni-google-io-2026)** (Modelos; imini). Modelo unificado que gera texto, imagem e video num unico pipeline deve ser anunciado no Google I/O (19-20/5). Reposta ao OmniLLM da OpenAI.
- **[Gemini Intelligence chega ao Android](https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/)** (Modelos; google). Google liberou Gemini Intelligence em dispositivos Android: automação de tarefas complexas, sumarização proativa de conteúdo web, preenchimento de formulários simplificado. Rollout em verão para Samsung e Pixel selecionados, expansão depois.
- **[Google lança Gemini 3.1 Flash-Lite: 2.5× mais rápido, US$ 0,25/Mtok input](https://blog.google/technology/ai/gemini-3-1-flash-lite/)** (Modelos; google-deepmind). Google posicionou um Gemini 3.1 Flash-Lite focado em eficiência — 2.5× mais rápido em response time, 45% mais rápido em output generation que Gemini versões anteriores, a US$ 0,25 por milhão de tokens de input. Movimento de margem antes do I/O 2026 (19-20/5) onde se espera o Gemini Omni multimodal.
- **[MiniCPM-V-4.6 — multimodal on-device da OpenBMB](https://hf.co/openbmb/MiniCPM-V-4.6)** (Modelos; huggingface). MiniCPM-V-4.6 (image-text-to-text) da OpenBMB no top trending do HF: 16.8K downloads, 510 likes. Foco em rodar visão multimodal localmente em dispositivos.
- **[Google libera Gemma 4 31B IT Assistant no HF](https://hf.co/google/gemma-4-31B-it-assistant)** (Modelos; huggingface). Gemma 4 31B IT Assistant — variante any-to-any do Gemma 4 da Google, Apache 2.0, 109K downloads, 232 likes. Reforça aposta open-weights antes do I/O 2026.

## Ferramentas e código

- **[OpenAI Codex agora no app ChatGPT mobile (iOS/Android)](https://openai.com/index/work-with-codex-from-anywhere/)** (Ferramentas e código; openai-blog). Codex passou a ser invocável de dentro do app do ChatGPT no iOS e Android. Usuários podem iniciar/retomar threads, aprovar comandos, mudar de rumo e revisar resultados enquanto o agente continua rodando no Mac host. Junto com o /goal e o Agent View do Claude Code, é o segundo grande sinal da semana de que coding agents estão saindo do CLI/IDE e indo para 'qualquer lugar'.
- **[MCP Roadmap 2026: Streamable HTTP, Tasks, enterprise readiness e governanca](https://blog.modelcontextprotocol.io/posts/2026-mcp-roadmap/)** (Ferramentas e código; mcp-blog). Mantenedores priorizam transporte HTTP stateful, retry semantics em Tasks, SSO/audit corporativo e desbloqueio do bottleneck de SEPs. MCP virando padrao de fato para agentes em producao.
- **[Google lanca Deep Research Max com Gemini 3.1 Pro, MCP e visualizacoes nativas](https://blog.google/innovation-and-ai/models-and-research/gemini-models/next-generation-gemini-deep-research/)** (Ferramentas e código; google-blog). Nova geracao de agentes de pesquisa autonoma com suporte MCP, visualizacoes nativas e workflows long-horizon em web ou fontes custom. Google entrando no mercado de agentes de research a la Perplexity Pro e ChatGPT Deep Research.
- **[Hugging Face lanca ml-intern: agente open-source para ML engineering](https://aitoolly.com/ai-news/article/2026-04-25-hugging-face-launches-ml-intern-an-open-source-ai-agent-for-machine-learning-engineering-tasks)** (Ferramentas e código; aitoolly). Agente open-source que le papers, treina modelos e faz deploy autonomamente. Resposta open ao Devin/Codex cloud.
- **[MCP Apps (SEP-1865) formaliza entrega de UI interativa via servidores MCP](https://thenewstack.io/model-context-protocol-roadmap-2026/)** (Ferramentas e código; thenewstack). Antiga mcp-ui vira spec oficial — protocolo agora cobre rendering de widgets, nao so dados. Abre caminho para apps inteiros distribuidos como MCPs.
- **[Cursor 3.2 ganha /multitask para subagentes paralelos; Zed 1.0 com Agent Client Protocol](https://thenewstack.io/ai-coding-tool-stack/)** (Ferramentas e código; thenewstack). Comando /multitask do Cursor 3.2 spawna subagentes em paralelo no IDE; Zed 1.0 trouxe paralelismo nativo via Agent Client Protocol. Paralelismo de agentes vira commodity em IDEs.
- **[OpenAI: Trabalhe com Codex de qualquer lugar](https://openai.com/index/work-with-codex-from-anywhere)** (Ferramentas e código; openai-rss). OpenAI lanca capacidade de invocar Codex a partir de telefone, web, Slack e PRs do GitHub, alem do CLI/IDE. Codex passa a operar 'cloud-first' como o Claude Code agent view — reforca a guerra de coding agents em 14/5.
- **[OpenAI lança Daybreak — detecção de vulnerabilidade e validação de patch via IA](https://thehackernews.com/2026/05/openai-launches-daybreak-for-ai-powered.html)** (Ferramentas e código; thehackernews). OpenAI lançou o Daybreak, sistema agêntico que descobre, valida e propõe patches para vulnerabilidades em codebases complexas. Parte da corrida defensiva contra ataques zero-day assistidos por IA.
- **[yetone/native-feel-skill viraliza no GitHub (839 stars em 36h)](https://github.com/yetone/native-feel-skill)** (Ferramentas e código; github). Yetone publicou no GitHub uma Agent Skill (Claude Code / Codex / Cursor) que ensina o agente a desenhar apps desktop cross-platform que parecem nativos — destilada de reverse-engineering profundo do Raycast 2.0 Beta. 839 stars em ~36h, indicando que skills do tipo 'destilação de design system' viraram commodity quente.
- **[Anthropic publica guia oficial: How Claude Code works in large codebases](https://claude.com/blog/how-claude-code-works-in-large-codebases-best-practices-and-where-to-start)** (Ferramentas e código; anthropic-blog). Anthropic publicou guia oficial de best practices de Claude Code em codebases grandes. Foi para #4 no Hacker News (176 pts) e abre discussão sobre como o Claude navega monorepos, mantém contexto de PRs e divide trabalho entre subagentes. Leitura essencial para quem já adotou Claude Code em produção.
- **[OpenAI Codex ganha extensão para Chrome com trabalho paralelo em abas](https://developers.openai.com/codex/changelog)** (Ferramentas e código; openai). Junto com a chegada do Codex no app ChatGPT mobile, OpenAI lançou uma extensão Chrome que permite ao agente trabalhar em paralelo entre abas mantendo controle do usuário sobre acesso a sites. Não 'toma' o navegador — opera em background, completando trabalho enquanto o dev continua usando o Chrome normalmente.
- **[DeepMind detalha 'Magic Pointer' do Googlebook (vem para Gemini no Chrome)](https://9to5google.com/2026/05/12/deepmind-googlebook-magic-pointer/)** (Ferramentas e código; 9to5google). DeepMind detalhou o 'Magic Pointer' do Googlebook com demos interativos. Funcionalidade está vindo também para o Gemini no Chrome — agente que aponta/destaca elementos da tela para guiar o usuário.
- **[Claude add-ins Microsoft 365 em GA (Excel, PowerPoint, Word); Outlook beta](https://releasebot.io/updates/anthropic/claude)** (Ferramentas e código; releasebot). Add-ins do Claude para Office saem do beta com contexto compartilhado entre apps e sync de edicao entre arquivos abertos. Pressao adicional sobre Microsoft Copilot for Business.
- **[LlamaIndex lanca LiteParse para extracao de alta fidelidade em PDFs e slides](https://www.mindstudio.ai/blog/llm-frameworks-replaced-by-agent-sdks)** (Ferramentas e código; mindstudio). Open source com visual understanding multimodal e workflow engine event-driven. Chega no momento em que founder admite que era dos frameworks RAG esta acabando, dando lugar a Agent SDKs + MCP.
- **[Rewrite do Bun em Rust foi mergeado](https://github.com/oven-sh/bun/pull/30412)** (Ferramentas e código; github). PR #30412 do Bun com a reescrita em Rust foi mergeada. Marco importante para o runtime JS/TS — performance e manutenibilidade. 106 pontos no HN nas últimas horas.
- **[Simon Willison constrói datasette-ip-rate-limit usando Codex GPT-5.5 xhigh](https://simonwillison.net/2026/May/14/datasette-ip-rate-limit/)** (Ferramentas e código; simonwillison). Simon Willison publicou release do plugin datasette-ip-rate-limit 0.1a0, construído na íntegra usando Codex (GPT-5.5 xhigh) para bloquear IPs que estavam martelando endpoints como /global-power-plants/* e /legislators/*. Case study real de 'vibe coding' em produção, com configuração de janelas e cooldown, exportado via Markdown session transcript do Codex desktop.
- **[Skill para Claude Code/Codex: 'Deliberate Skill Development](https://github.com/DrCatHicks/learning-opportunities)** (Ferramentas e código; github). Skill open-source para Claude Code e Codex projetada para 'deliberate skill development' — usar os agentes de coding para acelerar aprendizado humano, não substituir. 60 pontos no HN.
- **[Simon Willison libera llm 0.32a2](https://simonwillison.net/2026/May/12/llm/)** (Ferramentas e código; simonwillison). Nova alpha do CLI 'llm' (0.32a2): refinamentos em tool calling, integração com mais providers, melhorias no fluxo de plugins.
- **[TIL: usar llm na linha shebang de um script](https://simonwillison.net/2026/May/11/llm-shebang/)** (Ferramentas e código; simonwillison). Truque do Simon Willison: usar o CLI 'llm' direto na shebang line de um script, transformando o arquivo num agente executável com tool calls.
- **[Simon Willison abre blog dedicado ao Datasette](https://simonwillison.net/2026/May/13/welcome-to-the-datasette-blog/)** (Ferramentas e código; simonwillison). Simon Willison anuncia o lançamento do blog dedicado ao Datasette, projeto open-source de exploração de dados via SQLite.

## Pesquisa

- **[Position paper: avaliação comportamental não verifica os safety claims que a governança exige](http://arxiv.org/abs/2605.15164v1)** (Pesquisa; arxiv). Position paper argumenta que frameworks de governança IA (2019-2026) exigem 'evidência revisável' de propriedades — bias, refusal, robustness, etc. — mas a metodologia dominante (behavioural assurance via testes) é fundamentalmente incapaz de verificar essas propriedades. Crítica oportuna no momento em que CAISI assina acordos com Google/Microsoft/xAI.
- **[MinerU2.5: VLM de 1.2B para parsing de documentos com SOTA](https://huggingface.co/papers/trending)** (Pesquisa; hf-papers). Estrategia coarse-to-fine permite parsing de PDFs com fidelidade SOTA num modelo enxuto. Pressao sobre Mistral OCR e GPT-4o doc parsing.
- **[Anthropic: Natural Language Autoencoder em Claude (interpretabilidade)](https://www.anthropic.com/research/natural-language-autoencoder)** (Pesquisa; anthropic). Tecnica de interpretabilidade que aprende representacoes em linguagem natural dos circuitos internos do Claude. Passo importante para mech-interp escalavel.
- **[Codex (GPT-5.5) atinge 82.7% em Terminal-Bench 2.0; Claude Code lidera SWE-bench Verified](https://sourceryintel.com/reports/the-state-of-ai-coding-agents-2026)** (Pesquisa; sourcery-intel). Novo benchmark coloca Codex a frente em workflows de terminal; Claude Code segue lider em SWE-bench Verified (77-81%). Diferenciacao por persona de uso.
- **[arXiv: 'History Anchors' — passado de uma trace empurra LLM a continuar ações inseguras](http://arxiv.org/abs/2605.13825v1)** (Pesquisa; arxiv). Achado de segurança importante: se um passo anterior numa trace foi danoso, frontier LLMs tendem a continuar a trajetória nociva. Bench HistoryAnchor-100 para medir o efeito. Implicação direta para agentes long-running.
- **[arXiv: 'Good Agentic Friends... Update Your Weights' — multi-agent além de texto](http://arxiv.org/abs/2605.13839v1)** (Pesquisa; arxiv). Paper propõe que agentes LLM colaborem não só por mensagens em linguagem natural (custo de tokens, perda de info intermediária) mas atualizando pesos uns dos outros diretamente. Aponta caminhos para colaboração agêntica mais eficiente.
- **[FutureSim: Replaying World Events to Evaluate Adaptive Agents](http://arxiv.org/abs/2605.15188v1)** (Pesquisa; arxiv). Novo benchmark mede adaptação de agentes a informação que muda ao longo do tempo. Em vez de avaliação estática, FutureSim replay de eventos reais do mundo em ambientes simulados, forçando o agente a reagir a 'notícias' incrementais que invalidam decisões prévias. Resposta a um gap relevante dos benchmarks atuais.
- **[ATLAS: agentic vs. latent visual reasoning — uma palavra basta para ambos](http://arxiv.org/abs/2605.15198v1)** (Pesquisa; arxiv). Paper argumenta que visual reasoning intermediário não precisa ser sempre gerado como imagem (caro) nem sempre latent (opaco) — uma única palavra-pivô permite escolher dinamicamente. Endereça o trade-off entre raciocínio visual gerativo e raciocínio latent no mesmo modelo.
- **[OpenDeepThink: paralelismo de reasoning via agregação Bradley-Terry](http://arxiv.org/abs/2605.15177v1)** (Pesquisa; arxiv). Paper propõe agregar múltiplos traços de raciocínio paralelos via Bradley-Terry (modelo de comparação pareada usado em ranking esportivo) em vez de chain-of-thought serial mais longa. Endereça o problema clássico de scaling breadth (sampling múltiplos candidatos) sem perder coerência ou explodir custo.
- **[arXiv: EVA-Bench — framework end-to-end para avaliar agentes de voz](http://arxiv.org/abs/2605.13841v1)** (Pesquisa; arxiv). EVA-Bench gera conversas simuladas realistas E mede qualidade — primeiro benchmark a cobrir as duas pontas para agentes de voz em aplicações enterprise.
- **[arXiv: detecção de alucinação no nível do passo via geometria de transporte de hidden-states](http://arxiv.org/abs/2605.13772v1)** (Pesquisa; arxiv). Aborda alucinação como propriedade do passo de raciocínio, não do trace inteiro. Detector que localiza o primeiro erro sem precisar de múltiplas amostras.

## Comunidade

- **[Anthropic × Gates Foundation: parceria de US$ 200M para IA em saúde, educação e agricultura no Sul Global](https://www.anthropic.com/news/gates-foundation-partnership)** (Comunidade; anthropic-news). Anthropic e Gates Foundation anunciam parceria de US$ 200 milhões em 4 anos combinando grants, créditos de Claude e suporte técnico para programas em saúde global, ciências da vida, educação, agricultura e mobilidade econômica. Foco inicial em doenças negligenciadas (polio, HPV, eclâmpsia/pré-eclâmpsia), tutoria evidence-based para K-12, e suporte a smallholder farmers. Inclui esforço explícito de coleta/labeling de dados em línguas africanas sub-representadas, com release público para melhorar a indústria toda. Maior aposta filantrópica de uma lab frontier até hoje — e movimento que posiciona Anthropic no eixo "AI for good" às vésperas do I/O e em contraste com a polarização Altman-Musk.
- **[Karpathy publica resumo do Sequoia AI Ascent 2026](https://karpathy.bearblog.dev/sequoia-ascent-2026/)** (Comunidade; karpathy-bearblog). Notas sobre vibe coding evoluindo para agentic engineering, conversas com Hassabis e Jim Fan. Leitura obrigatoria da semana para quem opera na fronteira de agentes.
- **[Anthropic e Gates Foundation lancam parceria de US$ 200mi em saude, educacao e agricultura](https://www.anthropic.com/news/gates-foundation-partnership)** (Comunidade; anthropic). Parceria de 4 anos com US$ 200 milhoes em grant, creditos de API Claude e suporte tecnico para construir bens publicos de IA em saude (polio, HPV, eclampsia), educacao (infra compartilhada para professores) e agricultura (decisoes em tempo real para pequenos produtores em linguas locais).
- **[Anthropic aperta cotas de tokens enquanto OpenAI corteja devs de agentes](https://www.axios.com/2026/05/14/anthropic-claude-price-openai-tokens)** (Comunidade; axios). Anthropic reduziu cotas de tokens em planos pagos no mesmo dia em que OpenAI lanca ofertas agressivas de preco para devs de agentes (Codex from anywhere). Sinal de guerra de margem no segmento de coding agents.
- **[Google I/O 2026 (19-20/05): preview confirma Gemini 4, Android 17 Adaptive Everywhere e possível Veo 4](https://www.androidauthority.com/what-to-expect-from-google-io-2026-3664979/)** (Comunidade; android-authority). Google I/O 2026 acontece 19-20/05 em Mountain View. Confirmado bump de versão para Gemini (provavelmente Gemini 4) com overhaul UX, modelo multimodal nativo unificado (texto + imagem + áudio + vídeo + código no mesmo prompt) e context windows maiores. Possíveis novidades em Veo (4) e Lyria. Android 17 "Adaptive Everywhere" merge Android + ChromeOS + XR. Magic Pointer (item de hoje) ganha rollout amplo. Calendário deixa I/O 6 dias depois do Anthropic Gates/SMB blitz — pauta de IA segue dominando a primeira metade do ano.
- **[Google diz ter prevenido 'mass exploitation event' assistido por IA](https://www.cnbc.com/2026/05/11/google-thwarts-effort-hacker-group-use-ai-mass-exploitation-event.html)** (Comunidade; cnbc). Google divulgou que sua descoberta proativa impediu um grupo criminoso de usar IA num evento de exploração em massa. Atacantes vinham testando ferramentas como 'OpenClaw' para explorar falhas de software. A corrida defesa × ataque favorece atacantes em 2025–2026.
- **[AI is making me dumb' viraliza no HN (492 pts) — debate sobre cognitive offloading](https://jpain.io/god-damn-ai-is-making-me-dumb/)** (Comunidade; hackernews). Post pessoal de J. Pain virou notícia #1 do Hacker News (492 pts). Autor descreve perda de habilidades 'core' (parsear logs, debugar sem hint, escrever sem revisão) depois de 18 meses usando agentes de coding intensivamente. Discussão derivou para uma versão moderna do 'GPS apagou minha orientação espacial' — agora aplicada a engenharia de software.
- **[LangChain Interrupt 2026 (SF, 13-14/5): Deep Agents Deploy beta + LangSmith Fleet](https://www.langchain.com/blog/previewing-interrupt-2026-agents-at-enterprise-scale)** (Comunidade; langchain). A LangChain rodou Interrupt 2026 em San Francisco com 1000+ pessoas (Apple, Coinbase, LinkedIn, NVIDIA, Lyft, Rippling, Workday, Honeywell). Anúncios: Deep Agents Deploy em beta e LangSmith Fleet (rebrand do Agent Builder). Foco do evento: como empresas grandes estão construindo plataformas de agentes em escala, com evals fortes e structures de time dedicadas a 'agent engineering'.
- **[Vapi capta US$ 50M apos operar 100% das chamadas da Amazon Ring](https://theaiinsider.tech/2026/05/14/ai-voice-startup-vapi-secures-50m-after-handling-100-of-amazon-rings-customer-calls/)** (Comunidade; the-ai-insider). Rodada liderada com M12 (Microsoft), Kleiner Perkins e Bessemer. Total US$ 72M. Marco para AI voice em customer service.
- **[Simon Willison: 'Not so locked in any more](https://simonwillison.net/2026/May/14/not-so-locked-in/)** (Comunidade; simonwillison). Reflexao sobre como o mercado de modelos esta finalmente reduzindo lock-in: APIs compativeis, MCP, modelos open-weight competitivos e portabilidade real entre Claude/GPT/Gemini para tarefas tipicas.
- **[Anton Leicht: acesso a frontier AI será limitado por restrições econômicas e de segurança](https://writing.antonleicht.me/p/cut-off)** (Comunidade; blog-anton-leicht). Ensaio viral no Hacker News (167 pts) argumenta que acesso aos modelos frontier vai ficar concentrado por dois motivos convergentes: compute escasso/caro (data center bottleneck) e oversight de segurança (CAISI, EU AI Act). Implicação: a janela 'todo mundo na Claude API por US$ 20/mês' pode estar fechando.
- **[Auditoria de Ontario: AI note takers em consultórios médicos errando fatos básicos](https://www.theregister.com/ai-ml/2026/05/14/ontario-auditors-find-doctors-ai-note-takers-routinely-blow-basic-facts/5240771)** (Comunidade; the-register). Auditoria pública de Ontario encontrou que AI scribes médicos (Abridge, Nuance DAX, etc.) erram rotineiramente fatos básicos — dosagens, idade, lateralidade. Caso vira sinal vermelho para healthcare AI sem validação humana. 243 pontos no HN.
- **[Arena AI Model ELO History — visualização da corrida de modelos](https://mayerwin.github.io/AI-Arena-History/)** (Comunidade; github-pages). Site interativo plotando o histórico de ELO no LM Arena por modelo. Ajuda a ver a curva de aceleração dos frontier models. 61 pontos no HN.
