Radar do FAROL54 notas

quinta-feira, 14 de maio de 2026

Modelos

Anthropic lança Claude for Small Business

Anthropic anunciou o Claude for Small Business: pacote de conectores e workflows prontos que coloca Claude dentro de QuickBooks, PayPal, HubSpot, Canva, Docusign, Google Workspace e Microsoft 365. Empresas podem criar automações customizadas — ex: dashboard de receita do QuickBooks + métricas do HubSpot via Slack, com Claude disparando campanha de marketing quando vendas caem. Saiu junto com update do Agent SDK (créditos mensais de US$20–200).

Modelos · anthropic · - anthropic

OpenAI Realtime-2, Realtime-Translate e Realtime-Whisper na API

Nova familia de modelos de voz com reasoning configuravel em speech-to-speech, traducao streaming e ASR streaming. Empurra agentes de voz para producao no mesmo dia em que Vapi captou US$ 50M com Amazon Ring.

Modelos · openai · openai, realtime, voz, traducao, asr

Anthropic anuncia Claude Mythos Preview + Project Glasswing (cybersecurity)

Anthropic apresentou o Claude Mythos Preview, modelo especializado em identificar vulnerabilidades e falhas de segurança em software, lançado em acesso restrito sob a iniciativa Project Glasswing. Empurra o frontier para o domínio de red-team / cyber defense, área que tinha ficado para o Microsoft MDASH.

Modelos · anthropic · anthropic, claude, cybersecurity, vulnerabilities, preview

Microsoft MDASH: sistema multi-modelo para descoberta autonoma de vulnerabilidades

Agentes especializados por classe de vulnerabilidade descobrem, validam e provam exploits em codebases complexos. Model-agnostic. Concorrente direto do OpenAI Daybreak anunciado 24h antes.

Modelos · thehackernews · microsoft, security, vulnerabilities, agents

Kimi K2.6 se confirma como melhor open-weight para devs em 2026

~1.1T parametros sob licenca MIT modificada, performance comparavel a frontier closed-source em coding e tool use. China consolida lideranca open-weight.

Modelos · hf-blog · kimi, moonshot, open-weight, coding

Vazamento aponta Gemini Omni dias antes do Google I/O 2026

Modelo unificado que gera texto, imagem e video num unico pipeline deve ser anunciado no Google I/O (19-20/5). Reposta ao OmniLLM da OpenAI.

Modelos · imini · google, gemini, omni, vazamento, io-2026

Gemini Intelligence chega ao Android

Google liberou Gemini Intelligence em dispositivos Android: automação de tarefas complexas, sumarização proativa de conteúdo web, preenchimento de formulários simplificado. Rollout em verão para Samsung e Pixel selecionados, expansão depois.

Modelos · google · - google

Google lança Gemini 3.1 Flash-Lite: 2.5× mais rápido, US$ 0,25/Mtok input

Google posicionou um Gemini 3.1 Flash-Lite focado em eficiência — 2.5× mais rápido em response time, 45% mais rápido em output generation que Gemini versões anteriores, a US$ 0,25 por milhão de tokens de input. Movimento de margem antes do I/O 2026 (19-20/5) onde se espera o Gemini Omni multimodal.

Modelos · google-deepmind · google, gemini, flash-lite, preco, efficient-models

MiniCPM-V-4.6 — multimodal on-device da OpenBMB

MiniCPM-V-4.6 (image-text-to-text) da OpenBMB no top trending do HF: 16.8K downloads, 510 likes. Foco em rodar visão multimodal localmente em dispositivos.

Modelos · huggingface · - openbmb

Google libera Gemma 4 31B IT Assistant no HF

Gemma 4 31B IT Assistant — variante any-to-any do Gemma 4 da Google, Apache 2.0, 109K downloads, 232 likes. Reforça aposta open-weights antes do I/O 2026.

Modelos · huggingface · - google

Ferramentas e código

OpenAI Codex agora no app ChatGPT mobile (iOS/Android)

Codex passou a ser invocável de dentro do app do ChatGPT no iOS e Android. Usuários podem iniciar/retomar threads, aprovar comandos, mudar de rumo e revisar resultados enquanto o agente continua rodando no Mac host. Junto com o /goal e o Agent View do Claude Code, é o segundo grande sinal da semana de que coding agents estão saindo do CLI/IDE e indo para 'qualquer lugar'.

Ferramentas e código · openai-blog · openai, codex, mobile, coding-agents, ide, remote-control

MCP Roadmap 2026: Streamable HTTP, Tasks, enterprise readiness e governanca

Mantenedores priorizam transporte HTTP stateful, retry semantics em Tasks, SSO/audit corporativo e desbloqueio do bottleneck de SEPs. MCP virando padrao de fato para agentes em producao.

Ferramentas e código · mcp-blog · mcp, protocol, streamable-http, tasks, governanca

Google lanca Deep Research Max com Gemini 3.1 Pro, MCP e visualizacoes nativas

Nova geracao de agentes de pesquisa autonoma com suporte MCP, visualizacoes nativas e workflows long-horizon em web ou fontes custom. Google entrando no mercado de agentes de research a la Perplexity Pro e ChatGPT Deep Research.

Ferramentas e código · google-blog · google, gemini, deep-research, mcp, agentes

Hugging Face lanca ml-intern: agente open-source para ML engineering

Agente open-source que le papers, treina modelos e faz deploy autonomamente. Resposta open ao Devin/Codex cloud.

Ferramentas e código · aitoolly · huggingface, ml-intern, open-source, agentes

MCP Apps (SEP-1865) formaliza entrega de UI interativa via servidores MCP

Antiga mcp-ui vira spec oficial — protocolo agora cobre rendering de widgets, nao so dados. Abre caminho para apps inteiros distribuidos como MCPs.

Ferramentas e código · thenewstack · mcp, mcp-apps, ui, widgets, sep-1865

Cursor 3.2 ganha /multitask para subagentes paralelos; Zed 1.0 com Agent Client Protocol

Comando /multitask do Cursor 3.2 spawna subagentes em paralelo no IDE; Zed 1.0 trouxe paralelismo nativo via Agent Client Protocol. Paralelismo de agentes vira commodity em IDEs.

Ferramentas e código · thenewstack · cursor, zed, agent-client-protocol, paralelismo

OpenAI: Trabalhe com Codex de qualquer lugar

OpenAI lanca capacidade de invocar Codex a partir de telefone, web, Slack e PRs do GitHub, alem do CLI/IDE. Codex passa a operar 'cloud-first' como o Claude Code agent view — reforca a guerra de coding agents em 14/5.

Ferramentas e código · openai-rss · openai, codex, agentes, coding

OpenAI lança Daybreak — detecção de vulnerabilidade e validação de patch via IA

OpenAI lançou o Daybreak, sistema agêntico que descobre, valida e propõe patches para vulnerabilidades em codebases complexas. Parte da corrida defensiva contra ataques zero-day assistidos por IA.

Ferramentas e código · thehackernews · - openai

yetone/native-feel-skill viraliza no GitHub (839 stars em 36h)

Yetone publicou no GitHub uma Agent Skill (Claude Code / Codex / Cursor) que ensina o agente a desenhar apps desktop cross-platform que parecem nativos — destilada de reverse-engineering profundo do Raycast 2.0 Beta. 839 stars em ~36h, indicando que skills do tipo 'destilação de design system' viraram commodity quente.

Ferramentas e código · github · github, agent-skill, raycast, design, trending

Anthropic publica guia oficial: How Claude Code works in large codebases

Anthropic publicou guia oficial de best practices de Claude Code em codebases grandes. Foi para #4 no Hacker News (176 pts) e abre discussão sobre como o Claude navega monorepos, mantém contexto de PRs e divide trabalho entre subagentes. Leitura essencial para quem já adotou Claude Code em produção.

Ferramentas e código · anthropic-blog · anthropic, claude-code, best-practices, codebases, guide

OpenAI Codex ganha extensão para Chrome com trabalho paralelo em abas

Junto com a chegada do Codex no app ChatGPT mobile, OpenAI lançou uma extensão Chrome que permite ao agente trabalhar em paralelo entre abas mantendo controle do usuário sobre acesso a sites. Não 'toma' o navegador — opera em background, completando trabalho enquanto o dev continua usando o Chrome normalmente.

Ferramentas e código · openai · openai, codex, chrome-extension, browser-agent, parallel

DeepMind detalha 'Magic Pointer' do Googlebook (vem para Gemini no Chrome)

DeepMind detalhou o 'Magic Pointer' do Googlebook com demos interativos. Funcionalidade está vindo também para o Gemini no Chrome — agente que aponta/destaca elementos da tela para guiar o usuário.

Ferramentas e código · 9to5google · - google

Claude add-ins Microsoft 365 em GA (Excel, PowerPoint, Word); Outlook beta

Add-ins do Claude para Office saem do beta com contexto compartilhado entre apps e sync de edicao entre arquivos abertos. Pressao adicional sobre Microsoft Copilot for Business.

Ferramentas e código · releasebot · anthropic, microsoft-365, office, claude

LlamaIndex lanca LiteParse para extracao de alta fidelidade em PDFs e slides

Open source com visual understanding multimodal e workflow engine event-driven. Chega no momento em que founder admite que era dos frameworks RAG esta acabando, dando lugar a Agent SDKs + MCP.

Ferramentas e código · mindstudio · llamaindex, liteparse, parsing, rag

Rewrite do Bun em Rust foi mergeado

PR #30412 do Bun com a reescrita em Rust foi mergeada. Marco importante para o runtime JS/TS — performance e manutenibilidade. 106 pontos no HN nas últimas horas.

Ferramentas e código · github · - bun

Simon Willison constrói datasette-ip-rate-limit usando Codex GPT-5.5 xhigh

Simon Willison publicou release do plugin datasette-ip-rate-limit 0.1a0, construído na íntegra usando Codex (GPT-5.5 xhigh) para bloquear IPs que estavam martelando endpoints como /global-power-plants/* e /legislators/*. Case study real de 'vibe coding' em produção, com configuração de janelas e cooldown, exportado via Markdown session transcript do Codex desktop.

Ferramentas e código · simonwillison · simon-willison, codex, datasette, case-study, vibe-coding

Skill para Claude Code/Codex: 'Deliberate Skill Development

Skill open-source para Claude Code e Codex projetada para 'deliberate skill development' — usar os agentes de coding para acelerar aprendizado humano, não substituir. 60 pontos no HN.

Ferramentas e código · github · - claude-code

Simon Willison libera llm 0.32a2

Nova alpha do CLI 'llm' (0.32a2): refinamentos em tool calling, integração com mais providers, melhorias no fluxo de plugins.

Ferramentas e código · simonwillison · - llm-cli

TIL: usar llm na linha shebang de um script

Truque do Simon Willison: usar o CLI 'llm' direto na shebang line de um script, transformando o arquivo num agente executável com tool calls.

Ferramentas e código · simonwillison · - llm-cli

Simon Willison abre blog dedicado ao Datasette

Simon Willison anuncia o lançamento do blog dedicado ao Datasette, projeto open-source de exploração de dados via SQLite.

Ferramentas e código · simonwillison · - datasette

Pesquisa

Position paper: avaliação comportamental não verifica os safety claims que a governança exige

Position paper argumenta que frameworks de governança IA (2019-2026) exigem 'evidência revisável' de propriedades — bias, refusal, robustness, etc. — mas a metodologia dominante (behavioural assurance via testes) é fundamentalmente incapaz de verificar essas propriedades. Crítica oportuna no momento em que CAISI assina acordos com Google/Microsoft/xAI.

Pesquisa · arxiv · ai-safety, governance, behavioural-assurance, position-paper, arxiv

MinerU2.5: VLM de 1.2B para parsing de documentos com SOTA

Estrategia coarse-to-fine permite parsing de PDFs com fidelidade SOTA num modelo enxuto. Pressao sobre Mistral OCR e GPT-4o doc parsing.

Pesquisa · hf-papers · mineru, vlm, doc-parsing, ocr

Anthropic: Natural Language Autoencoder em Claude (interpretabilidade)

Tecnica de interpretabilidade que aprende representacoes em linguagem natural dos circuitos internos do Claude. Passo importante para mech-interp escalavel.

Pesquisa · anthropic · anthropic, interpretabilidade, autoencoder, mech-interp

Codex (GPT-5.5) atinge 82.7% em Terminal-Bench 2.0; Claude Code lidera SWE-bench Verified

Novo benchmark coloca Codex a frente em workflows de terminal; Claude Code segue lider em SWE-bench Verified (77-81%). Diferenciacao por persona de uso.

Pesquisa · sourcery-intel · codex, claude-code, terminal-bench, swe-bench

arXiv: 'History Anchors' — passado de uma trace empurra LLM a continuar ações inseguras

Achado de segurança importante: se um passo anterior numa trace foi danoso, frontier LLMs tendem a continuar a trajetória nociva. Bench HistoryAnchor-100 para medir o efeito. Implicação direta para agentes long-running.

Pesquisa · arxiv · - llm-safety

arXiv: 'Good Agentic Friends... Update Your Weights' — multi-agent além de texto

Paper propõe que agentes LLM colaborem não só por mensagens em linguagem natural (custo de tokens, perda de info intermediária) mas atualizando pesos uns dos outros diretamente. Aponta caminhos para colaboração agêntica mais eficiente.

Pesquisa · arxiv · - multi-agent

FutureSim: Replaying World Events to Evaluate Adaptive Agents

Novo benchmark mede adaptação de agentes a informação que muda ao longo do tempo. Em vez de avaliação estática, FutureSim replay de eventos reais do mundo em ambientes simulados, forçando o agente a reagir a 'notícias' incrementais que invalidam decisões prévias. Resposta a um gap relevante dos benchmarks atuais.

Pesquisa · arxiv · benchmarks, adaptive-agents, simulation, evaluation, arxiv

ATLAS: agentic vs. latent visual reasoning — uma palavra basta para ambos

Paper argumenta que visual reasoning intermediário não precisa ser sempre gerado como imagem (caro) nem sempre latent (opaco) — uma única palavra-pivô permite escolher dinamicamente. Endereça o trade-off entre raciocínio visual gerativo e raciocínio latent no mesmo modelo.

Pesquisa · arxiv · visual-reasoning, vlm, agentic-reasoning, latent-reasoning, arxiv

OpenDeepThink: paralelismo de reasoning via agregação Bradley-Terry

Paper propõe agregar múltiplos traços de raciocínio paralelos via Bradley-Terry (modelo de comparação pareada usado em ranking esportivo) em vez de chain-of-thought serial mais longa. Endereça o problema clássico de scaling breadth (sampling múltiplos candidatos) sem perder coerência ou explodir custo.

Pesquisa · arxiv · reasoning, test-time-compute, parallel-sampling, bradley-terry, arxiv

arXiv: EVA-Bench — framework end-to-end para avaliar agentes de voz

EVA-Bench gera conversas simuladas realistas E mede qualidade — primeiro benchmark a cobrir as duas pontas para agentes de voz em aplicações enterprise.

Pesquisa · arxiv · - voice-agents

arXiv: detecção de alucinação no nível do passo via geometria de transporte de hidden-states

Aborda alucinação como propriedade do passo de raciocínio, não do trace inteiro. Detector que localiza o primeiro erro sem precisar de múltiplas amostras.

Pesquisa · arxiv · - hallucination

Comunidade

Anthropic × Gates Foundation: parceria de US$ 200M para IA em saúde, educação e agricultura no Sul Global

Anthropic e Gates Foundation anunciam parceria de US$ 200 milhões em 4 anos combinando grants, créditos de Claude e suporte técnico para programas em saúde global, ciências da vida, educação, agricultura e mobilidade econômica. Foco inicial em doenças negligenciadas (polio, HPV, eclâmpsia/pré-eclâmpsia), tutoria evidence-based para K-12, e suporte a smallholder farmers. Inclui esforço explícito de coleta/labeling de dados em línguas africanas sub-representadas, com release público para melhorar a indústria toda. Maior aposta filantrópica de uma lab frontier até hoje — e movimento que posiciona Anthropic no eixo "AI for good" às vésperas do I/O e em contraste com a polarização Altman-Musk.

Comunidade · anthropic-news · anthropic, gates-foundation, global-health, education, agriculture, AI4SDG

Karpathy publica resumo do Sequoia AI Ascent 2026

Notas sobre vibe coding evoluindo para agentic engineering, conversas com Hassabis e Jim Fan. Leitura obrigatoria da semana para quem opera na fronteira de agentes.

Comunidade · karpathy-bearblog · karpathy, sequoia, ai-ascent, vibe-coding, agentic-engineering

Anthropic e Gates Foundation lancam parceria de US$ 200mi em saude, educacao e agricultura

Parceria de 4 anos com US$ 200 milhoes em grant, creditos de API Claude e suporte tecnico para construir bens publicos de IA em saude (polio, HPV, eclampsia), educacao (infra compartilhada para professores) e agricultura (decisoes em tempo real para pequenos produtores em linguas locais).

Comunidade · anthropic · anthropic, gates-foundation, social-impact, saude, educacao, agricultura

Anthropic aperta cotas de tokens enquanto OpenAI corteja devs de agentes

Anthropic reduziu cotas de tokens em planos pagos no mesmo dia em que OpenAI lanca ofertas agressivas de preco para devs de agentes (Codex from anywhere). Sinal de guerra de margem no segmento de coding agents.

Comunidade · axios · anthropic, openai, pricing, tokens, agents

Google I/O 2026 (19-20/05): preview confirma Gemini 4, Android 17 Adaptive Everywhere e possível Veo 4

Google I/O 2026 acontece 19-20/05 em Mountain View. Confirmado bump de versão para Gemini (provavelmente Gemini 4) com overhaul UX, modelo multimodal nativo unificado (texto + imagem + áudio + vídeo + código no mesmo prompt) e context windows maiores. Possíveis novidades em Veo (4) e Lyria. Android 17 "Adaptive Everywhere" merge Android + ChromeOS + XR. Magic Pointer (item de hoje) ganha rollout amplo. Calendário deixa I/O 6 dias depois do Anthropic Gates/SMB blitz — pauta de IA segue dominando a primeira metade do ano.

Comunidade · android-authority · google, deepmind, gemini, veo, io-2026, android

Google diz ter prevenido 'mass exploitation event' assistido por IA

Google divulgou que sua descoberta proativa impediu um grupo criminoso de usar IA num evento de exploração em massa. Atacantes vinham testando ferramentas como 'OpenClaw' para explorar falhas de software. A corrida defesa × ataque favorece atacantes em 2025–2026.

Comunidade · cnbc · - google

AI is making me dumb' viraliza no HN (492 pts) — debate sobre cognitive offloading

Post pessoal de J. Pain virou notícia #1 do Hacker News (492 pts). Autor descreve perda de habilidades 'core' (parsear logs, debugar sem hint, escrever sem revisão) depois de 18 meses usando agentes de coding intensivamente. Discussão derivou para uma versão moderna do 'GPS apagou minha orientação espacial' — agora aplicada a engenharia de software.

Comunidade · hackernews · cognitive-offloading, dependencia-ia, hackernews-viral, produtividade, metacognicao

LangChain Interrupt 2026 (SF, 13-14/5): Deep Agents Deploy beta + LangSmith Fleet

A LangChain rodou Interrupt 2026 em San Francisco com 1000+ pessoas (Apple, Coinbase, LinkedIn, NVIDIA, Lyft, Rippling, Workday, Honeywell). Anúncios: Deep Agents Deploy em beta e LangSmith Fleet (rebrand do Agent Builder). Foco do evento: como empresas grandes estão construindo plataformas de agentes em escala, com evals fortes e structures de time dedicadas a 'agent engineering'.

Comunidade · langchain · langchain, interrupt, deep-agents, langsmith-fleet, enterprise

Vapi capta US$ 50M apos operar 100% das chamadas da Amazon Ring

Rodada liderada com M12 (Microsoft), Kleiner Perkins e Bessemer. Total US$ 72M. Marco para AI voice em customer service.

Comunidade · the-ai-insider · vapi, voice-ai, funding, m12, kleiner-perkins

Simon Willison: 'Not so locked in any more

Reflexao sobre como o mercado de modelos esta finalmente reduzindo lock-in: APIs compativeis, MCP, modelos open-weight competitivos e portabilidade real entre Claude/GPT/Gemini para tarefas tipicas.

Comunidade · simonwillison · simon-willison, openai, anthropic, lock-in

Anton Leicht: acesso a frontier AI será limitado por restrições econômicas e de segurança

Ensaio viral no Hacker News (167 pts) argumenta que acesso aos modelos frontier vai ficar concentrado por dois motivos convergentes: compute escasso/caro (data center bottleneck) e oversight de segurança (CAISI, EU AI Act). Implicação: a janela 'todo mundo na Claude API por US$ 20/mês' pode estar fechando.

Comunidade · blog-anton-leicht · frontier-models, acesso, compute-constraints, geopolitica, policy

Auditoria de Ontario: AI note takers em consultórios médicos errando fatos básicos

Auditoria pública de Ontario encontrou que AI scribes médicos (Abridge, Nuance DAX, etc.) erram rotineiramente fatos básicos — dosagens, idade, lateralidade. Caso vira sinal vermelho para healthcare AI sem validação humana. 243 pontos no HN.

Comunidade · the-register · healthcare-ai, scribes, auditoria, confiabilidade, ontario

Arena AI Model ELO History — visualização da corrida de modelos

Site interativo plotando o histórico de ELO no LM Arena por modelo. Ajuda a ver a curva de aceleração dos frontier models. 61 pontos no HN.

Comunidade · github-pages · - benchmark