Radar do FAROL27 notas

sábado, 9 de maio de 2026

Modelos

Anthropic apresenta Claude Dreaming: agentes que revisam o trabalho entre sessões

Anthropic libera em research preview o Claude Dreaming: o sistema revisa o trabalho entre sessões, identifica padrões e atualiza arquivos com preferências do usuário e contexto.

Modelos · web-search · anthropic, claude, dreaming, memory, research-preview, agents

Anthropic investiga acesso nao-autorizado ao Claude Mythos via conta de contractor

Anthropic confirma que investiga acesso nao-autorizado ao Claude Mythos Preview por meio de uma conta de fornecedor (contractor). Bloomberg apurou que usuarios em forum privado conseguiram rodar prompts no modelo via credencial vazada. Mythos Preview e o frontier model com capacidades cyber de elite (encontrou RCE de 17 anos em FreeBSD/NFS sozinho). Caso reforca tese de que credenciais de terceiros sao o vetor mais fraco e levanta duvidas sobre os $100M em creditos do Project Glasswing prometidos a 40 organizacoes de software critico.

Modelos · bloomberg · anthropic, claude-mythos, bloomberg, supply-chain, security, contractor

xAI libera Grok 4.3 na API: 1M de contexto, vídeo nativo e $1.25/M tokens

Grok 4.3 entra disponível via API com raciocínio integrado, 1M de contexto, entrada nativa de vídeo e preço $1.25/M tokens — 8 modelos legados serão aposentados em 15/maio.

Modelos · web-search · xai, grok, grok-4-3, api, video, long-context

OpenAI lança trio de voice models realtime: GPT-Realtime-2, Translate e Whisper

OpenAI adiciona à API três novos modelos de voz: GPT-Realtime-2 para raciocínio em voz, GPT-Realtime-Translate para tradução simultânea (70+ idiomas) e GPT-Realtime-Whisper para transcrição streaming.

Modelos · web-search · openai, voice, realtime, whisper, translate, api

Gemini 3.1 Flash Lite entra em GA: foco em tarefas agentic de alto volume

Gemini 3.1 Flash Lite agora está em disponibilidade geral, otimizado para tarefas agentic de alto volume, tradução e custo-eficiência.

Modelos · web-search · google, gemini, flash-lite, agentic, translation

Zyphra ZAYA1-8B aparece entre os top trending da Hugging Face

Zyphra publicou o ZAYA1-8B em 4 de maio: 23.6K downloads, 295 likes, trending score 291 — entre os modelos open-weights mais quentes da semana.

Modelos · huggingface · zyphra, zaya1, huggingface, open-weights, 8b

HiDream-O1-Image: novo modelo image-to-image em qwen3-vl trending no HuggingFace

HiDream-AI publicou em 8/5 o HiDream-O1-Image, modelo image-text-to-image construido sobre arquitetura qwen3-vl, licenca MIT. Trending score 97 no Hub apos 24h. Combina geracao + edicao de imagem em pipeline unificado. Concorrente direto do Z-Image e do Tongyi-MAI/Z-Image que vinha dominando o trending da semana.

Modelos · huggingface · hidream, image-generation, qwen3-vl, huggingface, multimodal

Ferramentas e código

Claude desembarca no Microsoft 365: add-ins para Excel, PowerPoint, Word e Outlook

Anthropic estende o Claude ao Microsoft 365 com add-ins para Excel, PowerPoint e Word, com Outlook a caminho — disputando o terreno do Copilot dentro do Office.

Ferramentas e código · web-search · anthropic, claude, microsoft-365, excel, powerpoint, word

GitHub lanca Spec-Kit: toolkit open-source para spec-driven development com agentes

GitHub anunciou em 8/5 o Spec-Kit, toolkit open-source para spec-driven development com agentes de codigo (Claude Code, Cursor, Copilot agent). Ideia: voce escreve uma spec executavel em YAML/Markdown, o kit gera testes, scaffolding e tasks que o agente segue de forma estruturada — em vez de prompt cru. Tenta resolver o problema de 'agent reviewer' nao saber se mudanca esta dentro do escopo.

Ferramentas e código · marktechpost · github, spec-kit, spec-driven, coding-agents, claude-code, copilot

CISA + Five Eyes publicam advisory: 'Adocao Cuidadosa de IA Agentica' — rapido demais e perigoso

CISA, NSA, ASD ACSC (Australia), Centre for Cyber Security (Canada), NCSC-UK e NCSC-NZ publicaram advisory conjunto 'Careful Adoption of Agentic Artificial Intelligence (AI) Services'. Mensagem: agentes autonomos sao perigosos demais para rollout rapido em ambientes corporativos. Recomendam: sandboxing por padrao, principle-of-least-privilege em ferramentas, audit trail de toda chamada externa, kill-switch humano, threat-modeling especifico para prompt injection.

Ferramentas e código · cisa · cisa, nsa, ncsc, agentic-ai, advisory, governance

ChatGPT Workspace Agents libera para Enterprise com EKM

OpenAI libera Workspace Agents — agentes corporativos repetitiveis cruzando ChatGPT e Slack — para ChatGPT Enterprise com Enterprise Key Management. Empurra OpenAI para o territorio que o Anthropic acabou de ocupar com Claude Managed Agents.

Ferramentas e código · openai · openai, chatgpt, workspace-agents, enterprise, ekm, slack

Heretic 1.3 viraliza no r/LocalLLaMA: 273 upvotes em 7 horas

Heretic 1.3, atualização de stack para rodar LLMs localmente, somou 273 upvotes e 47 comentários em 7 horas no r/LocalLLaMA — promete saídas reproduzíveis, benchmarking integrado e menor pico de VRAM.

Ferramentas e código · reddit · heretic, localllama, tooling, reproducibility, vram, benchmark

Simon Willison libera llm-gemini 0.31, llm-echo 0.5a0 e datasette-llm 0.1a7

Simon Willison liberou em 5-7 de maio múltiplas releases: llm-gemini 0.31 (Gemini provider para o LLM CLI), llm-echo 0.5a0 (mock provider), datasette-llm 0.1a7 e datasette-referrer-policy 0.1.

Ferramentas e código · blog · simon-willison, llm-cli, datasette, gemini, plugins

QwenPaw v1.1.6: assistente pessoal local-first com Mermaid, skill CLI e session titles

AgentScope (time da Alibaba) liberou em 9/5 a v1.1.6 do QwenPaw — assistente pessoal local-first construido em cima da familia Qwen3.6. Novidades: titulos de sessao gerados por LLM, dashboard de uso de tokens, render de diagramas Mermaid, CLI para instalar/desinstalar/testar skills, API de status de agente. Ponto importante: arquitetura modela colaboracao entre 'small + large' models — pequeno responde rapido, grande entra quando o pequeno declara incerteza.

Ferramentas e código · github · qwen, agentscope, local-llm, assistant, github, mermaid

Pesquisa

AI Co-Mathematician: paper do DeepMind sobre acelerar matematicos com IA agentica

Daniel Zheng, Ingrid von Glehn, Lars Buesing, Daniel M. Roy, Martin Wattenberg e outros publicaram em 8/5/2026 o paper 'AI Co-Mathematician: Accelerating Mathematicians with Agentic AI' (22 paginas, cs.AI). Apresenta agentes que conversam com matematicos profissionais durante a prova, gerenciam lemmas/conjecturas como contexto vivo, e recuperam literatura relevante. Continuacao da agenda Gemini Deep Think aplicada a matematica avancada.

Pesquisa · arxiv · deepmind, math, agentic, paper, von-glehn, daniel-roy

Google DeepMind: AlphaEvolve ganha atualizações para descobertas matemáticas e otimização

Em 7 de maio, Google introduziu atualizações no AlphaEvolve, agente de código baseado em Gemini que projeta algoritmos avançados — agora avança em problemas abertos de matemática/CS e otimiza algoritmos já em produção.

Pesquisa · web-search · google, deepmind, alphaevolve, gemini, coding-agent, math

ARGUS: paper apresenta benchmark AgentLure para prompt-injection contextual em agentes

Pesquisadores publicaram em 5/5 o paper ARGUS, que introduz o benchmark **AgentLure** capturando ataques de prompt-injection conscientes de contexto contra agentes de LLM (nao mais o ataque ingenuo, mas adversario que ja sabe a estrutura do prompt do sistema). Junto com o benchmark, o paper propoe uma defesa baseada em verificacao redundante por agente independente. Resultados sugerem que agentes hoje em producao falham em 60-80 porcento dos casos contextuais.

Pesquisa · arxiv · argus, agentlure, prompt-injection, agents, security, paper

VibeServe (arXiv 2605.06068): podem agentes de IA construir stacks completos de LLM serving?

Paper publicado em 7 de maio apresenta o VibeServe, primeiro loop agentic que gera stacks inteiros de LLM serving end-to-end — outer loop planeja designs, inner loop implementa, valida e mede performance.

Pesquisa · arxiv · arxiv, vibeserve, llm-serving, agents, search

Mercado

Moonshot AI levanta US$ 2 bilhões a US$ 20bi de valuation — pressão sobre o open source chinês

Moonshot AI (criadora do Kimi K2) levantou US$ 2 bilhões a um valuation reportado de US$ 20bi — sinal do apetite por modelos open-source chineses como alternativa mais barata aos frontier americanos.

Mercado · web-search · moonshot-ai, kimi, china, open-source, funding

Sierra (Bret Taylor) levanta quase US$ 1 bilhão para agentes de atendimento

Sierra, startup de agentes de atendimento fundada pelo ex-co-CEO da Salesforce e atual chairman do board da OpenAI Bret Taylor, levanta cerca de US$ 1 bilhão na nova rodada — semana mais forte de funding em IA enterprise.

Mercado · web-search · sierra, bret-taylor, funding, ai-agents, customer-service

Regulação e segurança

Casa Branca prepara ordem executiva para auditar modelos de IA no estilo FDA

Em 7 de maio, a Casa Branca anunciou planos de redigir uma ordem executiva para auditar novos modelos de IA — processo comparado à aprovação de drogas pelo FDA — em resposta direta ao Mythos da Anthropic, que encontra vulnerabilidades de rede.

Regulação e segurança · web-search · white-house, executive-order, fda, mythos, anthropic, regulation

Anthropic abre programa público de bug bounty no HackerOne (US$ 100 a US$ 10K)

Anthropic abriu publicamente seu programa de bug bounty no HackerOne, com recompensas de US$ 100 a US$ 10.000 por vulnerabilidades reportadas.

Regulação e segurança · web-search · anthropic, bug-bounty, hackerone, security, vulnerabilities

Comunidade

Karpathy no AI Ascent: \"Software 3.0\" e a transição do vibe coding para agentic engineering

No AI Ascent 2026 da Sequoia, Andrej Karpathy formaliza a ideia de \"Software 3.0\" — código escrito por prompts, contexto, agentes, ferramentas e verificação — e separa o vibe coding (raise the floor) do agentic engineering (manter qualidade profissional).

Comunidade · web-search · karpathy, sequoia, software-3-0, vibe-coding, agentic-engineering

NVIDIA ja passou de US$ 40B em investimentos AI em 2026

Levantamento da CNBC: NVIDIA acumula US$ 40B+ em equity em 2026, financiando toda a cadeia de IA — US$ 30B em OpenAI, US$ 3.2B em Corning, US$ 2.1B em IREN — para garantir capacidade e bloquear concorrencia em silicio.

Comunidade · cnbc · nvidia, capex, equity-investments, ai-economy, supply-chain

Hassabis (DeepMind) prev AGI com 10x do impacto da Revolucao Industrial em 1/10 do tempo

Demis Hassabis (CEO DeepMind), no India AI Impact Summit, manteve a previsao de AGI em ~5 anos e disse que tera '10x o impacto da Revolucao Industrial em 1/10 do tempo'. Pediu guardrails cientificos urgentes e mais investimento em alinhamento.

Comunidade · yahoo-finance · deepmind, hassabis, agi, india-summit, regulacao

Andon Labs abre cafe rodado por IA em Stockholm — barista, caixa e estoque autonomos

Simon Willison cobriu em 5/5 a abertura do cafe da Andon Labs em Stockholm — operacao integral comandada por IA: braco robotico para preparar bebidas, kiosk com agente conversacional para atendimento, sistema de visao para gerenciar estoque, e integracao com Claude para resolver casos fora do script. Sem barista humano em horario comercial. Item ganha tracao porque toca em duas teses: 'agentes operam o mundo fisico' e 'IA substitui empregos de servico'.

Comunidade · simonwillison · andon-labs, cafe, real-world-ai, stockholm, simon-willison, embodied-ai

Meta testa internamente \"Hatch\": agente de IA sempre-ligado em Instagram e Facebook

Meta está testando internamente um agente de IA sempre-ligado chamado Hatch, ancorado nos dados de Instagram e Facebook do usuário.

Comunidade · web-search · meta, hatch, instagram, facebook, ai-agent, privacy