# Radar do FAROL · domingo, 3 de maio de 2026

16 notícias. Dados: https://radar.farolia.org/dados/dia/2026-05-03.json

## Modelos

- **[OpenAI abre Bio Bug Bounty: US$ 25K por jailbreak universal das 5 questoes biosafety do GPT-5.5](https://openai.com/index/gpt-5-5-bio-bug-bounty/)** (Modelos; openai). OpenAI lancou (23/4) Bio Bug Bounty pagando US$ 25K para quem encontrar um *unico* prompt que derrote as 5 perguntas biosafety undisclosed do GPT-5.5 sem disparar moderacao. Escopo estreito: so vale GPT-5.5 rodando em Codex Desktop. Janela: 23/4 a 22/6 (com testes ate 27/7). Programa por convite + aplicacao via lista de bio red-teamers vetados. Contexto crucial: OpenAI assinou contrato com Pentagon e GPT-5.5 envia 'strongest set of safeguards to date'.
- **[Anthropic publica case Kepler — verifiable AI para servicos financeiros com Claude](https://claude.com/blog/how-kepler-built-verifiable-ai-for-financial-services-with-claude)** (Modelos; anthropic). Anthropic publicou case do Kepler (firma de servicos financeiros): construiu pipeline de IA verificavel sobre Claude, com requisitos de auditoria, rastreabilidade e prova de raciocinio. Subiu para HN frontpage hoje (30 pts).
- **[Kimi K2.6 vence Claude, GPT-5.5 e Gemini em coding challenge — HN frontpage com 295 pontos](https://news.ycombinator.com/item?id=47947356)** (Modelos; hackernews). Post 'An open-weights Chinese model just beat Claude, GPT-5.5 and Gemini in a programming challenge' viralizou no Hacker News (295 pontos, frontpage). Tema ja conhecido — K2.6 lidera SWE-Bench Pro (58.6%) e fica 0.6pp atras de Opus 4.6 em SWE-Bench Verified (80.2 vs 80.8) — mas agora narrativa entra na bolha mainstream dev pelo HN. Combinado com Mistral Medium 3.5 (77.6% Verified) e Qwen3.6 Max-Preview, segunda metade de Abril e primeira de Maio confirmaram: open-weights fechou o gap em coding.
- **[Sulphur-2-base: novo text-to-video em GGUF aparece no top trending do HuggingFace](https://hf.co/SulphurAI/Sulphur-2-base)** (Modelos; huggingface). Modelo Sulphur-2-base de geração text-to-video subiu rápido no trending do HF (>20K downloads, 169 likes, trending score 166). Disponibilizado em GGUF, o que permite rodar localmente em hardware modesto via diffusers — algo que antes era exclusivo de cloud. Confirma a tendência de open-weights se aproximando de Sora/Veo na qualidade e abrindo brecha para experimentação por estúdios independentes e creators.

## Ferramentas e código

- **[Google DeepMind AI Co-clinician: 97/98 consultas primary care sem erros criticos](https://www.geeky-gadgets.com/google-deepmind-ai-co-clinician/)** (Ferramentas e código; google-deepmind). Google DeepMind anunciou *AI Co-clinician* — sistema agentico de apoio a diagnostico em primary care. Em avaliacao com 98 consultas reais, errou de forma critica em apenas 1; em 68 das 140 areas avaliadas, atingiu paridade ou superioridade vs medicos generalistas.
- **[Alibaba abre AILens — observabilidade end-to-end para RL post-training de LLMs](https://github.com/alibaba/AILens)** (Ferramentas e código; github). Alibaba abriu AILens — observabilidade full-stack 'starting with end-to-end RL post-training'. E uma das primeiras stacks publicas focadas explicitamente em monitorar runs de RL post-training (PPO, GRPO, DPO etc) que viraram a tecnica dominante de alinhamento em 2026. Combina com tendencia do paper 'Demystifying RL in Agentic Reasoning' (Hugging Face, 33 upvotes) que pediu mais transparencia metodologica em RL para LLMs. Sinal de que tooling pra RL-ops esta sairindo da era artesanal.
- **[Nous Research lanca hermes-agent — *the agent that grows with you*](https://github.com/NousResearch/hermes-agent)** (Ferramentas e código; github). Nous Research subiu hermes-agent — framework de agent autonomo com memoria persistente e *adaptacao por uso*. Ainda sem release notes detalhadas mas trending hoje (>131K stars somando network effect da casa).
- **[everything-claude-code (affaan-m) — agent harness com performance optimization, skills, instincts, memory, security](https://github.com/affaan-m/everything-claude-code)** (Ferramentas e código; github). Repositorio explodiu em stars este fim de semana. Empacota um *agent harness* completo sobre Claude Code: skills pre-curadas, sistema de instincts, memoria de longo prazo, layer de security/permissoes, abordagem research-first.
- **[Claude Code Governor — community tool para context slimming, cap de uso e tool budget](https://github.com/0xhimanshu/governor)** (Ferramentas e código; github). 0xhimanshu publicou 'governor' — Claude Code usage governor que faz compact professional output, context slimming e cap de tool calls/budget. Resolve a dor real de usuarios power-user do Claude Code que ja sentem efeito do limite quinquenal de uso. Repo entrou em GitHub trending (★59 em poucos dias). Conecta com a tendencia Karpathy/Willison de 'agentic engineering' precisar de governance — nao basta ter um agente, tem que governar a quantidade de contexto e budget.
- **[vLLM 0.20.1 — patch crítico (CVE-2026-0994), PyTorch 2.11 e Python 3.14](https://github.com/vllm-project/vllm/releases)** (Ferramentas e código; github). vLLM 0.20.1 corrige a CVE-2026-0994, atualiza para PyTorch 2.11, suporta Python 3.14 e adiciona compatibilidade com Transformers v5. Update obrigatório para quem hospeda inferência open-weight em produção.
- **[TradingAgents: framework LLM multi-agente para trading entra no top trending GitHub](https://github.com/lukiIabs/trading-agents)** (Ferramentas e código; github). TradingAgents — framework multi-agente LLM para trading de stocks/crypto/quant — entrou em top trending no GitHub na semana (★199, lider). Sinal claro de que o ciclo agentic chegou ao retail/quant: mesmo nao havendo evidencia publica de alpha consistente, a comunidade esta convergindo em multi-agent (varios papeis: analyst, risk, executor) como template. Reforca a tese de que 'agentic-first' deixou de ser teoria e virou padrao de arquitetura, mesmo em vertical com baixo retorno empirico de IA generativa ate aqui.
- **[AgentFigureGallery: skill de plotting cientifico para Claude Code, Codex e Cursor](https://github.com/Dsadd4/AgentFigureGallery)** (Ferramentas e código; github). AgentFigureGallery (★27 nesta semana) e um skill drop-in de plotting cientifico para Claude Code, Codex, Cursor e outros coding agents. Resolve dor real do trabalho em pesquisa: plots gerados por LLM tendem a ser feios, sem padronizacao, com legenda mal posicionada. Skill carrega templates pre-validados (Nature, Science, IEEE) e o agente vira pipeline 'descreve-figura → escolhe template → executa matplotlib/seaborn/plotly'. Boa adicao a stack do Giordano (escritor + pesquisador).

## Pesquisa

- **[ARC-AGI-3 lança como benchmark interativo agentico — frontier models <1% do humano](https://arxiv.org/abs/2603.24621)** (Pesquisa; arxiv). ARC Prize anunciou o ARC-AGI-3, primeiro benchmark *interativo* da serie. Em vez de pares I/O fixos (ARC 1 e 2), agentes precisam explorar ambientes turn-based, inferir objetivos sem instrucao explicita, construir modelo interno da dinamica e planejar acoes. Marco de Mar/2026: humanos resolvem 100%, **frontier models (Gemini 3.1, GPT-5.4, Opus 4.6, Grok-4.20) ficam abaixo de 1%**. Competicao Kaggle aberta com >US$ 2M em premios.
- **[PKU TIDE: distilacao cross-architecture de LLMs autoregressive para diffusion](https://github.com/PKU-YuanGroup/TIDE)** (Pesquisa; github). Repo TIDE (Turning the TIDE) do Yuan Group da Peking University trending no GitHub na ultima semana — propoe metodo de cross-architecture distillation transferindo conhecimento de LLMs autoregressive para Diffusion LLMs (dLLMs). Aborda o problema-chave de dLLMs: ainda saem caros para pre-treinar do zero, e distilar de AR cobre o gap. Combina com a leitura do Z-Lab Qwen3.6-DFlash que ja entrou na nossa base em 2/5 — sinal de que dLLMs viraram tema serio em laboratorios de fronteira em 2026.
- **[Christopher Meiklejohn: *30 anos programando com Phish ligado* — flow humano vs agents on the rift](https://christophermeiklejohn.com/ai/personal/phish/flow/agents/2026/05/03/rift.html)** (Pesquisa; hackernews). Pesquisador de sistemas distribuidos (Carnegie Mellon, autor de Filibuster e Lasp) publica ensaio pessoal: 30 anos programando ouvindo Phish, sempre em estado de flow. Com agents (Claude Code, Cursor) o flow muda — ele descreve uma *rift* (rachadura) entre o programar como pratica corporea-musical e o programar como direcao de orquestra de agents.
- **[Paper 'Demystifying RL in Agentic Reasoning' (HuggingFace, 33 upvotes) — receita pra modelos pequenos competirem](https://hf.co/papers/2510.11701)** (Pesquisa; huggingface). Paper de Yu/Yang/Zou/Yan/Wang (Out/2025, mas em alta tracao agora com 33 upvotes e discussao ativa) sistematiza o que funciona em RL para agentic reasoning de LLMs. Conclusao: combinacao SFT inicial com end-to-end tool-use trajectories + datasets de alta diversidade + tecnicas de exploracao 'clip higher' + overlong reward shaping + entropy control + estrategia deliberativa entrega ganhos significativos. Mostra que MODELOS MENORES (4-7B) podem chegar perto de gigantes em AIME/GPQA/LiveCodeBench se a receita de RL for bem feita.
