Radar do FAROL43 notas

quinta-feira, 28 de maio de 2026

Modelos

Anthropic levanta US$ 65B em Series H @ US$ 965B post-money e prepara rollout do Claude Mythos

Anthropic anunciou em 28/05 a captação de US$ 65B em Series H a um post-money de US$ 965B, liderada por Altimeter Capital, Dragoneer, Greenoaks e Sequoia Capital. No mesmo dia anunciou Opus 4.8 e confirmou que o Mythos (modelo frontier com capacidades avançadas de cibersegurança, em preview com ~50 parceiros do Project Glasswing) será disponibilizado a todos os clientes 'nas próximas semanas'.

Modelos · web-news · anthropic, funding, series-h, mythos, opus-4-8, valuation

Hacker News debate Claude Opus 4.8 (1103 pontos)

Lançamento do Opus 4.8 dominou o topo do Hacker News com 1103 pontos. Discussão divide-se entre quem celebra os ganhos em agentic coding e quem aponta saturação dos benchmarks atuais — vários comentários defendem suítes mais difíceis (SWE-bench Verified Extreme, METR long-horizon) e críticos do 'modelo que decide quando dizer não sei' soam menos cínicos do que em releases passados.

Modelos · hackernews · anthropic, claude, opus-4-8, hn

Google lança Gemini 3 com Deep Think e Spark

Google anunciou Gemini 3 — descrito como o modelo mais poderoso da casa em multimodalidade e 'vibe coding' agêntico. Inclui Gemini 3 Pro (preview), Gemini 3 Deep Think (raciocínio profundo para ciência) e o agente Spark integrado ao app Gemini.

Modelos · blog.google · google, gemini, deepmind, multimodal

Claude Opus 4.8 ganha contexto padrão de 1M token e entra GA no GitHub Copilot

Recapitulando o Opus 4.8 já em circulação completa: lançado em 28/05, marca 88.6% SWE-bench Verified e 74.6% Terminal-Bench 2.1, com janela de contexto padrão de 1M tokens, controle explícito de "effort" no claude.ai, dynamic workflows no Claude Code e fast mode 2.5x mais rápido / 3x mais barato. Disponível em GA no GitHub Copilot desde 28/05 e nas IDEs Cursor 3.5 / Windsurf. Apenas 41 dias após Opus 4.7.

Modelos · anthropic · anthropic, claude-opus-4-8, 1m-context, github-copilot, swe-bench, claude-code

Anthropic atualiza Claude Managed Agents com 3 novos recursos

Anthropic anunciou três novidades no Claude Managed Agents: 'dreaming' (revisão de sessões passadas para auto-melhoria), orquestração multiagente (lead agent delega para especialistas em paralelo) e sandboxes self-hosted em parceria com Cloudflare/Daytona/Modal/Vercel.

Modelos · 9to5mac · anthropic, claude, agents, managed-agents

Google debuta AI Ultra, Gemini Spark e modelo de mundo Omni

Cobertura CNBC: Google apresentou AI Ultra (assinatura premium), Gemini Spark (agente pessoal que age sob direção do usuário em apps conectados) e Omni — um world model para simular ambientes físicos integrado a Flash, Gemini app, Flow e YouTube Shorts.

Modelos · cnbc · google, gemini, agents, world-model

Liquid AI lança LFM2.5-8B-A1B — MoE on-device com 1.5B ativos

Liquid AI publicou LFM2.5-8B-A1B, modelo MoE para dispositivos com 8.3B parâmetros totais e apenas 1.5B ativados por token. Contexto saltou de 32K para 128K, pretraining de 12T para 38T tokens, vocabulário dobrou para 128K. Arquitetura híbrida: 18 blocos LIV convolucionais double-gated + 6 GQA. É reasoning-only (chain-of-thought explícita). Salto enorme nos benchmarks: AA-Omniscience Non-Hallucination Rate 7.46 → 63.47, IFEval 79.44 → 91.84, MATH500 74.80 → 88.76. Modelo trending #2 no HF.

Modelos · marktechpost · liquid-ai, lfm2-5, mixture-of-experts, edge-ai, on-device, tool-calling

Simon Willison: Claude Opus 4.8 é 'melhoria modesta mas palpável

Simon Willison publicou em 28/05 sua avaliação do Claude Opus 4.8: classifica como 'a modest but tangible improvement' sobre 4.7. Importante porque é um dos reviewers mais ouvidos e técnicos da comunidade — calibra expectativa contra o press release oficial que celebra ganhos de 64.3%→69.2% em agentic coding.

Modelos · simon-willison · anthropic, claude-opus-4-8, simonw, review, benchmark

ByteDance Lance — modelo any-to-any multimodal

ByteDance Research publicou Lance — modelo any-to-any (texto, imagem, vídeo) baseado em Qwen2.5-VL-3B-Instruct, com geração de imagem, edição, vídeo e compreensão de vídeo. Licença Apache-2.0. Trending 358 no HF. Direção: modelos unificados substituindo pilhas separadas de SD + Whisper + LLM.

Modelos · huggingface · bytedance, lance, multimodal, any-to-any, image-generation, video

Bonsai Image WebGPU: geração de imagens no navegador

Space recém-criado (26/05) que roda geração de imagens diretamente no navegador via WebGPU. Demonstra a maturidade do stack de inferência client-side, sem servidor.

Modelos · huggingface · huggingface, webgpu, image-generation, edge

MiniCPM5-1B — modelo on-device com tool-calling e long-context

OpenBMB publicou MiniCPM5-1B em 21/05 — modelo de 1B parâmetros pensado para edge/on-device com suporte a tool-calling e long-context, treinado com Ultra-FineWeb. Trending score 437 no HF. Importante para quem quer agentes locais em CPU/celular sem depender de API.

Modelos · huggingface · minicpm, openbmb, edge-ai, on-device, tool-calling, long-context

Stability AI lança Stable Audio 3 (HF Space)

Space oficial do Stable Audio 3 da Stability AI, criado em 20/05. Continua o trabalho da Stability em síntese de áudio generativo.

Modelos · huggingface · stability-ai, audio, tts, generative-audio

NVIDIA LocateAnything-3B — grounding e detecção de objetos

NVIDIA publicou LocateAnything-3B — VLM baseado em Eagle para localização de objetos via texto. Trending 180 no HF. Útil para pipelines de agente que precisam de 'aponte para o botão X na tela' como complemento ao computer use da Anthropic.

Modelos · huggingface · nvidia, vision, object-detection, grounding, vlm

OpenAI nomeada 'Leader' pelo Gartner em enterprise coding agents

Em 27/05, Gartner classificou OpenAI como Leader em enterprise coding agents — reconhecimento institucional que ajuda a destravar compras corporativas. Anthropic provavelmente disputará o mesmo quadrante na próxima revisão dada a tração do Claude Code.

Modelos · openai · openai, gartner, enterprise, coding-agents

Ferramentas e código

claude-mem — contexto persistente entre sessões para todo agente

Projeto com ~79k estrelas que captura tudo do contexto de um agente e disponibiliza entre sessões. Atualizado nas últimas horas. Diretamente comparável ao CLAUDE.md/memory directory mas pensado para múltiplos agentes simultâneos. Bom estudo para o seu workflow Cowork.

Ferramentas e código · github · claude-code, memory, persistence, agent-tools

Dynamic Workflows no Claude Code

Post explicando como construir 'dynamic workflows' no Claude Code — sequências de skills que mudam de rota com base em contexto, ao invés de pipelines lineares. 133p na HN. Discussão menciona uso de subagents para isolar contexto e a importância de design de skills auto-descritivas para que o orquestrador decida bem.

Ferramentas e código · hackernews · claude-code, workflows, skills, agentic-coding

guizang/social-card-skill: skill para Claude Code/Codex (Xiaohongshu+WeChat)

Skill com 544 estrelas para Claude Code/Codex que gera carrosséis para Xiaohongshu (RED) e cards WeChat em formato 21:9+1:1. Indica fortemente que o ecossistema de skills está se especializando em verticais de mercado regional (China).

Ferramentas e código · github · claude-code, skill, social-media, design

ECC — agent harness performance optimization (skills, instincts, memory)

ECC ('Energy-Conservation Control'?) é um sistema de otimização de performance para agent harnesses: skills, instincts e memory unificados, atualizado nas últimas horas. Aborda problema real: agentes desperdiçam tokens recuperando contexto que já foi usado. Vale acompanhar como referência de design.

Ferramentas e código · github · agent-harness, skills, memory, optimization, open-source

WhitzardAgent/AgentGuard: framework ABAC para agentes que usam ferramentas

Framework de Attribute-Based Access Control para agentes LLM que invocam tools. Aborda risco crescente: agentes que ganham acesso a APIs sensíveis precisam de autorização granular.

Ferramentas e código · github · security, agents, abac, tool-use

withkynam/vibecode-pro-max-kit: harness spec-driven para vibecoders

Repo com 140 estrelas: 'Sua IA esquece. Isto lembra.' Harness spec-driven para vibecoders produzirem código de produção. Aborda o problema de memória/contexto em loops longos de coding agent.

Ferramentas e código · github · vibecoding, spec-driven, agent-harness, memory

Continue? Y/N — joguinho de 60s sobre fadiga de permissão de agentes

Show HN com 213 pontos: jogo de 60 segundos que satiriza a fadiga de aprovar ações de agentes ('Continue? Y/N'). Reflete dor real no UX dos agentes atuais — Claude Code, Codex, OpenHands. Vários comentários defendem auto-approve por escopo + audit trail em vez de bloqueio constante.

Ferramentas e código · hackernews · agentic, ux, permission-fatigue, satire, show-hn

cc-switch — assistente desktop All-in-One para Claude Code, Codex, OpenCode

App desktop cross-platform que orquestra múltiplos agentes de coding (Claude Code, Codex, OpenCode) num único front-end. ~83k estrelas. Atualizado hoje. Sinaliza o fenômeno 'comoditização de agentes de coding': o valor migra do agente para o switcher/orquestrador.

Ferramentas e código · github · claude-code, codex, opencode, desktop-app, multi-agent

paper-reading-zh: regras evidence-aware para leitura de papers em chinês

Skill (47 estrelas) com regras evidence-aware para leitura crítica de papers em chinês usando Codex, Claude Code ou Claude Projects.

Ferramentas e código · github · claude-code, skill, academic, evidence

nekocode/filetree-skill: skill que mantém FILETREE.md atualizado

Plugin Claude Code com 103 estrelas que mantém um arquivo FILETREE.md sempre sincronizado com a estrutura do repo — útil para dar contexto rápido a agentes que entram num codebase grande.

Ferramentas e código · github · claude-code, skill, documentation

Obsidian-Dashboard: command center do Claude Code dentro do Obsidian

Guia passo-a-passo para construir um command center do Claude Code dentro do Obsidian. Interessa diretamente ao seu workflow Obsidian+Claude.

Ferramentas e código · github · obsidian, claude-code, dashboard

OnlyTerp/prompt-cache-skills: correções drop-in de prompt caching

Repo recente (28 estrelas) com fixes drop-in de prompt caching para harnesses de agente. Resolve o problema de cache invalidation que mata performance em loops longos.

Ferramentas e código · github · prompt-caching, agent-harness, performance

Harkirat1462/claude-code-cli: guia completo da CLI

Guia (126 estrelas) sobre instalação e uso da Claude Code CLI no terminal — referência para quem está adotando agora.

Ferramentas e código · github · claude-code, cli, documentation

Pesquisa

Discordância entre LLMs de fronteira em fact-checks do mundo real

Estudo viralizou no HN (479 pontos) mostrando que modelos de fronteira discordam entre si em afirmações factuais verificáveis — implicação prática: estratégias de 'multi-model ensemble' não eliminam erro porque os modelos erram em direções correlacionadas. Reforça necessidade de ground-truth externo e human-in-the-loop em pipelines de verificação.

Pesquisa · hackernews · llm-evaluation, fact-checking, hallucination, frontier-models

OSWorld-MCP: benchmark de invocação de tools MCP em computer-use agents

Benchmark que avalia agentes multimodais em invocação de tools MCP, operação de GUI e decisão. Pipeline automatizado de geração de código gera tasks reproduzíveis. Sinal: MCP virou padrão de fato para tool-use, agora ganha benchmarks dedicados.

Pesquisa · huggingface-papers · mcp, benchmark, computer-use, agents

InfiAgent — framework infinite-horizon para agentes autônomos

Paper InfiAgent propõe abstração file-centric para externalizar estado persistente, mantendo contexto bounded para tarefas long-horizon. Usa snapshot de workspace + janela fixa de ações recentes. Resolve sem fine-tuning o problema de degradação por crescimento de contexto.

Pesquisa · huggingface-papers · llm-agents, long-horizon, context-management, state-externalization

TraceR1: planejamento antecipatório para agentes multimodais via RL em duas fases

Framework RL de duas etapas que melhora planejamento de agentes multimodais através de raciocínio antecipatório de trajetórias e refinamento por feedback de execução.

Pesquisa · huggingface-papers · multimodal, agents, rl, planning

Mercado

Anthropic levanta US$ 65B em Série H — valuation pós-money de US$ 965B

Anthropic anunciou rodada Série H de US$ 65 bilhões com valuation pós-money de US$ 965 bilhões — quase US$ 1 trilhão. Hacker News com 211 pontos. Reforça concentração de capital em poucos laboratórios de fronteira e levanta perguntas sobre runway até precificação efetiva da inferência cobrir o burn de treinamento.

Mercado · hackernews · anthropic, funding, series-h, valuation

Comunidade

Google I/O 2026: blog oficial consolida as '100 coisas anunciadas

Google publicou o índice oficial '100 coisas que anunciamos no I/O 2026'. Destaques: Gemini 3.5 Flash (rivaliza com flagships, supera Gemini 3.1 Pro em coding/agentic), corte do Ultra de US$ 250→US$ 200/mês, novo tier Developer a US$ 100/mês, Gemini com 900M MAUs (dobrou em 12 meses), DeepMind contrata 20+ pesquisadores da Contextual AI (deal de US$ 80-90M).

Comunidade · web-news · google, io-2026, gemini-3-5-flash, ultra-pricing, developer-tier, deepmind

Google, Microsoft e xAI dão acesso antecipado ao governo dos EUA (CAISI) para revisão pre-deployment

Google DeepMind, Microsoft e xAI assinaram acordos com o Center for AI Standards and Innovation (CAISI) para avaliações pre-deployment de modelos de fronteira. Estende padrão iniciado por OpenAI e Anthropic em 2024. Sinaliza que governo dos EUA vai fazer review técnico antes de releases — atrito regulatório vira norma.

Comunidade · the-hill · regulation, google, microsoft, xai, caisi, ai-safety

Simon Willison: 'Acho que Anthropic e OpenAI encontraram product-market fit

Em post de 27/05, Simon Willison argumenta que Anthropic (via Claude Code/Skills) e OpenAI (via Codex/Codex CLI) encontraram PMF claro: desenvolvedores pagando por ferramentas agênticas de coding em escala. Diferente do 'chatbot horizontal', há monetização repetível e direta. Leitura essencial para entender o estado da indústria.

Comunidade · simon-willison · simon-willison, anthropic, openai, pmf, analysis

Altman e Amodei recuam de previsões de 'apocalipse de empregos

Sam Altman e Dario Amodei estão suavizando previsões anteriores de que a IA causaria colapso massivo de empregos no curto prazo. Hacker News 138p. Mudança coincide com dados de mercado de trabalho que não mostram o pico de desemprego pintado em 2024-2025; é também leitura política para a regulação que se aproxima nos EUA e UE.

Comunidade · hackernews · openai, anthropic, altman, amodei, jobs, labor-market

Mem0: State of AI Agent Memory 2026 — benchmarks e gaps

Relatório anual da Mem0 sobre o estado da memória de agentes: arquiteturas dominantes, benchmarks, gaps entre pesquisa e produção. Cita ganhos maiores em queries temporais e raciocínio multi-hop.

Comunidade · mem0 · memory, benchmarks, production, agents

Loop de autoresearch de Karpathy se espalha; PR da Shopify com claim de 53% ainda sem merge

O loop de autoresearch popularizado por Karpathy (via extensão pi-autoresearch, desenvolvida com engenheiros da Shopify) virou referência. Um PR de 53% de speedup ficou marcado como possivelmente overfit e segue sem merge — sinal de que a comunidade está ficando mais cética com claims de agentes autônomos.

Comunidade · techtimes · karpathy, shopify, autoresearch, agents

Cloudflare Agents Week 2026: hub de updates da semana

Página hub da Agents Week da Cloudflare: lançamentos consolidados incluindo Agent Memory (serviço gerenciado de memória persistente) e Email Service (infra para agentes enviarem/receberem email nativamente).

Comunidade · cloudflare · cloudflare, agents, infrastructure

Agent identity: como governar IA agêntica em 6 estágios

Cisco e CrowdStrike publicaram (RSAC 2026) um maturity model em 6 estágios para identidade e governança de agentes. Tema crítico: como autenticar e auditar agentes que agem em nome de humanos.

Comunidade · venturebeat · security, iam, agents, governance

Memória para agentes: novo paradigma de context engineering

Artigo explicando como memória virou componente arquitetural separado da janela de contexto: facts extraídos em vector DB indexado por user/session/agent, retrieval semântico + keyword + entity no início de cada sessão.

Comunidade · thenewstack · memory, context-engineering, agents

AI Agents of the Week: papers que você deveria conhecer

Curadoria semanal de papers sobre agentes — boa fonte para acompanhar pesquisa sem mergulhar no arXiv direto.

Comunidade · llmwatch · newsletter, papers, agents

n8n: precisamos re-aprender o que são 'ferramentas de dev de agente' em 2026

Post conceitual do n8n sobre como o stack de desenvolvimento de agentes mudou em 2026 — categorias velhas (framework, vector DB, orchestrator) já não descrevem bem o que ferramentas como Claude Code, n8n, ou Bolt fazem.

Comunidade · n8n-blog · n8n, agent-dev, tooling, essay