Radar do FAROL34 notas

sexta-feira, 22 de maio de 2026

Modelos

Karpathy entra para a Anthropic e vai liderar time de pré-treino com Claude

Andrej Karpathy começou na Anthropic em maio/2026, sob Nick Joseph, montando um time que vai usar o Claude para acelerar pesquisa de pré-treino. Em update pessoal, disse que segue apaixonado por educação e pretende retomá-la no futuro.

Modelos · websearch · - karpathy

Google I/O 2026: Gemini 3.5 Flash, Gemini Spark (agente pessoal) e Gemini Omni

Google entra de cabeça na era agentic: Gemini Spark (agente pessoal beta para AI Ultra), Gemini 3.5 Flash GA (frontier-level a 4× a velocidade, $1.5/$9 por 1M tokens, contexto 1M, 76.2% Terminal-Bench 2.1) e Gemini Omni para geração/edição de vídeo. AI Ultra cai de $250 → $200 e ganha tier de $100.

Modelos · rss-googleblog-ai · - google

Gemma 4: byte-por-byte, os open models mais capazes do Google

DeepMind apresenta a família Gemma 4 como a coleção open-weight mais capaz por byte do Google, com variantes para diferentes orçamentos de inferência e foco em multilíngue/multimodal.

Modelos · rss-deepmind · - google

DeepSeek-V4: contexto de 1M token que agentes conseguem usar de verdade

DeepSeek lança a V4 com contexto efetivo de 1M tokens otimizado para uso por agentes — não só o número grande, mas tooling e benchmarks que mostram que ele se sustenta em tarefas longas reais.

Modelos · rss-huggingface-blog · - deepseek

ByteDance Lance — multimodal unificado 3B Apache 2.0 para imagem, vídeo, geração e edição

ByteDance liberou em 19-21/05 o Lance — modelo multimodal unificado de 3B parâmetros ativos, Apache 2.0, que cobre entendimento e geração de imagem e vídeo + edição num único framework. Arquitetura dual-stream MoE sobre sequências interleaved, treinado do zero com 1B pares imagem-texto e 140M vídeo-texto (1.5T tokens) em 128 A100s.

Modelos · websearch · - bytedance

NVIDIA Nemotron 3 Nano Omni: inteligência multimodal de long-context para agentes de doc/áudio/vídeo

NVIDIA lança o Nemotron 3 Nano Omni: modelo multimodal pequeno com contexto longo desenhado para agentes que precisam ler documentos, áudio e vídeo no mesmo turno.

Modelos · rss-huggingface-blog · - nvidia

IBM Granite 4.1 LLMs: detalhes de arquitetura e treino

IBM detalha como construiu a família Granite 4.1, com foco em workloads enterprise (compliance, baixo custo, fine-tuning previsível).

Modelos · rss-huggingface-blog · - ibm

Granite Embedding Multilingual R2: melhor retrieval sub-100M com 32K de contexto

IBM abre o Granite Embedding Multilingual R2 sob Apache 2.0: melhor qualidade na faixa sub-100M com janela de 32K, pensado para RAG empresarial.

Modelos · rss-huggingface-blog · - ibm

Goldman Sachs adota Claude da Anthropic para contabilidade e compliance

Goldman Sachs anunciou rollout do Claude (Anthropic) para automatizar funções de contabilidade e compliance — integração de IA generativa em operações financeiras de alto risco. Sinaliza maturidade do mercado enterprise para uso de LLMs em workflows com requisitos regulatórios. Caso relevante para discutir governança e auditabilidade de agentes.

Modelos · webnews · anthropic, claude, goldman-sachs, financial-services, automation, compliance

Anthropic publica update do Project Glasswing — Mythos achou 10k+ vulnerabilidades em 1 mês

Anthropic divulgou primeiro update do Project Glasswing — programa de acesso restrito ao Claude Mythos Preview para ~50 organizações de infraestrutura crítica. Em um mês: 1.000+ projetos open source varridos, 6.202 candidatos a vulnerabilidade alta/crítica sinalizados, 1.726 exploits confirmados (1.094 high/critical). Caso emblemático: exploit no wolfSSL permitindo forjar certificados bancários. Gargalo passou de descoberta para patching — menos de 100 patches deployados. Importa porque dá peso empírico ao argumento dual-use que justifica não liberar Mythos publicamente, e redefine economia de segurança ofensiva/defensiva.

Modelos · Anthropic Research · anthropic, mythos, glasswing, ai-security, zero-days, patching

Ferramentas e código

OpenAI + Dell: Codex agora roda em ambientes híbridos e on-premise enterprise

OpenAI e Dell anunciam parceria para levar Codex (e GPT-5.5 para agentes de código) a ambientes híbridos e on-premise de grandes empresas — resposta direta a Claude Code/Anthropic no terreno corporativo.

Ferramentas e código · rss-openai · - openai

Anthropic — Compliance API e Managed Agents: self-hosted sandboxes e MCP tunnels

Em 21/05, a Anthropic adicionou ao Claude duas peças voltadas à empresa pesada: Compliance API (integração com ferramentas de segurança/compliance para governar Claude como qualquer outro app da stack) e Managed Agents (sandboxes self-hosted em beta pública e MCP tunnels em research preview — execução de agentes e acesso a serviços privados dentro do perímetro corporativo).

Ferramentas e código · websearch · - anthropic

OpenAI Codex update — Appshots, Goal mode GA e Locked Computer Use no Mac

Update do Codex de 22/05/2026 traz Appshots (anexar janela do macOS a uma thread via hotkey — Codex enxerga screenshot + texto sem prompt longo), Goal mode em GA pelo app/IDE/CLI (o usuário define objetivo e critério de sucesso, Codex itera até bater), e Locked Computer Use remoto para usuários elegíveis no macOS. ChatGPT Business ganha shared plugins e analytics de adoção.

Ferramentas e código · websearch · - openai

Databricks + GPT-5.5: agentes empresariais com o modelo de maior inteligência da OpenAI

Databricks passa a oferecer GPT-5.5 dentro dos workflows de agentes enterprise — combina dados governados do lakehouse com o modelo de raciocínio mais forte da OpenAI.

Ferramentas e código · rss-openai · - openai

Anthropic separa uso programático em crédito mensal — Agent SDK, GitHub Actions e MCP fora da assinatura de chat a partir de 15/06

A partir de 15/06, a Anthropic separa uso programático do Claude da assinatura de chat. Pro recebe $20 de crédito mensal para Agent SDK, GitHub Actions e frameworks de terceiros, Max 5x ganha $100, Max 20x ganha $200 — tudo cobrado em taxa-API. O movimento responde a abusos de planos baratos rodando agentes 24/7.

Ferramentas e código · websearch · - anthropic

GitHub karpathy-skills — pacote de skills para Claude Code seguindo o estilo de programação do próprio Karpathy

Apareceu em 22/05 um repo GitHub de "karpathy-skills" — coleção de Skills para Claude Code que aplicam padrões de programação do próprio Andrej Karpathy (estilo nanoGPT/llm.c: código minimal, comentários densos, preferência por do-it-yourself sobre frameworks). É reação direta da comunidade à entrada dele na Anthropic.

Ferramentas e código · websearch · - karpathy

Open Agent Leaderboard: ranking aberto de agentes (IBM Research)

IBM Research lança um leaderboard público para agentes, com tarefas reprodutíveis de tool-use e raciocínio multi-step — alternativa aberta aos benchmarks fechados de Anthropic/OpenAI.

Ferramentas e código · rss-huggingface-blog · - benchmark

HoloTab da HCompany: navegador-companion movido a IA

HCompany lança o HoloTab, um companion de browser que age como agente: lê páginas, executa workflows e mantém memória entre abas — concorrente direto de Comet/Arc Search.

Ferramentas e código · rss-huggingface-blog · - browser

OpenAI: sandbox seguro para rodar Codex no Windows

OpenAI detalha como construiu um sandbox leve para permitir que o Codex execute código no Windows com isolamento adequado — pré-requisito para uso em estações enterprise.

Ferramentas e código · rss-openai · - openai

Pesquisa

Co-Scientist: parceiro multi-agente da DeepMind para acelerar pesquisa científica

DeepMind apresenta o Co-Scientist, sistema multi-agente que colabora com cientistas humanos em ciclos de hipótese-experimento-revisão — primeiros casos em biologia e materiais.

Pesquisa · rss-deepmind · - deepmind

OpenAI: modelo refuta conjectura central de geometria discreta

Um modelo da OpenAI gerou um contraexemplo válido para uma conjectura central em geometria discreta — pequeno marco simbólico de raciocínio matemático original assistido por IA.

Pesquisa · rss-openai · - openai

DeepMind faz acquihire da Contextual AI — Douwe Kiela e +20 pesquisadores em deal de $80-90M

Google DeepMind contratou mais de 20 pesquisadores da Contextual AI e licenciou tecnologia da empresa em deal de $80-90M, com o co-fundador e CEO Douwe Kiela entre os que migraram. Não é aquisição cheia — é o formato "acquihire + licença" usado para evitar revisão antitruste, mesma jogada feita com Character.AI e Adept.

Pesquisa · websearch · - deepmind

PEEK — Context Map como Orientation Cache para agentes long-context (Khattab, Madden et al.)

Paper publicado em 19/05/2026 (HF Papers 2605.19932) por Zhuohan Gu, Qizheng Zhang, Omar Khattab e Samuel Madden propõe PEEK — Context Map, um cache persistente de "orientação" sobre contextos externos recorrentes. Em vez de re-aprender a estrutura de um codebase ou base de docs a cada tarefa, o agente mantém um mapa programável (Distiller, Cartographer, Evictor) e cacheia política de uso. Testes contra ACE e OpenAI Codex.

Pesquisa · huggingface · - paper

CODA: reescrevendo blocos de Transformer como programas GEMM-epilogue

Paper que ganhou tração no HN: reformular os blocos do Transformer como programas GEMM-epilogue permite fundir muitas operações em kernels mais rápidos — caminho para inferência mais barata.

Pesquisa · hackernews · - transformer

LongSeeker — Elastic Context Orchestration para agentes de busca de horizonte longo

Paper publicado em 06/05/2026 (HF Papers 2605.05191) introduz LongSeeker / Context-ReAct — orquestração elástica de contexto para search agents de longo horizonte. Em vez de inflar o context window indefinidamente, o agente executa operações dinâmicas (Compress, Rollback, Snippet, Delete) sobre o working memory. Resultado: mais raciocínio por token e menos drift.

Pesquisa · huggingface · - paper

Waypoint 1.5: mundos interativos de maior fidelidade rodando em GPUs comuns

Waypoint 1.5 melhora a fidelidade de world models interativos a ponto de rodar em GPUs de consumo — passo importante para simulações que treinam agentes embarcados.

Pesquisa · rss-huggingface-blog · - world-model

VAKRA: análise de raciocínio, tool use e modos de falha de agentes (IBM)

IBM Research mostra, com o benchmark VAKRA, onde agentes mais quebram hoje (planejamento, recuperação de erro, escolha de ferramenta) — útil para quem está endurecendo seus pipelines agentic.

Pesquisa · rss-huggingface-blog · - benchmark

Mem0 — arquitetura memory-centric baseada em grafo para coerência conversacional

Mem0 propõe arquitetura de memória baseada em grafo para conversas longas, com extração, consolidação e recuperação eficiente. Resultados superam sistemas de memória atuais em acurácia e custo computacional. Importa para builders de agentes pessoais (Spark, ChatGPT memory, Claude memory) que ainda tratam memória como string longa. Ganhou tração na comunidade de context engineering, casando com o paper Survey of Context Engineering de Mei et al.

Pesquisa · Hugging Face Papers · mem0, memory, graph, agents, long-context, context-engineering

Mercado

Anthropic compra a Stainless — tooling de SDK e MCP server agora vira casa

Em paralelo à entrada de Karpathy, a Anthropic anunciou em 18/05 a aquisição da Stainless — startup fundada em 2022 que gera SDKs automaticamente e produz conectores MCP server. O movimento dobra a aposta no Claude como plataforma agentic (Claude Code + Agent SDK + MCP) e fecha o ciclo desde modelo até integração.

Mercado · websearch · - anthropic

Regulação e segurança

Microsoft abre RAMPART e Clarity — segurança de agentes vira disciplina contínua de CI

Microsoft abriu o código de RAMPART (framework Pytest-native para red-team de agentes, sobre o PyRIT) e Clarity (sounding board estruturado para definir o problema antes de codar). A proposta é tirar a segurança de agentes da "lista de checagem periódica" e colocar dentro do pipeline de CI — cobrindo cross-prompt injection, exfiltração de dados e regressões comportamentais.

Regulação e segurança · websearch · - microsoft

Comunidade

Cohere Command A+ — 218B MoE Apache 2.0 rodando em apenas 2 H100s

Cohere abriu o Command A+ sob Apache 2.0 — primeiro modelo da casa com licença totalmente aberta. É um MoE esparso de 218B parâmetros com 25B ativos, focado em workflows agentic e que roda com apenas 2 H100s. Suporta 48 idiomas, traz citações nativas via tags e ganhos de tokenização de até 20% em árabe/coreano/japonês.

Comunidade · websearch · - cohere

ElevenReader licencia 200 mil audiobooks humanos por $11/mês — mira direto na Audible

Em 22/05, a ElevenLabs (valor de $11B) anunciou licenciamento de 200 mil audiobooks narrados por humanos das grandes editoras para o app ElevenReader, em assinatura de $11/mês. É um movimento "anti-Audible" — combinar catálogo humano clássico com TTS sintético próprio na mesma assinatura.

Comunidade · websearch · - elevenlabs

Spotify lança criação de audiobook com IA da ElevenLabs em beta de junho

No Investor Day, Spotify anunciou ferramenta nativa de criação de audiobooks por IA dentro do Spotify for Authors, usando ElevenLabs como engine — beta em junho, convite, só inglês. Sem cláusula de exclusividade — autores podem publicar o áudio gerado em qualquer plataforma.

Comunidade · websearch · - spotify

Quatro labs, quatro aquisições em cinco dias: sinal de consolidação em IA

Reportagem do StartupHub destaca padrão emergente: quatro labs de IA fizeram aquisições estratégicas em uma janela de cinco dias em maio/2026 — sinal forte de fase de consolidação após dois anos de fragmentação (proliferação de startups de modelos, agentes, evals, infra). Mercado de IA começa a "espremer" para poucos vencedores por categoria.

Comunidade · webnews · consolidacao, ma, ai-industry, market-signal