Radar do FAROL16 notas

terça-feira, 23 de junho de 2026

Modelos

Anthropic lança Claude Tag: agente 'sempre-ligado' que vive nos canais do Slack

A Anthropic lançou em research preview o Claude Tag, um "Claude sempre-ligado" com identidade própria dentro do Slack: qualquer pessoa de um canal pode invocá-lo via @Claude. Diferente das integrações anteriores, ele mantém memória contínua das conversas e do histórico de trabalho do canal, e tem um "modo ambiente" em que monitora os canais atribuídos e intervém proativamente (lembretes, resumos, contexto puxado de outra parte da empresa) sem esperar ser chamado. Roda em Opus 4.8 e está disponível para clientes Claude Enterprise e Claude Team. Administradores controlam, por canal, quais ferramentas, fontes e dados cada identidade Claude acessa.

Modelos · anthropic · anthropic, claude, slack, agentes, claude-tag, opus-4.8

Claude Fable 5 sai dos planos por assinatura: a partir de 23/06 o uso passa a consumir créditos a preço de API

A partir de hoje (23/06), a Anthropic remove a Claude Fable 5 dos limites de Pro, Max, Team e Enterprise; o uso continuado passa a consumir créditos cobrados a preço de API — US$10/milhão de tokens de entrada e US$50/milhão de saída (o dobro do Opus 4.8), tornando-a o modelo de fronteira mais caro da casa. O acesso gratuito vigorou de 09 a 22/06.

Modelos · web · claude, fable-5, anthropic, pricing, api, claude-code

Claude fora do ar: apagão de ~2h40 atinge Claude.ai, API, Code e Cowork

O Claude sofreu uma queda generalizada em 23/06: os relatos começaram por volta de 10h02 ET, com pico de ~7.119 reportes no Downdetector (EUA) e a TechRadar citando mais de 8.000 no auge. A página de status confirmou "elevated error rate" em todos os modelos; a Anthropic começou a investigar às 14h19 UTC e resolveu o incidente às 12h44 ET. O problema afetou Claude.ai, Console, API, Claude Code e Cowork (exceto Claude for Government). Em comunicado, a Anthropic reconheceu que a demanda cresceu mais rápido que a infraestrutura, sobretudo em horários de pico — episódio sensível porque a empresa entrou com pedido confidencial de IPO.

Modelos · techradar · anthropic, claude, outage, claude-code, cowork, api

Ferramentas e código

Simon Willison roda modelo de inpainting (0,2B) no navegador via WebGPU, portado com Claude Code

Simon Willison (22/06) usou o Claude Opus 4.8 para converter um modelo PyTorch de inpainting (Moebius, ~0,2B parâmetros) para ONNX e executá-lo inteiramente no navegador via WebGPU, rodando em Chrome, Firefox e Safari sem servidor.

Ferramentas e código · web · simon-willison, claude-code, webgpu, onnx, browser-ai, inpainting

Prompt injection como 'confusão de papéis' — enquadramento de Simon Willison

Em post de 22/06, Simon Willison reformula prompt injection como um problema de 'confusão de papéis': o modelo não distingue de forma confiável instruções do sistema de dados vindos do usuário ou de ferramentas, e por isso trata conteúdo externo como ordem legítima.

Ferramentas e código · web · prompt-injection, seguranca, agentes, llm, simon-willison

Pesquisa

Censo de agentes de código em 180M repositórios: Claude Code domina e a adoção é subcontada ~30x

Paper propõe um framework multi-método (varredura de arquivos de config, análise de mensagens de commit, identidade de autor e assinaturas de bot) sobre o World of Code para medir adoção de agentes de código. Encontra 850.157 commits do Claude Code em um snapshot — dos quais o sinal de "conta-bot" usado pela maioria dos estudos recupera só 3,3% (lacuna de recall de ~30x). Claude Code lidera (886 mil commits em 17.295 projetos) e domina a adoção "silenciosa", só detectável via arquivos de config. Canais de commit e de PR capturam populações quase disjuntas.

Pesquisa · arxiv · arxiv, claude-code, agentes-de-codigo, adocao, medicao, world-of-code

EnterpriseClawBench: benchmark de agentes a partir de sessões reais de trabalho

Paper no arXiv (22/06) apresenta o EnterpriseClawBench, benchmark de agentes corporativos construído a partir de sessões proprietárias e reais de trabalho: agentes que leem arquivos heterogêneos, invocam ferramentas e entregam artefatos de negócio.

Pesquisa · web · arxiv, agentes, enterprise, benchmark, tool-use

Randomized YaRN melhora a generalização de comprimento em raciocínio de contexto longo

Paper no arXiv (22/06) propõe uma variação randomizada do YaRN para estender LLMs a sequências muito longas com melhor generalização do que o treino padrão (pré-treino curto + extensão), atacando a dificuldade de generalizar para contextos muito além do visto.

Pesquisa · web · arxiv, long-context, context-engineering, rope, yarn

AIR: raciocínio intercalado com código em modelos multimodais (MLLMs)

Paper no arXiv (22/06) propõe o AIR, que intercala raciocínio com execução de código em modelos multimodais (MLLMs) — seguindo o paradigma aberto pelo OpenAI o3 — para ir além de tool-use simples e melhorar tarefas que exigem cômputo/verificação no meio da cadeia de raciocínio.

Pesquisa · web · arxiv, mllm, reasoning, code, multimodal

MAS-PromptBench: quando a otimização de prompts ajuda (ou não) sistemas multi-agente?

Benchmark no arXiv (22/06) que investiga em que condições a otimização de prompts melhora sistemas multi-agente — vários LLMs, cada um com seu prompt e posição num fluxo de coordenação. Mapeia onde o esforço de prompt realmente compensa.

Pesquisa · web · arxiv, multi-agente, prompt-optimization, agentes, benchmark

LLMs conseguem 'auto-reportar' prefixos adversariais de forma confiável? (segurança)

Paper no arXiv (22/06) estende a questão da introspecção de LLMs para o contexto de segurança: quão confiavelmente um modelo reconhece que a própria resposta anterior foi induzida por um prefixo adversarial (jailbreak por prefill).

Pesquisa · web · arxiv, seguranca, introspeccao, jailbreak, alignment

Comunidade

Google DeepMind talent exodus — John Jumper, researchers leave to Anthropic

John Jumper (AlphaFold, Nobel 2024) + top researchers saem DeepMind → Anthropic. Fortune questiona se lab mantém liderança em AI race.

Comunidade · Fortune · DeepMind, talent, Anthropic, research leadership

Meta pausa programa de treino de IA que rastreava digitação de funcionários após vazamento interno

Segundo o Business Insider (22/06), a Meta pausou um programa que coletava atividade e digitação (keystrokes) de funcionários para treinar IA, após um vazamento interno expor a prática em toda a empresa. Item em alta no Hacker News.

Comunidade · web · meta, privacidade, dados-de-treino, trabalho, vazamento

Líder de engenharia da Anthropic: uso intenso de Claude Code tornou o trabalho 'solitário

Fiona Fung, líder de engenharia dos times de Claude Code e Cowork na Anthropic, disse no podcast do Lenny que o uso tão intenso de IA agêntica passou a tornar o trabalho dos funcionários mais solitário — "começamos a trabalhar tanto com nossos agentes" que o time sentiu falta de interação. Para recompor o convívio, a empresa passou a promover hackathons e almoços de pair programming para as pessoas trocarem como usam o Claude Code. Fung tem 25+ anos de engenharia (11 na Microsoft, em Visual Studio/TypeScript, depois Meta e Instagram).

Comunidade · fortune · anthropic, claude-code, cowork, cultura, fiona-fung, agentes

Oracle reduz quadro em ~21 mil postos (≈13%) em meio à adoção de IA

A Reuters (22/06) reporta que a Oracle encolheu seu quadro em cerca de 21 mil postos (aproximadamente 13% da força de trabalho), movimento associado à adoção de IA e à reorganização interna.

Comunidade · web · oracle, empregos, layoffs, automacao, mercado

AI's Brokenomics': Ed Zitron questiona a economia por trás do boom de IA

Ensaio de Ed Zitron em alta no Hacker News argumenta que a economia da indústria de IA não fecha: custos de inferência, capex e receitas não se sustentariam nos níveis atuais. Peça de ceticismo que pauta o debate sobre bolha e sustentabilidade do setor.

Comunidade · web · economia-de-ia, custos, inferencia, bolha, opiniao