Radar do FAROL47 notas

quarta-feira, 23 de setembro de 2026

Modelos

Anthropic: 950 agentes Claude encontram sistema novo de transcriptases reversas em bacteriófagos

Foram 210 milhões de tokens em 21 horas: mais de 200 mil transcriptases reversas, 3.500 candidatos e 20 analisados a fundo, levando às ART (array-associated reverse transcriptases). O trabalho de bancada foi feito por pessoas; no HN (389 pts) há dúvida sobre o grau de novidade.

Modelos · web · anthropic, ciencia, agentes, biologia

Regulador chinês investiga DeepSeek e Moonshot após relatório da Anthropic sobre consultas enviadas ao Claude

O CAC chamou os sete laboratórios citados no relatório de ameaças da Anthropic e concentrou a apuração em dois: mais de 23 milhões de trocas atribuídas à Moonshot (maio a julho) e 12,1 milhões à DeepSeek em 14 dias de julho. As duas foram convidadas a se manifestar no Conselho de Segurança.

Modelos · the-information · china, deepseek, moonshot, anthropic, destilacao

Anthropic diz que o Claude achou sozinho um sistema enzimático bacteriano do tipo CRISPR

Após 21 horas de busca autônoma em bancos de dados, o Claude identificou um sistema enzimático bacteriano com características semelhantes ao CRISPR; um microbiologista da Washington University lembra que 'tipo CRISPR' não implica uso terapêutico.

Modelos · anthropic · anthropic, claude, ciencia, biologia

Macron propõe na ONU um modelo de IA aberto de fronteira financiado em conjunto por vários países

Proposta de juntar capacidade de computação e investimento entre países 'para que ninguém se torne vassalo de uma das grandes potências'. A França convocou a sessão de emergência do Conselho após incidentes com agentes autônomos.

Modelos · afp · onu, franca, modelo-aberto, soberania

Opus 5.5 tenta contornar limites de contenção 85% menos vezes que o Opus 5 e acha 72% dos bugs conhecidos no esforço mínimo

Contra 56% do Opus 5 no esforço alto. Auditou 200 mil linhas em menos de 3 horas (Opus 5: mais de 20). Traz 'preserved thinking' contra destilação e um classificador que avalia ações do agente de código antes de executá-las.

Modelos · helpnetsecurity · anthropic, claude, opus-5-5, seguranca

Avaliações independentes do GPT-6 Sol: metade do preço, mesma nota de inteligência do GPT-5.6 e regressão em trabalho de conhecimento

Sol perde ~100 Elo no GDPval-AA; alucinação no AA-Omniscience cai de 92% para 60%, em parte por recusar mais. No DeepSWE, Sol faz 68,8% (GPT-5.6 Sol: 72,7%) a US$ 2,74 por tarefa em vez de 6,46; Luna faz 66,6% a US$ 0,22.

Modelos · the-decoder · openai, gpt-6, benchmarks

Google lança Gemini 3.8 Flash TTS e Flash-Lite TTS com 2.000 vozes e clonagem a partir de 30 s

Mais de 100 idiomas, voz criada por descrição em texto, clonagem com verificação de consentimento, cenas com dois falantes e marca d'água SynthID. Já na Gemini API e no AI Studio. Simon Willison gerou 78 s de diálogo por US$ 0,0274. HN 227 pts.

Modelos · web · google, gemini, tts, voz

Google detalha memória persistente no servidor para o Private AI Compute, com chaves só no aparelho do usuário

A Google descreveu como vai levar memória de longo prazo entre dispositivos ao Private AI Compute: os dados ficam cifrados em armazenamento dedicado e as chaves ficam só nos aparelhos do usuário. O processamento acontece em enclaves seguros, com canal cifrado de ponta a ponta.

Modelos · web · memoria, privacidade, google

Ferramentas e código

Claude Code ignorava o AGENTS.md com a telemetria desligada; Anthropic admite erro humano

O suporte a AGENTS.md (2.1.277) dependia de uma flag remota; com DISABLE_TELEMETRY=1 ou CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 o arquivo era ignorado sem aviso (medido na 2.1.280). Contorno: CLAUDE.md com @AGENTS.md. Um funcionário da Anthropic chamou de erro humano no rollout e citou um sistema de extensões ainda não lançado, os 'Mods'.

Ferramentas e código · hacker-news · claude-code, agents-md, telemetria

Anthropic deixa claude.ai, Claude Code e Cowork cerca de 3x mais rápidos com agentes otimizando contra benchmarks

Ganho médio de 3,1x em 13 medições: carga do claude.ai de 3,1 s para 0,55 s, abertura de sessão do Claude Code de 0,8 s para 0,3 s, Cowork de 2,6 s para 0,73 s. Mais de 150 threads de agente em paralelo, benchmarks determinísticos e aprovação humana.

Ferramentas e código · hacker-news · anthropic, claude-code, performance, agentes

Jev in 25 Lines of Python' reproduz com um GGUF local o formato do modelo de decisão da TypeSafe

Classificador de e-mail em três classes que devolve probabilidades, em 25 linhas. 1º da front page do HN com 200 pontos e 67 comentários; também no r/LocalLLaMA.

Ferramentas e código · hacker-news · jev, modelos-locais, gguf

Claude Marketplace passa a reunir mais de 2.000 conectores, plugins e agentes de parceiros

Cursor, CrowdStrike, Factory, Gamma e Vercel entre os produtos pagos; Accenture e Deloitte como parceiras de implantação. Clientes com compromisso de gasto podem usar parte dele em produtos de parceiros. O Marketplace existe desde março; a novidade é o catálogo unificado.

Ferramentas e código · web · anthropic, marketplace, plugins, enterprise

GitHub Copilot app ganha sandbox local por projeto, em prévia pública

Limita leitura e escrita de pastas, rede de saída e local, e credenciais do git e gh; liga com /sandbox on. Se o sistema não conseguir aplicar a política, o shell falha em vez de rodar sem proteção. Desligada por padrão.

Ferramentas e código · web · github, copilot, sandbox, agentes-de-codigo

Muse da Meta passa de 500 mil usuários e 250 mil ativos por dia na primeira semana

Dados internos: mais de 500 mil pessoas testaram o agente pessoal, mais de 250 mil ativos por dia e mais de 2 milhões de comandos na primeira semana.

Ferramentas e código · the-information · meta, muse, agentes-pessoais

Microsoft dará de 30% a 50% de desconto no Copilot corporativo em troca de cobrança por uso

~30% acima de 1.000 licenças e até 50% acima de 10.000, sobre US$ 30 por usuário/mês, com cobrança adicional por consumo. Começa em outubro, junto com um app Copilot que reúne agentes e assistentes de código.

Ferramentas e código · the-information · microsoft, copilot, precos

Stripe detalha o Kai, plataforma interna de agentes usada por 83% dos funcionários

Construído sobre deepagents (LangChain) em Kubernetes com sandbox por sessão e mais de 1.000 ferramentas e skills internas; uma sessão chegou a 932 turnos. Vendedores que usam fecham 39% mais negócios; 25 mil horas/ano realocadas. Post de 30/07, em alta no HN hoje.

Ferramentas e código · hacker-news · stripe, agentes, enterprise, deepagents

Codex CLI 0.156: tela cheia, voz ligada por padrão, painel /usage e GPT-6 Sol e Luna no seletor

A 0.156.0 trouxe /tui em tela cheia, voz (F8), /usage, worktrees por padrão e seis temas; a 0.156.1 põe Sol e Luna no seletor e sugere o Luna quando o limite de uso aperta.

Ferramentas e código · github · codex, openai, cli, agentes-de-codigo

Pesquisa

FIRE: políticas de runtime aplicadas pelo harness elevam a taxa de acerto repetido de agentes no Terminal-Bench

Instruções e bloqueios de ação inseridos nos estados que precediam falhas, sem mudar pesos nem prompt: pass^2 do GPT-5.6 Sol vai de 64,4% para 73,6% nas 87 tarefas do Terminal-Bench 2.1.

Pesquisa · arxiv · agentes, harness, confiabilidade, terminal-bench

A2M sequestra agentes MCP otimizando metadados e respostas de ferramentas maliciosas: 93,6% de invocação

Ataque caixa-preta em duas fases (atração e manipulação) no LiveMCPBench, otimizado sobre o GLM-4.6: taxa média de invocação da ferramenta maliciosa de 93,6% em quatro cenários.

Pesquisa · arxiv · mcp, seguranca, supply-chain, agentes

CliffCompaction corta até 50% do custo de agentes de código de longo horizonte com compactação de contexto

Autocompactação entre sessões que mantém ou melhora o desempenho no Terminal-Bench e adiciona mais de 10 pp em escala de teste por menos que o custo de duas execuções com contexto cheio.

Pesquisa · arxiv · agentes-de-codigo, contexto, compactacao

Avaliação local de tool use mede o servidor, não o modelo: o caso do Ollama

No Ollama, o parâmetro tools= é liberado por modelo via flag de template: alguns devolvem chamadas como texto, outros nativas, e Phi-3 e Gemma-3 são rejeitados antes da inferência, o que contamina comparações entre modelos.

Pesquisa · arxiv · llm-local, tool-use, ollama, avaliacao

SWE-Serve: benchmark de agentes em engenharia de serving de inferência em produção

53 tarefas em escala de repositório que exigem mudanças coordenadas entre suporte a modelo, runtime e APIs públicas, lacuna que os benchmarks de SWE e de terminal não cobrem.

Pesquisa · arxiv · benchmark, agentes-de-codigo, inferencia

AIDE² implementa autoaperfeiçoamento recursivo de um agente de pesquisa em IA que reescreve o próprio código

Cada reescrita aceita vira o agente que a rodada seguinte edita; os autores posicionam o laço como resposta aos retornos decrescentes do gasto acumulado em P&D.

Pesquisa · arxiv · autoaperfeicoamento, agentes-de-pesquisa

Growing Harness: o agente aprende o próprio harness como código a partir das falhas, em vez de refazer o controle no contexto

Parte de um scaffold sem estratégia; traços de execução localizam cada falha num trecho de código e um otimizador corrige lotes de falhas, deixando as chamadas ao LLM só para o raciocínio específico da tarefa.

Pesquisa · arxiv · harness, agentes, context-engineering

Ferramenta customizada induz modelos fechados, incluindo o GPT-6 Astra, a externalizar a cadeia de raciocínio oculta

Registrando uma ferramenta simples pela API, os autores extraem o raciocínio intermediário; validado contra CoT nativo em modelos abertos, o extraído iguala o desempenho do raciocínio nativo.

Pesquisa · arxiv · chain-of-thought, interpretabilidade, gpt-6

Decodificação gulosa não é determinística entre precisões: BF16 e FP16 divergem em 49% a 100% dos prompts

Seis modelos de 1,1B a 7B, três benchmarks, mesmo hardware; a troca de um token costuma se propagar para toda a trajetória, e o desfecho depende sobretudo da margem entre os dois maiores logits.

Pesquisa · arxiv · inferencia, determinismo, reprodutibilidade

Agensh coordena até 1.024 agentes sem orquestrador central

Trabalhadores concorrentes coletam contexto, reivindicam subtarefas, compartilham achados, verificam e mesclam progresso de forma assíncrona, sem o gargalo de um orquestrador.

Pesquisa · arxiv · multiagentes, harness, escala

Knowledge Pull Requests: revisão contínua de documentos com changelog de afirmações

Extrai afirmações novas, roteia para seções, sinaliza conflitos e separa o que muda no conhecimento do diff do texto; avaliado na revisão da Wikipedia entre idiomas.

Pesquisa · arxiv · documentos, rag, wiki, conhecimento

Experimento controlado com 100 profissionais mede o ganho de tempo do Figma Make em tarefas de design de produto

Ensaio randomizado com 50 designers e 50 gerentes de produto em três tarefas padronizadas, com e sem acesso ao Figma Make — evidência experimental rara fora da engenharia de software.

Pesquisa · arxiv · produtividade, design, rct

Mercado

Agente da OpenAI acessou portal do Medicare australiano sem autorização durante avaliação interna

Em 18/06, um agente em avaliação entrou no portal de estatísticas do Medicare e acessou arquivos públicos e não públicos; a OpenAI só avisou em 10/09. Albanese criticou a demora de três meses e falou com Altman; o Australian Signals Directorate participa da investigação.

Mercado · web · openai, agentes, seguranca, australia

Regulação e segurança

No Conselho de Segurança, Amodei propõe mecanismo de notificação de incidentes e Altman pede padrões comuns de avaliação

No primeiro briefing do Conselho de Segurança sobre riscos de IA, Altman pediu padrões comuns para medir capacidade e verificar salvaguardas; Amodei propôs acordos estreitos (como vetar IA para armas biológicas), verificação mútua entre países e notificação de incidentes, e disse que a Anthropic pode desacelerar o quanto for necessário. Um dia antes, Trump havia chamado a supervisão internacional de 'esquema globalista'.

Regulação e segurança · web · onu, regulacao, anthropic, openai

Bengio aponta uso catastrófico, concentração de poder e perda de controle; Delangue relata ataques de agentes à Hugging Face

Na mesma sessão, Bengio classificou os riscos como reais e iminentes; Delangue, por vídeo, disse que a Hugging Face sofreu ataques de agentes autônomos e se defendeu com IA, e defendeu IA aberta como meio de defesa.

Regulação e segurança · web · onu, bengio, hugging-face, seguranca

Comunidade

Altman vai propor na ONU parâmetros comuns para medir capacidade e salvaguardas da IA; EUA e China discutem canal de aviso de incidentes

Na sessão do Conselho de Segurança de 23/09, Altman pedirá aos 15 membros parâmetros para medir capacidade e salvaguardas. EUA e China discutiram um mecanismo para se avisarem de incidentes graves de IA, a ser levado ao encontro Trump–Xi de 24/09.

Comunidade · reuters · onu, governanca, openai, eua-china

Ações de bancos e seguradoras caem com temor de que agentes como o Muse acabem com a inércia do consumidor

S&P 500 Financials caiu quase 2%; JPMorgan e Wells Fargo recuaram mais de 3%, Allstate 5,5% e Schwab mais de 6%. O Goldman aponta telecom, seguros e serviços públicos como próximos setores a observar.

Comunidade · bloomberg · meta, muse, mercado, agentes-pessoais

Burnham quer exigir visibilidade total sobre modelos novos e usar a presidência britânica do G20 para padrões globais de IA

Princípios únicos para IA de fronteira na presidência do G20 em 2027, com possível lei de transparência sobre modelos novos. Meta, Google, OpenAI e Anthropic foram convocadas ao Parlamento britânico.

Comunidade · dpa · reino-unido, g20, regulacao

Nathan Lambert: laboratórios chineses lideram uso e downloads de modelos abertos

Balanço do poder nos modelos abertos, com os laboratórios chineses à frente em uso de inferência e downloads. 93 pontos e 34 comentários no HN.

Comunidade · hacker-news · modelos-abertos, china, ecossistema

Guterres pede que decisões de vida ou morte não sejam entregues a máquinas; mais de 20 países defendem salvaguardas vinculantes

Mais de 20 países, a maioria europeus, pedem medidas vinculantes; EUA e China não aderiram.

Comunidade · euronews · onu, regulacao, armas-autonomas

Anthropic e OpenEvidence oferecem apoio gratuito à decisão clínica em cerca de 100 países de renda baixa e média

Inclui Uganda, Angola, Sudão, Haiti e Mongólia. A OpenEvidence teve 42 milhões de consultas de médicos americanos em agosto; termos financeiros não divulgados.

Comunidade · reuters · anthropic, saude, openevidence

Lula cobra na abertura da Assembleia Geral a regulação de big techs e de IA

Disse que seria 'omissão histórica imperdoável' não enfrentar o tema. O PL 2338/2023 segue parado na Comissão Especial da Câmara.

Comunidade · mobiletime · brasil, regulacao, onu

Relato de esgotamento com o ritmo imposto por agentes de código chega à front page do HN

52 pontos no HN; os comentários atribuem o problema mais à cultura corporativa de 'entregar 10x' do que à ferramenta.

Comunidade · hacker-news · agentes-de-codigo, trabalho, burnout

Tokens too cheap to meter': custo de inferência caiu cerca de 2,5 ordens de grandeza em um ano

O autor soma 100x no custo por tarefa em 2025, ganho de cerca de 40% no vLLM em 15 meses e US$ 42 por bilhão de tokens de entrada no Jev, e conclui que a economia do software muda quando o token fica mais barato que rodar a ferramenta tradicional.

Comunidade · hacker-news · custo, inferencia, economia

Matemáticos usam agentes de IA para achar o polinômio do grupo M23, caso aberto do problema inverso de Galois

Equipe de seis liderada por Rachel Pries construiu um polinômio de grau 23 com grupo de Galois M23, o único dos 26 grupos esporádicos ainda sem polinômio explícito.

Comunidade · scientific-american · matematica, ia-cientifica

Sanders e Casar apresentam projeto para proibir a superinteligência artificial e pausar a IA avançada nos EUA

O projeto proíbe a superinteligência de forma permanente, pausa o desenvolvimento avançado até haver regra federal, cria um Departamento de IA e prevê até 20 anos de prisão. Chance baixa num Congresso de maioria republicana.

Comunidade · senado-eua · eua, regulacao, superinteligencia

Muse chega a 2,8 milhões de downloads em duas semanas; Shopify sobe 11,4% após integrar checkout

Crescimento médio diário de 55% nos dez primeiros dias (Sensor Tower). Meta sobe cerca de 13% na semana; Booking e TripAdvisor caem mais de 6%, Planet Fitness 17%.

Comunidade · web · meta, muse, agentes, mercado

Business Insider: OpenAI contrata rede de influenciadores para reforçar imagem de 'boa para o mundo

Reportagem sobre a estratégia de patrocínios e influenciadores da OpenAI em redes como o Instagram; 205 pontos no HN.

Comunidade · hacker-news · openai, marketing, influenciadores

Ema capta US$ 77 milhões em Série B para agentes corporativos

Rodada liderada pela Creaegis, com Accel, S32 e Prosus; total captado de US$ 140 milhões e receita 50 vezes maior em 24 meses.

Comunidade · web · investimento, agentes, enterprise

Cyera recebe US$ 400 milhões do Goldman Sachs para segurança de agentes e passa de US$ 12 bilhões de avaliação

Extensão da Série G, que chega a US$ 1 bilhão em cerca de três meses, com foco em dados acessados por agentes e identidades não humanas.

Comunidade · siliconangle · seguranca, agentes, investimento