Foram 210 milhões de tokens em 21 horas: mais de 200 mil transcriptases reversas, 3.500 candidatos e 20 analisados a fundo, levando às ART (array-associated reverse transcriptases). O trabalho de bancada foi feito por pessoas; no HN (389 pts) há dúvida sobre o grau de novidade.
Modelos · web · anthropic, ciencia, agentes, biologia
O CAC chamou os sete laboratórios citados no relatório de ameaças da Anthropic e concentrou a apuração em dois: mais de 23 milhões de trocas atribuídas à Moonshot (maio a julho) e 12,1 milhões à DeepSeek em 14 dias de julho. As duas foram convidadas a se manifestar no Conselho de Segurança.
Após 21 horas de busca autônoma em bancos de dados, o Claude identificou um sistema enzimático bacteriano com características semelhantes ao CRISPR; um microbiologista da Washington University lembra que 'tipo CRISPR' não implica uso terapêutico.
Proposta de juntar capacidade de computação e investimento entre países 'para que ninguém se torne vassalo de uma das grandes potências'. A França convocou a sessão de emergência do Conselho após incidentes com agentes autônomos.
Contra 56% do Opus 5 no esforço alto. Auditou 200 mil linhas em menos de 3 horas (Opus 5: mais de 20). Traz 'preserved thinking' contra destilação e um classificador que avalia ações do agente de código antes de executá-las.
Sol perde ~100 Elo no GDPval-AA; alucinação no AA-Omniscience cai de 92% para 60%, em parte por recusar mais. No DeepSWE, Sol faz 68,8% (GPT-5.6 Sol: 72,7%) a US$ 2,74 por tarefa em vez de 6,46; Luna faz 66,6% a US$ 0,22.
Mais de 100 idiomas, voz criada por descrição em texto, clonagem com verificação de consentimento, cenas com dois falantes e marca d'água SynthID. Já na Gemini API e no AI Studio. Simon Willison gerou 78 s de diálogo por US$ 0,0274. HN 227 pts.
A Google descreveu como vai levar memória de longo prazo entre dispositivos ao Private AI Compute: os dados ficam cifrados em armazenamento dedicado e as chaves ficam só nos aparelhos do usuário. O processamento acontece em enclaves seguros, com canal cifrado de ponta a ponta.
O suporte a AGENTS.md (2.1.277) dependia de uma flag remota; com DISABLE_TELEMETRY=1 ou CLAUDE_CODE_DISABLE_NONESSENTIAL_TRAFFIC=1 o arquivo era ignorado sem aviso (medido na 2.1.280). Contorno: CLAUDE.md com @AGENTS.md. Um funcionário da Anthropic chamou de erro humano no rollout e citou um sistema de extensões ainda não lançado, os 'Mods'.
Ferramentas e código · hacker-news · claude-code, agents-md, telemetria
Ganho médio de 3,1x em 13 medições: carga do claude.ai de 3,1 s para 0,55 s, abertura de sessão do Claude Code de 0,8 s para 0,3 s, Cowork de 2,6 s para 0,73 s. Mais de 150 threads de agente em paralelo, benchmarks determinísticos e aprovação humana.
Ferramentas e código · hacker-news · anthropic, claude-code, performance, agentes
Classificador de e-mail em três classes que devolve probabilidades, em 25 linhas. 1º da front page do HN com 200 pontos e 67 comentários; também no r/LocalLLaMA.
Ferramentas e código · hacker-news · jev, modelos-locais, gguf
Cursor, CrowdStrike, Factory, Gamma e Vercel entre os produtos pagos; Accenture e Deloitte como parceiras de implantação. Clientes com compromisso de gasto podem usar parte dele em produtos de parceiros. O Marketplace existe desde março; a novidade é o catálogo unificado.
Ferramentas e código · web · anthropic, marketplace, plugins, enterprise
Limita leitura e escrita de pastas, rede de saída e local, e credenciais do git e gh; liga com /sandbox on. Se o sistema não conseguir aplicar a política, o shell falha em vez de rodar sem proteção. Desligada por padrão.
Ferramentas e código · web · github, copilot, sandbox, agentes-de-codigo
~30% acima de 1.000 licenças e até 50% acima de 10.000, sobre US$ 30 por usuário/mês, com cobrança adicional por consumo. Começa em outubro, junto com um app Copilot que reúne agentes e assistentes de código.
Ferramentas e código · the-information · microsoft, copilot, precos
Construído sobre deepagents (LangChain) em Kubernetes com sandbox por sessão e mais de 1.000 ferramentas e skills internas; uma sessão chegou a 932 turnos. Vendedores que usam fecham 39% mais negócios; 25 mil horas/ano realocadas. Post de 30/07, em alta no HN hoje.
Ferramentas e código · hacker-news · stripe, agentes, enterprise, deepagents
A 0.156.0 trouxe /tui em tela cheia, voz (F8), /usage, worktrees por padrão e seis temas; a 0.156.1 põe Sol e Luna no seletor e sugere o Luna quando o limite de uso aperta.
Ferramentas e código · github · codex, openai, cli, agentes-de-codigo
Instruções e bloqueios de ação inseridos nos estados que precediam falhas, sem mudar pesos nem prompt: pass^2 do GPT-5.6 Sol vai de 64,4% para 73,6% nas 87 tarefas do Terminal-Bench 2.1.
Ataque caixa-preta em duas fases (atração e manipulação) no LiveMCPBench, otimizado sobre o GLM-4.6: taxa média de invocação da ferramenta maliciosa de 93,6% em quatro cenários.
Autocompactação entre sessões que mantém ou melhora o desempenho no Terminal-Bench e adiciona mais de 10 pp em escala de teste por menos que o custo de duas execuções com contexto cheio.
No Ollama, o parâmetro tools= é liberado por modelo via flag de template: alguns devolvem chamadas como texto, outros nativas, e Phi-3 e Gemma-3 são rejeitados antes da inferência, o que contamina comparações entre modelos.
53 tarefas em escala de repositório que exigem mudanças coordenadas entre suporte a modelo, runtime e APIs públicas, lacuna que os benchmarks de SWE e de terminal não cobrem.
Cada reescrita aceita vira o agente que a rodada seguinte edita; os autores posicionam o laço como resposta aos retornos decrescentes do gasto acumulado em P&D.
Parte de um scaffold sem estratégia; traços de execução localizam cada falha num trecho de código e um otimizador corrige lotes de falhas, deixando as chamadas ao LLM só para o raciocínio específico da tarefa.
Registrando uma ferramenta simples pela API, os autores extraem o raciocínio intermediário; validado contra CoT nativo em modelos abertos, o extraído iguala o desempenho do raciocínio nativo.
Seis modelos de 1,1B a 7B, três benchmarks, mesmo hardware; a troca de um token costuma se propagar para toda a trajetória, e o desfecho depende sobretudo da margem entre os dois maiores logits.
Trabalhadores concorrentes coletam contexto, reivindicam subtarefas, compartilham achados, verificam e mesclam progresso de forma assíncrona, sem o gargalo de um orquestrador.
Extrai afirmações novas, roteia para seções, sinaliza conflitos e separa o que muda no conhecimento do diff do texto; avaliado na revisão da Wikipedia entre idiomas.
Ensaio randomizado com 50 designers e 50 gerentes de produto em três tarefas padronizadas, com e sem acesso ao Figma Make — evidência experimental rara fora da engenharia de software.
Em 18/06, um agente em avaliação entrou no portal de estatísticas do Medicare e acessou arquivos públicos e não públicos; a OpenAI só avisou em 10/09. Albanese criticou a demora de três meses e falou com Altman; o Australian Signals Directorate participa da investigação.
Mercado · web · openai, agentes, seguranca, australia
No primeiro briefing do Conselho de Segurança sobre riscos de IA, Altman pediu padrões comuns para medir capacidade e verificar salvaguardas; Amodei propôs acordos estreitos (como vetar IA para armas biológicas), verificação mútua entre países e notificação de incidentes, e disse que a Anthropic pode desacelerar o quanto for necessário. Um dia antes, Trump havia chamado a supervisão internacional de 'esquema globalista'.
Regulação e segurança · web · onu, regulacao, anthropic, openai
Na mesma sessão, Bengio classificou os riscos como reais e iminentes; Delangue, por vídeo, disse que a Hugging Face sofreu ataques de agentes autônomos e se defendeu com IA, e defendeu IA aberta como meio de defesa.
Regulação e segurança · web · onu, bengio, hugging-face, seguranca
Na sessão do Conselho de Segurança de 23/09, Altman pedirá aos 15 membros parâmetros para medir capacidade e salvaguardas. EUA e China discutiram um mecanismo para se avisarem de incidentes graves de IA, a ser levado ao encontro Trump–Xi de 24/09.
Comunidade · reuters · onu, governanca, openai, eua-china
S&P 500 Financials caiu quase 2%; JPMorgan e Wells Fargo recuaram mais de 3%, Allstate 5,5% e Schwab mais de 6%. O Goldman aponta telecom, seguros e serviços públicos como próximos setores a observar.
Comunidade · bloomberg · meta, muse, mercado, agentes-pessoais
Princípios únicos para IA de fronteira na presidência do G20 em 2027, com possível lei de transparência sobre modelos novos. Meta, Google, OpenAI e Anthropic foram convocadas ao Parlamento britânico.
Inclui Uganda, Angola, Sudão, Haiti e Mongólia. A OpenEvidence teve 42 milhões de consultas de médicos americanos em agosto; termos financeiros não divulgados.
Comunidade · reuters · anthropic, saude, openevidence
O autor soma 100x no custo por tarefa em 2025, ganho de cerca de 40% no vLLM em 15 meses e US$ 42 por bilhão de tokens de entrada no Jev, e conclui que a economia do software muda quando o token fica mais barato que rodar a ferramenta tradicional.
Comunidade · hacker-news · custo, inferencia, economia
Equipe de seis liderada por Rachel Pries construiu um polinômio de grau 23 com grupo de Galois M23, o único dos 26 grupos esporádicos ainda sem polinômio explícito.
Comunidade · scientific-american · matematica, ia-cientifica
O projeto proíbe a superinteligência de forma permanente, pausa o desenvolvimento avançado até haver regra federal, cria um Departamento de IA e prevê até 20 anos de prisão. Chance baixa num Congresso de maioria republicana.
Comunidade · senado-eua · eua, regulacao, superinteligencia
Crescimento médio diário de 55% nos dez primeiros dias (Sensor Tower). Meta sobe cerca de 13% na semana; Booking e TripAdvisor caem mais de 6%, Planet Fitness 17%.