RL assíncrono com 2,7 a 3,7 bi de tokens por passo, ambientes de código, visão e ciber sob vários harnesses, e avaliação agêntica em grupo que favorece soluções mais curtas.
A aquisição mira o celld, implementação aberta de Durable Objects, para tornar o workerd auto-hospedável. O Deno terá um ano de correções mensais e depois segue só como código aberto. Ryan Dahl diz que concorda com a decisão.
Ferramentas e código · rss · cloudflare, deno, workers, open-source
A ferramenta de contar e truncar texto por tokens chega à 1.0. Um teste de terceiros com 31 arquivos indica que os sete modelos GPT-5.5 a GPT-6 contam os mesmos tokens; a OpenAI não confirmou.
Ferramentas e código · rss · simon-willison, tokenizador, cli, gpt-6
A equipe de infraestrutura troca agendas por orçamentos e fair-share, com simulações, para manter o cluster ocupado e dar GPU primeiro ao trabalho mais valioso.
Ferramentas e código · rss · ai2, gpu, infraestrutura, escalonamento
Benchmark de tarefas longas em repositórios que evoluem, com um agente que simula quatro perfis reais de usuário. A distância entre os perfis mostra que o gargalo está em esclarecer requisitos ao longo da conversa.
O modelo troca resultados antigos de ferramenta por uma nota curta e guarda o original num arquivo recuperável. Num caso de depuração, 232 mil tokens de prompt contra 912 mil, custo de US$ 1,3 contra US$ 4,4, com 17% mais tempo.
Quatro modelos avaliadores julgam as soluções sem gabarito. Os modelos abertos completos ficam entre 5,5% e 6,7%, e as versões Flash entre 2,4% e 3,7%.
No DeepPlanning, um harness que se reescreve leva o Qwen3.5-4B de 0,16 a 0,30. Bloqueios, laços e orçamento estourado se resolvem no harness; plano ruim pede treino, e LoRA sobre as trajetórias absorve o ganho.
Sem estado entre turnos além de scripts e notas, cada crença do agente vira traço auditável. O protocolo mede onde uma regra nasce, é corrigida ou abandonada, em sete execuções com três modelos.
Rodada liderada pela Andreessen Horowitz, com Sequoia e DCVC; Martin Casado entra no conselho. A empresa faz modelos para decisões dentro de software (o primeiro, Jev, em acesso antecipado) e diz que um terço da Fortune 500 o usa. 215 pontos no HN.
Mikita Balesni, Tomek Korbak e Jasmine Wang dizem que foram demitidos por defender compromissos do setor para preservar a monitorabilidade do raciocínio, com contato com grupos externos como o METR. A OpenAI diz que eles violaram políticas de informação sensível, sem detalhar quais.
Regulação e segurança · web · openai, safety, metr, monitorabilidade
Reportagem do Washington Post sobre artigos gerados com ChatGPT por uma campanha iraniana e publicados em veículos reais dos EUA. 174 pontos no HN; a página não abriu para conferência do conteúdo além da manchete.
Comunidade · hacker-news · desinformacao, ira, chatgpt, midia
Argumento: os modelos melhoraram e o agente (o programa que os liga ao código) ficou para trás. Travamentos, fluxos primitivos e tarefas dadas como prontas sem estarem.
Comunidade · hacker-news · agentes-de-codigo, claude-code, codex, harness
Arthur Holland Michel argumenta que a recusa é probabilística, pouco compreendida e quebrada por jailbreaks, e que os mesmos mecanismos podem suprimir fala legítima, com limites definidos em segredo.
Comunidade · rss · recusa, jailbreak, seguranca, censura