Radar do FAROL18 notas

sexta-feira, 9 de outubro de 2026

Modelos

Xiaomi publica o relatório do MiMo-V2.6, família omnimodal treinada com RL em escala e contexto de 1M

RL assíncrono com 2,7 a 3,7 bi de tokens por passo, ambientes de código, visão e ciber sob vários harnesses, e avaliação agêntica em grupo que favorece soluções mais curtas.

Modelos · arxiv · xiaomi, mimo, rl, moe, agentes

Ferramentas e código

Cloudflare compra a Deno; o runtime Deno deixa de ser desenvolvido em um ano

A aquisição mira o celld, implementação aberta de Durable Objects, para tornar o workerd auto-hospedável. O Deno terá um ano de correções mensais e depois segue só como código aberto. Ryan Dahl diz que concorda com a decisão.

Ferramentas e código · rss · cloudflare, deno, workers, open-source

Mistral põe em prévia pública os Managed Deployments para rodar Workflows sem infraestrutura própria

O código vai para a Mistral Cloud, que roda os workers. Na prévia, exige plano pago (pay-as-you-go ou Enterprise) e tem cota.

Ferramentas e código · web · mistral, workflows, agentes, cloud

ttok 1.0: Simon Willison troca o tokenizador padrão para a família GPT-5/GPT-6

A ferramenta de contar e truncar texto por tokens chega à 1.0. Um teste de terceiros com 31 arquivos indica que os sete modelos GPT-5.5 a GPT-6 contam os mesmos tokens; a OpenAI não confirmou.

Ferramentas e código · rss · simon-willison, tokenizador, cli, gpt-6

big-arrow-on-the-screen: agentes desenham setas, caixas e texto na tela do usuário

Projeto aberto para o agente apontar visualmente o que quer mostrar na tela. 361 pontos no Show HN.

Ferramentas e código · hacker-news · agentes, interface, open-source, show-hn

Ai2 conta como montou um escalonador de GPU que prioriza a pesquisa de maior impacto

A equipe de infraestrutura troca agendas por orçamentos e fair-share, com simulações, para manter o cluster ocupado e dar GPU primeiro ao trabalho mais valioso.

Ferramentas e código · rss · ai2, gpu, infraestrutura, escalonamento

Pesquisa

SWE-Journey: assistentes de código passam 75% dos testes com arquitetos e menos de 25% com quem não programa

Benchmark de tarefas longas em repositórios que evoluem, com um agente que simula quatro perfis reais de usuário. A distância entre os perfis mostra que o gargalo está em esclarecer requisitos ao longo da conversa.

Pesquisa · arxiv · benchmark, claude-code, codex, coding-agents

Esquecimento controlado pelo agente corta pela metade os tokens de entrada em tarefas com ferramentas

O modelo troca resultados antigos de ferramenta por uma nota curta e guarda o original num arquivo recuperável. Num caso de depuração, 232 mil tokens de prompt contra 912 mil, custo de US$ 1,3 contra US$ 4,4, com 17% mais tempo.

Pesquisa · arxiv · context-engineering, agentes, custo, memoria

OpenProblemBench: GPT-6-Astra resolve 14% de 82 problemas abertos de matemática e física teórica

Quatro modelos avaliadores julgam as soluções sem gabarito. Os modelos abertos completos ficam entre 5,5% e 6,7%, e as versões Flash entre 2,4% e 3,7%.

Pesquisa · arxiv · benchmark, matematica, gpt-6

Evoluir o harness corrige falhas de processo; treinar pesos corrige falhas de conteúdo

No DeepPlanning, um harness que se reescreve leva o Qwen3.5-4B de 0,16 a 0,30. Bloqueios, laços e orçamento estourado se resolvem no harness; plano ruim pede treino, e LoRA sobre as trajetórias absorve o ganho.

Pesquisa · arxiv · harness, agentes, lora, qwen

Rastrear cada ideia de um agente de código jogando ARC-AGI-3 pelos arquivos que ele escreve

Sem estado entre turnos além de scripts e notas, cada crença do agente vira traço auditável. O protocolo mede onde uma regra nasce, é corrigida ou abandonada, em sete execuções com três modelos.

Pesquisa · arxiv · arc-agi-3, aprendizado-continuo, coding-agents

Mercado

TypeSafe AI capta US$ 870 mi com avaliação de US$ 7,5 bi

Rodada liderada pela Andreessen Horowitz, com Sequoia e DCVC; Martin Casado entra no conselho. A empresa faz modelos para decisões dentro de software (o primeiro, Jev, em acesso antecipado) e diz que um terço da Fortune 500 o usa. 215 pontos no HN.

Mercado · hacker-news · investimento, a16z, sequoia, automacao

Regulação e segurança

Pesquisadores de segurança demitidos pela OpenAI publicam carta; a empresa alega quebra de confiança

Mikita Balesni, Tomek Korbak e Jasmine Wang dizem que foram demitidos por defender compromissos do setor para preservar a monitorabilidade do raciocínio, com contato com grupos externos como o METR. A OpenAI diz que eles violaram políticas de informação sensível, sem detalhar quais.

Regulação e segurança · web · openai, safety, metr, monitorabilidade

Comunidade

Washington Post: campanha iraniana plantou artigos feitos com ChatGPT em veículos americanos

Reportagem do Washington Post sobre artigos gerados com ChatGPT por uma campanha iraniana e publicados em veículos reais dos EUA. 174 pontos no HN; a página não abriu para conferência do conteúdo além da manchete.

Comunidade · hacker-news · desinformacao, ira, chatgpt, midia

Michael Lynch: por que os agentes de código continuam tão ruins

Argumento: os modelos melhoraram e o agente (o programa que os liga ao código) ficou para trás. Travamentos, fluxos primitivos e tarefas dadas como prontas sem estarem.

Comunidade · hacker-news · agentes-de-codigo, claude-code, codex, harness

SoftBank busca até US$ 100 bi de investidores do Golfo para fundo que compra empresas e as reorganiza com IA

Masayoshi Son conversou nas últimas semanas com figuras de alto escalão dos Emirados Árabes Unidos, segundo fontes do FT.

Comunidade · web · softbank, investimento, emirados

MIT Technology Review: a recusa é a parede de sustentação da segurança de IA, e é frágil

Arthur Holland Michel argumenta que a recusa é probabilística, pouco compreendida e quebrada por jailbreaks, e que os mesmos mecanismos podem suprimir fala legítima, com limites definidos em segredo.

Comunidade · rss · recusa, jailbreak, seguranca, censura

Onda de ciberataques a empresas japonesas leva o governo a pedir revisões de segurança

Os ataques de setembro expuseram dados de milhões de pessoas; a reportagem associa o aumento à IA, que reduz a barreira para invasões.

Comunidade · web · ciberseguranca, japao