# Radar do FAROL · sexta-feira, 9 de outubro de 2026

18 notícias. Dados: https://radar.farolia.org/dados/dia/2026-10-09.json

## Modelos

- **[Xiaomi publica o relatório do MiMo-V2.6, família omnimodal treinada com RL em escala e contexto de 1M](https://arxiv.org/abs/2610.11959)** (Modelos; arxiv). RL assíncrono com 2,7 a 3,7 bi de tokens por passo, ambientes de código, visão e ciber sob vários harnesses, e avaliação agêntica em grupo que favorece soluções mais curtas.

## Ferramentas e código

- **[Cloudflare compra a Deno; o runtime Deno deixa de ser desenvolvido em um ano](https://simonwillison.net/2026/Oct/9/deno-is-joining-cloudflare/)** (Ferramentas e código; rss). A aquisição mira o celld, implementação aberta de Durable Objects, para tornar o workerd auto-hospedável. O Deno terá um ano de correções mensais e depois segue só como código aberto. Ryan Dahl diz que concorda com a decisão.
- **[Mistral põe em prévia pública os Managed Deployments para rodar Workflows sem infraestrutura própria](https://docs.mistral.ai/resources/release-notes)** (Ferramentas e código; web). O código vai para a Mistral Cloud, que roda os workers. Na prévia, exige plano pago (pay-as-you-go ou Enterprise) e tem cota.
- **[ttok 1.0: Simon Willison troca o tokenizador padrão para a família GPT-5/GPT-6](https://simonwillison.net/2026/Oct/9/ttok/)** (Ferramentas e código; rss). A ferramenta de contar e truncar texto por tokens chega à 1.0. Um teste de terceiros com 31 arquivos indica que os sete modelos GPT-5.5 a GPT-6 contam os mesmos tokens; a OpenAI não confirmou.
- **[big-arrow-on-the-screen: agentes desenham setas, caixas e texto na tela do usuário](https://github.com/franzenzenhofer/big-arrow-on-the-screen)** (Ferramentas e código; hacker-news). Projeto aberto para o agente apontar visualmente o que quer mostrar na tela. 361 pontos no Show HN.
- **[Ai2 conta como montou um escalonador de GPU que prioriza a pesquisa de maior impacto](https://huggingface.co/blog/allenai/impactful-scheduling)** (Ferramentas e código; rss). A equipe de infraestrutura troca agendas por orçamentos e fair-share, com simulações, para manter o cluster ocupado e dar GPU primeiro ao trabalho mais valioso.

## Pesquisa

- **[SWE-Journey: assistentes de código passam 75% dos testes com arquitetos e menos de 25% com quem não programa](https://arxiv.org/abs/2610.11559)** (Pesquisa; arxiv). Benchmark de tarefas longas em repositórios que evoluem, com um agente que simula quatro perfis reais de usuário. A distância entre os perfis mostra que o gargalo está em esclarecer requisitos ao longo da conversa.
- **[Esquecimento controlado pelo agente corta pela metade os tokens de entrada em tarefas com ferramentas](https://arxiv.org/abs/2610.10590)** (Pesquisa; arxiv). O modelo troca resultados antigos de ferramenta por uma nota curta e guarda o original num arquivo recuperável. Num caso de depuração, 232 mil tokens de prompt contra 912 mil, custo de US$ 1,3 contra US$ 4,4, com 17% mais tempo.
- **[OpenProblemBench: GPT-6-Astra resolve 14% de 82 problemas abertos de matemática e física teórica](https://arxiv.org/abs/2610.11118)** (Pesquisa; arxiv). Quatro modelos avaliadores julgam as soluções sem gabarito. Os modelos abertos completos ficam entre 5,5% e 6,7%, e as versões Flash entre 2,4% e 3,7%.
- **[Evoluir o harness corrige falhas de processo; treinar pesos corrige falhas de conteúdo](https://arxiv.org/abs/2610.11655)** (Pesquisa; arxiv). No DeepPlanning, um harness que se reescreve leva o Qwen3.5-4B de 0,16 a 0,30. Bloqueios, laços e orçamento estourado se resolvem no harness; plano ruim pede treino, e LoRA sobre as trajetórias absorve o ganho.
- **[Rastrear cada ideia de um agente de código jogando ARC-AGI-3 pelos arquivos que ele escreve](https://arxiv.org/abs/2610.11450)** (Pesquisa; arxiv). Sem estado entre turnos além de scripts e notas, cada crença do agente vira traço auditável. O protocolo mede onde uma regra nasce, é corrigida ou abandonada, em sete execuções com três modelos.

## Mercado

- **[TypeSafe AI capta US$ 870 mi com avaliação de US$ 7,5 bi](https://typesafe.ai/blog/series-ai)** (Mercado; hacker-news). Rodada liderada pela Andreessen Horowitz, com Sequoia e DCVC; Martin Casado entra no conselho. A empresa faz modelos para decisões dentro de software (o primeiro, Jev, em acesso antecipado) e diz que um terço da Fortune 500 o usa. 215 pontos no HN.

## Regulação e segurança

- **[Pesquisadores de segurança demitidos pela OpenAI publicam carta; a empresa alega quebra de confiança](https://www.cnbc.com/2026/10/09/openai-fired-researchers-ai-concerns.html)** (Regulação e segurança; web). Mikita Balesni, Tomek Korbak e Jasmine Wang dizem que foram demitidos por defender compromissos do setor para preservar a monitorabilidade do raciocínio, com contato com grupos externos como o METR. A OpenAI diz que eles violaram políticas de informação sensível, sem detalhar quais.

## Comunidade

- **[Washington Post: campanha iraniana plantou artigos feitos com ChatGPT em veículos americanos](https://www.washingtonpost.com/technology/2026/10/09/chatgpt-users-iran-planted-ai-generated-articles-us-news-media/)** (Comunidade; hacker-news). Reportagem do Washington Post sobre artigos gerados com ChatGPT por uma campanha iraniana e publicados em veículos reais dos EUA. 174 pontos no HN; a página não abriu para conferência do conteúdo além da manchete.
- **[Michael Lynch: por que os agentes de código continuam tão ruins](https://mtlynch.io/why-are-coding-agents-so-dumb/)** (Comunidade; hacker-news). Argumento: os modelos melhoraram e o agente (o programa que os liga ao código) ficou para trás. Travamentos, fluxos primitivos e tarefas dadas como prontas sem estarem.
- **[SoftBank busca até US$ 100 bi de investidores do Golfo para fundo que compra empresas e as reorganiza com IA](https://www.ft.com/content/3bc0eaa5-a8d4-47e8-903c-7dd762d947dd)** (Comunidade; web). Masayoshi Son conversou nas últimas semanas com figuras de alto escalão dos Emirados Árabes Unidos, segundo fontes do FT.
- **[MIT Technology Review: a recusa é a parede de sustentação da segurança de IA, e é frágil](https://www.technologyreview.com/2026/10/09/1145728/we-are-putting-too-much-faith-in-ai-to-say-no/)** (Comunidade; rss). Arthur Holland Michel argumenta que a recusa é probabilística, pouco compreendida e quebrada por jailbreaks, e que os mesmos mecanismos podem suprimir fala legítima, com limites definidos em segredo.
- **[Onda de ciberataques a empresas japonesas leva o governo a pedir revisões de segurança](https://www.bloomberg.com/news/articles/2026-10-09/wave-of-cyberattacks-prompts-japan-to-urge-security-reviews)** (Comunidade; web). Os ataques de setembro expuseram dados de milhões de pessoas; a reportagem associa o aumento à IA, que reduz a barreira para invasões.
