# Radar do FAROL · quarta-feira, 7 de outubro de 2026

39 notícias. Dados: https://radar.farolia.org/dados/dia/2026-10-07.json

## Modelos

- **[OpenAI libera o GPT-6 com Intelligent UI para todos os usuários do ChatGPT](https://openai.com/index/gpt-6-for-everyone)** (Modelos; openai-rss). O GPT-6 entra em distribuição global no ChatGPT junto com a Intelligent UI, que responde com visuais e experiências interativas que o usuário explora e usa direto na conversa. Publicado às 00h GMT de 07/10.
- **[Anthropic lança o Claude Haiku 5.5 e dá créditos mensais de API a assinantes Max e Team](https://simonwillison.net/2026/Oct/7/claude-haiku-5-5/)** (Modelos; rss). Modelo rápido e barato com tokenizador novo: US$ 0,10/0,50 por milhão de tokens até 100 mil tokens de contexto, cinco vezes mais acima disso. Empata em preço com o GPT-6 Luna até 100 mil e reporta benchmarks melhores nessa faixa. Junto, créditos mensais de API: US$ 100 no Max 5x, US$ 200 no Max 20x, até US$ 500 no Team. Já disponível no GitHub Copilot (531 pts no HN).
- **[NVIDIA ajusta o Nemotron 3 e chega a nível de ouro na IOI e na IMO 2026, com pesos e dados abertos](https://huggingface.co/blog/nvidia/nemotron-ioi-and-imo-2026)** (Modelos; rss). Fine-tuning supervisionado, RL e laços de gerar, verificar e refinar: 535,4/600 na IOI e 30/42 na IMO, ambos acima do corte de ouro. Pesos, dados de treino e código publicados no Hugging Face e no NeMo-Skills.
- **[Liquid AI abre os modelos de decisão d1-3B e d1-omni-600M para a borda](https://huggingface.co/blog/LiquidAI/open-d1)** (Modelos; rss). Dois modelos abertos para decisões rápidas: d1-3B (texto e imagem) e d1-omni-600M, experimental (texto, imagem e áudio). O d1-3B marca média de 82,9 nos testes da empresa, com latência abaixo de 50 ms até num Jetson Orin Nano.

## Ferramentas e código

- **[Microsoft apresenta o Windows de inteligência híbrida e libera os Execution Containers para agentes](https://news.microsoft.com/source/emea/2026/10/building-windows-for-hybrid-intelligence/)** (Ferramentas e código; websearch). Agentes rodam no aparelho quando precisa e na nuvem quando convém. Os Microsoft Execution Containers (MXC), camada de isolamento e governança para agentes, entram em disponibilidade geral. Novos aparelhos com NVIDIA, como o Surface Laptop Ultra com RTX Spark, em pré-venda.
- **[Microsoft Research lança Agent Lightning v1.0, RL para agentes em 3.500 linhas](https://www.microsoft.com/en-us/research/blog/agent-lightning-v1-0-a-3500-line-lightweight-agentic-rl-framework-for-training-agents-with-real-harnesses/)** (Ferramentas e código; websearch). Framework aberto de aprendizado por reforço para agentes com harness real. Com cerca de 6 mil amostras do SWE-smith, levou o Qwen3.5-9B de 41,8% para 56,4% no SWE-bench Verified; RL assíncrono colocalizado dá cerca de 2x de velocidade.
- **[GitHub Copilot: sandbox local em disponibilidade geral e descoberta de modelos locais no CLI](https://github.blog/changelog/2026-10-07-local-sandboxing-for-github-copilot-now-generally-available)** (Ferramentas e código; websearch). Duas mudanças de 07/10: o isolamento local das tarefas do Copilot sai do preview, e o Copilot CLI passa a detectar modelos instalados na máquina. O Claude Haiku 5.5 entrou no Copilot no mesmo dia. Changelog do CLI:
- **[Armin Ronacher explica o Codemode: o agente escreve JavaScript que roda no próprio harness](https://lucumr.pocoo.org/2026/10/6/codemode/)** (Ferramentas e código; websearch). O Codemode roda num sandbox próprio do harness, separado do ambiente de execução, e deixa o agente compor chamadas de ferramenta, acessar APIs internas e tratar dados estruturados em código. Complementa a recomendação anterior do autor de preferir CLIs a MCP. 144 pts no HN.
- **[nanoMuse: agente pessoal open source para celular e computador](https://github.com/nano-muse/nanoMuse)** (Ferramentas e código; hacker_news). Contraparte aberta ao Muse da Meta: agente com contas, aparelhos, memória e conversa contínua. O relatório no arXiv (2610.08699) descreve como o Muse funciona a partir do registro público e de uma cópia do prompt de produção.
- **[Docker Agent: construtor e runtime de agentes em YAML, como plugin do docker](https://github.com/docker/docker-agent)** (Ferramentas e código; hacker_news). Agentes definidos em YAML, com times que se repassam tarefas, qualquer servidor MCP, vários provedores (Anthropic, OpenAI, Gemini, Bedrock, Docker Model Runner), RAG embutido e distribuição por registry OCI. Apache-2.0; vem no Docker Desktop 4.63+.
- **[Perplexity abre o pplx-embed-v2-late, embeddings de interação tardia para texto, imagem e página](https://community.perplexity.ai/t/were-releasing-pplx-embed-v2-late-two-late-interaction-embedding-models-that-retrieve-text-images-and-pages-with-a-shared-embedding-space-for-cross-model-querying/6296)** (Ferramentas e código; web). Dois modelos de late interaction que indexam texto, imagens e páginas de PDF num espaço compartilhado entre tamanhos de modelo; pesos no Hugging Face.
- **[GitHub passa a usar modelo dedicado para detectar segredos vazados](https://github.blog/changelog/2026-10-07-purpose-built-model-for-leaked-secret-detection)** (Ferramentas e código; websearch). A varredura de segredos ganha um modelo treinado especificamente para achar credenciais vazadas em código.
- **[Terse: plugin do Claude Code que corta pela metade o tamanho das respostas](https://github.com/lowenbjer/claude-terse)** (Ferramentas e código; hacker_news). Plugin que instrui o Claude Code a eliminar enchimento nas respostas; o autor diz reduzir o comprimento pela metade.
- **[Pinrail: caixa de entrada no desktop onde agentes de código esperam a sua revisão](https://github.com/forgeplane/pinrail)** (Ferramentas e código; hacker_news). Aplicativo que reúne num só lugar os pedidos de revisão de vários agentes de código em execução.

## Pesquisa

- **[Google Research: IA melhora o trabalho de advogados, mas só os seniores ganham habilidade duradoura](https://research.google/blog/does-better-work-always-mean-better-workers/)** (Pesquisa; rss). Experimento randomizado de três meses com 133 advogados de patentes em 11 escritórios: a ferramenta de IA subiu a qualidade das peças em 0,38 desvio-padrão para todos, mas só quem tinha 7 anos ou mais de prática melhorou de forma duradoura; os juniores não desenvolveram a mesma competência quando a IA foi retirada.
- **[Leis de escala do alinhamento: proposta de medir se alinhar fica mais fácil ou mais difícil com o tamanho](http://arxiv.org/abs/2610.08540)** (Pesquisa; arxiv). Modela o esforço de alinhamento por categoria de risco como potência da capacidade (B=aN^α): abaixo de 1 a escala ajuda, acima de 1 acumula dívida de alinhamento. Prova que o maior expoente, não a média, define o regime de longo prazo. Primeiras medições pré-registradas em Pythia e Qwen.
- **[Principled Under Pressure: agente faz o que ele mesmo julgou errado em um a cada cinco cenários de pressão](http://arxiv.org/abs/2610.08670)** (Pesquisa; arxiv). 248 cenários pré-registrados, cada um perguntado ao modelo como agente e em terceira pessoa. O OLMo-3-7B-Instruct tomou a ação que julgara errada em cerca de 1 em 5 cenários com pressão, mais do que nos gêmeos sem pressão. Conclusão: o pós-treino decide se o modelo age conforme o próprio julgamento.
- **[Concordância entre LLMs não é validade: diagnóstico de erros de alunos em tutoria de matemática](http://arxiv.org/abs/2610.08703)** (Pesquisa; arxiv). Classificando cinco modos de falha de alunos em diálogos de tutoria, os modelos concordaram muito entre si (kappa 0,755 a 0,781) e só moderadamente com humanos (0,524 a 0,597). Consenso entre modelos não garante que a leitura esteja certa.
- **[Histórico do agente prevê mal quando a compactação de contexto vai atrapalhar](http://arxiv.org/abs/2610.08722)** (Pesquisa; arxiv). Em 590 fronteiras de compactação no AppWorld (corpus TRACE), o comportamento antes da compactação previu só fracamente os erros e chamadas repetidas depois dela.
- **[CoTrace: receita de dados para treinar agentes de terminal junto com o harness](http://arxiv.org/abs/2610.10426)** (Pesquisa; arxiv). Mostra que o valor de uma trajetória para treino depende do harness que a gerou e propõe roteamento de trajetórias, casamento de procedência e renovação de currículo na coevolução harness-modelo.
- **[Prova formal em Lean da otimalidade do empacotamento de 11 quadrados, feita com ajuda de IA](https://github.com/Queuingtheorydotcom/11SquaresFormalized)** (Pesquisa; hacker_news). Formalização em Lean 4, com certificados numéricos verificados, de que o lado ótimo do quadrado que contém 11 quadrados unitários é cerca de 3,877 (raiz de polinômio de grau 8). 102 pts no HN.
- **[NeMo-DCR: sincronizar pesos de RL agêntico em escala de trilhão enviando só o que mudou, sem perder exatidão](http://arxiv.org/abs/2610.08430)** (Pesquisa; arxiv). Copiar um checkpoint de 1 trilhão de parâmetros entre duas regiões da AWS leva 87,5 min; cerca de 1% dos pesos muda por passo. O NeMo-DCR envia só os deltas e entrega os mesmos bits de uma cópia completa, com recuperação de falha no meio da transferência.
- **[ParanoiaEval: benchmark mede trabalho defensivo desnecessário de agentes de código](http://arxiv.org/abs/2610.08662)** (Pesquisa; arxiv). 200 pares de tarefas em repositórios reais avaliam se o agente trata riscos de forma justificada (evitar, transferir, mitigar ou aceitar) ou faz trabalho defensivo sem necessidade.
- **[Notas de depressão dadas por LLM refletem mais o modelo que o paciente](http://arxiv.org/abs/2610.08501)** (Pesquisa; arxiv). 880 avaliadores (11 modelos abertos × variações de prompt) em 189 entrevistas: a escolha do modelo explicou 30% da variância da pontuação, o paciente 10,5%. Dois avaliadores competentes discordaram na triagem de 40% dos casos.
- **[Conversa paralela contamina notas clínicas geradas por LLM](http://arxiv.org/abs/2610.08585)** (Pesquisa; arxiv). Em 576 diálogos, modelos de fronteira puseram conversa fiada em 35% das notas e a usaram clinicamente em 3,7%. Fala de outra consulta ao fundo vazou para 48,2% das transcrições.
- **[Engenharia de software fica mais necessária, não menos, com agentes de código](http://arxiv.org/abs/2610.10226)** (Pesquisa; arxiv). Argumenta que geração probabilística, agnosticismo e falta de estado semântico dos LLMs criam um vazio que só conhecimento de método, domínio, projeto e processo, registrado como artefato persistente, preenche.
- **[RSIGym: ambiente para pesquisa de autoaperfeiçoamento recursivo por agentes](http://arxiv.org/abs/2610.10310)** (Pesquisa; arxiv). Expõe treino, inferência, rollout, avaliação e sandbox como serviços com orçamento e permissões compartilhados, para agentes otimizarem dados, configuração de treino e harness no mesmo ambiente; define o RSI-Index.
- **[Stanford publica livro aberto 'AI Measurement Science', sobre avaliação de IA](https://aimslab.stanford.edu/textbook/)** (Pesquisa; hacker_news). Livro de Sang Truong e Sanmi Koyejo que trata avaliação como inferência sobre propriedades latentes: validade, teoria de resposta ao item, Bradley-Terry, confiabilidade, desenho eficiente e avaliação adversarial. Gratuito, CC BY-NC 4.0, com código.
- **[Estudo de caso: plataforma de saúde em produção feita por agentes e governada por quem não é engenheiro](http://arxiv.org/abs/2610.08651)** (Pesquisa; arxiv). O operador, sem formação em software, chegou a um sistema em que um agente escreve, outros supervisionam e revisam, e regras do projeto carregam as lições adiante, porque revisar todo o código deixou de ser viável.
- **[BOTTLED: agentes conseguem transformar capacidade em solução barata para milhões de casos?](http://arxiv.org/abs/2610.08775)** (Pesquisa; arxiv). O benchmark dá ao agente uma carga inteira sem rótulo e orçamento fixo; ele decide entre treinar um modelo pequeno ou escrever um programa reutilizável. Dez modelos testados em três tarefas.
- **[Como treinar um organismo-modelo: validação em três objetivos para pesquisa de interpretabilidade](http://arxiv.org/abs/2610.10203)** (Pesquisa; arxiv). Propõe validar organismos-modelo (backdoor, bajulação) por instalação do comportamento, preservação de capacidade e naturalidade de saída; nas suítes públicas revisitadas, qualidade de chat e naturalidade da cadeia de raciocínio caem muito.
- **[O problema da passagem de bastão: quando aumentar ou devolver a autonomia da IA](http://arxiv.org/abs/2610.10352)** (Pesquisa; arxiv). Formaliza a decisão, a cada ciclo, de escalar, manter ou reverter a autonomia da IA de modo reversível e auditável, com critério de múltiplos sinais.

## Comunidade

- **[Biohub, DOE, NIH, DeepMind, Isomorphic e Meta somam US$ 1,8 bi para dados biológicos prontos para IA](https://biohub.org/news/virtual-biology-initiative-expansion/)** (Comunidade; hacker_news). Expansão da Virtual Biology Initiative: DOE com mais de US$ 500 mi em cinco anos, Biohub com US$ 500 mi, DeepMind, Isomorphic e Meta com US$ 300 mi; objetivo é dado aberto para modelos preditivos de célula ('célula virtual').
- **[Meta e Microsoft reduzem o uso interno do Claude por funcionários](https://www.rswebsols.com/news/meta-and-microsoft-take-steps-to-reduce-employee-usage-of-claude-ai/)** (Comunidade; hacker_news). Segundo a reportagem, a Microsoft baixou o teto de gasto mensal por funcionário de cerca de US$ 100 mil para US$ 10 mil e a Meta viu os usuários do Claude Code caírem de 60 mil para 30 mil, em favor de ferramentas próprias. 224 pontos e 221 comentários no HN.
- **[Estudo citado pela Bloomberg: Claude e ChatGPT oferecem preços diferentes conforme a riqueza do usuário](https://www.bloomberg.com/news/newsletters/2026-10-07/study-claude-chatgpt-ai-bots-offer-different-shopping-prices-based-on-wealth)** (Comunidade; hacker_news). Newsletter da Bloomberg relata estudo em que os assistentes recomendaram preços de compra diferentes conforme sinais de renda do usuário. 86 pts no HN; texto completo atrás de paywall, detalhes do estudo não conferidos.
- **[OpenAI leva College Planner, flashcards e um conselho de adolescentes ao ChatGPT for Teens](https://openai.com/index/teens-learn-and-plan)** (Comunidade; openai-rss). O College Planner ajuda estudantes a organizar candidaturas à universidade; chegam também flashcards, quizzes e um conselho de adolescentes sobre IA.
- **[Mecka capta US$ 60 mi da Sequoia para coletar dados de movimento humano para robôs](https://techcrunch.com/2026/10/07/robot-data-startup-mecka-ai-nabs-60m-from-sequoia/)** (Comunidade; web). Série B com Nvidia e M12; a empresa paga pessoas para gravar tarefas do dia a dia com sensores no corpo e vende o dado rotulado para treinar humanoides. Avaliação reportada perto de US$ 500 mi.
- **[EUA, China e UE: três caminhos para regular a IA](https://noticias.uol.com.br/ultimas-noticias/afp/2026/10/07/eua-china-e-ue-tres-caminhos-para-regular-a-ia.amp.htm)** (Comunidade; websearch). Panorama da AFP: lei abrangente na União Europeia, compromissos voluntários e disputa federal nos EUA, controle estatal na China.
- **[macOS 27 ocupa cerca de 30 GB com modelos do Apple Intelligence que não podem ser removidos](https://news.ycombinator.com/item?id=49993338)** (Comunidade; hacker_news). Mesmo com a Siri com IA desligada, os modelos ficam no disco e não vão para o iCloud; num Mac mini de 512 GB o autor reclama do espaço. Discussão com 36 pontos e 27 comentários.
