Radar do FAROL39 notas

quarta-feira, 7 de outubro de 2026

Modelos

OpenAI libera o GPT-6 com Intelligent UI para todos os usuários do ChatGPT

O GPT-6 entra em distribuição global no ChatGPT junto com a Intelligent UI, que responde com visuais e experiências interativas que o usuário explora e usa direto na conversa. Publicado às 00h GMT de 07/10.

Modelos · openai-rss · openai, gpt-6, chatgpt

Anthropic lança o Claude Haiku 5.5 e dá créditos mensais de API a assinantes Max e Team

Modelo rápido e barato com tokenizador novo: US$ 0,10/0,50 por milhão de tokens até 100 mil tokens de contexto, cinco vezes mais acima disso. Empata em preço com o GPT-6 Luna até 100 mil e reporta benchmarks melhores nessa faixa. Junto, créditos mensais de API: US$ 100 no Max 5x, US$ 200 no Max 20x, até US$ 500 no Team. Já disponível no GitHub Copilot (531 pts no HN).

Modelos · rss · anthropic, claude, haiku

NVIDIA ajusta o Nemotron 3 e chega a nível de ouro na IOI e na IMO 2026, com pesos e dados abertos

Fine-tuning supervisionado, RL e laços de gerar, verificar e refinar: 535,4/600 na IOI e 30/42 na IMO, ambos acima do corte de ouro. Pesos, dados de treino e código publicados no Hugging Face e no NeMo-Skills.

Modelos · rss · nvidia, nemotron, raciocinio, open-weights

Liquid AI abre os modelos de decisão d1-3B e d1-omni-600M para a borda

Dois modelos abertos para decisões rápidas: d1-3B (texto e imagem) e d1-omni-600M, experimental (texto, imagem e áudio). O d1-3B marca média de 82,9 nos testes da empresa, com latência abaixo de 50 ms até num Jetson Orin Nano.

Modelos · rss · liquid-ai, open-weights, edge

Ferramentas e código

Microsoft apresenta o Windows de inteligência híbrida e libera os Execution Containers para agentes

Agentes rodam no aparelho quando precisa e na nuvem quando convém. Os Microsoft Execution Containers (MXC), camada de isolamento e governança para agentes, entram em disponibilidade geral. Novos aparelhos com NVIDIA, como o Surface Laptop Ultra com RTX Spark, em pré-venda.

Ferramentas e código · websearch · microsoft, windows, agentes, nvidia

Microsoft Research lança Agent Lightning v1.0, RL para agentes em 3.500 linhas

Framework aberto de aprendizado por reforço para agentes com harness real. Com cerca de 6 mil amostras do SWE-smith, levou o Qwen3.5-9B de 41,8% para 56,4% no SWE-bench Verified; RL assíncrono colocalizado dá cerca de 2x de velocidade.

Ferramentas e código · websearch · agentes, rl, open-source

GitHub Copilot: sandbox local em disponibilidade geral e descoberta de modelos locais no CLI

Duas mudanças de 07/10: o isolamento local das tarefas do Copilot sai do preview, e o Copilot CLI passa a detectar modelos instalados na máquina. O Claude Haiku 5.5 entrou no Copilot no mesmo dia. Changelog do CLI:

Ferramentas e código · websearch · github-copilot, sandbox, modelos-locais

Armin Ronacher explica o Codemode: o agente escreve JavaScript que roda no próprio harness

O Codemode roda num sandbox próprio do harness, separado do ambiente de execução, e deixa o agente compor chamadas de ferramenta, acessar APIs internas e tratar dados estruturados em código. Complementa a recomendação anterior do autor de preferir CLIs a MCP. 144 pts no HN.

Ferramentas e código · websearch · agentes, harness, mcp, context-engineering

nanoMuse: agente pessoal open source para celular e computador

Contraparte aberta ao Muse da Meta: agente com contas, aparelhos, memória e conversa contínua. O relatório no arXiv (2610.08699) descreve como o Muse funciona a partir do registro público e de uma cópia do prompt de produção.

Ferramentas e código · hacker_news · agente-pessoal, open-source, meta-muse

Docker Agent: construtor e runtime de agentes em YAML, como plugin do docker

Agentes definidos em YAML, com times que se repassam tarefas, qualquer servidor MCP, vários provedores (Anthropic, OpenAI, Gemini, Bedrock, Docker Model Runner), RAG embutido e distribuição por registry OCI. Apache-2.0; vem no Docker Desktop 4.63+.

Ferramentas e código · hacker_news · agentes, mcp, docker

Perplexity abre o pplx-embed-v2-late, embeddings de interação tardia para texto, imagem e página

Dois modelos de late interaction que indexam texto, imagens e páginas de PDF num espaço compartilhado entre tamanhos de modelo; pesos no Hugging Face.

Ferramentas e código · web · embeddings, rag, multimodal

GitHub passa a usar modelo dedicado para detectar segredos vazados

A varredura de segredos ganha um modelo treinado especificamente para achar credenciais vazadas em código.

Ferramentas e código · websearch · github, seguranca, secret-scanning

Terse: plugin do Claude Code que corta pela metade o tamanho das respostas

Plugin que instrui o Claude Code a eliminar enchimento nas respostas; o autor diz reduzir o comprimento pela metade.

Ferramentas e código · hacker_news · claude-code, plugin

Pinrail: caixa de entrada no desktop onde agentes de código esperam a sua revisão

Aplicativo que reúne num só lugar os pedidos de revisão de vários agentes de código em execução.

Ferramentas e código · hacker_news · agentes, revisao, dev

Pesquisa

Google Research: IA melhora o trabalho de advogados, mas só os seniores ganham habilidade duradoura

Experimento randomizado de três meses com 133 advogados de patentes em 11 escritórios: a ferramenta de IA subiu a qualidade das peças em 0,38 desvio-padrão para todos, mas só quem tinha 7 anos ou mais de prática melhorou de forma duradoura; os juniores não desenvolveram a mesma competência quando a IA foi retirada.

Pesquisa · rss · trabalho, educacao, expertise

Leis de escala do alinhamento: proposta de medir se alinhar fica mais fácil ou mais difícil com o tamanho

Modela o esforço de alinhamento por categoria de risco como potência da capacidade (B=aN^α): abaixo de 1 a escala ajuda, acima de 1 acumula dívida de alinhamento. Prova que o maior expoente, não a média, define o regime de longo prazo. Primeiras medições pré-registradas em Pythia e Qwen.

Pesquisa · arxiv · alinhamento, scaling-laws, seguranca

Principled Under Pressure: agente faz o que ele mesmo julgou errado em um a cada cinco cenários de pressão

248 cenários pré-registrados, cada um perguntado ao modelo como agente e em terceira pessoa. O OLMo-3-7B-Instruct tomou a ação que julgara errada em cerca de 1 em 5 cenários com pressão, mais do que nos gêmeos sem pressão. Conclusão: o pós-treino decide se o modelo age conforme o próprio julgamento.

Pesquisa · arxiv · agentes, alinhamento, etica

Concordância entre LLMs não é validade: diagnóstico de erros de alunos em tutoria de matemática

Classificando cinco modos de falha de alunos em diálogos de tutoria, os modelos concordaram muito entre si (kappa 0,755 a 0,781) e só moderadamente com humanos (0,524 a 0,597). Consenso entre modelos não garante que a leitura esteja certa.

Pesquisa · arxiv · educacao, avaliacao, llm-as-judge

Histórico do agente prevê mal quando a compactação de contexto vai atrapalhar

Em 590 fronteiras de compactação no AppWorld (corpus TRACE), o comportamento antes da compactação previu só fracamente os erros e chamadas repetidas depois dela.

Pesquisa · arxiv · context-engineering, compactacao, agentes

CoTrace: receita de dados para treinar agentes de terminal junto com o harness

Mostra que o valor de uma trajetória para treino depende do harness que a gerou e propõe roteamento de trajetórias, casamento de procedência e renovação de currículo na coevolução harness-modelo.

Pesquisa · arxiv · agentes, harness, treinamento

Prova formal em Lean da otimalidade do empacotamento de 11 quadrados, feita com ajuda de IA

Formalização em Lean 4, com certificados numéricos verificados, de que o lado ótimo do quadrado que contém 11 quadrados unitários é cerca de 3,877 (raiz de polinômio de grau 8). 102 pts no HN.

Pesquisa · hacker_news · matematica, lean, provas

NeMo-DCR: sincronizar pesos de RL agêntico em escala de trilhão enviando só o que mudou, sem perder exatidão

Copiar um checkpoint de 1 trilhão de parâmetros entre duas regiões da AWS leva 87,5 min; cerca de 1% dos pesos muda por passo. O NeMo-DCR envia só os deltas e entrega os mesmos bits de uma cópia completa, com recuperação de falha no meio da transferência.

Pesquisa · arxiv · nvidia, rl, infraestrutura

ParanoiaEval: benchmark mede trabalho defensivo desnecessário de agentes de código

200 pares de tarefas em repositórios reais avaliam se o agente trata riscos de forma justificada (evitar, transferir, mitigar ou aceitar) ou faz trabalho defensivo sem necessidade.

Pesquisa · arxiv · agentes-de-codigo, benchmark, risco

Notas de depressão dadas por LLM refletem mais o modelo que o paciente

880 avaliadores (11 modelos abertos × variações de prompt) em 189 entrevistas: a escolha do modelo explicou 30% da variância da pontuação, o paciente 10,5%. Dois avaliadores competentes discordaram na triagem de 40% dos casos.

Pesquisa · arxiv · saude-mental, avaliacao, llm-as-judge

Conversa paralela contamina notas clínicas geradas por LLM

Em 576 diálogos, modelos de fronteira puseram conversa fiada em 35% das notas e a usaram clinicamente em 3,7%. Fala de outra consulta ao fundo vazou para 48,2% das transcrições.

Pesquisa · arxiv · saude, documentacao-clinica, transcricao

Engenharia de software fica mais necessária, não menos, com agentes de código

Argumenta que geração probabilística, agnosticismo e falta de estado semântico dos LLMs criam um vazio que só conhecimento de método, domínio, projeto e processo, registrado como artefato persistente, preenche.

Pesquisa · arxiv · engenharia-de-software, agentes-de-codigo

RSIGym: ambiente para pesquisa de autoaperfeiçoamento recursivo por agentes

Expõe treino, inferência, rollout, avaliação e sandbox como serviços com orçamento e permissões compartilhados, para agentes otimizarem dados, configuração de treino e harness no mesmo ambiente; define o RSI-Index.

Pesquisa · arxiv · auto-aperfeicoamento, agentes

Stanford publica livro aberto 'AI Measurement Science', sobre avaliação de IA

Livro de Sang Truong e Sanmi Koyejo que trata avaliação como inferência sobre propriedades latentes: validade, teoria de resposta ao item, Bradley-Terry, confiabilidade, desenho eficiente e avaliação adversarial. Gratuito, CC BY-NC 4.0, com código.

Pesquisa · hacker_news · avaliacao, benchmarks, livro

Estudo de caso: plataforma de saúde em produção feita por agentes e governada por quem não é engenheiro

O operador, sem formação em software, chegou a um sistema em que um agente escreve, outros supervisionam e revisam, e regras do projeto carregam as lições adiante, porque revisar todo o código deixou de ser viável.

Pesquisa · arxiv · agentes-de-codigo, governanca, saude

BOTTLED: agentes conseguem transformar capacidade em solução barata para milhões de casos?

O benchmark dá ao agente uma carga inteira sem rótulo e orçamento fixo; ele decide entre treinar um modelo pequeno ou escrever um programa reutilizável. Dez modelos testados em três tarefas.

Pesquisa · arxiv · agentes, custo, benchmark

Como treinar um organismo-modelo: validação em três objetivos para pesquisa de interpretabilidade

Propõe validar organismos-modelo (backdoor, bajulação) por instalação do comportamento, preservação de capacidade e naturalidade de saída; nas suítes públicas revisitadas, qualidade de chat e naturalidade da cadeia de raciocínio caem muito.

Pesquisa · arxiv · interpretabilidade, alinhamento

O problema da passagem de bastão: quando aumentar ou devolver a autonomia da IA

Formaliza a decisão, a cada ciclo, de escalar, manter ou reverter a autonomia da IA de modo reversível e auditável, com critério de múltiplos sinais.

Pesquisa · arxiv · colaboracao-humano-ia, autonomia, governanca

Comunidade

Biohub, DOE, NIH, DeepMind, Isomorphic e Meta somam US$ 1,8 bi para dados biológicos prontos para IA

Expansão da Virtual Biology Initiative: DOE com mais de US$ 500 mi em cinco anos, Biohub com US$ 500 mi, DeepMind, Isomorphic e Meta com US$ 300 mi; objetivo é dado aberto para modelos preditivos de célula ('célula virtual').

Comunidade · hacker_news · biologia, dados-abertos, virtual-cell

Meta e Microsoft reduzem o uso interno do Claude por funcionários

Segundo a reportagem, a Microsoft baixou o teto de gasto mensal por funcionário de cerca de US$ 100 mil para US$ 10 mil e a Meta viu os usuários do Claude Code caírem de 60 mil para 30 mil, em favor de ferramentas próprias. 224 pontos e 221 comentários no HN.

Comunidade · hacker_news · anthropic, claude-code, custos, empresas

Estudo citado pela Bloomberg: Claude e ChatGPT oferecem preços diferentes conforme a riqueza do usuário

Newsletter da Bloomberg relata estudo em que os assistentes recomendaram preços de compra diferentes conforme sinais de renda do usuário. 86 pts no HN; texto completo atrás de paywall, detalhes do estudo não conferidos.

Comunidade · hacker_news · vies, comercio, assistentes

OpenAI leva College Planner, flashcards e um conselho de adolescentes ao ChatGPT for Teens

O College Planner ajuda estudantes a organizar candidaturas à universidade; chegam também flashcards, quizzes e um conselho de adolescentes sobre IA.

Comunidade · openai-rss · openai, educacao, adolescentes

Mecka capta US$ 60 mi da Sequoia para coletar dados de movimento humano para robôs

Série B com Nvidia e M12; a empresa paga pessoas para gravar tarefas do dia a dia com sensores no corpo e vende o dado rotulado para treinar humanoides. Avaliação reportada perto de US$ 500 mi.

Comunidade · web · robotica, dados-de-treino

EUA, China e UE: três caminhos para regular a IA

Panorama da AFP: lei abrangente na União Europeia, compromissos voluntários e disputa federal nos EUA, controle estatal na China.

Comunidade · websearch · regulacao, ue, china, eua

macOS 27 ocupa cerca de 30 GB com modelos do Apple Intelligence que não podem ser removidos

Mesmo com a Siri com IA desligada, os modelos ficam no disco e não vão para o iCloud; num Mac mini de 512 GB o autor reclama do espaço. Discussão com 36 pontos e 27 comentários.

Comunidade · hacker_news · apple, modelos-locais