O GPT-6 entra em distribuição global no ChatGPT junto com a Intelligent UI, que responde com visuais e experiências interativas que o usuário explora e usa direto na conversa. Publicado às 00h GMT de 07/10.
Modelo rápido e barato com tokenizador novo: US$ 0,10/0,50 por milhão de tokens até 100 mil tokens de contexto, cinco vezes mais acima disso. Empata em preço com o GPT-6 Luna até 100 mil e reporta benchmarks melhores nessa faixa. Junto, créditos mensais de API: US$ 100 no Max 5x, US$ 200 no Max 20x, até US$ 500 no Team. Já disponível no GitHub Copilot (531 pts no HN).
Fine-tuning supervisionado, RL e laços de gerar, verificar e refinar: 535,4/600 na IOI e 30/42 na IMO, ambos acima do corte de ouro. Pesos, dados de treino e código publicados no Hugging Face e no NeMo-Skills.
Dois modelos abertos para decisões rápidas: d1-3B (texto e imagem) e d1-omni-600M, experimental (texto, imagem e áudio). O d1-3B marca média de 82,9 nos testes da empresa, com latência abaixo de 50 ms até num Jetson Orin Nano.
Agentes rodam no aparelho quando precisa e na nuvem quando convém. Os Microsoft Execution Containers (MXC), camada de isolamento e governança para agentes, entram em disponibilidade geral. Novos aparelhos com NVIDIA, como o Surface Laptop Ultra com RTX Spark, em pré-venda.
Ferramentas e código · websearch · microsoft, windows, agentes, nvidia
Framework aberto de aprendizado por reforço para agentes com harness real. Com cerca de 6 mil amostras do SWE-smith, levou o Qwen3.5-9B de 41,8% para 56,4% no SWE-bench Verified; RL assíncrono colocalizado dá cerca de 2x de velocidade.
Ferramentas e código · websearch · agentes, rl, open-source
Duas mudanças de 07/10: o isolamento local das tarefas do Copilot sai do preview, e o Copilot CLI passa a detectar modelos instalados na máquina. O Claude Haiku 5.5 entrou no Copilot no mesmo dia. Changelog do CLI:
Ferramentas e código · websearch · github-copilot, sandbox, modelos-locais
O Codemode roda num sandbox próprio do harness, separado do ambiente de execução, e deixa o agente compor chamadas de ferramenta, acessar APIs internas e tratar dados estruturados em código. Complementa a recomendação anterior do autor de preferir CLIs a MCP. 144 pts no HN.
Ferramentas e código · websearch · agentes, harness, mcp, context-engineering
Contraparte aberta ao Muse da Meta: agente com contas, aparelhos, memória e conversa contínua. O relatório no arXiv (2610.08699) descreve como o Muse funciona a partir do registro público e de uma cópia do prompt de produção.
Ferramentas e código · hacker_news · agente-pessoal, open-source, meta-muse
Agentes definidos em YAML, com times que se repassam tarefas, qualquer servidor MCP, vários provedores (Anthropic, OpenAI, Gemini, Bedrock, Docker Model Runner), RAG embutido e distribuição por registry OCI. Apache-2.0; vem no Docker Desktop 4.63+.
Ferramentas e código · hacker_news · agentes, mcp, docker
Experimento randomizado de três meses com 133 advogados de patentes em 11 escritórios: a ferramenta de IA subiu a qualidade das peças em 0,38 desvio-padrão para todos, mas só quem tinha 7 anos ou mais de prática melhorou de forma duradoura; os juniores não desenvolveram a mesma competência quando a IA foi retirada.
Modela o esforço de alinhamento por categoria de risco como potência da capacidade (B=aN^α): abaixo de 1 a escala ajuda, acima de 1 acumula dívida de alinhamento. Prova que o maior expoente, não a média, define o regime de longo prazo. Primeiras medições pré-registradas em Pythia e Qwen.
248 cenários pré-registrados, cada um perguntado ao modelo como agente e em terceira pessoa. O OLMo-3-7B-Instruct tomou a ação que julgara errada em cerca de 1 em 5 cenários com pressão, mais do que nos gêmeos sem pressão. Conclusão: o pós-treino decide se o modelo age conforme o próprio julgamento.
Classificando cinco modos de falha de alunos em diálogos de tutoria, os modelos concordaram muito entre si (kappa 0,755 a 0,781) e só moderadamente com humanos (0,524 a 0,597). Consenso entre modelos não garante que a leitura esteja certa.
Em 590 fronteiras de compactação no AppWorld (corpus TRACE), o comportamento antes da compactação previu só fracamente os erros e chamadas repetidas depois dela.
Mostra que o valor de uma trajetória para treino depende do harness que a gerou e propõe roteamento de trajetórias, casamento de procedência e renovação de currículo na coevolução harness-modelo.
Formalização em Lean 4, com certificados numéricos verificados, de que o lado ótimo do quadrado que contém 11 quadrados unitários é cerca de 3,877 (raiz de polinômio de grau 8). 102 pts no HN.
Copiar um checkpoint de 1 trilhão de parâmetros entre duas regiões da AWS leva 87,5 min; cerca de 1% dos pesos muda por passo. O NeMo-DCR envia só os deltas e entrega os mesmos bits de uma cópia completa, com recuperação de falha no meio da transferência.
200 pares de tarefas em repositórios reais avaliam se o agente trata riscos de forma justificada (evitar, transferir, mitigar ou aceitar) ou faz trabalho defensivo sem necessidade.
880 avaliadores (11 modelos abertos × variações de prompt) em 189 entrevistas: a escolha do modelo explicou 30% da variância da pontuação, o paciente 10,5%. Dois avaliadores competentes discordaram na triagem de 40% dos casos.
Em 576 diálogos, modelos de fronteira puseram conversa fiada em 35% das notas e a usaram clinicamente em 3,7%. Fala de outra consulta ao fundo vazou para 48,2% das transcrições.
Argumenta que geração probabilística, agnosticismo e falta de estado semântico dos LLMs criam um vazio que só conhecimento de método, domínio, projeto e processo, registrado como artefato persistente, preenche.
Expõe treino, inferência, rollout, avaliação e sandbox como serviços com orçamento e permissões compartilhados, para agentes otimizarem dados, configuração de treino e harness no mesmo ambiente; define o RSI-Index.
Livro de Sang Truong e Sanmi Koyejo que trata avaliação como inferência sobre propriedades latentes: validade, teoria de resposta ao item, Bradley-Terry, confiabilidade, desenho eficiente e avaliação adversarial. Gratuito, CC BY-NC 4.0, com código.
Pesquisa · hacker_news · avaliacao, benchmarks, livro
O operador, sem formação em software, chegou a um sistema em que um agente escreve, outros supervisionam e revisam, e regras do projeto carregam as lições adiante, porque revisar todo o código deixou de ser viável.
O benchmark dá ao agente uma carga inteira sem rótulo e orçamento fixo; ele decide entre treinar um modelo pequeno ou escrever um programa reutilizável. Dez modelos testados em três tarefas.
Propõe validar organismos-modelo (backdoor, bajulação) por instalação do comportamento, preservação de capacidade e naturalidade de saída; nas suítes públicas revisitadas, qualidade de chat e naturalidade da cadeia de raciocínio caem muito.
Expansão da Virtual Biology Initiative: DOE com mais de US$ 500 mi em cinco anos, Biohub com US$ 500 mi, DeepMind, Isomorphic e Meta com US$ 300 mi; objetivo é dado aberto para modelos preditivos de célula ('célula virtual').
Comunidade · hacker_news · biologia, dados-abertos, virtual-cell
Segundo a reportagem, a Microsoft baixou o teto de gasto mensal por funcionário de cerca de US$ 100 mil para US$ 10 mil e a Meta viu os usuários do Claude Code caírem de 60 mil para 30 mil, em favor de ferramentas próprias. 224 pontos e 221 comentários no HN.
Comunidade · hacker_news · anthropic, claude-code, custos, empresas
Newsletter da Bloomberg relata estudo em que os assistentes recomendaram preços de compra diferentes conforme sinais de renda do usuário. 86 pts no HN; texto completo atrás de paywall, detalhes do estudo não conferidos.
Comunidade · hacker_news · vies, comercio, assistentes
Série B com Nvidia e M12; a empresa paga pessoas para gravar tarefas do dia a dia com sensores no corpo e vende o dado rotulado para treinar humanoides. Avaliação reportada perto de US$ 500 mi.
Mesmo com a Siri com IA desligada, os modelos ficam no disco e não vão para o iCloud; num Mac mini de 512 GB o autor reclama do espaço. Discussão com 36 pontos e 27 comentários.