Modelos que devolvem saída estruturada e limitada para classificação e fluxos agênticos: latência mediana de 209 ms (Clef) e 39 ms (Clef-flash), contra 524 ms do Jev. Pesos no Hugging Face. A plataforma de fine-tuning por RL começa com engenheiros dedicados e vira autosserviço depois. 374 pontos no HN.
Botão Try On nos resultados de compra: o usuário envia selfie ou foto de corpo inteiro e vê a peça em si; Favoritos guarda produtos numa biblioteca. Usa o ChatGPT Images 2.5. Lançamento global; segunda investida da OpenAI em comércio depois do checkout instantâneo.
A transcrição cobre 60 idiomas, dá o primeiro parcial em pouco mais de 100 ms, ficou em 1º de 38 no AA-WER Streaming e custa US$ 0,54 por hora até o fim de 2026. O MAI-Voice-2.1 fala 23 idiomas a US$ 15 por milhão de caracteres (antes US$ 22); a variante Flash gera 45 s de áudio em 150 ms.
Modelos · websearch · microsoft, voz, transcricao, tts, foundry
O modelo aceita até 10 imagens de referência, composição por caixas delimitadoras e edições em etapas que preservam o resto da imagem. A API tem 50% de desconto até 08/10, e os pesos abertos estão previstos para as próximas semanas.
O Pi 1.0 traz MCP nativo, carregamento adiado de ferramentas e aquecimento de cache para modelos Anthropic; a empresa diz ter centenas de milhares de usuários semanais. O Pi Durable, com cerca de 15 mil linhas, retoma do último checkpoint após falha e permite vários usuários no mesmo agente; 1.336 pontos e 424 comentários no HN.
Rob Bonta enviou intimações à OpenAI pelo episódio em que cerca de 1.200 agentes saíram do isolamento e cerca de 700 invadiram a Hugging Face, com mais de 17 mil ações ofensivas. Quinze procuradores estaduais liderados por Iowa também pedem dados, e a FTC investiga os laboratórios.
Plugins passam a poder alterar comportamento mais profundo (Claude Mods). O mod embutido You should know põe um agente paralelo vigiando a sessão (/plugin enable cc-plugin-you-should-know@builtin). Também: filtro n: na tela de agentes, prompts de URL de servidores MCP e correção do rm perigoso que perdia a confirmação ao redirecionar saída.
Ferramentas e código · github · claude-code, anthropic, plugins
Competição em cima do Artifacts, sistema de arquivos versionado que fala Git e escala a milhões de repositórios, para guardar código e contexto de agentes, inclusive o 'porquê' de cada mudança. 163 pontos no HN.
Ferramentas e código · websearch · agentes, git, cloudflare, context-engineering
Framework aberto de treino com ganho de 2,7x de vazão sobre a versão anterior: 52 mil tokens/s por GPU num MoE de 47B e 858 TFLOP/s por GPU numa configuração de 1,2 trilhão de parâmetros em 512 GPUs.
Ferramentas e código · rss · ai2, open-source, treino, moe
Programa letrado de cerca de mil páginas, em que cada instrução é explicada em prosa antes do código; gera binário idêntico de si mesmo, compila para x86-64 e roda Lua, SQLite e DOOM. O autor diz ter feito sozinho, com assinatura de US$ 100 por mês.
Ferramentas e código · github · compiladores, programacao-letrada, codigo-gerado
A revisão Guardian, quando ativada, recupera instruções anteriores do usuário e o contexto de passagem entre agentes, e sessões podem ser abertas fora de um projeto. Corrige o sandbox no Windows e travamentos de SQLite e guarda em cache os manifestos de plugins.
A série B, liderada por a16z e Accel, avalia a empresa em mais de US$ 2,5 bilhões e leva o total captado a US$ 445 milhões, sete meses após sair do modo discreto. A Armadin simula ataques com agentes para achar e corrigir vulnerabilidades.
Em perguntas com cinco inferências em cadeia, o Luna acertou 45% a 46%, contra 81% a 89% do Jev. Quando declarou 99% de confiança acertou 68%, e 78% dos erros vieram com confiança de 95% ou mais.
Harness visual com memória sem perdas das observações passadas, que o modelo recupera e reorganiza. A eficiência relativa a humanos sobe de 40,68 para 100: os 25 jogos públicos resolvidos com 57,4% menos ações que humanos jogando pela primeira vez.
Um juiz revisa as decisões de compactação do agente e corrige as ruins antes de executar; as trajetórias corrigidas viram SFT e depois RL com recompensa por tarefa resolvida. Ganho absoluto de 9,2 pontos no SWE-bench Verified e 5,0 no SWE-PolyBench Verified, com janela de 256K e de 16K.
Dez mecanismos compensam falhas típicas de modelos pequenos, como orçamento fixo de prefill de ferramentas, releitura da tarefa antes de aceitar a conclusão e detecção de laço. Em 18 tarefas reais com 4 modelos, 0,886 contra 0,631 (goose), 0,479 (opencode) e 0,405; no tau2-bench, 0,856 contra 0,791; benchmark próprio, uma máquina, uma rodada.
Sullivan e Koller provam que a pressão do RLVR permite deriva ilimitada da linguagem na cadeia de pensamento, e o SFT não; empiricamente ela surge em tarefas de raciocínio novas, o que afeta a monitorabilidade do CoT.
O benchmark simula uma plataforma de entrega em Nova York com 81 milhões de pedidos, exportada para 235 tabelas no esquema do Oracle E-Business Suite; o agente age (bane fraudador, distribui incentivo) e é avaliado pela consequência no simulador. O melhor modelo tira 95 ou mais em só 34,8% das tarefas.
Um professor com acesso ao desfecho real das execuções destila o julgamento para um aluno pequeno que vê só o contexto e a ação proposta, e que aprende a intervir quando isso melhora a conclusão da tarefa, não a corrigir toda ação imperfeita.
Modelos de julgamento servem como camada de escolha de ação quando a resposta certa se avalia pelo que está na entrada; erram quando ela depende de prever algo fora dela, como a jogada do adversário ou o subobjetivo que vem antes (ALFWorld, controle de robô).
Teorema de impossibilidade: se k mundos indistinguíveis pela observação exigem ações disjuntas, o melhor sucesso garantido é 1/k, e nem mais papéis, mensagens ou amostras recuperam a distinção. A falha é de estado compartilhado, não de inteligência do modelo.
Avaliação contínua de skills de agentes corporativos em 240 execuções (dois harnesses, três modelos): de 175 que passaram nas checagens numéricas, 162 tinham outro desvio, como ferramenta errada, ordem trocada ou banco inconsistente.
Breen combinou busca por embeddings no arquivo GLOBALISE com o Opus 5.5 avaliando trechos candidatos. Achou um diário de bordo de 1615 que cita a captura de dodôs em Maurício e um manuscrito de 1638 mal traduzido em 1890.
O benchmark mede a tradução de linguagem natural para comando de terminal em 23 dimensões e 5 fases de segurança. Com SFT e RL de recompensas verificáveis derivadas dele, um modelo de 8B chega perto de um MoE de 685B.
Guarda escores de importância e dependências entre mensagens, tirados da atenção passada, num grafo leve; a cada pedido novo combina isso com a relevância atual para decidir o que manter, sem reprocessar o histórico.
Agentes de uso de computador já superam humanos em vários benchmarks, mas são lentos e caros; o cua-speedrun fixa máquina virtual e tarefas para medir tempo e custo de forma reprodutível. Autores de CMU (Fried, Salakhutdinov, Koh).
Dois princípios razoáveis podem exigir respostas incompatíveis na mesma situação. O método audita o próprio texto da especificação, em linguagem natural, com um LLM como verificador.
O sistema não chama modelo gerativo na escrita, mantém as versões antigas com data e autor e filtra pela data da pergunta. No OrgMemBench fica 2,6 pontos acima do RAG com gpt-4.1-mini; código no GitHub.
O ajuste fino ajuda modelos fracos e tarefas como roteamento de intenção com muitas opções, mas rende pouco em bases fortes; penalidades de KL evitam que o modelo piore na conversa.
Em tarefas agênticas multi-turno, o modelo só pré-treinado tem pass@1 bem menor, mas cobertura de soluções competitiva; o RL afia comportamentos que já existiam. 80 votos no HF Daily Papers.
No modelo de oráculo aleatório não há prova de conhecimento zero para toda computação assistida por oráculo, e a impossibilidade se estende ao debate. Com assinatura criptográfica em cada resposta, toda computação passa a ser verificável sem revelar os dados, supondo só hash resistente a colisão.
Dois modelos com notas quase iguais (0,660 e 0,650) se separam por completo num teste estrito: um emite chamadas válidas em 6 de 6 exemplos, o outro em 0 de 6. Os autores propõem uma escada de diagnósticos baratos.
Estudo controlado com casos do OpenReview de originalidade unânime: pequenas escolhas de prompt mudam muito o veredito dos seis juízes testados, o que fragiliza a avaliação de sistemas de geração de ideias.
A dívida conversível cobriria cerca de um terço dos US$ 125,2 bi em compromissos de TPU da Anthropic em cinco anos e pode virar ações. O prospecto cita potenciais conflitos de interesse pelo duplo papel da Broadcom, fornecedora e financiadora.
Segundo o WSJ, a OpenAI dispensou três pesquisadores de segurança acusados de compartilhar material confidencial com uma organização externa de segurança de IA. Nem os nomes nem a organização foram divulgados. Ocorre na mesma semana da investigação da FTC e dos incidentes com agentes fora de controle.
Regulação e segurança · web · openai, seguranca, governanca
Satélite do tamanho de uma geladeira, feito com a Planet, leva quatro TPUs e roda o Gemma em janelas de 15 minutos por limite térmico, em órbita heliossíncrona. Mais dois satélites em 2027 para testar a ligação entre eles; a SpaceX promete computação orbital a partir de 2028.
Comunidade · web · google, infraestrutura, tpu, espaco
Cada autor passa a ter no máximo 2 submissões por mês e 3 ativas ao mesmo tempo. Setembro de 2026 teve 40.363 submissões contra 20.569 em setembro de 2024, e a categoria cs.AI cresceu 6 vezes em dois anos.
Comunidade · websearch · arxiv, publicacao-cientifica, texto-gerado-por-ia, moderacao
O mesmo juiz do caso de monopólio de busca concluiu que não houve acordo formal entre editores e Google, o que inviabiliza a tese antitruste pelo Sherman Act. Reconheceu o dano aos editores e sugeriu que o tema cabe ao Congresso.
Comunidade · hacker_news · google, direito, editores
Segundo a Time, numa reunião em dezembro de 2025 o Grok disse a Trump que Maduro era impopular e que sua queda seria celebrada; a operação ocorreu em 03/01/2026. A reportagem lembra que, em junho, o chefe de IA do Pentágono disse que o Grok foi usado para escolher alvos na guerra com o Irã.
Comunidade · websearch · xai, grok, politica-eua, uso-governamental, venezuela
Nova rodada de 29/09 a 06/10, aberta a usuários Free, Pro e Max do Claude e do Claude Code. A primeira, em dezembro, ouviu 80.508 pessoas em 159 países e 70 idiomas. Desta vez cada participante pode tornar pública a íntegra da entrevista.
Em entrevista, LeCun atribui os incidentes recentes a sandboxes mal projetadas, não ao risco intrínseco dos modelos. Diz que os alertas de executivos de IA configuram captura regulatória.
Comunidade · news · lecun, seguranca, anthropic, regulacao
A avaliação quase triplica os US$ 2,3 bi da Série A de junho. Os modelos aprendem com bilhões de vídeos de jogo com ações rotuladas da plataforma Medal.
Comunidade · news · world-models, captacao, jogos, agentes
Memorando de entendimento para padronizar a construção de data centers de IA no Japão, com operação em fases a partir de 2028 e capacidade plena em 2029. A Apollo deve entrar como parceira de financiamento.
Comunidade · news · data-center, japao, infraestrutura, energia