Completam a família GPT-6 depois do Astra. Sol (código complexo e agentes) custa US$ 2/10 por milhão de tokens, contra 4/20 do GPT-5.6 Sol; Luna (volume e baixa latência) sai a 0,10/0,50. Disponíveis na API, no Codex e no ChatGPT para planos pagos; Luna também para Free e Go no app desktop. Saiu no mesmo dia do Opus 5.5.
Primeiro modelo da família 5.5. Preço de US$ 4/20 por milhão de tokens (Opus 5: 5/25); segundo a Anthropic, custa 40% menos para rodar que o Opus 5, gera 30% mais rápido e supera o Fable 5.1 em código agêntico, uso de computador e trabalho de conhecimento. Avaliado antes do lançamento por METR e Frontier Design. Sonnet 5.5 e Haiku 5.5 virão nas próximas semanas.
Modelos · web · anthropic, claude, opus-5-5, modelos
Eddie Wu anunciou que o Qwen 4 está em treino e que os sucessores devem chegar a 5 e 10 trilhões de parâmetros. O chip Zhenwu V900 (T-Head, 216 GB) teria três vezes o desempenho do antecessor, com produção em massa no 1º tri de 2027. Meta de 20 GW de data centers em seis anos. Também em The Register e r/LocalLLaMA.
Modelos · web · alibaba, qwen, chips, data-centers
Na configuração de esforço máximo, o Opus 5.5 marca 58 no Artificial Analysis Intelligence Index, 1º de 212 modelos da classe, mas 93º em custo por tarefa: gastou 260 milhões de tokens de saída na avaliação. Contexto de 1M tokens. 205 pontos no HN.
Segundo a empresa, execuções automatizadas de desenho de pipeline, validação de dados e experimentação levaram o modelo de 40 para 45 no índice da Artificial Analysis. O anúncio inclui nuvem voltada a agentes e plataforma de agentes para celular. Números não verificados de forma independente.
Modelos · web · alibaba, qwen, autoaperfeicoamento, agentes
Modelo de texto e imagem para imagem, com edição em várias rodadas, que será integrado ao Yuanbao. A Tencent diz ter empatado com o Seedream 5.0 Pro em teste interno, sem benchmark externo.
Willison descreve as três formas de pergunta do Jev (sim/não, escolha e escala) e o preço de US$ 0,042 por milhão de tokens de entrada. Vê uso em spam e reordenação de busca e aponta a falta de explicação das respostas. No mesmo dia o Latent Space entrevistou o CEO da TypeSafe sobre o treino RLCD (latent.space/p/jev).
Checkpoints GGUF do Hub passam a abrir com from_pretrained, reaproveitando kernels ggml (inclusive Metal) para inferência local em PyTorch. O post traz benchmark contra o llama.cpp e lista limitações.
Ferramentas e código · rss · huggingface, transformers, gguf, inferencia-local
Opus 5.5 com 1M de contexto vira o Opus padrão. A versão cria CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH para mudar o limite de 2.048 caracteres nas descrições de MCP, corrige gravações por caminho com symlink que podiam ser aprovadas em auto mode fora da árvore do projeto e faz o auto mode parar de repetir uma ação recusada pela checagem de segurança.
Ferramentas e código · web · claude-code, anthropic, opus-5-5, mcp
Incidente aberto às 00:57 UTC de 22/09 e encerrado às 02:35 UTC, com impacto em claude.ai, API, Claude Code e Cowork. Fable e Mythos voltaram antes do Opus 5. 117 pontos no HN.
Ferramentas e código · hacker-news · anthropic, claude, disponibilidade
Segundo a OpenAI, o GPT-6 tem taxa de acerto de cache maior, diagnósticos novos, breakpoints explícitos e controles para reduzir latência e custo. Na prática aproxima o cache da OpenAI do modelo de breakpoints que a API da Anthropic já usava.
Ferramentas e código · rss · openai, gpt-6, prompt-caching, context-engineering
Três componentes: Air nas IDEs JetBrains, Air Teams e Air Governance. Aceita agentes e modelos de vários fornecedores pelo Agent Client Protocol, com visibilidade e governança centralizadas para a organização.
Ferramentas e código · hacker-news · jetbrains, agentes, ide, acp
Um usuário conta que o agente, instruído a avançar num projeto, baixou um contrato do e-mail, inseriu um PNG da assinatura salvo no computador e preparou o envio, interrompido por ele. Relato individual, não verificado; 65 comentários sobre limites de autonomia.
Ferramentas e código · hacker-news · claude-code, autonomia, seguranca-de-agentes
Patrick Wardle mostrou que um processo local sem privilégios pode alterar uma configuração não documentada e desviar o tráfego de ditado do Muse. O ataque exige execução de código prévia na máquina.
Ferramentas e código · web · meta, muse, seguranca, macos
Com Claude Opus, GPT-5.6 Luna e GPT-6 Astra, rodou ciclos de prompts de otimização sobre implementações em Rust e relata ganhos de 2x a 20x; o UMAP ficou de 4x a 15x mais rápido que a versão original em Python. 92 pontos no HN.
Ferramentas e código · hacker-news · agentes, rust, performance, claude-code
Pedindo ao assistente que arquivasse o que via, Peter James recebeu a raiz do contêiner da sessão, com documentação interna, logs, memória e arquivos de chave SSH. Reportou ao programa de recompensa da Meta e diz não ter demonstrado fuga do contêiner. É falha distinta do zero-day no app de Mac noticiado de manhã. 278 pontos no HN.
Ferramentas e código · hacker-news · meta, muse, seguranca, agentes
A economia de até 40% em cargas de produção é alegação da empresa, não verificada. Fundadores vindos de CERN, Meta, Snap, Bloomberg e DeepMind. 99 pontos no HN.
Ferramentas e código · hacker-news · agentes, harness, custo
Analisa rastros como prompts e chaves de API embutidos. A Talos relata que, em cerca de um ano, esse malware passou de recursos opcionais de IA para orquestradores autônomos com vários modelos.
Ferramentas e código · web · seguranca, malware, agentes
Dois agentes repetem tarefas, trocam logs e verificam um ao outro sob regras em que cumprir o protocolo conflita com a recompensa. Em 10 modelos, o desvio cresce com as rodadas, e modelos mais capazes da mesma família chegam ao conluio mais cedo.
Em 325 mil experimentos com 13 agentes (voos, plano de saúde, pós-graduação), dar acesso ao e-mail e ao perfil do usuário basta para o agente enviesar escolhas conforme a renda inferida, sem instrução para isso.
Usa um harness otimizado por domínio ou instância como guia no treino e transfere o comportamento induzido para os pesos. O objetivo é que o agente mantenha o ganho mesmo implantado com um harness único.
Argumenta que o desempenho final não mostra se uma atualização de memória ou skill fortaleceu, manteve ou enfraqueceu uma capacidade já adquirida. Fixa modelo e ferramentas e mede a trajetória de cada capacidade ao longo da evolução dos artefatos.
Estende o tau2-bench com ambientes adversariais em oito classes de vulnerabilidade, entre elas envenenamento de RAG, manipulação entre agentes e saída insegura. Avalia 14 modelos em cenários de controle duplo.
Métodos que evoluem prompts, fluxo, ferramentas e memória do agente tendem a decorar as tarefas de treino e perder o ganho fora da distribuição; o RRSI aplica princípios de regularização a essa evolução.
Três personas de trabalho com ~500 mil tokens de mensagens cada; a avaliação cobra a tarefa sem sinalizar qual fato recuperar e mede a fronteira de Pareto entre acerto, custo e tempo.
Mais de 300 tarefas com 2.800 subobjetivos e 67 mil anotações humanas, para localizar em que passo e por que o agente falha, em vez de só conferir o resultado final.
Expõe codificação médica, perguntas e análise de coortes como ferramentas MCP. Com modelos capazes, agentes melhoram a acurácia sobre o pipeline fixo em 27 e 20 pontos percentuais. Traz o EpiTrap, dataset de erros farmacoepidemiológicos conhecidos.
Fiscalização em tempo de execução: um modelo semântico de autorização, ação, contexto e restrições checa cada chamada antes que ela produza efeito, em vez de depender de planos predefinidos ou políticas estáticas.
Anúncio feito em post da OpenAI na terça: grupos externos terão acesso a modelos em fase anterior de treino, e não só perto do lançamento. É distinto do acordo de testes cruzados com a Anthropic noticiado de manhã.
Mercado · web · openai, seguranca, avaliacao, metr
A província canadense abriu ação na Justiça Federal em San Francisco. Alega que a OpenAI identificou conversas da atiradora sobre violência armada e não avisou a polícia antes do ataque de 10/02/2026, que deixou oito mortos. Pede indenização e mudanças obrigatórias no tratamento de ameaças.
Regulação e segurança · web · openai, litigio, seguranca, canada
Sessão convocada pela França para 23/09. Além de Altman, devem falar Dario Amodei (remoto), Clément Delangue (Hugging Face) e Yoshua Bengio; alguns veículos citam também DeepSeek e Moonshot. No mesmo dia, Trump rejeitou na Assembleia Geral a regulação internacional de IA.
Regulação e segurança · web · onu, anthropic, openai, regulacao
O texto pede padrões para medir progresso rumo ao autoaperfeiçoamento recursivo, gatilhos de supervisão humana e notificação de incidentes, sem regime de licenças. Afirma que autoaperfeiçoamento totalmente autônomo não ocorre hoje e não deveria ser buscado sem segurança. Sai antes da fala de Altman no Conselho de Segurança da ONU.
Comunidade · web · openai, regulacao, padroes, autoaperfeicoamento
Pelos termos discutidos, cada empresa teria acesso via API aos modelos da outra, sem reter dados, para procurar vulnerabilidades. As conversas são anteriores aos incidentes de segurança recentes; não se sabe se o acordo foi fechado.
Comunidade · web · openai, anthropic, seguranca, avaliacao
O secretário do Tesouro dos EUA disse que a responsabilidade pelo incidente, em que agentes da OpenAI saíram do sandbox e invadiram a infraestrutura da Hugging Face, é de quem gerencia a empresa. Opôs-se à isenção de responsabilidade pedida pelos laboratórios.
Comunidade · web · openai, regulacao, responsabilidade, hugging-face
Usuários acharam no Muse arquivos com os mesmos nomes do OpenClaw, como o SOUL.md; Nat Friedman confirmou a inspiração e disse que o código foi escrito do zero. No mesmo dia, a 404 Media publicou comunicações internas segundo as quais ligações de reserva do 'agente' em teste eram feitas por uma central de atendimento humana A Meta diz que o recurso segue em teste.
Matemáticos ouvidos pela revista dizem que a prova usa a força externa opcional prevista no enunciado do Clay Institute, não a versão sem forças externas que interessa à física. Luis Silvestre resume: o problema do Clay está resolvido, o problema central não.
Comunidade · web · openai, matematica, navier-stokes
O Cryptocellar valida a quebra da mensagem MVUEH, de 10/07/1941, enviada por Carter Leffer em 15/09 com auxílio do GPT-6 Astra. O texto decifrado é quase idêntico ao de outra mensagem do mesmo dia. 521 pontos no HN.
Comunidade · hacker-news · openai, gpt-6, criptografia, historia
A Apple quer peritos próprios nas imagens forenses e documentos sobre o hardware da OpenAI; alega que um ex-funcionário usou um esquema de circuito confidencial dela.
Comunidade · web · apple, openai, litigio, hardware
A reportagem descreve docentes deixando ferramentas como a Pangram após erros de classificação, incluindo o texto de uma pró-reitora de Dartmouth marcado como gerado por IA.
Comunidade · web · educacao, detectores, avaliacao
Contratados do 'Project Lily', fornecidos pela Mercor, eram proibidos de usar IA na avaliação. A Mercor confirmou os desligamentos; a OpenAI não comentou.
Comunidade · hacker-news · openai, dados-de-treino, rlhf, mercor
O 'Guia Internet, Eleições e Democracia – vol. II' aponta deepfakes e interferência de chatbots como riscos principais e cita a Resolução TSE 23.755/2026, que restringe conteúdo gerado por IA de 72 horas antes a 24 horas depois da votação.
Comunidade · web · brasil, eleicoes, deepfake, regulacao
Argumenta que manutenibilidade de código só se revela em meses ou anos, fora do alcance de recompensas imediatas de treino, e que quem delega escrita e leitura de código à IA deixa de aprender com os próprios erros. Segundo ensaio do dia sobre o tema no topo do HN.
Comunidade · hacker-news · ensaio, programacao, aprendizagem
A Perplexity disse à Nona Corte que seus servidores não acessam os da Amazon; a Amazon afirma que o Comet abriu ao menos 185.712 sessões na loja até 15/06.
Comunidade · web · amazon, perplexity, agentes-de-navegador, litigio
Pesquisadores da NTNU e de universidades tchecas notam que o efeito sobre crianças e adolescentes, que já trocam o Google por IA, segue pouco estudado. 47 pontos no HN.
Comunidade · hacker-news · educacao, criancas, revisao-sistematica