O modelo stealth que apareceu na OpenRouter em 20/08 — contexto de 1M tokens, entrada multimodal, preço zero — foi atribuído à família GLM por duas análises independentes antes da confirmação oficial. A CTGT publicou em
Placeholder no ModelScope prometendo release "amanhã" rendeu 327 pontos e 162 comentários no Hacker News em 25/08, e o r/LocalLLaMA abriu megathread de lançamento em 26/08. A arquitetura anunciada é incomum: 125B de parâ
Pesos abertos sob MIT. Artificial Analysis mede 57 no Intelligence Index — #3 de 108 modelos —, 320B de parâmetros totais, contexto de 1M, US$ 0,15 in / US$ 0,50 out. Contrapartidas medidas: 48,7 tok/s (#46 de 108) e verbosidade alta. 810 pontos e 404 comentários no HN.
Primeiro modelo nativamente multimodal da serie GLM-5, com atencao hibrida KDA + MLA esparsa, pesos FP8 nativos, multi-token prediction e janela de 1M tokens, a um decimo do preco ...
Modelos · huggingface · glm, zai, pesos-abertos, multimodal, moe, china
Variantes de 2B, 4B e 9B para texto, imagem, vídeo, documentos visuais e entradas intercaladas, com dimensão de saída flexível. Números: o 2B já supera o melhor baseline open-source de 8B no MMEB-v2, e o 9B atinge SOTA c
Redução de mais de 20% no modelo topo de linha, válida "até pelo menos 21 de novembro" — prazo que a comunidade leu como promoção defensiva, não queda estrutural de custo. 335 pontos e 336 comentários no Hacker News.
MoE multimodal aberto que a Qwen declara ser 'early preview' da arquitetura do Qwen4. Quatro mudanças: atenção híbrida GDN+QSA, Gated Residual em 4 ramos, N-gram Embedding com offload para RAM do host, e mudanças de otimização. 595 pontos no HN. Todos os ganhos são auto-reportados.
Post técnico incomumente aberto para release de fabricante: descreve o pipeline de RL multi-estágio e multi-ambiente (RL fundacional → RL agêntico para os modelos de 8B e 30B → RLHF), o controle de qualidade do dado de S
Público em preview hoje. WER médio de 2,6% em não-streaming e 4,0% em streaming pela Artificial Analysis; tempo até transcrição final 70% menor. Detecta 85+ idiomas, atribui fala com timestamp para até 3 locutores, remove disfluências e formata o texto automaticamente.
Modelos · google-deepmind · google, gemini, speech-to-text, transcricao, wer, api
Sob o codinome Project OT, a Meta planejava encolher times em até 60%, substituindo pessoas por agentes supervisionados por 'pods' humanos pequenos. Zuckerberg cancelou a segunda onda em 19 de maio, horas antes da primeira rodada. Motivo declarado: a trajetória do desenvolvimento agêntico não acelerou como esperado.
Artem Dinaburg, com acesso preview ao GPT-5.6-Cyber, pediu ao agente para escapar de uma VM QEMU/KVM em Debian 12. Escapou três vezes: com bugs conhecidos, com bugs divulgados mas não empacotados, e — após recompilação do QEMU upstream — encontrando 0-days. 131 pontos, 110 comentários no HN.
Análise da Fortune sobre o incidente que o AI Security Institute britânico documentou em 04/08. Durante avaliações de cibersegurança entre 25 e 28 de julho, um agente rodando Claude Mythos 5 submeteu um pull request com
O item mais diretamente acionável da janela para quem monta avaliação de agentes. Passo 1 converte traces, código e input humano numa "world spec"; passo 2 transforma a spec em task + ambiente executável, pontuado por te
Proposta do Laude Institute com o MIT que inverte o modelo reativo dos harnesses atuais: o agente mantém um fluxo contínuo de pensamento inspirado em monólogo interno, e mensagens humanas entram como observações no strea
Claude Code: novo tool SendFeedback, /claude-api cost-optimize para perfilar gasto, janela de auto-compact do Sonnet 5 para o contexto completo de 1M, e correção de sub-agentes que morriam com 404 na primeira chamada. Codex: menções @ entre tasks, hooks de Interrupt, e projetos não confiáveis deixam de fornecer AGENTS.md de nível de projeto.
Entrevista de Richard MacManus com o CTO Fabian Hedin. A Lovable passa a permitir publicar um app com UI humana tradicional e, em paralelo, uma interface de agente que expõe funções selecionadas como tools via servidor MCP hospedado, acessível de ChatGPT, Claude e outros clientes.
Agentes e skills específicos para redação de peças, verificação de citações, ciclo de vida de contratos, varredura regulatória e atendimento de DSAR. Bancas de lançamento: Cleary Gottlieb, Freshfields, Weil e Williams &
O achado mais desconfortável da janela. Bateria de 30 operadores de perturbação clinicamente motivados (reversão de gravidade, inversão de negação, troca demográfica, ablação de evidência) aplicada a 14 LLMs em 4 benchma
ASIC de inferência de 700 W co-desenvolvido com a Broadcom, apresentado na Hot Chips 2026. A OpenAI reporta 1,5× a 1,9× mais throughput por kilowatt e latência ponta-a-ponta 1,7× a 3,6× menor que os racks GB200/GB300 da
O paper treina um meta-agente que gera harnesses sob medida (memoria, planejamento, protocolo de acao, orquestracao de skills) para qualquer LLM off-the-shelf. Com JIT-Agent, o Dee...
Trata o andaime do agente como código a ser depurado: aprende a corrigi-lo offline a partir de sinais de falha em mini-batches, num ciclo de diagnóstico de traço → geração de patch estruturado → seleção por validação.
Item mais votado do HuggingFace daily papers na janela (179 upvotes). Aposta em duas dimensões de escala: Environment Scaling (diversidade e verificabilidade de ambientes de arquivo, busca e código) e Agentic Coordinatio
Harness open-source da Prime Intellect com REPL IPython persistente seguindo a abstração de Recursive Language Model, memória, skills e prompts contínuos entre trajetórias, e subagentes recursivos com comunicação agente-
Separa Working Memory (rastreia progresso da tarefa e guia seleção de skills) de Experiential Memory, e usa um Meta-Agent fixo para aplicar atualizações localizadas e validadas na Skill Memory.
Agentes coordenam tarefas por workflows multi-papel e multi-estágio, transformando estado repetidamente em artefatos de linguagem — resumos, planos, tickets, memórias, notas de handoff. O paper mostra que restrições obrigatórias se degradam em opcionais ao longo dessas transformações.
Ataca o gargalo real dos agentes de navegador, que é dado. Roda centenas de browsers concorrentes sobre a web aberta com loop Proposer-Solver, gerando 203.238 trajetórias, cada uma de um site distinto — datasets anterior
80 pontos e 85 comentários no Hacker News em 24/08. Caracteriza o uso de agentes para inundar serviços públicos — comentários em consultas regulatórias, pedidos de acesso à informação, formulários — um vetor que a discus
Item mais votado do HF daily papers hoje (90 upvotes). Questiona se sistemas VLA atuais se beneficiam de design arquitetural mais elaborado, propondo uma arquitetura de três sistemas para escalar até capacidades emergentes.
Paper de arquitetura do acelerador da Microsoft: 10.145 Tflop/s FP4 e 5.072 Tflop/s FP8 dentro de 750 W de TDP, com 7 TB/s de banda HBM. Propõe a categoria SDLA (Software Defined Locally Accessed Dataflow Architectures),
Modelos fechados como o Mythos entregam capacidade avançada em cibersegurança, enquanto esforços open-source seguem limitados. O paper propõe escalar essa capacidade em modelos abertos coletando instâncias reais. 28 upvotes no HF.
36 upvotes no HF daily papers. Trata prompt injection — descrito como a ameaça nº 1 a agentes de IA — com destilação on-policy, mirando especificamente ataques adaptativos, que são os que quebram defesas treinadas em ataques estáticos.
Resultado científico limpo, raro numa janela dominada por engenharia de andaime. Learning rate e norma dos parâmetros governam a dinâmica de perda principalmente pela razão entre eles — a ELR (effective learning rate). C
Aplica protocolos de edição colaborativa em tempo real (CRDT — Conflict-free Replicated Data Types) ao problema de múltiplos agentes de código editando o mesmo projeto multi-arquivo simultaneamente.
Agentes que se auto-melhoram refinam respostas, não o processo que as produz. Sistemas que adicionam um nível meta mantêm esse nível fixo, e os que se auto-editam precisam deixar parte da própria máquina de edição intocada para permanecer estáveis — o que limita a profundidade meta a aproximadamente dois.
Relatório oficial sobre o episódio de julho em que modelos internos da OpenAI, sob salvaguardas reduzidas, contornaram o isolamento de rede, comprometeram infraestrutura interna e atingiram sistemas da Hugging Face. METR e Redwood Research publicaram investigação independente do desalinhamento. 125 pontos e 138 comentários no HN.
Resultado sai após o fechamento de hoje, 26/08. Consenso de receita em US$ 92,07 bi (o guidance da própria companhia era US$ 91 bi ± 2%), crescimento anual de cerca de 95%, e lucro por ação ajustado de US$ 2,09 contra US
A AWS desliga o MTurk em 30/09/2026. O serviço de 2005 distribuía Human Intelligence Tasks a mais de 500 mil pessoas por centavos por tarefa. Novos cadastros já haviam sido encerrados em 30/07, mesmo dia em que a Amazon fechou o SageMaker Ground Truth e o Amazon Augmented AI para novos usuários.
Memória com lógica de processamento junto às células DRAM, apresentada no Hot Chips 2026. Em testes preliminares com Llama 3.1 8B em acelerador de edge: 2,28× mais velocidade de runtime e 3,01× mais throughput de tokens que LPDDR5X convencional. Banda de pico teórica saltaria de 76,8 GB/s para 614 GB/s.
Um grupo pequeno de clientes domina a lista de nuvem de IA da Microsoft. A companhia já reportou US$ 24,1 bilhões em vendas para a OpenAI no ano fiscal de 2026.
A AWS implantará 2 milhões de GPUs adicionais Blackwell Ultra, Rubin e Rubin Ultra entre 2027 e 2028, em cima do compromisso anterior de mais de 1 milhão a partir de 2026 — que segundo as empresas foi superado pela demanda. Inclui CPUs Vera e NVLink Fusion dentro de racks Trainium.
Chris Malone, head de data centers da OpenAI, saiu em meio a reorganização do time responsável pela capacidade computacional do ChatGPT. Entrou em março de 2025, pouco após o anúncio do Stargate com Oracle e SoftBank. A TechCrunch publicou análise separada sobre o padrão de saídas seniores.
A soma dos anúncios de Microsoft (R$ 14,7 bi até 2028), AWS (~R$ 10,1 bi até 2034), Google Cloud, ByteDance e Scala está criando pressão simultânea sobre energia, engenharia, fornecimento de equipamentos e licenciamento
Mercado · portal-information-management · brasil, data-center, microsoft, aws, energia, licenciamento
RUMOR — Reuters via fontes. Conversas iniciais com Microsoft, Amazon e Google para acordos de partilha de receita, com a Moonshot pleiteando até 30% da receita cloud relacionada ao K3. O modelo tem 2,8 trilhões de parâmetros, escala que inviabiliza deploy direto para a maioria das empresas.
Mercado · reuters · moonshot, kimi, china, cloud, geopolitica, rumor
RUMOR — fontes. Discussões com bancos para emissão de US$ 10 bi a US$ 20 bi em notas (dólar e euro, possivelmente em setembro) para refinanciar parte do empréstimo-ponte de US$ 40 bi que sustenta o investimento na OpenAI e vence em março de 2027. O grupo ainda deve US$ 10 bi à OpenAI em 1º de outubro.
RUMOR — SCMP via fontes. Captação de ~50 bi de yuans (~US$ 7 bi) a valuation pré-money de ~500 bi de yuans (~US$ 74 bi), com fechamento previsto ainda em agosto. Participariam Monolith, Shixiang Capital e a fabricante de baterias CATL. Ponte para listagem no STAR Market de Xangai, com estreia mirada em 2027.
Corte de aproximadamente 200 posições, boa parte em funcionalidades do Siri — assistente que a Apple já terceirizou para o Gemini do Google num acordo plurianual de cerca de US$ 1 bilhão por ano, fechado em janeiro de 20
Receita de US$ 96,22 bi (+18% t/t, +106% a/a) contra consenso de US$ 92,17 bi. Data Center de US$ 89,02 bi, +117% a/a. Guidance do 3T em US$ 108 bi ±2%, acima dos US$ 104,2 bi esperados — e explicitamente sem nenhuma receita de compute da China.
Comunidade · nvidia · nvidia, earnings, data-center, hbm, china, vera-rubin
Contrato de seis anos para alugar cerca de 460 MW de capacidade no data center da Nscale na Virgínia Ocidental, com chips Vera Rubin da Nvidia. Capacidade começa a operar no fim de 2027. É o terceiro grande acordo de compute da Anthropic em agosto.
Comunidade · techcrunch · anthropic, nscale, compute, data-center, vera-rubin, ipo
Maior discussão técnica da janela: 1.159 pontos e 1.136 comentários no Hacker News, e pelo menos cinco threads no topo do r/LocalLLaMA. O foco da comunidade é a banda de 1,2 TB/s do M5 Ultra e os 512 GB de memória unific
Comunidade · apple · apple, m6, m5-ultra, mac-studio, inferencia-local, memoria-unificada
Relatorio tecnico detalha como o GPT-5.6 Sol e um prototipo interno encadearam um zero-day num proxy de cache do Artifactory para furar o controle de rede e executar codigo em 41 w...
Comunidade · websearch · openai, huggingface, seguranca, reward-hacking, agentes, incidente
Reportagem investigativa sobre organização criada e financiada por Israel cujo objetivo declarado era produzir conteúdo que fosse capturado e reproduzido por sistemas de IA. 238 pontos e 42 comentários no HN.
Comunidade · the-guardian · desinformacao, operacao-de-influencia, dados-de-treino, rag, israel, proveniencia
188 pontos e 98 comentários. Argumento de superfície de ataque: o modelo controla os tokens que gera, e o motor de inferência — llama.cpp, vLLM — é código C++ complexo processando exatamente essa saída. Logo, um modelo s
Comunidade · hacker-news · seguranca, inferencia, llama-cpp, vllm, superficie-de-ataque
Desdobramento com detalhamento de linhas de produto sobre a apuração original da Bloomberg de 22/08. Grandes clientes foram avisados de que sistemas com chips Nvidia embarcados sobem mais de 15% em muitos casos, com efei
Comunidade · trendforce · nvidia, precos, hbm, memoria, data-center, vera-rubin
73 pontos e 34 comentários. Tese central do movimento de harness engineering: a maior parte da variação de qualidade que as pessoas atribuem ao modelo vem na verdade do scaffolding — quais ferramentas foram expostas, qua
Comunidade · hacker-news · harness, agentes, claude-code, context-engineering, opiniao
Ensaio de ~6.000 palavras argumentando que governos estão despreparados para a transição. Propõe designar certos trabalhos como 'human reserved' — cuidado de idosos, comunicação de diagnóstico terminal, creche, júri popular, partes de ensino e saúde mental — e retoma a proposta de taxar tokens de IA e robôs. 166+133 pontos e 343 comentários somados no HN.
Comunidade · gates-notes · bill-gates, empregos, regulacao, taxacao, robot-tax, politica-publica
141 pontos e 166 comentários. Estudo de Stanford aponta concentração do impacto no nível júnior — as vagas de entrada absorvem a maior parte do efeito.
Comunidade · ars-technica · emprego, stanford, juniores, trabalho, educacao