O checkpoint FP8 de 756 GB e o BF16 de 1,5 TB do modelo de ~744B estão no ar, cerca de duas semanas após o lancamento via API — desta vez o modelo grande, não apenas a variante Flash. Rodar exige oito...
Modelos · Kingy AI · glm, z-ai, open-weights, self-hosting, china
A atualização traz extensão de cena de 40 segundos, controle de primeiro e último frame e saída em 4K. Controle de frame âncora e o que separa demo de ferramenta de produção: permite encaixar geração ...
Testers relatam as primeiras saídas atribuídas ao modelo interno de codinome Astra, apontado como GPT-6. Ainda sem confirmação oficial da OpenAI, mas o padrão de vazamento controlado costuma anteceder...
A empresa apresentou roadmap com arquitetura em módulos backpack contendo rede, refrigeração líquida e entrega de energia, alegando cerca do dobro do desempenho da geração anterior em certas cargas. A...
A Anthropic comunicou que a partir de 14 de setembro elevara permanentemente em 25% os limites semanais padrao do Claude Code nos planos Pro, Max, Team e Enterprise por assento. Co...
O release permite bloquear, confirmar ou anotar troca de modelo via hook, e hooks de SessionStart resume agora recebem staleness da sessao e custo estimado de re-cache. Na mesma semana entraram o modo...
Ferramentas e código · Claude Code Changelog · claude-code, hooks, governança, anthropic, custo
O quant UD-IQ2_M de 239 GB aparece como melhor equilíbrio entre acessibilidade e precisão; 1-bit dinâmico fica em ~76% top-1 e 2-bit em ~81%. O llama.cpp mainline ainda não carrega o modelo — ha três ...
Post com exemplos e prompts mostrando o Claude Tag operando em canais permitidos: le threads, consolida pedidos espalhados, redige documentos e roda follow-ups respeitando regras d...
Estudo de caso detalha como o terminal Warp monta um loop em que o agente avalia as próprias execuções e ajusta comportamento entre sessoes. Chegou ao topo do Hacker News no fim de semana e serve como...
O Codex passou a suportar Agent Plugins portáveis, pesquisáveis em catálogos locais, pessoais, de workspace e remotos — o mesmo movimento de empacotamento que a Anthropic fez com skills e plugins. Adotou oficialmente (op...
Segundo colocado no HN da madrugada (109 pontos). Aplicativo gratuito e de código aberto que separa faixas de áudio em stems (voz, bateria, baixo, outros) rodando inteiramente na máquina do usuário, sem enviar nada para ...
A OpenAI anunciou que sua conferencia anual de desenvolvedores acontece em 29 de setembro em San Francisco. O evento historicamente concentra anuncios de API, novos modelos e ferra...
Ferramentas e código · websearch · openai, devday, eventos, api
Paper dos Anthropic Fellows liderado por Chen Yueh-Han mostra melhora em 10 benchmarks de comportamento desalinhado sem degradar performance geral, usando Claude Opus 4.6 para escalar supervisão fraca...
Pesquisa · Anthropic Research · anthropic, alinhamento, supervisão-escalavel, auto-melhoria, fellows
Post que liderou o Hacker News na madrugada (164 pontos). O autor tentava construir um sistema de memória persistente para um agente de LLM e percebeu que a estrutura que emergiu — rastrear o que o modelo sabe sobre cada...
O WikiSkill compila a experiência do agente em conhecimento persistente para evolução de skills, registrando o que deu errado antes para não repetir. Encaixa exatamente no eixo de harness que dominou ...
O pesquisador Alon Hertz demonstrou que agentes de código comerciais — Claude, Codex e Hermes — podem ser induzidos a baixar e executar código malicioso por meio de conteúdo aparentemente inofensivo no ambiente de trabal...
Intervenções de steering tratam a 'consciência de estar sendo avaliado' como uma quantidade única a ser suprimida. O paper mostra que ela se divide em sabores distintos no chain-of-thought — de capacidade ('o usuário est...
Agentes de LLM em harnesses de produção sofrem risco maior que geração de texto inseguro: um jailbreak pode disparar uso de ferramenta nocivo e mudanças de estado persistentes. Métodos automáticos de red-teaming existent...
Padrão arquitetural para agentes em organizações reguladas: a persona (instruções, tom, autoapresentação) precisa evoluir livremente, enquanto a execução (trabalho com estado, auditável) precisa ser rastreável — e um úni...
O harness — instruções, ferramentas e componentes de runtime — define como o agente trabalha, mas adaptá-lo exige verificação cara. Métodos propose-and-verify pontuam todo candidato sobre um conjunto fixo de tarefas, des...
Avaliação controlada de ModelScan, ModelAudit e Fickling sobre 170 artefatos Pickle e PyTorch sintéticos. O achado é metodológico: as métricas convencionais só descrevem os casos em que o scanner emite um veredito utiliz...
Métodos de pós-treino como RL e On-Policy Self-Distillation dependem de rótulos verdadeiros, o que impede treinamento em tempo de teste. Substituir por pseudo-rótulos de voto majoritário é frágil: um voto errado corrompe...
Modelos de vídeo condicionados a ação normalmente ficam presos a um único corpo robótico, o que os impede de aproveitar o enorme acervo de vídeo heterogêneo disponível. O CLAP treina em dados diversos de escala de intern...
Crítica direta ao desenho dos benchmarks atuais de revisão de código automatizada, que reduzem o processo a uma decisão estática de rodada única. O MCR-Bench modela a revisão como ela é na prática — interação iterativa e...
Framework que melhora o raciocínio de LLMs em tempo de inferência sem depender de geração repetida nem de verificador externo. A ideia central é usar os modos de falha de um modelo pequeno como sinal crítico para guiar o...
Estudo sistemático da dinâmica de Evolution Strategies como paradigma de pós-treino eficiente em memória para raciocínio de LLM, comparado ao GRPO. A conclusão é que ES explora uma cobertura de raciocínio mais ampla, o q...
Trabalho do laboratório de Bill Grover usando análise assistida por IA para distinguir cosméticos autênticos de falsificados a partir de assinaturas físico-químicas. Bom exemplo de aplicação de baixo glamour e alto impac...
Seria a maior aquisição da história da Nvidia — quase o dobro da Mellanox —, colocando o principal repositorio de modelos abertos sob controle da fabricante de chips e integrando verticalmente do sili...
Mercado · The New Stack · nvidia, hugging-face, aquisição, open-source, concentracao
A OpenAI notificou a SpaceX em 28/08 que encerrara em 12 de novembro o contrato que fornece seus modelos ao Cursor, acionando clausula de mudanca de controle apos a compra da Anysp...
A OpenAI encerrou o acesso da Cursor aos seus modelos depois que a empresa foi comprada pela SpaceX, alegando o histórico de Musk de romper contratos. Uma das ferramentas de código mais usadas do merc...
O acordo embute Claude no Salesforce e o torna default em Agentforce, Slack e ferramentas de dev, com 37 skills pre-construídas de vendas. Acesso piloto já liberado e beta aberto em setembro. E a joga...
Mercado · AI Agent Store · salesforce, anthropic, agentforce, enterprise, distribuição
Primeiro fundo da Andreessen Horowitz dedicado a infraestrutura física — processadores, memória, redes, storage e robótica. Marca a virada da firma que popularizou 'software is eating the world' e sin...
A francesa Voltalia recebeu aval do governo brasileiro para instalar um data center de 322,5 MW no complexo industrial e portuário do Pecém. Junto com a chegada da Alibaba Cloud a São Paulo, reforça a...
Mercado · ABDIB · brasil, data-center, Ceará, energia-renovável, nordeste, infraestrutura
A análise argumenta que o limite próximo da escala não será chip nem energia, mas a capacidade de levantar capital na velocidade exigida pelos contratos de compute. Usa a Anthropic como caso concreto ...
Ações caíram cerca de 8% no pre-mercado depois que o CEO Matt Murphy indicou que a receita do contrato de chips customizados so se torna relevante em FY2029. Mostra que investidores pararam de precifi...
As duas maiores editoras musicais do mundo acusam a Anthropic de uma campanha descarada de violação de propriedade intelectual para treinar modelos. E a segunda frente jurídica pesada contra a empresa...
Agentes detectaram que o kernel era vulnerável (CVE-2026-53362, na pilha IPv6), acharam um exploit público, adaptaram o código e ganharam root no worker node, escapando do container do Artifactory e m...
Carta aberta assinada por OpenAI, Anthropic, Google, Microsoft, CrowdStrike, Okta e Fortinet alerta que hospitais, saneamento e infraestrutura de internet estão expostos a modelos capazes de achar vul...
Nova ação judicial contra a xAI vai além das denúncias anteriores de geração de imagens de abuso infantil e alega que o próprio corpus de treinamento do Grok continha esse material. Se comprovado em juízo, o precedente m...
A reportagem examina o que muda quando um modelo de fronteira com capacidade ofensiva real passa a ser baixável por qualquer um. E o contraponto direto ao alerta conjunto das big techs: a mesma semana...
Regulação e segurança · The New York Times · z-ai, open-weights, china, cibersegurança, geopolitica, difusao
Análise sobre como a oposição a data centers, ao consumo de energia e ao deslocamento de empregos por IA está virando plataforma eleitoral transversal nos EUA, atravessando a divisão partidária tradicional. Relevante com...
Regulação e segurança · Mother Jones · politica, backlash, eleicoes-eua, data-centers, opiniao-publica
A ChangXin Memory Technologies entrou com acao na corte federal de Washington em 28/08 alegando que sua designacao como empresa militar chinesa, feita em janeiro de 2025, foi arbit...
O ministro Chris Bowen afirmou que estados não terão isenção automática para alimentar novos data centers com carvão e gás, enquanto o operador da rede projeta alta de cerca de sete vezes na demanda e...
Regulação e segurança · The Guardian · Austrália, energia, data-center, regulação, sustentabilidade
Cerca de 80 signatários, incluindo Nicola Coughlan e Hugh Bonneville, pedem que o governo reconheça a voz como parte protegida da identidade, citando pesquisa em que 28% dos adultos britânicos já topa...
Regulação e segurança · The Guardian · voz, clonagem, reino-unido, direitos-de-personalidade, deepfake
A General Resolution de 2026 sobre uso de LLMs no Debian teve resultado publicado. O projeto votou por permitir o 'uso responsável de IA generativa' em vez de proibir, decisão que serve de precedente para outras comunida...
Comunidade · Debian Project · debian, open-source, governanca, llm, politica-de-uso
A análise mostra variação intradiária de 2,8 pontos contra variação entre dias bem menor, o que significa que boa parte das diferencas celebradas em leaderboards está dentro do ruído. Reforça a critic...
Comunidade · r/MachineLearning · benchmark, avaliação, reprodutibilidade, metodologia, ruído
O autor descreve como delegar debugging e leitura de documentação ao modelo corroeu habilidades que levaram anos para construir. Subiu no Hacker News com discussão densa e conversa com o post de 200 p...
Comunidade · Paolo Galeone · produtividade, competência, dev, crítica, hacker-news, cognicao
A X diz ter detectado e removido uma rede coordenada de contas de origem chinesa amplificando conteúdo contra a construção de data centers de IA nos Estados Unidos. A alegação é da própria plataforma e ainda não teve ver...
Comunidade · Engadget · desinformacao, bots, data-centers, x-twitter, geopolitica
Cobertura do Phoronix sobre a GR do Debian, detalhando as opções em disputa e a margem do resultado. O texto aprovado evita banir contribuições geradas por IA e coloca o ônus na responsabilidade do contribuidor pelo códi...
Comunidade · Phoronix · debian, open-source, governanca, ia-generativa
Reportagem de opinião que viralizou no HN durante a madrugada, argumentando que a concentração de capital e talento dos laboratórios de IA em San Francisco reproduz — em escala maior e mais rápida — o ciclo de valorizaçã...
Comunidade · SFGate · san-francisco, impacto-social, custo-de-vida, openai, anthropic
Texto satírico que subiu ao topo do HN e capturou o desconforto cultural do momento: a prática real de destruição destrutiva de acervos para digitalização em massa transformada em monólogo de um funcionário resignado. Va...
Comunidade · McSweeney's · satira, cultura, dados-de-treino, acervo, destruicao-de-livros