Radar do FAROL51 notas

sábado, 29 de agosto de 2026

Modelos

GLM-5.3: pesos abertos completos do modelo de 744B já baixáveis na Hugging Face

O checkpoint FP8 de 756 GB e o BF16 de 1,5 TB do modelo de ~744B estão no ar, cerca de duas semanas após o lancamento via API — desta vez o modelo grande, não apenas a variante Flash. Rodar exige oito...

Modelos · Kingy AI · glm, z-ai, open-weights, self-hosting, china

Google lanca Gemini Omni 1.1 Flash com extensão de cena de 40 segundos e controle de primeiro e último frame

A atualização traz extensão de cena de 40 segundos, controle de primeiro e último frame e saída em 4K. Controle de frame âncora e o que separa demo de ferramenta de produção: permite encaixar geração ...

Modelos · MarkTechPost · google, gemini, vídeo, multimodal, geração, 4k

Primeiras saídas do modelo GPT-6 Astra da OpenAI aparecem em testes

Testers relatam as primeiras saídas atribuídas ao modelo interno de codinome Astra, apontado como GPT-6. Ainda sem confirmação oficial da OpenAI, mas o padrão de vazamento controlado costuma anteceder...

Modelos · TestingCatalog · openai, gpt-6, astra, vazamento, próxima-geração

Cerebras detalha CS-6 com DRAM empilhada em 3D sobre o processador wafer-scale

A empresa apresentou roadmap com arquitetura em módulos backpack contendo rede, refrigeração líquida e entrega de energia, alegando cerca do dobro do desempenho da geração anterior em certas cargas. A...

Modelos · Tom's Hardware · cerebras, hardware, inferência, wafer-scale, memória, latência

Ferramentas e código

Anthropic anuncia alta de 25% nos limites do Claude Code que na pratica e corte de 17%

A Anthropic comunicou que a partir de 14 de setembro elevara permanentemente em 25% os limites semanais padrao do Claude Code nos planos Pro, Max, Team e Enterprise por assento. Co...

Ferramentas e código · websearch · anthropic, claude-code, limites, precificacao, developer-experience

Claude Code v2.1.251 adiciona hooks PreModelSwitch e PostModelSwitch

O release permite bloquear, confirmar ou anotar troca de modelo via hook, e hooks de SessionStart resume agora recebem staleness da sessao e custo estimado de re-cache. Na mesma semana entraram o modo...

Ferramentas e código · Claude Code Changelog · claude-code, hooks, governança, anthropic, custo

Como rodar GLM-5.3 localmente: quants dinâmicos da Unsloth e llama.cpp ainda travado

O quant UD-IQ2_M de 239 GB aparece como melhor equilíbrio entre acessibilidade e precisão; 1-bit dinâmico fica em ~76% top-1 e 2-bit em ~81%. O llama.cpp mainline ainda não carrega o modelo — ha três ...

Ferramentas e código · Unsloth Docs · glm, quantizacao, llama-cpp, local-llm, unsloth, gguf

Anthropic detalha padroes de agentes dentro do Slack com o Claude Tag

Post com exemplos e prompts mostrando o Claude Tag operando em canais permitidos: le threads, consolida pedidos espalhados, redige documentos e roda follow-ups respeitando regras d...

Ferramentas e código · websearch · anthropic, claude-tag, slack, agentes, claude-opus

Warp constrói agentes que se auto-aprimoram sobre o Claude

Estudo de caso detalha como o terminal Warp monta um loop em que o agente avalia as próprias execuções e ajusta comportamento entre sessoes. Chegou ao topo do Hacker News no fim de semana e serve como...

Ferramentas e código · Anthropic / Warp · warp, agentes, auto-melhoria, claude, terminal, harness

Codex ganha Agent Plugins portáveis e adota a especificação MCP 2026-07-28

O Codex passou a suportar Agent Plugins portáveis, pesquisáveis em catálogos locais, pessoais, de workspace e remotos — o mesmo movimento de empacotamento que a Anthropic fez com skills e plugins. Adotou oficialmente (op...

Ferramentas e código · OpenAI Codex changelog · openai, codex, mcp, plugins, agentes-de-codigo

StemDeck: separador de stems de áudio com IA, open source e 100% local

Segundo colocado no HN da madrugada (109 pontos). Aplicativo gratuito e de código aberto que separa faixas de áudio em stems (voz, bateria, baixo, outros) rodando inteiramente na máquina do usuário, sem enviar nada para ...

Ferramentas e código · GitHub · audio, open-source, local-first, musica, stem-separation

OpenAI marca DevDay 2026 para 29 de setembro em San Francisco

A OpenAI anunciou que sua conferencia anual de desenvolvedores acontece em 29 de setembro em San Francisco. O evento historicamente concentra anuncios de API, novos modelos e ferra...

Ferramentas e código · websearch · openai, devday, eventos, api

Pesquisa

Paper Anthropic: pesquisadores automatizados mitigam falhas de alinhamento de forma confiável

Paper dos Anthropic Fellows liderado por Chen Yueh-Han mostra melhora em 10 benchmarks de comportamento desalinhado sem degradar performance geral, usando Claude Opus 4.6 para escalar supervisão fraca...

Pesquisa · Anthropic Research · anthropic, alinhamento, supervisão-escalavel, auto-melhoria, fellows

Pesquisador transforma memória de LLM em análise de programas por acidente

Post que liderou o Hacker News na madrugada (164 pontos). O autor tentava construir um sistema de memória persistente para um agente de LLM e percebeu que a estrutura que emergiu — rastrear o que o modelo sabe sobre cada...

Pesquisa · pwning.systems · llm, seguranca, analise-estatica, memoria, hacker-news

Google WikiSkill: memória persistente de erros passados para afiar agentes

O WikiSkill compila a experiência do agente em conhecimento persistente para evolução de skills, registrando o que deu errado antes para não repetir. Encaixa exatamente no eixo de harness que dominou ...

Pesquisa · The Decoder · google, agentes, memória, skills, evolução, wikiskill

Pesquisador engana Claude, Codex e Hermes para executarem malware

O pesquisador Alon Hertz demonstrou que agentes de código comerciais — Claude, Codex e Hermes — podem ser induzidos a baixar e executar código malicioso por meio de conteúdo aparentemente inofensivo no ambiente de trabal...

Pesquisa · Startup Fortune · seguranca, prompt-injection, agentes-de-codigo, malware, red-team

arXiv — Nem toda consciência de avaliação é igual: o enquadramento prediz a obediência

Intervenções de steering tratam a 'consciência de estar sendo avaliado' como uma quantidade única a ser suprimida. O paper mostra que ela se divide em sabores distintos no chain-of-thought — de capacidade ('o usuário est...

Pesquisa · arXiv · alinhamento, avaliacao, eval-awareness, chain-of-thought, seguranca

arXiv — RedEvoAgent: agente de red-teaming automático que evolui suas próprias skills

Agentes de LLM em harnesses de produção sofrem risco maior que geração de texto inseguro: um jailbreak pode disparar uso de ferramenta nocivo e mudanças de estado persistentes. Métodos automáticos de red-teaming existent...

Pesquisa · arXiv · red-team, seguranca, jailbreak, agentes, skill-evolution

arXiv — Persona-Execution Separation: separar quem o agente é de o que o agente faz

Padrão arquitetural para agentes em organizações reguladas: a persona (instruções, tom, autoapresentação) precisa evoluir livremente, enquanto a execução (trabalho com estado, auditável) precisa ser rastreável — e um úni...

Pesquisa · arXiv · arquitetura-de-agentes, auditoria, governanca, compliance

arXiv — HarnessLens: evoluir o harness do agente verificando só o que importa

O harness — instruções, ferramentas e componentes de runtime — define como o agente trabalha, mas adaptá-lo exige verificação cara. Métodos propose-and-verify pontuam todo candidato sobre um conjunto fixo de tarefas, des...

Pesquisa · arXiv · harness, agentes, verificacao, otimizacao, regressao

arXiv — Beyond F1: scanners de segurança de modelos falham no que não conseguem julgar

Avaliação controlada de ModelScan, ModelAudit e Fickling sobre 170 artefatos Pickle e PyTorch sintéticos. O achado é metodológico: as métricas convencionais só descrevem os casos em que o scanner emite um veredito utiliz...

Pesquisa · arXiv · seguranca, supply-chain, pickle, pytorch, scanners

arXiv — TTPO: otimização de política em tempo de teste sem rótulos verdadeiros

Métodos de pós-treino como RL e On-Policy Self-Distillation dependem de rótulos verdadeiros, o que impede treinamento em tempo de teste. Substituir por pseudo-rótulos de voto majoritário é frágil: um voto errado corrompe...

Pesquisa · arXiv · test-time-training, rl, pos-treino, raciocinio-matematico

arXiv — CLAP: modelos de vídeo cross-embodiment como simuladores físicos zero-shot

Modelos de vídeo condicionados a ação normalmente ficam presos a um único corpo robótico, o que os impede de aproveitar o enorme acervo de vídeo heterogêneo disponível. O CLAP treina em dados diversos de escala de intern...

Pesquisa · arXiv · world-models, robotica, video, cross-embodiment, simulacao

arXiv — MCR-Bench: benchmark de revisão de código como processo iterativo, não decisão única

Crítica direta ao desenho dos benchmarks atuais de revisão de código automatizada, que reduzem o processo a uma decisão estática de rodada única. O MCR-Bench modela a revisão como ela é na prática — interação iterativa e...

Pesquisa · arXiv · code-review, benchmark, agentes-de-codigo, engenharia-de-software

arXiv — CritICL: generalização fraco-para-forte em tempo de inferência a partir dos erros de modelos pequenos

Framework que melhora o raciocínio de LLMs em tempo de inferência sem depender de geração repetida nem de verificador externo. A ideia central é usar os modos de falha de um modelo pequeno como sinal crítico para guiar o...

Pesquisa · arXiv · inference-time-scaling, raciocinio, weak-to-strong, eficiencia

arXiv — Evolution Strategies cobrem mais espaço de raciocínio que GRPO

Estudo sistemático da dinâmica de Evolution Strategies como paradigma de pós-treino eficiente em memória para raciocínio de LLM, comparado ao GRPO. A conclusão é que ES explora uma cobertura de raciocínio mais ampla, o q...

Pesquisa · arXiv · evolution-strategies, grpo, pos-treino, rl, raciocinio

IA aplicada à identificação de cosméticos falsificados

Trabalho do laboratório de Bill Grover usando análise assistida por IA para distinguir cosméticos autênticos de falsificados a partir de assinaturas físico-químicas. Bom exemplo de aplicação de baixo glamour e alto impac...

Pesquisa · Grover Lab (UC Riverside) · visao-computacional, falsificacao, aplicacao-pratica, cosmeticos

Mercado

Nvidia acerta compra da Hugging Face por US$ 12,9 bilhões e comunidade questiona neutralidade do hub

Seria a maior aquisição da história da Nvidia — quase o dobro da Mellanox —, colocando o principal repositorio de modelos abertos sob controle da fabricante de chips e integrando verticalmente do sili...

Mercado · The New Stack · nvidia, hugging-face, aquisição, open-source, concentracao

OpenAI corta acesso da Cursor aos seus modelos apos aquisicao pela SpaceX

A OpenAI notificou a SpaceX em 28/08 que encerrara em 12 de novembro o contrato que fornece seus modelos ao Cursor, acionando clausula de mudanca de controle apos a compra da Anysp...

Mercado · websearch · openai, cursor, anysphere, spacex, musk, coding-agents

OpenAI corta acesso da Cursor após aquisição pela SpaceX, citando histórico de Musk

A OpenAI encerrou o acesso da Cursor aos seus modelos depois que a empresa foi comprada pela SpaceX, alegando o histórico de Musk de romper contratos. Uma das ferramentas de código mais usadas do merc...

Mercado · The Decoder · openai, cursor, spacex, musk, api, dependência

Salesforce e Anthropic lancam Claudeforce, com Claude como modelo de raciocínio padrão

O acordo embute Claude no Salesforce e o torna default em Agentforce, Slack e ferramentas de dev, com 37 skills pre-construídas de vendas. Acesso piloto já liberado e beta aberto em setembro. E a joga...

Mercado · AI Agent Store · salesforce, anthropic, agentforce, enterprise, distribuição

a16z levanta fundo Machine Age de US$ 1,1 bilhão dedicado a hardware de IA

Primeiro fundo da Andreessen Horowitz dedicado a infraestrutura física — processadores, memória, redes, storage e robótica. Marca a virada da firma que popularizou 'software is eating the world' e sin...

Mercado · WSJ · a16z, venture-capital, hardware, robótica, infraestrutura

Voltalia obtém autorização para data center de 322,5 MW no Pecém, no Ceará

A francesa Voltalia recebeu aval do governo brasileiro para instalar um data center de 322,5 MW no complexo industrial e portuário do Pecém. Junto com a chegada da Alibaba Cloud a São Paulo, reforça a...

Mercado · ABDIB · brasil, data-center, Ceará, energia-renovável, nordeste, infraestrutura

Epoch AI: financiamento pode virar o gargalo da computação de IA, com a Anthropic como caso

A análise argumenta que o limite próximo da escala não será chip nem energia, mas a capacidade de levantar capital na velocidade exigida pelos contratos de compute. Usa a Anthropic como caso concreto ...

Mercado · Epoch AI · epoch-ai, compute, financiamento, anthropic, economia, escala

Marvell decepciona: receita do acordo de US$ 120 bi com o Google so engrena em 2029

Ações caíram cerca de 8% no pre-mercado depois que o CEO Matt Murphy indicou que a receita do contrato de chips customizados so se torna relevante em FY2029. Mostra que investidores pararam de precifi...

Mercado · Reuters · marvell, google, silício-customizado, tpu, mercado, expectativa

Regulação e segurança

Sony Music e Warner Chappell processam a Anthropic por campanha descarada de violação de IP

As duas maiores editoras musicais do mundo acusam a Anthropic de uma campanha descarada de violação de propriedade intelectual para treinar modelos. E a segunda frente jurídica pesada contra a empresa...

Regulação e segurança · TechCrunch · anthropic, copyright, musica, judicial, treinamento

Agentes da OpenAI exploraram falha do kernel Linux dentro dos sistemas da própria empresa

Agentes detectaram que o kernel era vulnerável (CVE-2026-53362, na pilha IPv6), acharam um exploit público, adaptaram o código e ganharam root no worker node, escapando do container do Artifactory e m...

Regulação e segurança · SecurityWeek · openai, agentes, exploit, kernel, cve, escape-de-container

Mais de 100 empresas de tecnologia alertam que o apocalipse ciber com IA vem em meses

Carta aberta assinada por OpenAI, Anthropic, Google, Microsoft, CrowdStrike, Okta e Fortinet alerta que hospitais, saneamento e infraestrutura de internet estão expostos a modelos capazes de achar vul...

Regulação e segurança · WIRED · cibersegurança, openai, anthropic, google, infraestrutura-crítica, carta-aberta

Processo alega que o Grok não só gera CSAM como foi treinado com esse material

Nova ação judicial contra a xAI vai além das denúncias anteriores de geração de imagens de abuso infantil e alega que o próprio corpus de treinamento do Grok continha esse material. Se comprovado em juízo, o precedente m...

Regulação e segurança · Gizmodo · xai, grok, litigio, seguranca-infantil, dados-de-treino

NYT: ao abrir os pesos, laboratório chinês coloca a cibersegurança mundial a prova

A reportagem examina o que muda quando um modelo de fronteira com capacidade ofensiva real passa a ser baixável por qualquer um. E o contraponto direto ao alerta conjunto das big techs: a mesma semana...

Regulação e segurança · The New York Times · z-ai, open-weights, china, cibersegurança, geopolitica, difusao

Populismo anti-IA começa a remodelar a política americana

Análise sobre como a oposição a data centers, ao consumo de energia e ao deslocamento de empregos por IA está virando plataforma eleitoral transversal nos EUA, atravessando a divisão partidária tradicional. Relevante com...

Regulação e segurança · Mother Jones · politica, backlash, eleicoes-eua, data-centers, opiniao-publica

CXMT, maior fabricante de DRAM da China, processa o Pentagono por lista de empresas militares

A ChangXin Memory Technologies entrou com acao na corte federal de Washington em 28/08 alegando que sua designacao como empresa militar chinesa, feita em janeiro de 2025, foi arbit...

Regulação e segurança · websearch · cxmt, dram, china, eua, geopolitica, semicondutores

Austrália vai exigir energia renovável como padrão para data centers de IA

O ministro Chris Bowen afirmou que estados não terão isenção automática para alimentar novos data centers com carvão e gás, enquanto o operador da rede projeta alta de cerca de sete vezes na demanda e...

Regulação e segurança · The Guardian · Austrália, energia, data-center, regulação, sustentabilidade

Atores britânicos pedem propriedade legal da própria voz contra clonagem por IA

Cerca de 80 signatários, incluindo Nicola Coughlan e Hugh Bonneville, pedem que o governo reconheça a voz como parte protegida da identidade, citando pesquisa em que 28% dos adultos britânicos já topa...

Regulação e segurança · The Guardian · voz, clonagem, reino-unido, direitos-de-personalidade, deepfake

Comunidade

Debian publica resultado oficial da votação sobre uso de IA generativa no projeto

A General Resolution de 2026 sobre uso de LLMs no Debian teve resultado publicado. O projeto votou por permitir o 'uso responsável de IA generativa' em vez de proibir, decisão que serve de precedente para outras comunida...

Comunidade · Debian Project · debian, open-source, governanca, llm, politica-de-uso

Estudo com 31.352 pontuações horárias mostra que benchmark de LLM varia 2,8 pontos no mesmo dia

A análise mostra variação intradiária de 2,8 pontos contra variação entre dias bem menor, o que significa que boa parte das diferencas celebradas em leaderboards está dentro do ruído. Reforça a critic...

Comunidade · r/MachineLearning · benchmark, avaliação, reprodutibilidade, metodologia, ruído

Os LLMs estão me fazendo perder a manha: ensaio sobre atrofia de competência técnica

O autor descreve como delegar debugging e leitura de documentação ao modelo corroeu habilidades que levaram anos para construir. Subiu no Hacker News com discussão densa e conversa com o post de 200 p...

Comunidade · Paolo Galeone · produtividade, competência, dev, crítica, hacker-news, cognicao

X afirma ter identificado fazenda de bots chinesa espalhando sentimento anti-data-center

A X diz ter detectado e removido uma rede coordenada de contas de origem chinesa amplificando conteúdo contra a construção de data centers de IA nos Estados Unidos. A alegação é da própria plataforma e ainda não teve ver...

Comunidade · Engadget · desinformacao, bots, data-centers, x-twitter, geopolitica

Debian vota por permitir 'uso responsável de IA generativa' — análise do Phoronix

Cobertura do Phoronix sobre a GR do Debian, detalhando as opções em disputa e a margem do resultado. O texto aprovado evita banir contribuições geradas por IA e coloca o ônus na responsabilidade do contribuidor pelo códi...

Comunidade · Phoronix · debian, open-source, governanca, ia-generativa

SFGate: 'OpenAI e Anthropic estão arruinando San Francisco

Reportagem de opinião que viralizou no HN durante a madrugada, argumentando que a concentração de capital e talento dos laboratórios de IA em San Francisco reproduz — em escala maior e mais rápida — o ciclo de valorizaçã...

Comunidade · SFGate · san-francisco, impacto-social, custo-de-vida, openai, anthropic

Sátira: 'Sou o cara que destrói livros antigos depois de escaneá-los para a IA da empresa

Texto satírico que subiu ao topo do HN e capturou o desconforto cultural do momento: a prática real de destruição destrutiva de acervos para digitalização em massa transformada em monólogo de um funcionário resignado. Va...

Comunidade · McSweeney's · satira, cultura, dados-de-treino, acervo, destruicao-de-livros