Radar do FAROL57 notas

quinta-feira, 17 de setembro de 2026

Modelos

Anthropic diz que o Claude já lidera 26% do próprio P&D de IA

Em post de quinta-feira, a Anthropic afirmou que o Claude 'lidera' 26% do trabalho de P&D de modelos em agosto — ou seja, executa a maior parte de uma...

Modelos · websearch · anthropic, claude, auto-aperfeicoamento, pesquisa

Chefe de IA da Microsoft critica a constituicao do Claude e fala em impacto desastroso

Mustafa Suleyman publicou ensaio criticando a constituicao do Claude por dizer ao modelo que ele pode ser consciente e merecer agencia independente, o que na vi...

Modelos · websearch · microsoft, suleyman, anthropic, model-welfare, consciencia

Claude Code ganha Projects em beta: um agente coordenador distribui metas entre sessões paralelas na nuvem

Um agente coordenador quebra um objetivo de engenharia em sessões paralelas na nuvem, chamadas threads, cada uma com seu branch e cópia do repositório...

Modelos · websearch · claude-code, multiagente, anthropic, orquestracao

Huawei antecipa o Ascend 960 e lanca cluster SuperPoD Atlas 960 com 4.096 aceleradores

Na abertura da conferencia anual em Xangai, a Huawei apresentou um cluster que une 4.096 placas Ascend 960 num unico no, com alegados 8 exaflops em FP8 e 1 peta...

Modelos · websearch · huawei, ascend, hardware, china, exaflops

Bonsai 2 27B: compressao quase sem perda em um decimo do espaco

A Prism ML anuncia um modelo de 27B com compressao quase sem perda num espaco nove vezes menor, com pesos ternarios publicados em GGUF no HuggingFace. Conversa ...

Modelos · hacker-news-api · quantizacao, ternario, modelo-local, compressao

Anthropic abre Life Sciences Verification Program: salvaguardas de biologia mais soltas para equipes verificadas

Equipes de ciências da vida verificadas passam a usar Mythos, Opus e Sonnet com salvaguardas de biologia afrouxadas. O nível Standard renova anualment...

Modelos · websearch · anthropic, biosseguranca, politica-de-uso, ciencia

Anthropic: Claude acelerou mais de 30 modelos biomoleculares abertos e patrocina competição de design de proteínas

Em menos de quatro semanas, o Claude produziu 36 pacotes otimizados de modelos biomoleculares de código aberto, cerca de 4x mais rápidos em média, com...

Modelos · websearch · anthropic, biologia, ciencia, kernels

Crusoe capta US$ 3,9 bilhoes em Serie F a uma avaliacao de US$ 30,9 bilhoes

A rodada foi co-liderada por Atreides, Mubadala Capital e Valor Equity, com participacao de Founders Fund, GIC, Nvidia, QIA, Radical e TPG. O dinheiro vai para ...

Modelos · websearch · crusoe, infraestrutura, data-center, captacao

Figure mostra Helix 2.5 generalizando para trinta casas sem treino previo

A Figure afirma que o modelo Helix 2.5 opera em trinta residencias nunca vistas sem ajuste especifico. E o tipo de alegacao de generalizacao corporificada que v...

Modelos · hacker-news-api · robotica, figure, helix, zero-shot, embodied

Análise técnica do DeepSeek-V4.1 Flash descreve compressão de 4x no KV cache e contexto de 1 milhão de tokens

Uma análise independente da arquitetura do DeepSeek-V4.1 Flash, que chegou a 115 pontos no Hacker News, descreve um modelo de 552B parâmetros com arquitetura...

Modelos · hacker-news-api · deepseek, kv-cache, arquitetura, modelos-abertos

Google, Nvidia e Emerald AI criam alianca para tornar data centers flexiveis na rede eletrica

A AI Energy Management Alliance quer que data centers desloquem cargas de trabalho em horarios de pico, funcionando como recurso gerenciavel para as concessiona...

Modelos · websearch · google, nvidia, energia, data-center, rede-eletrica

Z.ai diz que agente movido a GLM-5.3 construiu a infraestrutura de inferência do GLM-5.3-Flash em chips chineses

A Z.ai relata ter montado num cluster de mais de 100 mil aceleradores chineses o serviço que atende a inferência de produção do GLM-5.3-Flash, com boa parte ...

Modelos · hacker-news-api · z-ai, glm, inferencia, chips-chineses, auto-aperfeicoamento

NeoHorse-1-4B: modelo agentico compacto sobre Qwen 3.5 para hardware restrito

Construido sobre Qwen 3.5, com foco declarado em uso de ferramentas e fluxos autonomos em hardware restrito. Faz parte de um movimento visivel hoje de LLMs agen...

Modelos · websearch · qwen, modelo-pequeno, agentico, on-device

Google Labs expande o agente CC para familias e grupos

O Google Labs estendeu o agente CC para uso compartilhado por familias e grupos, e nao apenas por uma pessoa. Move a fronteira de produto para coordenacao entre...

Modelos · hacker-news-api · google, agentes, grupos, produto

Edge0-35B-A3B-preview: MoE com 3B ativos otimizado para inferencia na borda

Mixture-of-experts com cerca de 3B de parametros ativos, desenhado para eficiencia fora do data center. Entra na mesma tendencia que sustenta o paper de poda de...

Modelos · websearch · moe, edge, inferencia, modelo-aberto

Ferramentas e código

Plugin4Shell: RCE sem clique encontrado nos quatro principais agentes de codigo

Pesquisa descreve uma vulnerabilidade de execucao remota de codigo sem interacao do usuario, encontrada no mecanismo de plugins dos quatro agentes de codigo mai...

Ferramentas e código · hacker-news-api · seguranca, rce, agentes-de-codigo, plugins, vulnerabilidade

Claude Code 2.1.274 avisa quando a memória fica crítica e corrige sessões presas em erro 400 e timeouts de MCP

A versão 2.1.274, publicada às 00h12 UTC de 17/09, mostra aviso quando o uso de memória fica crítico e cria a variável CLAUDE_CODE_MCP_STARTUP_WAIT_MS, que l...

Ferramentas e código · websearch · claude-code, release, mcp

VentureBeat detalha o fim do Cowork e a justificativa da Anthropic para unificar o Claude

A empresa justificou a fusao dizendo que os usuarios se confundiam ao escolher entre conversar com o Claude e delegar uma tarefa a ele. A cobertura detalha o ro...

Ferramentas e código · websearch · anthropic, claude, cowork, claude-design

Bend: linguagem que bloqueia erros de IA por prova formal, em CPU e GPU

Segunda historia mais votada do Hacker News hoje, com 192 pontos: uma linguagem cujo sistema de tipos e provas pretende impedir que codigo gerado por IA passe c...

Ferramentas e código · hacker-news-api · linguagem, prova-formal, verificacao, gpu, codigo-gerado

Safari 27 passa a embarcar servidor MCP para controle por agentes

O comando `safaridriver --mcp` permite que ferramentas de IA controlem o navegador localmente, com acesso ao DOM e captura de tela, em sessão WebDriver isolada. O recurso estreou no Technology Preview 247, em julho, e chega agora ao Safari estável. É o primeiro navegador de plataforma a expor MCP nativamente, sem extensão nem binário de terceiros.

Ferramentas e código · websearch · mcp, safari, webkit, automacao, browser

ECC oferece harness de agente com memoria, seguranca e orquestracao de skills entre plataformas

Camada de harness que atravessa Claude Code, Cursor e outras plataformas, oferecendo memoria persistente, controles de seguranca e orquestracao de skills num so...

Ferramentas e código · websearch · harness, claude-code, cursor, memoria, skills

skillbox: biblioteca de skills versionadas e auto-hospedada para agentes

Serviço auto-hospedado que guarda skills de agente com versão, clientes com escopo definido e integração MCP. Passou de 190 estrelas em dois dias. Endereça um problema concreto de quem opera muitos agentes: a skill que muda sem que ninguém saiba qual versão cada sessão carregou.

Ferramentas e código · github · skills, mcp, agentes, versionamento

claude-mem comprime e reidrata memoria de sessao entre Claude, Copilot e Gemini

Comprime historico de sessao e o reidrata em sessoes seguintes, funcionando atraves de Claude, Copilot e Gemini. Enderecа em produto o mesmo problema que o pape...

Ferramentas e código · websearch · memoria, claude-code, copilot, sessao

Graphify transforma repositorios em grafo de conhecimento consultavel, sem banco vetorial

Converte repositorios em grafos derivados de AST, em vez de embeddings, para RAG deterministico e explicavel. Entra numa linha de RAG local-first e auditavel qu...

Ferramentas e código · websearch · rag, grafo, ast, codebase, determinismo

Skillsync (YC W26) torna sessoes de chat com IA portateis entre agentes

Startup do lote W26 da Y Combinator propoe levar o estado de uma sessao de chat de um agente para outro. Junta-se ao claude-mem e ao paper Agora na mesma frente...

Ferramentas e código · hacker-news-api · portabilidade, sessao, agentes, yc

nanobot: framework de agente auto-hospedado ultraleve com MCP e WebUI

Framework minimalista com WebUI, memoria, suporte a MCP e automacao, pensado para rodar inteiramente na maquina do usuario. Ocupa o nicho oposto aos frameworks ...

Ferramentas e código · websearch · agentes, self-hosted, mcp, local-first

Simon Willison repercute alerta de ataques direcionados a mantenedores de Rust

O time de segurança do crates.io avisa que atacantes marcam videochamadas sobre supostas oportunidades com membros do time Rust e donos de crates popu...

Ferramentas e código · websearch · seguranca, supply-chain, rust, open-source

Skillbay: mercado curado por humano para agent skills

Diretorio de agent skills com curadoria humana declarada, apresentado como alternativa a listas automaticas. Aparece no mesmo dia em que um paper mede o vies an...

Ferramentas e código · hacker-news-api · agent-skills, curadoria, marketplace

ChatGPT chega ao Word como add-in, inclusive no plano gratuito

O add-in, que já existia para Excel e PowerPoint, rascunha, revisa, resume e formata documentos pela barra lateral em todos os planos, com limites no ...

Ferramentas e código · websearch · openai, chatgpt, office

browser-use publica o Jev Ultrafast, agente de navegador com espaço de ações indexado sobre o modelo Jev

O repositório da browser-use implementa um agente de navegador com espaço de ações dinâmico e indexado usando o Jev, modelo da TypeSafe AI lançado em 15/09 q...

Ferramentas e código · hacker-news-api · browser-agent, browser-use, jev

Pesquisa

Infinite-Parameter LLMs: gerar e adaptar pesos a partir de dados ao vivo

Paper propoe gerar e adaptar pesos do modelo a partir de dados que chegam em tempo de execucao, em vez de manter um conjunto fixo apos o treino. Chegou a 91 pon...

Pesquisa · hacker-news-api · arquitetura, pesos-dinamicos, adaptacao, pesquisa

Anthropic publica medidas para entender o ritmo do desenvolvimento de IA dentro dos laboratorios

O Anthropic Institute propoe medidas para acompanhar a velocidade do desenvolvimento dentro dos laboratorios de fronteira. Publicado no mesmo ciclo em que Amode...

Pesquisa · hacker-news-api · anthropic, metricas, governanca, ritmo

Xeno-interpretabilidade: e se o modelo representar distinções sem conceito humano correspondente?

O artigo argumenta que a interpretabilidade sempre lê o modelo por conceitos que os humanos já possuem — veracidade, recusa, engano, personalidade, nocividade — e pergunta o que fica de fora. Propõe o termo xeno-representações para estruturas internas sem contraparte conceitual humana adequada, e separa o espaço semântico interpretável do espaço xeno-semântico. A consequência prática é desconfortável: uma auditoria que só procura o que sabe nomear não mede o que não tem nome.

Pesquisa · arxiv · interpretabilidade, representacao, teoria

Lavagem de dano: discriminação de gênero é transformada, não reduzida, entre gerações de modelos

Análise de 450 mil completions direcionadas a gênero em 15 modelos, do GPT-2 ao GPT-5, mostra que os clusters de violência sexual presentes na saída do GPT-2 desaparecem até o GPT-4 enquanto as completions dirigidas a homens ganham representação positiva. Os autores chamam o fenômeno de harm laundering e sustentam que as avaliações de segurança, baseadas em classificadores de forma superficial, registram queda no escore sem que o dano tenha sido removido. É uma crítica de método a como a indústria reporta progresso em segurança.

Pesquisa · arxiv · seguranca, vies, avaliacao, genero

Estudo compara 176 configurações de harness para agentes de código

O estudo varia a configuração do harness em 4 modelos e 2 benchmarks. O gerenciamento de contexto pesa mais quanto menor o orçamento de janela, e a melhor estratégia foi filtrar po...

Pesquisa · huggingface-api · context-engineering, harness, coding-agents, arxiv

Grupos de LLM superestimam consenso ao reproduzir deliberação humana

Os autores reproduziram 100 grupos humanos da tarefa de Wason com grupos equivalentes de agentes, ancorando cada agente na resposta prévia de um participante e pontuando ambos com o mesmo código. Entre humanos a taxa de consenso pleno varia de 24% a 57% conforme a definição adotada, e cerca de um quinto dos participantes nunca se manifesta — enquanto os agentes quase sempre respondem. Os grupos de agentes permaneceram mais consensuais mesmo em duas análises de sensibilidade, o que recomenda cautela a quem usa painel de agentes como proxy de deliberação.

Pesquisa · arxiv · multi-agente, deliberacao, avaliacao, wason

SoL-Pi: ciclos de auto-pesquisa otimizam harness e cortam 45% dos tokens

O harness do agente foi otimizado por ciclos iterativos em quatro frentes: execução de ações, compactação de contexto, tratamento de observações e leitura delegada. No EdgeBench (5...

Pesquisa · huggingface-api · agentes, compactacao-de-contexto, eficiencia, arxiv

Teste de estresse no midtraining de alinhamento encontra pouca evidência pública de eficácia

O alignment midtraining — continuar o pré-treino sobre grandes volumes de documentos relevantes para alinhamento — é defendido como caminho para generalizar fora da distribuição de pós-treino. O artigo identifica os pressupostos por trás da técnica e os testa, apontando que a evidência pública de sua eficácia é limitada apesar da proeminência do método.

Pesquisa · arxiv · alinhamento, midtraining, generalizacao

RetireOPD: professor que se aposenta sozinho na destilação on-policy de agentes

Agentes multi-turno treinados por RL recebem uma única recompensa escalar por trajetória, o que motiva usar destilação on-policy para dar supervisão densa por token. O artigo mostra que informação privilegiada não torna o professor confiável por si só e que o benefício da supervisão depende do estágio do treino; propõe então um professor condicionado à habilidade que se retira quando deixa de ajudar.

Pesquisa · arxiv · destilacao, rl, agentes, treino

Mercado

Emulate, laboratório de ex-pesquisadores de modelos de mundo do DeepMind, negocia rodada de US$ 700 milhões a quase US$ 4 bilhões

Segundo o Financial Times e a Bloomberg, a Emulate, fundada há cerca de um mês em Londres por Jack Parker-Holder, Matthew McGill e Philip Ball, do time de mo...

Mercado · hacker-news-api · investimento, deepmind, modelos-de-mundo, startups

Comunidade

Martin Fowler publica ensaio 'I Don't Like LLMs' e lidera o Hacker News do dia

O texto de Fowler, referencia em engenharia de software, foi a historia mais votada do Hacker News em 17/09, com 194 pontos. O peso do item nao esta na novidade...

Comunidade · hacker-news-api · martin-fowler, llm, ceticismo, engenharia-de-software

Processo NYT × OpenAI/Microsoft: documento interno chama a raspagem por IA de \"o maior roubo de trabalho da história\

Documentos tornados públicos no processo do New York Times contra OpenAI e Microsoft trazem um memorando interno de janeiro de 2023 de um executivo da...

Comunidade · hacker-news-api · direitos-autorais, openai, microsoft, jornalismo, regulacao

Comissão Europeia propõe o EU KIDS Act, que desliga companions de IA para menores por padrão

A proposta veda acesso a chatbots para menores de 13 anos sem autorização de responsável e desativa funções de companion por padrão para todos os menores de 18. Também proíbe, nessa faixa etária, a simulação de relações interpessoais que gerem dependência emocional e a retenção de memória entre sessões. É a primeira peça regulatória a tratar o vínculo afetivo com o modelo — e não a capacidade do modelo — como o objeto a regular.

Comunidade · websearch · uniao-europeia, criancas, companion, educacao, regulacao

Lider do PS5 Linux abandona o projeto e culpa novatos usando LLMs

Andy TheFlow0 Nguyen saiu do cenario PS5 dizendo que a comunidade deixou de ser de pesquisadores para virar gente usando LLM e escrevendo hacks que nem entende....

Comunidade · websearch · open-source, llm, comunidade, ps5, qualidade-de-codigo

Microsoft e OpenAI perdem disputa para manter sob sigilo documentos internos sobre scraping

Decisao judicial libera documentos internos em que um executivo da Microsoft descreve a raspagem para treino como o maior roubo da historia. Muda a base probato...

Comunidade · hacker-news-api · direito-autoral, scraping, microsoft, openai, judiciario

Pew: no mundo todo, mais gente espera que a IA destrua empregos do que gere crescimento

Levantamento global do Pew mostra que a expectativa de perda de emprego supera a de crescimento economico na maioria dos paises pesquisados. E o segundo dado do...

Comunidade · hacker-news-api · pew, opiniao-publica, empregos, pesquisa-global

Desenvolvedor treina o substituto do Gemini por US$ 9 numa tarefa de NER

Relato de usar o Gemini para rotular dados e destilar um modelo pequeno dedicado por nove dolares, substituindo a chamada de API na tarefa. E o argumento econom...

Comunidade · hacker-news-api · destilacao, custo, ner, modelo-pequeno

Steve Yegge desativa o orquestrador de agentes Gas Town e cita custo e confiabilidade

A edição de 17/09 do AINews registra que Steve Yegge desligou o Gas Town, seu orquestrador de agentes de código, e reconheceu que era a única coisa que tinha...

Comunidade · websearch · agentes-de-codigo, orquestracao, custo

Congresso dos EUA sai para a campanha eleitoral sem votar nada sobre IA

A Câmara encerrou os trabalhos um dia antes e só deve voltar depois das eleições de novembro. O presidente da Câmara, Mike Johnson, disse que o medo d...

Comunidade · websearch · regulacao, eua, politica

Especialistas dos EUA e da China propõem salvaguardas no estilo nuclear para IA militar

O diálogo mantido pela Brookings e pela Universidade Tsinghua propõe proibir que a IA decida o lançamento de armas nucleares, manter controle humano sobre ci...

Comunidade · websearch · geopolitica, ia-militar, eua, china

Nvidia compromete US$ 2 bilhões com fundo de infraestrutura de IA da Brookfield

Segundo documentos a investidores citados pela Bloomberg, Nvidia e a Kuwait Investment Authority são investidores-âncora de um fundo da Brookfield que...

Comunidade · websearch · infraestrutura, nvidia, data-centers, investimento

Base Labs, Hugging Face e Goodfire se unem por padrões de segurança para modelos de pesos abertos

Parceria para definir padrões, métodos de treino e monitoramento de segurança em modelos de pesos abertos, com foco em 'abliteration' — a remoção das ...

Comunidade · websearch · open-weights, seguranca-de-ia, hugging-face

Timothy Gowers explica por que não assinou a carta de medalhistas Fields sobre IA na matemática

Gowers discorda da carta, liderada por Terence Tao e publicada em 11/09, na ideia de que a compreensão conceitual deve ter prioridade sobre a resolução de pr...

Comunidade · websearch · matematica, pesquisa, academia

GPT-6 Astra decifra mensagem de rádio alemã da 1ª Guerra que seguia sem solução

O modelo decifrou uma mensagem em cifra ADFGVX de 27/11/1918, com a chave TRUPPENVERSCHIEBUNG, e o texto foi conferido contra registros da chegada do HMS Canterbury a Sevastopol. O...

Comunidade · hacker-news · openai, gpt-6, criptoanalise, hacker-news

Zuckerberg, Musk e Huang teriam convencido Trump a barrar regulador de IA no modelo da FINRA

A proposta, associada a Demis Hassabis, previa um órgão financiado pela indústria para testar modelos de fronteira antes do lançamento. Os três execut...

Comunidade · websearch · regulacao, eua

Thomas Ptacek: use o LLM como editor, não como autor

Ptacek defende usar o LLM como editor e revisor, nunca como quem escreve, e evitar rigorosamente a formulação que o modelo sugere. O texto teve 184 po...

Comunidade · websearch · escrita, uso-de-llm, opiniao

Conselho de Supervisão da Meta manda remover deepfakes e propõe nove mudanças de política

Dois vídeos gerados por IA foram retirados, um deles deepfake de uma vereadora britânica. Entre as recomendações: tela de confirmação antes de conteúd...

Comunidade · websearch · meta, deepfakes, moderacao