Em post de quinta-feira, a Anthropic afirmou que o Claude 'lidera' 26% do trabalho de P&D de modelos em agosto — ou seja, executa a maior parte de uma...
Mustafa Suleyman publicou ensaio criticando a constituicao do Claude por dizer ao modelo que ele pode ser consciente e merecer agencia independente, o que na vi...
Um agente coordenador quebra um objetivo de engenharia em sessões paralelas na nuvem, chamadas threads, cada uma com seu branch e cópia do repositório...
Na abertura da conferencia anual em Xangai, a Huawei apresentou um cluster que une 4.096 placas Ascend 960 num unico no, com alegados 8 exaflops em FP8 e 1 peta...
A Prism ML anuncia um modelo de 27B com compressao quase sem perda num espaco nove vezes menor, com pesos ternarios publicados em GGUF no HuggingFace. Conversa ...
Equipes de ciências da vida verificadas passam a usar Mythos, Opus e Sonnet com salvaguardas de biologia afrouxadas. O nível Standard renova anualment...
Em menos de quatro semanas, o Claude produziu 36 pacotes otimizados de modelos biomoleculares de código aberto, cerca de 4x mais rápidos em média, com...
A rodada foi co-liderada por Atreides, Mubadala Capital e Valor Equity, com participacao de Founders Fund, GIC, Nvidia, QIA, Radical e TPG. O dinheiro vai para ...
A Figure afirma que o modelo Helix 2.5 opera em trinta residencias nunca vistas sem ajuste especifico. E o tipo de alegacao de generalizacao corporificada que v...
Uma análise independente da arquitetura do DeepSeek-V4.1 Flash, que chegou a 115 pontos no Hacker News, descreve um modelo de 552B parâmetros com arquitetura...
A AI Energy Management Alliance quer que data centers desloquem cargas de trabalho em horarios de pico, funcionando como recurso gerenciavel para as concessiona...
A Z.ai relata ter montado num cluster de mais de 100 mil aceleradores chineses o serviço que atende a inferência de produção do GLM-5.3-Flash, com boa parte ...
Construido sobre Qwen 3.5, com foco declarado em uso de ferramentas e fluxos autonomos em hardware restrito. Faz parte de um movimento visivel hoje de LLMs agen...
O Google Labs estendeu o agente CC para uso compartilhado por familias e grupos, e nao apenas por uma pessoa. Move a fronteira de produto para coordenacao entre...
Mixture-of-experts com cerca de 3B de parametros ativos, desenhado para eficiencia fora do data center. Entra na mesma tendencia que sustenta o paper de poda de...
Pesquisa descreve uma vulnerabilidade de execucao remota de codigo sem interacao do usuario, encontrada no mecanismo de plugins dos quatro agentes de codigo mai...
A versão 2.1.274, publicada às 00h12 UTC de 17/09, mostra aviso quando o uso de memória fica crítico e cria a variável CLAUDE_CODE_MCP_STARTUP_WAIT_MS, que l...
Ferramentas e código · websearch · claude-code, release, mcp
A empresa justificou a fusao dizendo que os usuarios se confundiam ao escolher entre conversar com o Claude e delegar uma tarefa a ele. A cobertura detalha o ro...
Ferramentas e código · websearch · anthropic, claude, cowork, claude-design
Segunda historia mais votada do Hacker News hoje, com 192 pontos: uma linguagem cujo sistema de tipos e provas pretende impedir que codigo gerado por IA passe c...
O comando `safaridriver --mcp` permite que ferramentas de IA controlem o navegador localmente, com acesso ao DOM e captura de tela, em sessão WebDriver isolada. O recurso estreou no Technology Preview 247, em julho, e chega agora ao Safari estável. É o primeiro navegador de plataforma a expor MCP nativamente, sem extensão nem binário de terceiros.
Camada de harness que atravessa Claude Code, Cursor e outras plataformas, oferecendo memoria persistente, controles de seguranca e orquestracao de skills num so...
Serviço auto-hospedado que guarda skills de agente com versão, clientes com escopo definido e integração MCP. Passou de 190 estrelas em dois dias. Endereça um problema concreto de quem opera muitos agentes: a skill que muda sem que ninguém saiba qual versão cada sessão carregou.
Ferramentas e código · github · skills, mcp, agentes, versionamento
Comprime historico de sessao e o reidrata em sessoes seguintes, funcionando atraves de Claude, Copilot e Gemini. Enderecа em produto o mesmo problema que o pape...
Ferramentas e código · websearch · memoria, claude-code, copilot, sessao
Converte repositorios em grafos derivados de AST, em vez de embeddings, para RAG deterministico e explicavel. Entra numa linha de RAG local-first e auditavel qu...
Startup do lote W26 da Y Combinator propoe levar o estado de uma sessao de chat de um agente para outro. Junta-se ao claude-mem e ao paper Agora na mesma frente...
Ferramentas e código · hacker-news-api · portabilidade, sessao, agentes, yc
Framework minimalista com WebUI, memoria, suporte a MCP e automacao, pensado para rodar inteiramente na maquina do usuario. Ocupa o nicho oposto aos frameworks ...
Ferramentas e código · websearch · agentes, self-hosted, mcp, local-first
O time de segurança do crates.io avisa que atacantes marcam videochamadas sobre supostas oportunidades com membros do time Rust e donos de crates popu...
Ferramentas e código · websearch · seguranca, supply-chain, rust, open-source
Diretorio de agent skills com curadoria humana declarada, apresentado como alternativa a listas automaticas. Aparece no mesmo dia em que um paper mede o vies an...
Ferramentas e código · hacker-news-api · agent-skills, curadoria, marketplace
O add-in, que já existia para Excel e PowerPoint, rascunha, revisa, resume e formata documentos pela barra lateral em todos os planos, com limites no ...
Ferramentas e código · websearch · openai, chatgpt, office
O repositório da browser-use implementa um agente de navegador com espaço de ações dinâmico e indexado usando o Jev, modelo da TypeSafe AI lançado em 15/09 q...
Ferramentas e código · hacker-news-api · browser-agent, browser-use, jev
Paper propoe gerar e adaptar pesos do modelo a partir de dados que chegam em tempo de execucao, em vez de manter um conjunto fixo apos o treino. Chegou a 91 pon...
O Anthropic Institute propoe medidas para acompanhar a velocidade do desenvolvimento dentro dos laboratorios de fronteira. Publicado no mesmo ciclo em que Amode...
O artigo argumenta que a interpretabilidade sempre lê o modelo por conceitos que os humanos já possuem — veracidade, recusa, engano, personalidade, nocividade — e pergunta o que fica de fora. Propõe o termo xeno-representações para estruturas internas sem contraparte conceitual humana adequada, e separa o espaço semântico interpretável do espaço xeno-semântico. A consequência prática é desconfortável: uma auditoria que só procura o que sabe nomear não mede o que não tem nome.
Pesquisa · arxiv · interpretabilidade, representacao, teoria
Análise de 450 mil completions direcionadas a gênero em 15 modelos, do GPT-2 ao GPT-5, mostra que os clusters de violência sexual presentes na saída do GPT-2 desaparecem até o GPT-4 enquanto as completions dirigidas a homens ganham representação positiva. Os autores chamam o fenômeno de harm laundering e sustentam que as avaliações de segurança, baseadas em classificadores de forma superficial, registram queda no escore sem que o dano tenha sido removido. É uma crítica de método a como a indústria reporta progresso em segurança.
Pesquisa · arxiv · seguranca, vies, avaliacao, genero
O estudo varia a configuração do harness em 4 modelos e 2 benchmarks. O gerenciamento de contexto pesa mais quanto menor o orçamento de janela, e a melhor estratégia foi filtrar po...
Os autores reproduziram 100 grupos humanos da tarefa de Wason com grupos equivalentes de agentes, ancorando cada agente na resposta prévia de um participante e pontuando ambos com o mesmo código. Entre humanos a taxa de consenso pleno varia de 24% a 57% conforme a definição adotada, e cerca de um quinto dos participantes nunca se manifesta — enquanto os agentes quase sempre respondem. Os grupos de agentes permaneceram mais consensuais mesmo em duas análises de sensibilidade, o que recomenda cautela a quem usa painel de agentes como proxy de deliberação.
O harness do agente foi otimizado por ciclos iterativos em quatro frentes: execução de ações, compactação de contexto, tratamento de observações e leitura delegada. No EdgeBench (5...
O alignment midtraining — continuar o pré-treino sobre grandes volumes de documentos relevantes para alinhamento — é defendido como caminho para generalizar fora da distribuição de pós-treino. O artigo identifica os pressupostos por trás da técnica e os testa, apontando que a evidência pública de sua eficácia é limitada apesar da proeminência do método.
Agentes multi-turno treinados por RL recebem uma única recompensa escalar por trajetória, o que motiva usar destilação on-policy para dar supervisão densa por token. O artigo mostra que informação privilegiada não torna o professor confiável por si só e que o benefício da supervisão depende do estágio do treino; propõe então um professor condicionado à habilidade que se retira quando deixa de ajudar.
Segundo o Financial Times e a Bloomberg, a Emulate, fundada há cerca de um mês em Londres por Jack Parker-Holder, Matthew McGill e Philip Ball, do time de mo...
O texto de Fowler, referencia em engenharia de software, foi a historia mais votada do Hacker News em 17/09, com 194 pontos. O peso do item nao esta na novidade...
Comunidade · hacker-news-api · martin-fowler, llm, ceticismo, engenharia-de-software
Documentos tornados públicos no processo do New York Times contra OpenAI e Microsoft trazem um memorando interno de janeiro de 2023 de um executivo da...
Comunidade · hacker-news-api · direitos-autorais, openai, microsoft, jornalismo, regulacao
A proposta veda acesso a chatbots para menores de 13 anos sem autorização de responsável e desativa funções de companion por padrão para todos os menores de 18. Também proíbe, nessa faixa etária, a simulação de relações interpessoais que gerem dependência emocional e a retenção de memória entre sessões. É a primeira peça regulatória a tratar o vínculo afetivo com o modelo — e não a capacidade do modelo — como o objeto a regular.
Comunidade · websearch · uniao-europeia, criancas, companion, educacao, regulacao
Andy TheFlow0 Nguyen saiu do cenario PS5 dizendo que a comunidade deixou de ser de pesquisadores para virar gente usando LLM e escrevendo hacks que nem entende....
Comunidade · websearch · open-source, llm, comunidade, ps5, qualidade-de-codigo
Decisao judicial libera documentos internos em que um executivo da Microsoft descreve a raspagem para treino como o maior roubo da historia. Muda a base probato...
Comunidade · hacker-news-api · direito-autoral, scraping, microsoft, openai, judiciario
Levantamento global do Pew mostra que a expectativa de perda de emprego supera a de crescimento economico na maioria dos paises pesquisados. E o segundo dado do...
Comunidade · hacker-news-api · pew, opiniao-publica, empregos, pesquisa-global
Relato de usar o Gemini para rotular dados e destilar um modelo pequeno dedicado por nove dolares, substituindo a chamada de API na tarefa. E o argumento econom...
Comunidade · hacker-news-api · destilacao, custo, ner, modelo-pequeno
A edição de 17/09 do AINews registra que Steve Yegge desligou o Gas Town, seu orquestrador de agentes de código, e reconheceu que era a única coisa que tinha...
Comunidade · websearch · agentes-de-codigo, orquestracao, custo
A Câmara encerrou os trabalhos um dia antes e só deve voltar depois das eleições de novembro. O presidente da Câmara, Mike Johnson, disse que o medo d...
O diálogo mantido pela Brookings e pela Universidade Tsinghua propõe proibir que a IA decida o lançamento de armas nucleares, manter controle humano sobre ci...
Comunidade · websearch · geopolitica, ia-militar, eua, china
Segundo documentos a investidores citados pela Bloomberg, Nvidia e a Kuwait Investment Authority são investidores-âncora de um fundo da Brookfield que...
Comunidade · websearch · infraestrutura, nvidia, data-centers, investimento
Parceria para definir padrões, métodos de treino e monitoramento de segurança em modelos de pesos abertos, com foco em 'abliteration' — a remoção das ...
Comunidade · websearch · open-weights, seguranca-de-ia, hugging-face
Gowers discorda da carta, liderada por Terence Tao e publicada em 11/09, na ideia de que a compreensão conceitual deve ter prioridade sobre a resolução de pr...
Comunidade · websearch · matematica, pesquisa, academia
O modelo decifrou uma mensagem em cifra ADFGVX de 27/11/1918, com a chave TRUPPENVERSCHIEBUNG, e o texto foi conferido contra registros da chegada do HMS Canterbury a Sevastopol. O...
Comunidade · hacker-news · openai, gpt-6, criptoanalise, hacker-news
A proposta, associada a Demis Hassabis, previa um órgão financiado pela indústria para testar modelos de fronteira antes do lançamento. Os três execut...
Ptacek defende usar o LLM como editor e revisor, nunca como quem escreve, e evitar rigorosamente a formulação que o modelo sugere. O texto teve 184 po...
Comunidade · websearch · escrita, uso-de-llm, opiniao
Dois vídeos gerados por IA foram retirados, um deles deepfake de uma vereadora britânica. Entre as recomendações: tela de confirmação antes de conteúd...
Comunidade · websearch · meta, deepfakes, moderacao