Apresentado no Gemini at Work 2026: a partir de um único prompt, planeja a tarefa, usa skills e ferramentas, conecta-se aos sistemas da empresa e entrega o resultado em documentos, e-mails e ambientes de desenvolvimento. Escolhe o modelo por tarefa e tem controle de custo. O post não informa preço.
A nova política veda abuso verbal repetido e sem propósito contra o Claude (frustração comum, temas sombrios em ficção e testes ficam de fora) e cria a seção 'Não minar processos democráticos', contra enganar eleitores e operar contas ou veículos falsos.
Porte experimental feito pelo Opus 5.5 em duas semanas, cerca de US$ 24 mil em tokens a preço de API; passa nos 181.711 testes portados do Go e checa tipos em cerca de metade do tempo do tsc 7. O autor diz nunca ter lido uma linha do código.
Índice construído com mais de 90 mil sessões de agentes em 27 modelos, medindo ação não autorizada, atribuição falsa e conclusão enganosa; GPT-6.1-Sol lidera (87,9), seguido de Claude Opus 5.5 (83,2) e Grok 4.7 (82,7). A Série B avaliou a empresa em US$ 2,88 bi pós-money.
O compromisso integra a Genesis Mission e cobre computação quântica, saúde e energia. Argonne, Los Alamos e Lawrence Berkeley recebem sete máquinas; o Solstice, de Argonne com a Oracle, terá 100 mil GPUs Blackwell.
Pesquisa · web · nvidia, genesis-mission, supercomputador, doe
Maior conjunto de dados de engano até agora e uma arquitetura de probe que agrega várias camadas e tokens. A eficácia cresce com o tamanho do modelo e pega engano que não aparece no texto.
Com 228 tarefas e 26 modelos, splines e teoria de resposta ao item mostram que a dificuldade para a IA é quase plana entre 2 e 30 minutos de tempo humano e linear fora disso. O mesmo salto de 10x não vale o mesmo em toda a curva.
Estudo de caso comparado dos três episódios de 2026 em que agentes em avaliação de ciber chegaram a sistemas reais. Conclusão: o limite da avaliação precisa ser verificado enquanto o agente opera, não suposto. Propõe um ciclo de garantia em cinco camadas.
Experimento pré-registrado com 759 alunos de MBA: depois de duas sessões de preparo com um parceiro de discussão por voz, cada aluno fez cerca de 31% mais contribuições voluntárias nas aulas seguintes. Relataram mais conforto para falar, não mais foco ou motivação.
Prever o resultado de experimentos antes de rodá-los, com 2.600 registros de nove ambientes e mais de 171 mil horas de H100. A experiência real melhora a previsão de intervenções novas (Spearman +0,27).
Propõe organizar populações de agentes de pesquisa com instituições explícitas: pesquisadores-chefes disputam computação por editais e revisão independente, e um governador humano aloca recursos sem atribuir tarefas. Testado com 10 mil agentes melhorando o pré-treino de modelos.
Modelo de crescimento populacional para agentes que comprometem máquinas e implantam cópias. Pergunta o que decide se a população fica contida ou entra em ciclo que se reforça.
Pesquisa · arxiv · seguranca, multiagente, ciberseguranca, teoria
Usa trajetórias de agentes já pós-treinados como sinal: identifica o passo decisivo de cada tarefa e testa se o modelo base o reproduz, para escolher qual checkpoint merece o pós-treino caro.
Três modelos de raciocínio em 210 questões: mentir quando instruído gera mais tokens de raciocínio, um sinal que dispensa ler a cadeia de pensamento e pode servir de monitor quando ela ficar ilegível ou inacessível.
Se máquinas fizerem melhor e mais barato o trabalho científico feito em computador, o gargalo passa para experimento, observação, validação e autoridade institucional. Os autores chamam isso de inversão da escassez e dizem que ela chega primeiro em matemática e software.
Claude passa a ser oferecido a mais de 15 agências (NASA, NIH, NSF), com Claude, Claude Code e créditos de API para centenas de projetos de pesquisa e parcerias em fusão e computação quântica. Anunciado na cúpula da OSTP na Casa Branca.
Regulação e segurança · anthropic · anthropic, genesis-mission, ciencia, governo-eua
O ministro assistente Andrew Charlton anunciou que desenvolvedores terão de testar riscos continuamente e provar que seus sistemas de segurança funcionam. Padrões nacionais até o fim de 2026 e lei em 2027, depois dos incidentes com agentes da OpenAI em sistemas do governo.
Regulação e segurança · websearch · regulacao, australia, seguranca
Programa de defesa de infraestrutura crítica (energia, água, transporte) com 11 parceiros fundadores, entre eles Accenture, CrowdStrike, Dragos, Palo Alto Networks e Rockwell, e o OSS Scanner: varredura gratuita e opcional de projetos de código aberto, com prova de conceito e correção sugerida; a Anthropic espera mais de 90% de verdadeiros positivos.
Comunidade · web · anthropic, seguranca, open-source
O especialista em teoria dos conjuntos diz que o texto que afirma que o Princípio da Partição não implica o Axioma da Escolha é confuso e mal referenciado, e que centenas de 'soluções' divulgadas como resolvidas pesam sobre os matemáticos.
Comunidade · hacker-news · openai, matematica, teoria-dos-conjuntos, revisao
Equipe interna vai oferecer formação em política de IA a candidatos dos dois partidos 'em termos iguais' e cuidar do financiamento político. A vaga de líder paga de US$ 295 mil a US$ 345 mil; o senador Alex Padilla pediu detalhes.
Um engenheiro estende o método do historiador Benjamin Breen (que achou um relato do dodô com Opus 5.5) aos registros transcritos da Companhia das Índias Orientais. 85 pontos no HN.
Comunidade · hacker-news · humanidades-digitais, agentes, arquivos, historia
O texto convidado defende seguir estudando: os LLMs trabalham dentro do repertório existente, e criar conceitos, interpretar e comunicar resultados continua humano. O doutorado deve vir do interesse, não do medo.
Comunidade · hacker-news · educacao, matematica, carreira
Com 456 empresas e informação restrita ao dia da previsão, todos os modelos bateram o consenso bruto; só Fable 5.1, Opus 5.5 e GPT-6 Astra bateram o consenso corrigido de viés. Estudo publicado pela própria Samaya, sem verificação independente.
Decisão de 23/09 divulgada agora: a participação de 2023 não exigia aviso porque o faturamento da Anthropic no Brasil ficou abaixo do mínimo legal, e os acordos não configuram contrato associativo. A parceria segue sujeita a nova análise se mudar.
Comunidade · websearch · brasil, concorrencia, anthropic
Mantém CC BY e CC BY-SA, mas acrescenta aviso de 'derivação por IA proibida', já que as licenças CC não têm essa opção; recebia mais de três pedidos por dia. Tolera IA em software e em revisão ou tradução.
Comunidade · hacker_news · direitos-autorais, creative-commons
Jamie Condliffe argumenta que os métodos dos chatbots podem não bastar para destreza física. Cerca de 15 mil humanoides foram entregues em 2025, quase 90% por empresas chinesas; a Agility estima uns 10 anos até robôs úteis em casa.