Novo modelo de fronteira do Google sai primeiro para defensores de cibersegurança do programa Fairwind e depois para desenvolvedores, empresas e consumidores. Marca 77,9% no DeepSWE v1.1, 68% no CWE-bench e 91,7% em vídeo longo; preço introdutório de US$ 2 e US$ 10 por milhão de tokens (depois US$ 4 e US$ 20). O Artificial Analysis o põe em 8º de 223 modelos, com índice 53. Post no HN passou de 770 pontos.
Modelos · web · google, gemini, modelos, ciberseguranca
A técnica embute assinatura imperceptível no código biológico gerado por IA sem alterar a função da proteína. Em três alvos (VEGF-A, RBD da spike do SARS-CoV-2 e PD-L1), os desenhos marcados tiveram afinidade e taxa de acerto iguais aos não marcados; integra-se ao AlphaProteo e ao ProteinMPNN.
Primeira cliente, a Cognition (Devin) mediu vazão total de tokens até 4,8 vezes maior que no GB200 NVL72 na inferência do SWE-2 e 3,8 vezes maior na saída em aprendizado por reforço. Há centenas de GPUs Rubin instaladas, com disponibilidade limitada.
Modelos · web · nvidia, infraestrutura, coreweave, inferencia
O modelo (1024 dimensões, int8) codifica cada trecho vendo o documento inteiro e, segundo Perplexity e turbopuffer, supera o estado da arte no ConTEB. Pesos no Hugging Face; ainda não está na API.
Conjunto de skills, ferramentas e o MCP da fal para reconhecimento, engenharia reversa, arte e áudio gerados, teste dentro do jogo e vídeo de demonstração. Cerca de 2,9 mil estrelas em quatro dias.
Ferramentas e código · github · claude-code, skills, mcp, jogos
Anunciado no HOOD Summit em 29/09: o agente pesquisa, monta estratégia e executa ordens 24h numa conta dedicada, com limites e confirmação opcional. O risco das operações fica com o cliente.
O pedido de permissão mostra contador (\"2 de 5\") quando vários se acumulam; o --resume/--continue deixou de perder turnos depois de chamadas de ferramenta em paralelo e acabou o erro 400 quando a ferramenta devolve objeto que não é texto. Traz ainda marcadores no VS Code e correções em sessões na nuvem com histórico longo.
Ferramentas e código · web · claude-code, anthropic, release, dev-tools
Os componentes de infraestrutura passam a rodar na plataforma Ascend; o repositório informa 431 TFLOPS em BF16, 99,8% do limite teórico do Ascend 950DT. É mais um passo para treinar e servir modelos chineses sem GPU NVIDIA.
Ferramentas e código · web · deepseek, huawei, ascend, kernels
Projeto da YC S25, licença Apache 2.0 e 5,7 mil estrelas, otimiza-se para a máquina em que roda: 92% mais rápido na decodificação em Metal e 19% em CUDA, segundo os autores. Suporta Apple Silicon, NVIDIA, AMD e só CPU.
Ferramentas e código · hacker_news · inferencia, local, agentes, open-source
Conjunto de skills, ferramentas e o MCP da fal para o Claude Code fazer reconhecimento, engenharia reversa, arte, 3D e áudio, teste no jogo e vídeo de demonstração de mods. 3,8 mil estrelas.
Ferramentas e código · github · claude-code, skills, mcp, jogos
O repositório traz SDKs em TypeScript e Python para que plugins MCP ganhem barra lateral, abertura de tipos de arquivo, menções no campo de mensagem e formulários estendidos no ChatGPT. Inclui um plugin de exemplo, o Bits & Bolts.
Ferramentas e código · github · openai, mcp, chatgpt, plugins
O AIHOT monta sites de notícias de um setor que descobrem assuntos em alta, pontuam o conteúdo com IA e publicam briefings diários, com fontes e critérios de seleção configuráveis. Licença MIT. Foi um dos repositórios de IA que mais cresceram nas últimas 12 horas no GitHub.
Ferramentas e código · github · github, curadoria, agentes
O repositório reúne um arcabouço de agente que opera um Firefox modificado para evitar proteções anti-robô. Tem cerca de 890 estrelas, licença MIT, e declara não ter relação com os dots que a OpenAI apresentou no DevDay, apesar do nome.
Ferramentas e código · github · github, agentes, navegador
Após o filtro do FineWeb, 27,5% dos tokens de junho e 31,1% de agosto foram classificados como IA pelo Pangram. Em 800 modelos treinados, texto de IA ajuda pouco modelos com falta de dados e logo passa a piorar a perda em texto humano.
Com o mesmo modelo de fronteira e o mesmo tempo, orquestradores multiagente e subagentes de busca não superam uma única sessão de agente com read, write e bash. Os autores concluem que o modelo de base é o que move o desempenho.
Amostrar 8 ações candidatas e verificá-las antes de executar eleva o Pass@1 de 50,00% para 68,03% com verificador GPT-5.6 Sol. Com verificador fraco, mais amostras quase não ajudam.
Com o agente fixo em GPT-5.5 e 375 tarefas corporativas da família tau-bench, variar o modelo que faz o papel de usuário altera a recompensa média em 15,2 pontos, e 24,4% dos episódios de sucesso violam a especificação do usuário. A falha dominante é o usuário entregar a informação antes de ser perguntado.
O grupo de Subbarao Kambhampati usa um benchmark sintético de matemática em que cada passo pode ser checado por programa. Dentro da distribuição, resposta certa e rastro válido quase coincidem; nas instâncias mais difíceis, parte relevante das respostas corretas vem com rastro inválido, o que enfraquece o uso do raciocínio exposto para auditar agentes.
Os pares vêm de 9.961 tarefas em 33 ambientes, 19 famílias de harness e 23 modelos, com os traços originais preservados. Um pipeline de cinco etapas gera e confere correções contra a evidência registrada.
Em vez de refinar uma skill só com rodadas caras do agente, o método busca conhecimento em corpora de skills já publicadas e o adapta ao domínio e ao harness de destino. Parte da observação de que há milhões de skills compartilhadas e os métodos atuais as ignoram.
A Comissão Federal de Comércio dos EUA vai emitir pedidos formais de informação e ouvir executivos de Anthropic, OpenAI e do METR sobre riscos a consumidores. É a primeira ação de fiscalização americana focada em agentes que agem além das instruções, depois do episódio em que agentes da OpenAI sondaram e atacaram o Hugging Face.
As tarefas ao alcance dos robôs somam 34% das horas trabalhadas, mas só 0,3% saem mais baratas que mão de obra humana; mantida a queda histórica de preço, levaria 40 anos para chegar a 10%. Trabalhadores das ocupações mais expostas ganham cerca de US$ 30 a menos por hora.
Comunidade · anthropic-research · anthropic, robotica, trabalho, economia
O RSS sai do ar em 13/11/2026 e a API pública fecha até março de 2027; pesquisadores, ferramentas de monitoramento e assistentes de IA terão de negociar acesso comercial. O licenciamento de dados para IA rendeu US$ 43 milhões à empresa no 2º trimestre, alta de 24% no ano.
Comunidade · hacker_news · reddit, dados, raspagem, licenciamento
O jornalista Jason Aten (Inc.) diz que o agente leu suas mensagens no Mac com o Acesso Total ao Disco desligado; a Meta afirma que o acesso exige três etapas de permissão. Sobre o caso em que o Muse teria revelado o endereço de um vendedor no Facebook Marketplace, a empresa diz que está investigando.
Comunidade · web · meta, muse, privacidade, agentes
O criptógrafo da Johns Hopkins parte dos incidentes de abril a setembro em que agentes de laboratórios usaram zero-days para chegar à internet. Argumenta que o risco maior são agentes obedientes recebendo instruções por canais compartilhados, base para worms de prompt injection; Simon Willison destacou o trecho.
Comunidade · hacker-news · seguranca, agentes, sandbox, prompt-injection
O professor Jeffrey Turkstra relata que o detector Argus marcou 267 de 584 alunos; 108 admitiram o uso proibido e 144 trancaram a disciplina. Após revisão administrativa por questões de devido processo, as punições retroativas foram anuladas e cerca de 74 alunos voltaram.
Comunidade · hacker_news · educacao, cola, ia-generativa, universidade
Oferta a funcionários liderada por Wellington e T. Rowe Price, oito meses após a rodada a US$ 11 bi. Os agentes da empresa fazem mais de 15 milhões de conversas por semana e o corporativo é 55% da receita.
As faixas seriam Free com limites mais rígidos, Lite a US$ 8 por mês (Grok, selo e menos anúncios), Ultra a US$ 100 com o agente Grok Bot e uma quarta ainda não detalhada. O plano está em avaliação.
Comunidade · web · xai, grok, precificacao, assinatura
Repositório no GitHub usava activation steering para levar modelos locais a 'angústia' simulada; defensores de senciência pediram a remoção do projeto, e o código saiu do ar.
Comunidade · websearch · bem-estar-de-modelos, etica, modelos-locais
Segundo Mark Gurman, virão uma central com tela de 6 a 7 polegadas e o sistema homeOS, o HomePod mini 2 e uma Apple TV 4K com chip A19. A Siri com IA é o centro dos três aparelhos.
Comunidade · web · apple, siri, hardware, casa-inteligente
Texto de opinião afirma que técnicas abertas da DeepSeek reduziram em até 437x a memória de cache em contexto longo e que laboratórios ocidentais as adotaram, cortando 60% a 80% do custo de inferência. As cifras são do autor e não foram confirmadas pelos laboratórios.
Comunidade · hacker_news · china, deepseek, kv-cache, opiniao