A equipe Tongyi-MAI da Alibaba publicou o Qwen-UI-Agent, modelo-base que entende elementos de tela e executa cliques e tarefas multi-etapa em telefone, PC e web. Números: **82,1% no MobileWorld** contra 70,1% do GPT-5.6
Modelo rascunho derivado do Qwen3.8-27B usando DFlash2 — difusão em blocos aplicada a decodificação especulativa — com suporte pronto para sglang e vLLM.
Levantamento do trending do Hub nesta manhã: o Qwen3.8-27B original lidera (2,4 M downloads, trending 1826), mas **sete das quinze primeiras posições são derivados abliterated/uncensored** do mesmo modelo — orcarouter (M
Em vez do ciclo padrão de editar arquivo, rodar comando e ler stdout, o Autolith mantém um runtime vivo que o agente inspeciona e sobre o qual itera com o estado real do programa em mãos.
A Slack lançou o Slack Code: canais dedicados em que agentes de codificação — Claude Code da Anthropic, Devin da Cognition, GitHub Copilot e o agente da Vercel — trabalham de forma visível para o time inteiro, que acompa
Skill de agente com uma regra só: **dizer o que a ação vai fazer antes de gastá-la**. Com ela, o Claude Code sobre Opus 5 terminou os 25 jogos públicos do ARC-AGI-3 com 100,00 de RHAE em 7.645 ações. É a segunda evidênci
Projeto open-source com 2.402 estrelas: colegas de trabalho de IA que cada um ganha o próprio computador — browser, arquivos e ferramentas, com **cada ação decidida antes de acontecer e registrada depois**, aceitando q
Nova versão da ferramenta de linha de comando `llm`. Destaques: `llm prompt -t` agora é repetível, combinando um template de modelo/opções com um template de prompt (`llm -t lhigh -t pelican`); nova opção `reasoning_summ
Skill para coding agents que reescreve o pedido do usuário antes de executá-lo, com alegação de **redução de 45% em falhas** em tarefas agênticas; 729 estrelas. É a materialização em produto da tese de harness que domino
Repositório de curadoria com a tese no subtítulo: o modelo é o motor; o harness é o carro. Cobre gestão de contexto, design de ferramentas, loops de agente, memória, sandboxing e evals, em inglês e chinês; 126 estrelas
Ferramenta que converte um site qualquer em uma CLI compacta feita para agentes: navegue a web em centenas de tokens, não dezenas de milhares. 139 estrelas. O problema que ataca é de custo, não de capacidade — screensh
Repositório passo a passo de engenharia de inferência de LLM — KV cache, PagedAttention, continuous batching, vLLM, SGLang e GPUs — com 214 estrelas. Aparece junto com o AI-Engineering-Lab (98 estrelas, 24 semanas, 43 no
O argumento é cirúrgico: se um fato é revisado ao longo da conversa, a resposta correta reflete o estado atual, não o superado — e benchmarks de memória medem a lembrança, não a atualização.
Benchmark com 10 repositórios congelados em que o agente tem 4 horas numa B300 para reescrever o algoritmo de treinamento — desenho que isola auto-melhoria recursiva de mero ajuste de hiperparâmetro.
Auditando três rodadas de auto-treinamento LoRA no Qwen3-8B contra um controle congelado, os autores identificam sete falhas de medição — várias delas prática padrão — que invertem a conclusão reportada quando o controle está ausente.
Trata a escolha de qual modelo chamar como o problema clássico da Caixa de Pandora: estimadores baratos são ruidosos, os precisos custam, e existe um cálculo de valor-da-informação para decidir quando vale refinar a estimativa antes de rotear.
Estudo controlado com achado incômodo para quem constrói bibliotecas de skills: skills no nível de tarefa em geral pioram o desempenho abaixo do baseline sem memória, enquanto skills no nível de subtarefa melhoram — e skills escritas em texto transferem melhor que em código.
Nomeia o "Memory Correlation Bias": num sistema multi-agente, memórias escritas por agentes distintos podem descender da mesma fonte a montante, e a arbitragem por voto conta a mesma evidência várias vezes.
Sebastian Raschka publicou um passeio de 48 minutos pela mecânica de watermarking de texto no Claude: como o viés é injetado na amostragem de tokens, como a detecção funciona e — a parte que a indústria prefere não discu
A BBC detalha a operação interna de digitalização destrutiva de livros da Anthropic, apoiada na decisão do juiz William Alsup de que o uso das obras foi "excepcionalmente transformativo" e portanto permitido sob a lei americana.
Regulação e segurança · bbc · direitos-autorais, dados-de-treino, anthropic, livros, alsup
A Nvidia notificou grandes clientes — entre eles Microsoft, Alphabet e Oracle — de que os preços de servidores com seus chips de IA vão subir mais de 15% em muitos casos, por causa da disparada no custo de memória. O rea
Comunidade · bloomberg · nvidia, precos, memoria, vera-rubin, grace-blackwell, datacenter
NSA, CISA, FBI, Departamento de Energia e EPA publicaram o advisory conjunto AA26-231A sobre ataques ativos a controladores lógicos programáveis Siemens S7 (S7-200 a S7-1500 série F), usando scripts de exploração **gerad
Comunidade · cisa · cisa, nsa, fbi, ics-scada, siemens, seguranca-ofensiva
Em commit no driver drm/xe (correção de VRAM/CCS storage), Linus Torvalds relata uma sessão de debug do inferno enormemente ajudada por uma IA — que, segundo ele, **afirmou várias vezes que o problema era impossível e
Comunidade · github · linus-torvalds, kernel-linux, debugging, coding-agents, ceticismo
A Nvidia negou reportagem do The Information de que enviaria à China até o fim de 2026 um LPU (language processing unit) baseado em tecnologia licenciada da Groq. Porta-voz: não temos vendas de LPU no mercado chinês hoj
Comunidade · toms-hardware · nvidia, china, lpu, groq, exportacao
Abriu no National Speed Skating Oval, em Pequim, a 2ª edição dos World Humanoid Robot Games: **666 equipes e 2.056 robôs de 16 países**, 51 eventos e 1.301 competições, até 26/08. Contra a 1ª edição (2025: 280 equipes, ~
Comunidade · xinhua · robotica, humanoides, china, pequim, embodied-ai, competicao
Willison argumenta que a habilidade central para usar coding agents é instruir com clareza e depois **verificar com confiança** que a mudança foi aplicada corretamente — e que ler linha por linha nunca foi, mesmo antes d
Comunidade · simon-willison · code-review, verificacao, coding-agents, engenharia, simon-willison
No programa HBS Foundry, avatares de IA dos instrutores dão feedback durante pitches de treino e simulações de reunião de conselho, por US$ 699. O caso é menos sobre tecnologia e mais sobre modelo econômico: a instituiçã
Comunidade · techcrunch · educacao, avatares, harvard, hbs, escala, monetizacao
Levantamento europeu mostrando que a IA não conquistou a confiança do público e que seus fabricantes são ainda menos confiáveis que a tecnologia em si — item que subiu ao Hacker News nesta janela. Encaixa exatamente na p
Comunidade · euronews · confianca, opiniao-publica, pesquisa, regulacao, adocao