Radar do FAROL31 notas

domingo, 23 de agosto de 2026

Modelos

Qwen-UI-Agent: modelo-base da Alibaba para operar interfaces gráficas de verdade

A equipe Tongyi-MAI da Alibaba publicou o Qwen-UI-Agent, modelo-base que entende elementos de tela e executa cliques e tarefas multi-etapa em telefone, PC e web. Números: **82,1% no MobileWorld** contra 70,1% do GPT-5.6

Modelos · tongyi-mai · qwen, alibaba, gui-agent, computer-use, rpa, benchmark

Qwen3.8-27B-DFlash2: difusão em blocos vira modelo rascunho para decodificação especulativa

Modelo rascunho derivado do Qwen3.8-27B usando DFlash2 — difusão em blocos aplicada a decodificação especulativa — com suporte pronto para sglang e vLLM.

Modelos · huggingface · inferencia, decodificacao-especulativa, block-diffusion, qwen, vllm

Trending do Hugging Face vira monocultura: sete das quinze primeiras posições são variantes abliterated do Qwen3.8-27B

Levantamento do trending do Hub nesta manhã: o Qwen3.8-27B original lidera (2,4 M downloads, trending 1826), mas **sete das quinze primeiras posições são derivados abliterated/uncensored** do mesmo modelo — orcarouter (M

Modelos · huggingface · huggingface, qwen, abliterated, uncensored, quantizacao, open-weights

Ferramentas e código

Autolith: agente de programação que mantém um runtime vivo em vez de só editar arquivos

Em vez do ciclo padrão de editar arquivo, rodar comando e ler stdout, o Autolith mantém um runtime vivo que o agente inspeciona e sobre o qual itera com o estado real do programa em mãos.

Ferramentas e código · hacker-news · coding-agents, runtime, harness, repl, debugging

Slack Code embute Claude Code, Devin e Copilot dentro dos canais

A Slack lançou o Slack Code: canais dedicados em que agentes de codificação — Claude Code da Anthropic, Devin da Cognition, GitHub Copilot e o agente da Vercel — trabalham de forma visível para o time inteiro, que acompa

Ferramentas e código · venturebeat · slack, salesforce, claude-code, devin, copilot, vercel

arc-skill: Opus 5 fecha os 25 jogos públicos do ARC-AGI-3 com 100% de RHAE

Skill de agente com uma regra só: **dizer o que a ação vai fazer antes de gastá-la**. Com ela, o Claude Code sobre Opus 5 terminou os 25 jogos públicos do ARC-AGI-3 com 100,00 de RHAE em 7.645 ações. É a segunda evidênci

Ferramentas e código · github · arc-agi, harness, claude-code, opus-5, benchmark, raciocinio

CopilotKit lança OpenBot: cada agente ganha um computador só dele

Projeto open-source com 2.402 estrelas: colegas de trabalho de IA que cada um ganha o próprio computador — browser, arquivos e ferramentas, com **cada ação decidida antes de acontecer e registrada depois**, aceitando q

Ferramentas e código · github · openbot, copilotkit, ag-ui, sandbox, auditoria, open-source

llm 0.33 de Simon Willison ganha reasoning_summary e templates combináveis

Nova versão da ferramenta de linha de comando `llm`. Destaques: `llm prompt -t` agora é repetível, combinando um template de modelo/opções com um template de prompt (`llm -t lhigh -t pelican`); nova opção `reasoning_summ

Ferramentas e código · simon-willison · llm-cli, simon-willison, openai, reasoning, cli, open-source

autoprompt: skill que diz cortar falhas em 45% em tarefas de coding agent

Skill para coding agents que reescreve o pedido do usuário antes de executá-lo, com alegação de **redução de 45% em falhas** em tarefas agênticas; 729 estrelas. É a materialização em produto da tese de harness que domino

Ferramentas e código · github · autoprompt, claude-code, skills, prompt-engineering, benchmark

awesome-ai-harness: a comunidade começa a organizar o conhecimento de harness engineering

Repositório de curadoria com a tese no subtítulo: o modelo é o motor; o harness é o carro. Cobre gestão de contexto, design de ferramentas, loops de agente, memória, sandboxing e evals, em inglês e chinês; 126 estrelas

Ferramentas e código · github · harness, context-engineering, curadoria, agentes, memoria, evals

only-cli/oc transforma qualquer site em CLI de centenas de tokens para agentes

Ferramenta que converte um site qualquer em uma CLI compacta feita para agentes: navegue a web em centenas de tokens, não dezenas de milhares. 139 estrelas. O problema que ataca é de custo, não de capacidade — screensh

Ferramentas e código · github · cli, browsing, contexto, tokens, eficiencia, open-source

Curso aberto de inference engineering — de KV cache a vLLM e SGLang — ganha tração

Repositório passo a passo de engenharia de inferência de LLM — KV cache, PagedAttention, continuous batching, vLLM, SGLang e GPUs — com 214 estrelas. Aparece junto com o AI-Engineering-Lab (98 estrelas, 24 semanas, 43 no

Ferramentas e código · github · inferencia, kv-cache, paged-attention, vllm, sglang, formacao

Pesquisa

StateMemBench: sistemas de memória de agente medem recall, não rastreio de estado

O argumento é cirúrgico: se um fato é revisado ao longo da conversa, a resposta correta reflete o estado atual, não o superado — e benchmarks de memória medem a lembrança, não a atualização.

Pesquisa · arxiv · memoria, agentes, benchmark, estado, context-engineering

AI4AI-Bench: agentes fecham menos de um quinto da distância ao redesenhar o próprio treino

Benchmark com 10 repositórios congelados em que o agente tem 4 horas numa B300 para reescrever o algoritmo de treinamento — desenho que isola auto-melhoria recursiva de mero ajuste de hiperparâmetro.

Pesquisa · arxiv · auto-melhoria, benchmark, agentes, rsi, avaliacao

Phantom Gains: sete falhas de medição invertem conclusões de auto-treinamento de LLM

Auditando três rodadas de auto-treinamento LoRA no Qwen3-8B contra um controle congelado, os autores identificam sete falhas de medição — várias delas prática padrão — que invertem a conclusão reportada quando o controle está ausente.

Pesquisa · arxiv · metodologia, auto-treinamento, lora, replicacao, rigor

Pandora's Router: roteamento entre modelos formalizado como problema da Caixa de Pandora

Trata a escolha de qual modelo chamar como o problema clássico da Caixa de Pandora: estimadores baratos são ruidosos, os precisos custam, e existe um cálculo de valor-da-informação para decidir quando vale refinar a estimativa antes de rotear.

Pesquisa · arxiv · roteamento, custo, valor-da-informacao, rag, eficiencia

Break It Down: skills de agente só transferem entre tarefas no nível de subtarefa

Estudo controlado com achado incômodo para quem constrói bibliotecas de skills: skills no nível de tarefa em geral pioram o desempenho abaixo do baseline sem memória, enquanto skills no nível de subtarefa melhoram — e skills escritas em texto transferem melhor que em código.

Pesquisa · arxiv · skills, transferencia, agentes, memoria-procedural, avaliacao

Beyond Memory Majority: memórias de agentes distintos herdam a mesma fonte e forjam maioria

Nomeia o "Memory Correlation Bias": num sistema multi-agente, memórias escritas por agentes distintos podem descender da mesma fonte a montante, e a arbitragem por voto conta a mesma evidência várias vezes.

Pesquisa · arxiv · multi-agente, memoria, vies, arbitragem, evidencia

Raschka detalha como o Claude faz watermark de texto gerado — e como se remove

Sebastian Raschka publicou um passeio de 48 minutos pela mecânica de watermarking de texto no Claude: como o viés é injetado na amostragem de tokens, como a detecção funciona e — a parte que a indústria prefere não discu

Pesquisa · sebastian-raschka · watermarking, deteccao, amostragem, claude, proveniencia, forense

Regulação e segurança

Reuters: estudante do Texas denuncia tentativa real de invasão conduzida por agente de IA

Reportagem reconstrói como um estudante identificou e reportou um agente de IA executando tentativa de intrusão real.

Regulação e segurança · reuters · seguranca, agentes-autonomos, contencao, incidente, whistleblower

BBC: Anthropic mantém operação para escanear destrutivamente livros do mundo inteiro

A BBC detalha a operação interna de digitalização destrutiva de livros da Anthropic, apoiada na decisão do juiz William Alsup de que o uso das obras foi "excepcionalmente transformativo" e portanto permitido sob a lei americana.

Regulação e segurança · bbc · direitos-autorais, dados-de-treino, anthropic, livros, alsup

Comunidade

Nvidia sobe preço de servidores de IA acima de 15% por causa do custo de memória

A Nvidia notificou grandes clientes — entre eles Microsoft, Alphabet e Oracle — de que os preços de servidores com seus chips de IA vão subir mais de 15% em muitos casos, por causa da disparada no custo de memória. O rea

Comunidade · bloomberg · nvidia, precos, memoria, vera-rubin, grace-blackwell, datacenter

Alerta federal dos EUA: exploits gerados por IA já mapeiam CLPs Siemens em infraestrutura crítica

NSA, CISA, FBI, Departamento de Energia e EPA publicaram o advisory conjunto AA26-231A sobre ataques ativos a controladores lógicos programáveis Siemens S7 (S7-200 a S7-1500 série F), usando scripts de exploração **gerad

Comunidade · cisa · cisa, nsa, fbi, ics-scada, siemens, seguranca-ofensiva

Torvalds credita a IA em mensagem de commit do kernel depois de um "debug do inferno

Em commit no driver drm/xe (correção de VRAM/CCS storage), Linus Torvalds relata uma sessão de debug do inferno enormemente ajudada por uma IA — que, segundo ele, **afirmou várias vezes que o problema era impossível e

Comunidade · github · linus-torvalds, kernel-linux, debugging, coding-agents, ceticismo

NYT: Harvard disputa corpo docente de IA e expõe o custo de reter pesquisador na universidade

Coluna do DealBook sobre a dificuldade de Harvard em formar e segurar corpo docente de IA diante dos salários dos laboratórios privados.

Comunidade · nytimes-dealbook · academia, talentos, harvard, pesquisa, brain-drain

Nvidia nega que vá lançar LPU específico para a China até o fim do ano

A Nvidia negou reportagem do The Information de que enviaria à China até o fim de 2026 um LPU (language processing unit) baseado em tecnologia licenciada da Groq. Porta-voz: não temos vendas de LPU no mercado chinês hoj

Comunidade · toms-hardware · nvidia, china, lpu, groq, exportacao

Segunda edição dos World Humanoid Robot Games abre em Pequim com 2.056 robôs

Abriu no National Speed Skating Oval, em Pequim, a 2ª edição dos World Humanoid Robot Games: **666 equipes e 2.056 robôs de 16 países**, 51 eventos e 1.301 competições, até 26/08. Contra a 1ª edição (2025: 280 equipes, ~

Comunidade · xinhua · robotica, humanoides, china, pequim, embodied-ai, competicao

Simon Willison: revisar código nunca foi a melhor forma de validar uma mudança

Willison argumenta que a habilidade central para usar coding agents é instruir com clareza e depois **verificar com confiança** que a mudança foi aplicada corretamente — e que ler linha por linha nunca foi, mesmo antes d

Comunidade · simon-willison · code-review, verificacao, coding-agents, engenharia, simon-willison

Harvard vende bootcamp de US$ 699 com avatares de IA dos próprios instrutores

No programa HBS Foundry, avatares de IA dos instrutores dão feedback durante pitches de treino e simulações de reunião de conselho, por US$ 699. O caso é menos sobre tecnologia e mais sobre modelo econômico: a instituiçã

Comunidade · techcrunch · educacao, avatares, harvard, hbs, escala, monetizacao

Pesquisa: a IA falhou em conquistar a confiança das pessoas — e quem a faz, menos ainda

Levantamento europeu mostrando que a IA não conquistou a confiança do público e que seus fabricantes são ainda menos confiáveis que a tecnologia em si — item que subiu ao Hacker News nesta janela. Encaixa exatamente na p

Comunidade · euronews · confianca, opiniao-publica, pesquisa, regulacao, adocao

[DUPLICATA] OpenAI encosta na Anthropic entre usuários corporativos

Item descartado na verificação da varredura das 20h de 23/08 — a mesma matéria já havia sido registrada em 21/08.

Comunidade · techcrunch · duplicata, openai, anthropic