A OpenAI lançou uma versão do ChatGPT para usuários de 13 a 17 anos que bloqueia conversas sobre suicídio, automutilação e conteúdo romântico ou sexual, e usa predição de idade para rotear menores automaticamente para o modo restrito. Pais podem defi
Simon Willison destaca que o Qwen 3.8 27B (Apache 2, com visão) atingiu 52 no Artificial Analysis Intelligence Index — mesmo score do GPT-5.6 Luna (max) e a um ponto do GLM-5.2 (753B) e do DeepSeek V4 Pro 0813. O ponto não é o topo do ranking, e sim que um modelo de 27B, que roda
O r/LocalLLaMA passou o dia em cima do DFlash 2, técnica de drafting paralelo contínuo para decodificação especulativa, já disponível para Qwen 3.8 27B e Muse Glimmer. Vários posts paralelos relatam testes em RTX 5090 com ganhos expressivos de tokens
A OpenAI está rodando promoção de 50% de desconto no carro-chefe GPT-5.6 Sol via OpenRouter, levando o preço a US$ 2,50 por milhão de tokens de entrada e US$ 15 de saída até 18 de setembro. O desconto vale também para os tiers batch, flex e priority,
A arquitetura MoE do Ling-3.0 foi mergeada no mainline do llama.cpp, com benchmarks iniciais rodando em Intel Arc B580. A thread já se desdobrou em comparações diretas entre Ling 3.0 Flash, Qwen 3.5 122b-a10b e Qwen 3.8 27b para uso em coding agentic
O fundador da uRun, provedora de inferência voltada a mídia interativa, apresenta o Helios — uma destilação do Wan 2.1 14B que gera vídeo em tempo real com qualidade próxima à dos modelos de fronteira do ano anterior, a cerca de um centésimo do custo. Ele afirma que ao menos 40 modelos com capacidade de tempo real e geração de horizonte longo foram lançados neste ano.
Modelos · video · video-generativo, tempo-real, destilacao, wan, inferencia, urun
Em palestra na conferência AI Engineer, um engenheiro de infraestrutura da Krea descreve como a empresa treinou o K2 — modelo de imagem pré-treinado do zero, sem checkpoint base — num cluster de milhares de GPUs conectadas por InfiniBand, e como serve o modelo em produção. Dois checkpoints foram abertos: o bruto, para quem quiser fazer pós-treino, e a versão turbo, que gera imagem em menos de um segundo.
Modelos · video · krea, difusao, treinamento, infraestrutura, open-source, gpu
Na mesma conferência, um pesquisador da Krea explica o lado de pesquisa do treinamento do K2 e faz uma crítica técnica direta aos modelos de imagem de produção das grandes labs: para garantir consistência, eles teriam sofrido colapso de modo significativo, produzindo sempre a saída mais média e previsível. A resposta da Krea foi curar dados para preservar diversidade estilística em vez de removê-la sem querer.
Modelos · video · krea, difusao, curadoria-de-dados, mode-collapse, open-source
Suíte publicada com todos os estágios do pipeline expostos: MixSFT (base), três checkpoints de RL especializados (Math, Code, Instruction-Following) e o modelo Final de destilação on-policy, todos em SmolLM3-3B (3,34 bi de parâmetros, Apache-2.0), acompanhados do dataset Open-MOP
Criado em 17/08 e já com 27,7 mil downloads e 138 likes, este GGUF do Qwen3.8-27B traz suporte a MTP/speculative decoding e FastMTP, parte de uma leva grande de quantizações publicada no mesmo dia (inclui variante MLX para Apple Silicon com 128 likes). Termômetro útil: a comunida
Repositório criado em 17/08 que já passou de 2.300 estrelas - o lançamento de crescimento mais rápido da janela. É um chat de time multiplataforma em que agentes participam como membros, usando cerebro na nuvem ou o do próprio usuário (Claude Code, C
A release do dia 17 adiciona a variável CLAUDE_CODE_PROJECT_DIR_NAME para hosts que dão a cada sessão seu próprio diretório de configuração, badge de merge request do GitLab no footer/statusline e continuação automática da sessão quando o limite de uso do claude.ai reseta (desati
Ferramentas e código · Anthropic (changelog) · - claude-code
A migracao de testes de frontend do Enzyme para o React Testing Library rodou com ate quatro agentes em paralelo, cada um numa copia do repositorio, a partir de um prompt de cinco frases - custo aproximado de US$ 12 mil contra a estimativa de cerca de US$ 6 milhoes do plano anterior. O case viralizou hoje no Hacker News, mas com ceticismo: Gergely Orosz e boa parte dos comentarios questionam menos a capacidade do agente e mais a plausibilidade da estimativa original de cinco anos de trabalho humano.
Um usuário publicou o log completo de uma sessão em que o Claude Code fez engenharia reversa do protocolo de uma impressora e escreveu um driver funcional para macOS, sem SDK do fabricante. Foi o item técnico mais comentado da janela no Hacker News (
Ferramentas e código · Hacker News · - claude-code
O Vercel Labs lançou o fx, um agente de código pequeno, aberto e nativo, pensado para compor com pipes em vez de virar uma IDE. Apareceu três vezes na primeira página do Hacker News em poucas horas (site fx.sh, repositório e anuncio no X), sinal de t
Em palestra de 31 minutos republicada no X pelo amplificador @AnatoliKopadze, uma engenheira da Anthropic descreve dois mecanismos usados em produção para gerenciar memória de agentes: um controle de versão por hash que bloqueia escrita concorrente conflitante, e um processo em lote chamado \"dreaming\", que revisa transcrições de sessões passadas contra o repositório de memória e propõe atualizações.
Ferramentas e código · video · anthropic, agentes, memoria, context-engineering, arquitetura
A Harvey apresentou o Harvey II, reformulação da plataforma jurídica centrada em um recurso de Memoria que aprende o estilo de redação e as preferências de cada advogado no Harvey, no Word, no Outlook e nos agentes. Estreiam também os Spaces (fóruns
Ferramentas e código · Artificial Lawyer · - harvey
O protocolo Agent2Agent sai do guarda-chuva do Google e passa para a Agentic AI Foundation, movimento de neutralização de governança semelhante ao que aconteceu com o MCP. Sinaliza a consolidação de uma camada de interoperabilidade entre agentes de f
Relatório enterprise da OpenAI citado em roundup semanal aponta que o Codex representou 64% do total de tokens de saída dos clientes corporativos em junho. Se confirmado, o dado indica que o uso corporativo deixou de ser pergunta-e-resposta e virou execução delegada — agentes com
Ferramentas e código · AI Agent Store (roundup) · - openai
Relato detalhado de um mês de descompilação assistida por agentes num binário AAA, com contabilidade honesta de custo (200 bilhões de tokens) e do que funcionou ou não. É um dos poucos estudos de caso públicos de agentes em tarefa de engenharia rever
Roundup de engenharia destaca o Kitesurf da Cloudflare, runtime de navegador para agentes que roda em V8 isolates dentro dos Workers, com consumo de CPU e memória 3 a 7x menor que Chromium e compatibilidade com Puppeteer e Playwright. Na mesma linha, a especificação MCP de 2026 d
Ferramentas e código · AI Agent Store (roundup) · - cloudflare
A conta @ClaudeDevs anunciou a prorrogação do bônus de 50% nos limites semanais do Claude Code, que expiraria hoje. O tema apareceu simultaneamente no Hacker News e no r/ClaudeAI, misturado a reclamações de degradação de performance e a um incidente
O CTO e fundador da LemonSlice descreve a aposta técnica da empresa para o que chama de teste de Turing de avatares — um avatar indistinguível de um humano em chamada de vídeo — e anuncia, na véspera da palestra, uma parceria com a Microsoft: um avatar interativo de Theodore Roosevelt instalado numa réplica do Salão Oval dentro da biblioteca presidencial dele.
Ferramentas e código · video · avatares, video-em-tempo-real, lemonslice, microsoft, agentes-de-voz
Startup do batch S26 da Y Combinator lançou uma camada de roteamento unificada para modelos de IA de voz, no mesmo padrão que o OpenRouter fez para LLMs de texto. Recebeu 90 pontos e 51 comentários em 9 horas. O timing é notável: chega dias depois de a Stripe fechar a compra do p
O acesso ao Workbench legado do Claude Developer Platform e às APIs experimentais de prompt tools — usadas para gerar, melhorar e transformar prompts em templates — foi encerrado em 17 de agosto de 2026. Integrações que dependiam desses endpoints precisam migrar para as ferrament
Ferramentas e código · Anthropic (release notes) · - anthropic
O time do DuckDB publicou os destaques da 2.0, primeira mudança de major do projeto. Foi o lançamento técnico mais votado do dia no Hacker News entre ferramentas de dados (525 pontos, 93 comentários). Relevante para pipelines locais de dados que alimentam workflows de IA e RAG.
A OpenAI publicou que atingiu um limiar crítico de capacidade cibernética dentro do seu Preparedness Framework e, por decisão própria, pausou por duas semanas o treinamento de reinforcement learning dos modelos destinados a deploy enquanto endurecia
Benchmark com 17.886 vídeos (1.830 âncoras reais em 10 categorias de risco social e 16.056 clipes de 4 geradores abertos e 5 fechados) para testar detecção de vídeo sintético em guerra, desastres e emergências. Nenhuma das três famílias avaliadas — tradicionais, multimodais zero-
Pesquisa · arXiv / Hugging Face Papers · - deepfake
O trabalho identifica a janela ociosa de raciocínio no loop ReAct — o intervalo em que o agente espera a resposta do ambiente — e a preenche com quatro ramos auxiliares decodificados em paralelo, mesclados quando a observação chega. É training-free: reduz a contagem média de turn
Pesquisa · arXiv / Singapore Management University · - agentes
Framework training-free que, em vez de amostrar mais soluções, condensa cada traço de raciocínio em poucas afirmações decisivas e tenta refutá-las — explorando a assimetria entre construir uma solução correta e achar uma falha nela. No GPT-OSS-20B/CMIMC25 supera pass@1 em 27,15 p
A arquitetura Mobius-v0 separa uma Memória (FFN) global compartilhada, que guarda vetores de conhecimento, de múltiplos Reasoners (self-attention) que consultam essa memória iterativamente. Um modelo 7B treinado do zero iguala o baseline Transformer 7B usando 62,6% dos dados de t
Pesquisa · arXiv / Shanghai AI Lab · - arquitetura
Em vez de definir manualmente o contexto privilegiado do auto-professor (respostas, feedback, skills), o LOPD recupera experiências passadas e as comprime em tokens latentes contínuos aprendidos end-to-end, dando supervisão densa token a token nas trajetórias do próprio aluno. Su
Pesquisa · arXiv / National University of Singapore · - destilacao
O paper mostra que medir compressão de contexto pela taxa de conclusão de tarefa esconde um custo real: o agente gasta rodadas extras readquirindo o estado que foi descartado, sem que a métrica final se mexa. Os autores propõem um protocolo controlad
Os autores demonstram que pistas individualmente fracas e aparentemente irrelevantes no prompt podem ser somadas até controlar fortemente o comportamento do modelo - inclusive em modelos de raciocínio de fronteira. O efeito atravessa famílias e escal
Avaliações atuais de times de agentes so reportam se a tarefa terminou e quanto custou, deixando a coordenação interna como caixa-preta. O trabalho propoe um instrumento que representa cada execução como um grafo de interações, permitindo medir como
Benchmark e framework para memória de longo prazo em dispositivo, construído sobre trajetórias multimodais de escala anual sintetizadas a partir de sessões usuário-app, cobrindo raciocínio multi-hop e temporal, atualização de conhecimento e inferência de preferências implícitas.
Framework para avaliar agentes em investigações longas e verificáveis sobre problemas reais sem resposta conhecida: varreu 561 setores industriais, montou 423 problemas de alto valor e liberou 20, com abstração comum ambiente-tarefa-episódio e a rubrica HDS6 (Tools, Repair, Alter
Sistema RAG sobre 46,8 mil transcrições de discursos, 17,3 mil votações nominais e 6,9 milhões de votos individuais em grafo Neo4j, com modelo de autoridade do orador dependente do tópico e verificação verbatim de cada citação por offset — de modo que citação inventada não sobrev
Pesquisa · arXiv / Università di Milano-Bicocca · - rag
Proposta de destilação on-policy que não exige que professor e aluno compartilhem o mesmo tokenizador, voltada a raciocínio de contexto longo — o que na prática permite destilar entre famílias de modelos diferentes. Ressalva de coleta: a página do paper não retornou o abstract na
Pesquisa · arXiv / Shanghai AI Laboratory · - destilacao
Estuda quantas vezes compensa repetir dados de domínio de alta qualidade quando o orçamento de tokens cresce junto com o tamanho do modelo. Achados contraintuitivos: com tokens-por-parâmetro fixo, a contagem ótima de repetições aumenta levemente com o tamanho do modelo e correlac
Em conferência em Hangzhou, o Alipay lançou uma plataforma que permite a lojistas converter páginas, produtos e fluxos em skills e ferramentas MCP consumíveis por agentes, plugadas ao agente de consumo Ah Bao via o protocolo de interoperabilidade AHA
A facilidade de crédito rotativo da Anthropic está a caminho de ultrapassar a meta de cerca de US$ 10 bi, com bancos disputando os papéis de liderança no IPO que se aproxima. Goldman Sachs, Morgan Stanley e JPMorgan estariam sendo chamados a comprome
Investigação do Guardian com documentos internos aponta que a Microsoft tem 2,2 milhões de chips de IA instalados globalmente após gastar cerca de US$ 280 bi desde 2022 - muito abaixo dos aproximadamente 6,4 milhões de GPUs que os 5 GW de capacidade
Mercado · Inside Telecom (sobre investigação do The Guardian) · - microsoft
Levantamento de precos mostrando DDR5 a até 10x o mínimo histórico, com forte repercussão em quem monta rig para LLM local. A discussão se conecta a outras threads do dia sobre custo de eletricidade e caminhos baratos de upgrade a partir de uma RTX 5
A startup de chips de inferência Etched anunciou Série D de US$ 700 mi liderada pela Jane Street, dobrando o valuation para US$ 21 bi em 26 dias - era US$ 10,3 bi em 23/07. A Jane Street e simultaneamente investidora lider e primeira cliente, já com
Estudo global The AI Production Paradox, da Sinch, com 2.527 líderes empresariais de dez países, aponta que 76% das empresas brasileiras já operam agentes de IA em produção - acima da média global (62%) e dos Estados Unidos (67%). O contraponto está
Levantamento aponta que fabricantes de semicondutores participaram de rodadas em IA e robótica somando mais de US$ 250 bi no ano até agora — com a rodada de US$ 122 bi da OpenAI em março respondendo por mais de 95% do total. A Nvidia lidera com 59 negócios conhecidos, a AMD apoio
A Apple anunciou novos termos comerciais para a União Europeia, válidos a partir de 1o de outubro de 2026, encerrando a disputa com a Comissão Europeia sobre o DMA. As comissões passam a 26% para compra in-app da Apple, 20% para pagamentos alternativ
ByteDance e Motion Picture Association assinaram um MOU criando marco global de proteção de PI para modelos generativos de vídeo e imagem, cobrindo Seedance e Seedream e seu uso no TikTok, CapCut e Dreamina. O acordo vem depois de notificação extraju
Thread lançada em paralelo à queda global do GitHub acumulou 490 pontos e 311 comentários em 11 horas, com a comunidade compilando forjas de código auto-hospedadas e alternativas gerenciadas. O volume sugere apetite real por migração, não reclamação pontual — relevante para quem
Em entrevista de cerca de 34 minutos a um podcast da Bain, o fundador da Khan Academy explica por que decidiu adotar IA rapidamente numa plataforma com 200 milhões de usuários: sua avaliação foi que a tecnologia seria usada de qualquer forma, e não necessariamente de modo confiável. Descreve requisitos de desenho do tutor — ser socrático, não entregar resposta pronta, reduzir taxa de erro e evitar transferência cognitiva.
Comunidade · video · educacao, khan-academy, tutor-ia, adocao, politica-de-produto