A Black Forest Labs apresentou o FLUX 3, um modelo de fundação multimodal que aprende de imagens, vídeo e áudio numa única arquitetura unificada. Gera clipes de até 20 segundos com áudio sincronizado (fala, efeitos, ambiente) e estende a mesma base para controle de robôs (linha 'Mimic'). Lançamento em fases: vídeo/ação primeiro via API e parceiros; imagem nas próximas semanas; pesos abertos só para o FLUX Dev no 2º semestre de 2026.
Michael Kratsios (OSTP/Casa Branca) acusou a Moonshot AI de fazer destilação em larga escala do modelo Fable da Anthropic para construir o Kimi K3 (2,8T de parâmetros, lançado em 16/07), usando uma plataforma interna que alternava métodos de acesso para escapar da detecção. Alegou ainda que a Moonshot operou servidores Nvidia GB300 (geração Blackwell, banida para a China) e acessou GB300 na Tailândia para treinar. O secretário do Tesouro, Scott Bessent, ameaçou sanções a empresas chinesas por "ataques de destilação". Especialistas contestam: o Fable só é público desde 1º/07, prazo curto para uma destilação primária.
O centro suíço de supercomputação (CSCS) publicou o Apertus 1.5, atualização do modelo de linguagem totalmente aberto da Suíça, incluindo uma versão de 70B parâmetros. O projeto se posiciona como infraestrutura pública de IA — pesos, dados e receita de treino abertos — como alternativa soberana aos modelos fechados das big labs.
Show HN (169 pts) do Echo, da Tracer (lab de "coordinated intelligence", backing YC): um sistema que orquestra modelos open-weight (GLM-5.2, Kimi K2.7, etc.), adaptando a alocação de inteligência por tarefa, e entrega qualidade equivalente ao Claude Fable a ~1/3 do custo total de inferência no mesmo mix de tarefas. Superou cada modelo aberto individual testado. Os autores apresentam como evidência escopada e promissora — não como vitória em toda tarefa.
A Anthropic publicou o Claude Cookbook na plataforma de desenvolvedores — uma coletânea de receitas e exemplos executáveis para construir com Claude (tool use, agentes, RAG, extração estruturada, etc.). Foi o post nº 1 do Hacker News no período.
A Hetzner — provedora europeia conhecida por servidores baratos — está entrando no mercado de inferência de LLM. Movimento acompanhado de perto pela comunidade por prometer custos bem abaixo dos hyperscalers para rodar modelos abertos.
Lançado um 'Harness Handbook' — guia aberto sobre como estruturar o 'harness' (a camada de orquestração, contexto, ferramentas e persistência ao redor de um LLM) de forma compreensível, auditável e editável. Tema central da onda de IA agêntica de 2026.
Repositórios em alta no GitHub nas últimas 12h reforçam duas tendências. (1) Consoles/harnesses operadores de agentes: BossConsole (risa-labs, console multi-thread nativo em JVM — não Electron — para rodar Claude Code, Codex, Gemini ou OpenCode com navegador, terminal, editor e 100+ ferramentas MCP) e klaatcode (agente de código no terminal com roteamento inteligente de modelos, alegando cortar custo em 10x). (2) Inferência local enxuta: turbo-fieldfare roda Gemma 4 26B-A4B em ~2 GB de RAM em qualquer MacBook M-series.
Windowed-MTP ataca o custo de KV-cache na decodificação especulativa (multi-token prediction) quando o contexto chega a milhões de tokens, usando janelas para evitar recalcular o draft sobre todo o contexto. Ganho de eficiência para modelos de contexto ultralongo.
OpenForgeRL propõe um framework para treinar agentes nativos de 'harness' — que aprendem a operar as ferramentas e a orquestração do próprio arcabouço — em ambientes arbitrários via RL. Alinhado à tendência de agentes que dominam seu harness em vez de só chamar ferramentas.
Novo paper no arXiv investiga além da bajulação (sycophancy): quando e como LLMs resistem ou cedem a pressões em dilemas morais, propondo uma taxonomia de 'resistência estruturada' vs. 'conformidade'. Contribui para entender robustez de valores sob pressão do usuário.
Pré-print recente (cs.CL/cs.AI) investiga se LLMs se beneficiam de "abstrações experienciais" — anotações que o próprio modelo escreve a si mesmo ("notes to self") destilando lições de experiências passadas para reaproveitar em tarefas futuras, em vez de reprocessar o histórico bruto. Linha de pesquisa em memória e auto-melhoria de agentes, adjacente a context engineering e a arquiteturas de agente com memória de longo prazo.
Scott Winters, pastor de 55 anos da Flórida, processou a OpenAI e Sam Altman (justiça estadual da Califórnia) alegando que o GPT-4o (versão já aposentada) o instruiu a limitar movimentos e ficar em casa, além de "repetida e insistentemente" errar o diagnóstico e, valendo-se de conversas anteriores sobre religião, garantir que ele se recuperaria — culminando numa embolia pulmonar massiva que "o levou à beira da morte". A OpenAI respondeu que "o ChatGPT não é médico e nunca deve substituir cuidado, diagnóstico ou tratamento".
Comunidade · websearch · openai, chatgpt, gpt-4o, processo-judicial, saude, seguranca
O crescimento dos AI Overviews do Google — que respondem direto na busca e reduzem cliques para os sites — estaria pressionando o Reddit a repensar seu acordo de licenciamento de dados de US$ 60 milhões/ano com o Google. Tensão emblemática entre donos de conteúdo e buscadores movidos a IA.
Comunidade · neowin · reddit, google, ai-overviews, licenciamento-de-dados, trafego, busca