Radar do FAROL36 notas

quinta-feira, 2 de julho de 2026

Modelos

Meituan abre o LongCat-2.0: 1,6 tri de parâmetros, MIT, treinado 100% em chips chineses

A Meituan lançou (30/jun) o LongCat-2.0: MoE de 1,6 trilhão de parâmetros (~48B ativos), contexto nativo de 1M tokens, licença MIT — e o primeiro modelo trilionário treinado e servido ponta a ponta em chips chineses (50k+ aceleradores domésticos, sem Nvidia). É o mesmo sistema que rodava anônimo no OpenRouter como "Owl Alpha". Pesos ainda "coming soon"; API já ativa.

Modelos · huggingface · meituan, longcat, china, moe, 1.6T, mit-license

Paper de genômica da OpenAI vaza acidentalmente a linha 'GPT-5.6 Pro' (Sol/Terra/Luna)

Ao publicar o benchmark GeneBench-Pro, a OpenAI deixou escapar no próprio paper uma linha "Pro" ainda não anunciada do GPT-5.6, com variantes Sol/Terra/Luna — sinalizando uma quebra da estratégia de "um único modelo de topo". A tabela de resultados lista "GPT-5.6 Sol Pro", indicando níveis Pro paralelos aos modelos-base já conhecidos.

Modelos · the-decoder · openai, gpt-5-6, gpt-5-6-pro, sol, terra, luna

Z.ai lança ZCode: IDE agent-first grátis (MIT/GLM-5.2) para desafiar Cursor, Claude Code e Copilot

A Z.ai (marca internacional da Zhipu AI) lançou em 02/07 o ZCode, um "Agentic Development Environment" gratuito construído sobre o GLM-5.2 (MoE 744B, 40B ativos, 1M tokens de contexto, MIT license, lançado 13/06). Diferente de um assistente de prompt único, o ZCode planeja, edita, roda testes e itera em tarefas de múltiplas etapas com pouca intervenção humana; recurso de destaque é o "Goal Mode", que repete o ciclo até um objetivo verificável passar. Suporta controle remoto via WeChat/Feishu/Telegram. Tier gratuito + Lite a US$16,20/mês. Pesos abertos sob MIT permitem self-host, eliminando o "kill-switch" regulatório que ficou visceral após a suspensão do Fable 5 na China.

Modelos · venturebeat · zai, zcode, glm-5-2, coding-agent, open-weights, mit-license

UBTECH lança em Shenzhen o UWORLD U1, apresentado como 1º humanoide 'ultra-biônico' full-size produzido em massa

A UBTECH apresentou em Shenzhen o UWORLD U1, descrito como o primeiro humanoide ultra-biônico full-size produzido em massa. O lançamento reforça a ofensiva chinesa em robótica humanoide e aparece no digest 'Around the Horn' do The Neuron (03/jul), ao lado da restauração do Fable 5 e do movimento da Meta para vender excesso de compute.

Modelos · theneuron · ubtech, humanoide, robotica, uworld-u1, china, shenzhen

xAI lança Voice Agent Builder: agentes de voz de produção em ~2 minutos, sem código

A xAI anunciou (1/jul) o Voice Agent Builder em beta: plataforma no-code para montar agentes de voz de produção sobre o Grok Voice, com telefonia, retrieval, tools, guardrails, MCPs e observabilidade num só lugar. Caminho speech-to-speech (latência baixa), 80+ vozes com clonagem, US$ 0,05/min de áudio. Grok Voice marca 67,3% no τ-voice Bench, à frente de Gemini 3.1 Flash Live e GPT Realtime 1.5.

Modelos · x-ai · xai, grok-voice, voice-agent, no-code, telefonia, mcp

Tripo AI capta US$ 150 mi (Série A3) e estreia modelos 3D H3.1/P1.0 e o world model 'Project Eden

A Tripo AI fechou US$ 150 mi em Série A3 (um mês após captar US$ 200 mi), com Geely Capital e estúdios de games. Estreou os modelos de fundação 3D Tripo H3.1 e P1.0 (texturas 8K, segmentação de objetos) e o Project Eden, preview de world model que desacopla a simulação de estado da renderização visual. Foco em manufatura inteligente, entretenimento e robótica.

Modelos · siliconangle · tripo-ai, 3d, world-model, project-eden, geely, generative-3d

Meta: modelo em treino 'Watermelon' teria igualado o GPT-5.5 usando ~10x mais compute, diz Alexandr Wang (single-source)

Em town hall interno, o chefe de IA da Meta, Alexandr Wang, teria dito que o modelo em treino codinome "Watermelon" (sucessor do "Avocado") já iguala o GPT-5.5 da OpenAI em benchmarks importantes, usando ~10x mais compute que o modelo anterior. Alerta: é single-source (uma sala fechada, benchmarks não nomeados, sem confirmação de terceiros nem release) — tratar com cautela.

Modelos · benzinga · meta, alexandr-wang, watermelon, llm, compute, benchmarks

NVIDIA amplia o Nemotron 3 com modelos abertos de voz (ASR/VoiceChat), RAG multimodal e safety

A NVIDIA expandiu a família Nemotron 3 com modelos abertos para construção de agentes: ASR streaming multilíngue (Nemotron 3.5 ASR 0.6B, 40+ locales), voz full-duplex de ponta a ponta (VoiceChat 12B, early access, alvo <300ms), embeddings/rerank multimodais para RAG e moderadores de content-safety — todos publicados no Hugging Face.

Modelos · nvidia · nvidia, nemotron, asr, voicechat, rag-multimodal, safety

MolmoMotion (Ai2): modelo aberto de visão-linguagem que prevê movimento 3D a partir de vídeo

A Ai2 lançou o MolmoMotion, VLM totalmente aberto que, dada uma frame de vídeo, pontos 3D de um objeto e uma instrução em linguagem natural ("coloque a tigela branca na mesa"), prevê a trajetória desses pontos em 3D nos próximos segundos. Abre pesos, código de treino e o dataset MolmoMotion-1M (1,16 mi de vídeos), construído sobre o backbone Molmo 2. Lidera o novo PointMotionBench. (Release de meados de junho, ganhou destaque agora.)

Modelos · huggingface · ai2, molmomotion, vlm, molmo-2, robotica, movimento-3d

Unisound U2: modelo 'agêntico nativo' (266B MoE) que decompõe workflows de 100+ passos

A chinesa Unisound lançou o U2, um MoE esparso de 266B parâmetros totais / 10B ativos projetado para execução agêntica (não só chat), capaz de decompor e completar autonomamente workflows reais de 100+ passos. Benchmarks citados: 86,9% GPQA Diamond, 85,8% MATH-500 e 72,2% SWE-bench Verified. Preço US$ 0,15/0,30 por 1M tokens in/out. Licença proprietária.

Modelos · prnewswire · unisound, u2, moe, agentico, china, swe-bench

Ferramentas e código

Ethan Mollick: 'O crepúsculo dos chatbots' — o trabalho de valor migra para agentes

Em ensaio de ~1/jul, Ethan Mollick argumenta que o padrão "chatbot" está sendo superado: o trabalho de maior valor passa a ser delegado a agentes de longa duração, auto-corretivos, que rodam sobre "harnesses" (acesso a ferramentas e ambiente) como Claude Code e Codex. A tese: saímos de não-especialistas usando chatbots para especialistas gerenciando agentes — a melhor postura é pensar em si mesmo como gestor. "A IA não substitui profissões; torna as profissões porosas."

Ferramentas e código · oneusefulthing · ethan-mollick, agentes, chatbots, claude-code, codex, harness

Claude Code 2.1.198: 'Claude in Chrome' em GA, agentes em background com auto-commit e skill /dataviz

Segundo digest de 02/jul, a Anthropic lançou o Claude Code 2.1.198 com 'Claude in Chrome' em disponibilidade geral (GA), agentes em background com auto-commit, uma nova skill /dataviz e correções de estabilidade. Fonte é um agregador — vale confirmar no changelog oficial —, mas o conjunto de recursos é coerente com a direção de agentes de longo horizonte.

Ferramentas e código · tech-reader · anthropic, claude-code, claude-in-chrome, agentes-background, dataviz, dev-tools

Cognition lança Devin Security Swarm: enxame de agentes que caça, valida e corrige vulnerabilidades

A Cognition lançou (1/jul) o Devin Security Swarm: agentes paralelos que varrem a base de código, raciocinam sobre lógica de negócio, compõem cadeias de ataque, VALIDAM a exploitabilidade em sandbox e abrem PRs de correção. No benchmark de 50 vulnerabilidades reais (GHSA), acertou 36/50 (72% de recall) a US$ 90,23/run — melhor recall e ~30% mais barato que o concorrente mais próximo (Claude Security 34/50).

Ferramentas e código · cognition · cognition, devin, security-swarm, appsec, vulnerabilidades, agentic-mapreduce

Simon Willison usa DSPy para avaliar e melhorar os prompts do Datasette Agent

Em post de 02/jul, Simon Willison monta um harness em que agentes DSPy invocam as ferramentas e prompts reais do Datasette Agent contra um Datasette in-process, com dataset 'gold' auto-gerado e métricas customizadas. Descobriu que a instrução 'não chame describe_table se já tem a informação' provocava chutes de nomes de colunas e loops de erro-retry; a recomendação é incluir os nomes das colunas já na listagem de schema.

Ferramentas e código · simonwillison-blog · simon-willison, dspy, avaliacao, prompt-engineering, datasette, agentes

Miles: stack PyTorch-nativo para RL post-training de LLMs em larga escala (destaque no blog PyTorch)

Miles é um framework de reinforcement learning para post-training de LLMs/VLMs em escala, fork co-evoluído do slime, que ganhou destaque editorial no blog do PyTorch em ~1/jul. Compõe SGLang (rollout de alta vazão) + NVIDIA Megatron-LM (treino) + orquestração Ray, com recipes de baixa precisão, alinhamento rollout/treino ciente de MoE, sincronização rápida de pesos via NCCL/RDMA e tolerância a falhas.

Ferramentas e código · github · rl, post-training, pytorch, sglang, megatron, ray

Simon Willison: 'Understand to participate' — com agentes escrevendo o código, entender virou o gargalo

Willison comenta a palestra de Geoffrey Litt (AI Engineer): quando agentes fazem mudanças grandes de código, "entender" passa a ser o gargalo — é preciso compreender o suficiente para continuar participando do processo, evitando "dívida cognitiva". Litt propõe explicadores de código, quizzes e "micro-mundos jogáveis" em vez de só revisar diffs.

Ferramentas e código · simonwillison · simon-willison, agentes, coding, claude-code, context-engineering, divida-cognitiva

Hugging Face e Cerebras demonstram stack aberto e modular de fala-para-fala (Parakeet + Gemma 4 + Qwen3-TTS)

Hugging Face e Cerebras apresentaram um pipeline speech-to-speech totalmente aberto e modular combinando NVIDIA Parakeet (ASR), Gemma 4 31B do Google DeepMind rodando na Cerebras (LLM) e Qwen3-TTS da Alibaba (síntese de voz). O caso reforça a tendência de compor modelos abertos para voz em tempo real, tema quente em r/LocalLLaMA.

Ferramentas e código · theneuron · huggingface, cerebras, speech-to-speech, voz, parakeet, gemma-4

Show HN: OpenKnowledge (Inkeep) — alternativa open-source e 'AI-first' ao Obsidian/Notion

A Inkeep (YC) lançou o OpenKnowledge, editor markdown WYSIWYG open source que integra Claude Code, Codex e Cursor direto no app, deixando agentes lerem e reescreverem arquivos locais sem passar pela nuvem. Usa MCP embutido e um CRDT dual-observer (sobre yjs) que mantém o rich-text (ProseMirror) e o markdown cru em sincronia lossless. Framing: "LLM Wikis e segundo cérebro de agentes". (Show HN de fins de junho; catch-up.)

Ferramentas e código · hackernews · openknowledge, inkeep, obsidian, notion, markdown, claude-code

Pesquisa

Remote Labor Index: Claude Fable 5 lidera modelos públicos com 16,1% de trabalho freelance real automatizado

CAIS e Scale Labs publicaram (2/jul) resultados atualizados do Remote Labor Index (RLI): o Claude Fable 5 atinge 16,1% de automação em 240 projetos freelance reais (23 domínios), ~o dobro do Opus 4.8 (8,3%) e muito acima dos 2,5% do melhor agente no lançamento do benchmark, há menos de um ano. Cada entrega é julgada por humanos contra um "gold standard" feito por profissional pago.

Pesquisa · safe-ai · remote-labor-index, cais, scale-labs, fable-5, opus-4.8, automacao-trabalho

OpenAI lança GeneBench-Pro: benchmark de 'julgamento científico' em genômica derruba os melhores modelos

A OpenAI publicou (30/jun) o GeneBench-Pro, benchmark de 129 problemas sintéticos em genômica, biologia quantitativa e medicina translacional que mede "research taste" (julgamento científico multi-etapa), não recall factual. O melhor modelo, GPT-5.6 Sol Pro, resolve só 31,5% (28,7% o Sol base); o mais forte fora da OpenAI é o Claude Opus 4.8, com 16,0%. Revisores estimam 20-40h de trabalho humano por problema. Publicado também no bioRxiv.

Pesquisa · openai · openai, genebench-pro, benchmark, genomica, biologia, research-taste

ToolPrivacyBench: benchmark de privacidade 'purpose-bound' em agentes que usam ferramentas

Paper (submetido ~26/jun) que audita se "átomos" de dados privados de uma tarefa são roteados apenas para ferramentas e destinos autorizados por seu propósito. Contém 2.150 casos — 1.150 workflows de negócio sintéticos sensíveis + 1.000 adaptados de benchmarks de function-calling —, relevante para segurança de agentes com tool use.

Pesquisa · arxiv · arxiv, agentes, privacidade, tool-use, seguranca, benchmark

Paper mapeia 'loops agênticos infinitos' como nova classe de falha em agentes LLM

Paper identifica os "Infinite Agentic Loops" (IALs), causados por caminhos de feedback mal delimitados entre chamadas de modelo, ferramentas e handoffs entre agentes. Propõe o IAL-Scan, ferramenta de análise estática que, testada em 6.549 repositórios reais, encontrou 68 falhas confirmadas com 91,9% de precisão.

Pesquisa · arxiv · paper, agentes, debugging, static-analysis, arxiv, ial-scan

Regulação e segurança

OpenAI propõe dar 5% de participação ao governo dos EUA (~US$ 42,6 bi) para conter pressão política

A OpenAI teria proposto conceder ao governo dos EUA uma participação de ~5% (≈US$ 42,6 bi sobre a valuation de US$ 852 bi), num veículo inspirado em fundo soberano, para desarmar a pressão política às vésperas do IPO previsto para setembro. Altman defende que outros labs (Anthropic, Google, Meta) façam o mesmo. As conversas foram descritas como conceituais e em estágio inicial.

Regulação e segurança · cnbc · openai, sam-altman, governo-eua, equity, politica, ipo

Comunidade

Anthropic em negociação com a Samsung para seu 1º chip de IA próprio (foco em inferência)

A Anthropic está em conversas iniciais com a Samsung para fabricar seu primeiro chip de IA sob medida, no processo de 2nm e no packaging avançado da coreana, focado em INFERÊNCIA (não treino). Nada foi assinado; a empresa ainda define o que o chip deve fazer. Movimento lido como resposta ao chip "Jalapeño" (OpenAI+Broadcom) e à corrida por reduzir dependência da Nvidia.

Comunidade · techcrunch · anthropic, samsung, chip, inferencia, 2nm, hardware-ia

TwelveLabs capta US$ 100 mi (Série B) para 'superinteligência de vídeo'; Amazon fecha AWS como nuvem preferida

A TwelveLabs (busca e compreensão de vídeo por IA, apoiada pela Nvidia) fechou Série B de US$ 100 mi co-liderada por NEA e NAVER Ventures, com Amazon, Radical, Index, Korea Investment Partners, Quadrille e Red Bull Ventures. Total captado passa de US$ 207 mi. A AWS vira nuvem preferida num contrato plurianual que otimiza a inferência de vídeo em chips Trainium — e novos modelos da startup saem primeiro na AWS.

Comunidade · siliconangle · twelvelabs, amazon, aws, trainium, video, funding

MGX (Abu Dhabi) fecha Fundo I em US$ 49 bi — um dos maiores fundos de IA da história

A MGX, veículo de IA de Abu Dhabi (presidido pelo Sheikh Tahnoon bin Zayed; ancorado por Mubadala e G42), fechou seu Fundo I em US$ 49 bilhões — acima da meta de US$ 45 bi —, cobrindo semicondutores, infraestrutura e plataformas de IA. Já investiu em 14 empresas e co-liderou rodadas de Anthropic e OpenAI. Meta de longo prazo: >US$ 100 bi sob gestão.

Comunidade · cnbc · mgx, abu-dhabi, fundo-ia, capital-soberano, anthropic, openai

Sam Altman propõe no FT um fórum global de segurança em IA liderado pelos EUA ('ONU da IA')

Em artigo no Financial Times (~1/jul), Sam Altman defende um fórum internacional liderado pelos EUA para estabelecer padrões globais de teste e governança de segurança em IA, coordenando países democráticos e prevendo engajar rivais como a China. Retoma sua analogia com a AIEA (nuclear) e segue o G7 de 17/jun, onde CEOs de IA discutiram padrões globais com Trump.

Comunidade · financial-times · sam-altman, openai, governanca, seguranca-ia, financial-times, g7

Microsoft cria a 'Frontier Company', braço de deployment de IA empresarial com US$ 2,5 bi e ~6.000 especialistas

A Microsoft anunciou a "Microsoft Frontier Company", unidade operacional com US$ 2,5 bi e ~6.000 especialistas (engenharia + indústria), liderada pelo brasileiro Rodrigo Kede Lima, para tirar clientes da fase de piloto e levar IA à produção em escala. Parceiros iniciais incluem London Stock Exchange Group, Unilever, Land O'Lakes e Accenture.

Comunidade · techcrunch · microsoft, enterprise-ai, deployment, servicos, rodrigo-kede-lima, adocao

Casa Branca perto de fechar padrões voluntários para modelos de fronteira, com Google entre as empresas

O Financial Times reportou (02/jul) que a Casa Branca está em conversas avançadas com empresas de IA para finalizar padrões voluntários de lançamento de modelos de fronteira, com anúncio possível já na semana de 7/jul. A Reuters confirmou que o Google está entre as empresas em negociação, especificamente antes do lançamento esperado de seu modelo avançado de código (Gemini 3.5 Pro) em julho.

Comunidade · buildfastwithai · casa-branca, governanca-ia, padroes-voluntarios, modelos-de-fronteira, google, gemini-3-5-pro

Crunchbase: VC global bate recorde de US$ 510 bi no 1º semestre de 2026; OpenAI + Anthropic somam 43% do capital

Relatório da Crunchbase News aponta funding global de startups recorde de US$ 510 bi no 1º semestre de 2026 — acima dos US$ 440 bi de todo o ano de 2025. OpenAI e Anthropic sozinhas captaram US$ 217 bi, ~43% de todo o capital do período, evidenciando concentração inédita na corrida por IA de fronteira.

Comunidade · crunchbase · venture-capital, funding, openai, anthropic, mercado, concentracao

Crusoe negocia captação de US$ 3 bi que pode triplicar seu valor para ~US$ 30 bi

A Crusoe, que fornece capacidade de data center para Meta e Oracle e construiu o campus de Abilene (Texas) para OpenAI/Oracle no âmbito do Stargate, está em conversas para captar cerca de US$ 3 bilhões. A rodada pode elevar a avaliação para a faixa de US$ 30 bi (ante ~US$ 10 bi em outubro), refletindo a corrida por infraestrutura de computação para IA.

Comunidade · bloomberg · crusoe, infraestrutura-ia, data-center, stargate, abilene, meta

Venice AI vira unicórnio: US$ 65M Série A (Dragonfly) para IA 'privacy-first' e sem censura

A Venice AI, plataforma "privacy-first" de Erik Voorhees (200+ modelos open source, prompts criptografados no cliente, sem registro no servidor), levantou sua 1ª rodada externa: US$ 65M Série A a US$ 1 bi de valuation, liderada pela Dragonfly com Coinbase Ventures. Já lucrativa: >US$ 70M de receita anualizada, 3,5M de usuários, 1,3 tri de tokens/mês.

Comunidade · techcrunch · venice-ai, privacidade, open-source, erik-voorhees, dragonfly, coinbase-ventures

Anthropic contrata Jelani Nelson, chefe do depto. de CS de Berkeley — 4ª contratação de peso em ~2 semanas

Jelani Nelson, professor de CS teórica e chefe da divisão de EECS da UC Berkeley, tirou licença para se juntar à Anthropic como Member of Technical Staff (início 1/jul), confirmado por ele no X. É a 4ª contratação de alto perfil da Anthropic em ~2 semanas, depois de Andrej Karpathy e do Nobel John Jumper. Nelson é referência em algoritmos de streaming e redução de dimensionalidade.

Comunidade · techtimes · anthropic, jelani-nelson, berkeley, talento, streaming-algorithms, karpathy

Suprema Corte do Japão decide que uma IA não pode ser listada como inventora em patentes

A Suprema Corte do Japão decidiu que uma IA não pode constar como inventora em pedidos de patente — item que figurou na front page do Hacker News em 02/jul. A decisão alimenta o debate jurídico global sobre autoria e propriedade intelectual de invenções geradas ou assistidas por IA.

Comunidade · hacker-news · japao, propriedade-intelectual, patentes, ia-inventor, direito, regulacao

Harrison Chase (LangChain): 'Wiki Memory' — a wiki como substrato de memória/contexto de agentes

Na sua coluna "In the Loop" (30/jun), Harrison Chase argumenta que uma estrutura de wiki é o substrato emergente para memória/contexto durável de agentes — a companhia conceitual do lançamento do OpenWiki na mesma semana. Tese central da virada de 2026: dar aos agentes contexto persistente e estruturado, em vez de despejar tudo num único prompt.

Comunidade · langchain · langchain, harrison-chase, wiki-memory, memoria-de-agente, contexto-duravel, llm-wiki

Weave Robotics lança o Isaac 1: robô doméstico que dobra roupa e arruma a casa (US$ 7.999)

A Weave Robotics lançou o Isaac 1, robô doméstico com base sobre rodas, torso colapsável (0,9–1,75 m) e dois braços, que dobra e recolhe roupa, arruma almofadas e faz camas — com fallback de teleoperação. Preço: US$ 7.999 à vista ou US$ 449/mês; entregas a partir do outono de 2026 (Califórnia primeiro), reserva com depósito reembolsável.

Comunidade · newatlas · weave-robotics, isaac-1, robotica, robo-domestico, embodied-ai, teleoperacao