Radar do FAROL20 notas

quinta-feira, 25 de junho de 2026

Modelos

Modelo aberto chinês GLM-5.2 baixa a barreira para ciberataques, alertam pesquisadores

Pesquisadores de segurança alertam que o GLM-5.2 (open weights, licença MIT, do laboratório chinês Zhipu/zai-org) torna capacidades avançadas de hacking muito mais baratas e acessíveis. Avaliações independentes (Graphistry, Semgrep) colocam o modelo no mesmo nível de modelos de fronteira dos EUA em benchmarks de cibersegurança, por cerca de metade do custo. Por ser open-weight, ele pode ser baixado, ter as travas de segurança removidas e ser fine-tunado localmente — fóruns em russo já discutem como fazer jailbreak. É o ângulo quente do debate sobre modelos abertos de fronteira: o trade-off entre acesso/inovação e risco de uso ofensivo. No Hugging Face, o GLM-5.2 é hoje o modelo de geração de texto nº 1 em trending.

Modelos · axios · glm-5-2, zhipu, zai-org, modelo-aberto, open-weights, ciberseguranca

Anthropic acusa Alibaba (Qwen) da maior campanha de destilação já vista contra o Claude — 25 mil contas falsas e 28,8 mi de trocas

A Anthropic disse a senadores e a autoridades da Casa Branca que operadores ligados ao laboratório Qwen, da Alibaba, conduziram a maior campanha de "destilação" já registrada contra uma empresa de IA dos EUA: cerca de 25.000 contas fraudulentas geraram mais de 28,8 milhões de trocas com o Claude entre 22/04 e 05/06/2026, mirando especificamente as capacidades de engenharia de software e raciocínio agêntico do modelo. É a primeira vez que a Anthropic nomeia um grande conglomerado chinês — acusações anteriores (fevereiro) miraram DeepSeek, MiniMax e Moonshot (~16 mi de trocas via ~24 mil contas falsas). Os senadores Bill Hagerty e Andy Kim planejam emenda à lei de defesa para sancionar empresas chinesas que acessem indevidamente outputs de modelos dos EUA. A Alibaba não comentou.

Modelos · thenextweb · anthropic, claude, alibaba, qwen, destilacao, distillation

Mistral lança OCR 4: document AI self-hosted, 170 idiomas e saída 'citation-ready' para RAG

A Mistral lançou (23/06/2026) o OCR 4, modelo de document intelligence que roda totalmente na infraestrutura do próprio cliente (sem enviar dados sensíveis para nuvem de terceiros). Cobre 170 idiomas, devolve bounding boxes por bloco, classificação de tipo de bloco e scores de confiança por página/palavra — saída "citation-ready" para pipelines de RAG, busca agêntica e enterprise. Disponível via API da Mistral, Amazon SageMaker e Microsoft Foundry, com opção self-hosted. Avaliadores independentes preferem o OCR 4 a todo sistema líder testado (win rate médio ~72%) e ele lidera o OlmOCRBench (85,20). Preço: US$ 4 / 1.000 páginas (US$ 2 com Batch API).

Modelos · mistral · mistral, ocr, document-ai, rag, self-hosted, soberania-de-dados

Ornith-1.0 (DeepReinforce): modelo aberto de código que aprende a escrever o próprio scaffold de RL e supera o Claude Opus 4.7 no SWE-Bench Verified

A DeepReinforce abriu (MIT) a família Ornith-1.0 de modelos de código — variantes 9B densa, 31B densa, 35B MoE e um carro-chefe 397B MoE — construídas sobre Gemma 4 e Qwen 3.5. A inovação central é o RL "auto-scaffolding": em vez de um harness de treino desenhado à mão, o modelo gera tanto a solução quanto o próprio scaffold de RL, que co-evolui com a política. O 397B reporta 82,4 no SWE-Bench Verified e 62,2 no SWE-Bench Pro — acima do Claude Opus 4.7 (80,8 Verified) e de pares abertos como MiniMax M3 e DeepSeek-V4-Pro. Lançado em 25/jun, disparou no trending do Hugging Face no fim de semana (variantes GGUF Ornith-1.0-9B/35B entre as mais quentes).

Modelos · marktechpost · ornith, deepreinforce, modelo-aberto, coding-agent, reinforcement-learning, self-scaffolding

Google adia o Gemini 3.5 Pro para julho enquanto o êxodo de talentos pressiona a linha Gemini

Segundo reportagem da Business Insider (replicada por Reuters e outros), o Google adiou a disponibilidade geral do Gemini 3.5 Pro de junho para julho de 2026. A empresa estaria revisando feedback de testers e refinando código, eficiência de tokens e desempenho em tarefas longas antes do lançamento. O modelo segue em teste interno e preview limitado no Vertex AI, enquanto o irmão menor (Gemini 3.5 Flash) já está disponível. O Google "declinou comentar" o novo cronograma. O atraso ocorre na mesma semana da debandada de pesquisadores sênior do DeepMind/Gemini para a Anthropic, reforçando a percepção de pressão competitiva frente a OpenAI (GPT-5.6) e Anthropic.

Modelos · businessinsider · google, gemini-3-5-pro, atraso, lancamento, llm, talentos

Qwen publica AgentWorld-35B-A3B: world model aberto para simulação de ambientes de agentes

A Qwen publicou no Hugging Face (22/06/2026) o AgentWorld-35B-A3B, um modelo aberto (MoE, base Qwen3.5-35B-A3B, licença Apache-2.0) voltado a "world models" — simulação de ambientes para treinar e avaliar agentes. Vem acompanhado do dataset AgentWorldBench e do relatório técnico (arXiv 2606.24597). Subiu rápido no trending da Hub, reforçando o eixo de "modelos de mundo" para agentes que apareceu também em conversas de comunidade nesta semana.

Modelos · huggingface · qwen, world-model, agentes, simulacao, open-weights, moe

Ferramentas e código

Conta-regressiva do MCP 2026-07-28: nova análise detalha o que muda na autenticação de agentes (RC já noticiado em maio/junho)

Nota: o próprio release candidate da spec MCP 2026-07-28 já foi noticiado na base (23/05 e 03/06). O que há de NOVO na janela é uma onda de análises detalhadas (ex.: WorkOS, 25/06) à medida que o prazo final — 28/07 — se aproxima e SDKs/servidores precisam se preparar. O recado técnico: o protocolo-base vira STATELESS (removem-se sessões e o handshake de inicialização, então qualquer instância atende qualquer requisição, rodando atrás de load balancer round-robin simples) e a AUTORIZAÇÃO é endurecida — seis SEPs alinham o MCP ao OAuth 2.1/OpenID Connect na prática, com validação obrigatória do parâmetro `iss` por RFC 9207 (SEP-2468). Há ~10 semanas entre o RC e o final para validar contra cargas reais.

Ferramentas e código · workos · mcp, model-context-protocol, agentes, stateless, oauth, autenticacao

General Intuition capta US$ 320 mi (val. US$ 2,3 bi) para treinar agentes com dados de gameplay

Spin-out da Medal, a General Intuition levantou US$ 320 mi a uma avaliação de US$ 2,3 bi — rodada liderada pela Khosla Ventures, com Jeff Bezos, Eric Schmidt e General Catalyst — chegando a US$ 454 mi totais. A tese: clips de gameplay em primeira pessoa, rotulados com as ações (quais botões o jogador apertou e quando), ensinam raciocínio espaço-temporal que transfere para robótica e veículos autônomos. Um robô quadrúpede teria navegado um escritório após apenas 8 minutos de fine-tuning no mundo real.

Ferramentas e código · techcrunch · general-intuition, funding, agentes, robotica, world-model, medal

Patronus AI capta US$ 50 mi (Série B) e lança 'Digital World Models' para estressar agentes

A Patronus AI anunciou uma Série B de US$ 50 mi (liderada pela Greenfield Partners; com Lightspeed, Datadog e Samsung), elevando o total a US$ 70 mi, e lançou os "Digital World Models": ambientes de simulação em larga escala que replicam interfaces de sites e ferramentas internas para treinar e avaliar agentes de longo horizonte antes da produção. Fundada por ex-pesquisadores de IA da Meta (Anand Kannappan e Rebecca Qian), a empresa diz ter crescido a receita 15x no último ano, com praticamente todo lab de fronteira como cliente.

Ferramentas e código · techcrunch · patronus-ai, funding, avaliacao-de-agentes, simulacao, digital-world-models, confiabilidade

Newsletter LangChain (junho/2026): copiloto on-call no Fleet, computer use para agentes e RubricMiddleware para Deep Agents

A LangChain publicou (25/06) sua atualização mensal. Destaques: um copiloto on-call no Fleet para triagem de alertas que percorre código, traces e runbooks; "computer use" (computador virtual isolado) para agentes; debugging de voice traces com player de áudio inline; e o RubricMiddleware, que faz Deep Agents avaliarem o próprio trabalho contra critérios definidos e iterarem até cumprir — com subagentes despachados a partir do código do interpretador para paralelizar e sintetizar resultados. Há ainda tracking de progresso ao vivo de experimentos no LangSmith, um curso de Deployment e a possibilidade de plugar áudio a qualquer agente LangGraph sem reconstruir o grafo. Reforça a tese de "harness" (auto-avaliação + orquestração) acima das bibliotecas-base.

Ferramentas e código · langchain · langchain, langsmith, deep-agents, rubricmiddleware, fleet, on-call

Simon Willison converte o MDN browser-compat-data em SQLite servido por CDN (montado com agentes de código)

Inspirado pelo novo MDN MCP server da Mozilla, Simon Willison converteu o repositório mdn/browser-compat-data (~66 MB) num banco SQLite servido via CDN do GitHub com CORS aberto. O pipeline (conversão + GitHub Actions) foi montado com uma combinação de agentes de código rodando lado a lado — Claude Code for web (Opus 4.8) e Codex Desktop (GPT-5.5). É um caso prático e replicável de "MCP + agentes de código gerando pipeline de dados", e mostra o fluxo multi-modelo na prática.

Ferramentas e código · simonwillison · simon-willison, sqlite, mcp, claude-code, codex, mdn

Pesquisa

Semgrep: GLM-5.2 supera o Claude Code em detecção de vulnerabilidades — mas o scaffolding importa mais que o modelo

Em benchmark próprio de detecção de vulnerabilidades, a Semgrep mediu o GLM-5.2 (modelo aberto) com 39% de F1 na detecção de IDOR, batendo o Claude Code (32%) por 7 pontos, a cerca de US$ 0,17 por vulnerabilidade encontrada. A lição principal, porém, é outra: o pipeline multimodal proprietário da própria Semgrep, rodando num harness dedicado, supera ambos os modelos (53–61% F1). Ou seja, a orquestração (scaffolding) ao redor do modelo faz mais diferença que a troca do modelo em si — evidência concreta para o debate de "context engineering" e harness em tarefas agênticas de segurança.

Pesquisa · semgrep · semgrep, glm-5-2, claude-code, benchmark, ciberseguranca, idor

Mercado

Qualcomm compra a Modular por ~US$ 3,9 bi e mira o fosso do CUDA da Nvidia

A Qualcomm confirmou em 24/06/2026 a aquisição da Modular — criadora da linguagem Mojo e da plataforma de inferência MAX — por cerca de US$ 3,9 bilhões em ações. A Modular faz a camada de software que roda modelos de IA de forma eficiente em hardware de múltiplos fornecedores (Nvidia, AMD, Intel) sem reescrever código, atacando diretamente o maior fosso competitivo da Nvidia: o ecossistema CUDA. O negócio leva ~150 funcionários e os cofundadores Chris Lattner (criador do LLVM e do Swift) e Tim Davis; fechamento previsto para o 2º semestre de 2026, sujeito a aprovação regulatória.

Mercado · bloomberg · qualcomm, modular, mojo, max, chris-lattner, cuda

Comunidade

OpenAI e Broadcom revelam 'Jalapeño', o primeiro chip próprio da OpenAI (inferência de LLM)

A OpenAI apresentou, junto com a Broadcom, o "Jalapeño" — seu primeiro acelerador de IA próprio, desenhado do zero exclusivamente para inferência de LLM. Do design ao tape-out em apenas 9 meses (que a OpenAI chama de um dos ciclos de ASIC de ponta mais rápidos já feitos), o chip já roda cargas em laboratório na frequência/potência-alvo de produção, incluindo o GPT-5.3-Codex-Spark. Promete desempenho por watt "substancialmente melhor" que o estado da arte atual, com primeiro deploy previsto para o fim de 2026 e data centers em escala de gigawatts (com Microsoft e outros parceiros). É o passo mais concreto da OpenAI rumo à verticalização "full-stack".

Comunidade · openai · openai, broadcom, jalapeno, chip, inferencia, hardware

IBM revela o 1º chip sub-1nm do mundo (0,7nm 'nanostack') — fôlego para o compute de IA

A IBM apresentou (25/06) a primeira tecnologia de chip sub-1 nanômetro do mundo: nó de 0,7 nm (7 angstrom) com arquitetura 3D "nanostack" que empilha transistores em vez de só encolhê-los. São ~100 bilhões de transistores numa pastilha do tamanho de uma unha (~2x a densidade do chip de 2nm de 2021), com até +50% de desempenho OU -70% de consumo. Apresentado no VLSI 2026; caminho para produção estimado em ~5 anos. A IBM amarra o avanço às "demandas de largura de banda das cargas avançadas de IA".

Comunidade · ibm · hardware, semicondutores, ibm, nanostack, lei-de-moore, compute-ia

SpaceX fecha deal de compute de até US$ 6,3 bi com a Reflection AI (Colossus 2)

A SpaceX assinou com a startup de IA open-source Reflection AI um contrato de compute de até US$ 6,3 bi (US$ 150 mi/mês a partir de 01/07, somando ~US$ 6,3 bi até 2029) por acesso a chips Nvidia GB300 no data center Colossus 2 (Memphis). O movimento consolida o Colossus como "landlord" de compute, que já tem Anthropic (US$ 1,25 bi/mês), Google (US$ 920 mi/mês) e Cursor. Fato de 22/06 (CNBC/Bloomberg/TechCrunch) capturado agora — não havia sido registrado nas varreduras anteriores.

Comunidade · cnbc · infraestrutura, compute, spacex, colossus, reflection-ai, open-weights

Hassabis (DeepMind) responde à fuga de talentos em Cannes: 'o Google ainda está vencendo a guerra por talentos de IA

Em entrevistas no palco de Cannes Lions (23-24/06), Demis Hassabis rebateu a narrativa de êxodo do DeepMind — após as saídas de Noam Shazeer (→OpenAI) e do Nobel John Jumper (→Anthropic), que chegaram a derrubar a ação do Google até ~7%. Ele afirma que o Google tem "a maior e mais ampla bancada de pesquisa de qualquer laboratório" e cita o acesso a TPUs como trunfo de recrutamento. Numa peça irmã, comenta a ligação entre IA para arte e IA para ciência. É a resposta direta do CEO ao tema mais quente da semana (a guerra de talentos Google × Anthropic/OpenAI).

Comunidade · semafor · demis-hassabis, deepmind, google, gemini, talentos, anthropic

Hacker News mede o ceticismo dev com IA: 'por que o HN é tão anti-IA?' e 'qual seu stack/workflow de IA?' viram termômetro

Duas threads no topo do Hacker News (25/06) funcionam como retrato do sentimento dev atual sobre IA. Em "por que a turma do HN é tão anti-IA?", o consenso emergente é menos rejeição e mais fadiga com output bagunçado e expectativas infladas: workflows importam mais que demos, a verificação é o gargalo, "skills batem prompts" e orquestrar fluxos limitados (com humano supervisor) entrega mais que autonomia bruta. Em paralelo, "qual é seu tech stack/workflow de IA?" coleta práticas reais — manter as regras do projeto perto do repositório, codificar workflows repetíveis como skills/instruções locais, prompts curtos e específicos e preservar contexto em sessões longas. Bom mapa de context engineering aplicado.

Comunidade · hackernews · hacker-news, comunidade, agentes, workflows, context-engineering, ceticismo

Assort Health levanta US$ 120 mi (Série C) e sinaliza giro do VC para 'IA de produção' em saúde

A Assort Health captou US$ 120 mi em Série C (Menlo, Lightspeed, Felicis, First Round, Chemistry, Tau, Quiet Capital, entre outros), chegando a ~US$ 222 mi totais. O aporte faz parte de uma leva de investimento de 24/06 concentrada em "IA de produção" — sistemas que tomam decisões reais (roteiam pacientes, movem dinheiro, governam agentes), e não apenas demos. É um termômetro do apetite de funding em verticais regulados, numa janela em que IPOs seguem travados.

Comunidade · techstartups · funding, venture-capital, assort-health, saude, ia-de-producao, agentes

Karpathy diz que o X 'nunca esteve tão tóxico'; Musk concorda e pede 'revisão completa do algoritmo

Andrej Karpathy (agora na Anthropic) postou que o X "nunca esteve tão tóxico e parecido com o Reddit", atribuindo o problema ao algoritmo de recomendação. Elon Musk respondeu publicamente concordando: "precisamos de uma revisão completa do algoritmo". O episódio acontece em meio ao debate, levantado pelo próprio Karpathy, de tratar o Claude como uma entidade/"harness" de nível organizacional, e reacendeu a discussão sobre toxicidade de plataforma e otimização por engajamento via RL.

Comunidade · americanbazaar · andrej-karpathy, elon-musk, x, algoritmo, anthropic, engajamento