Pesquisadores de segurança alertam que o GLM-5.2 (open weights, licença MIT, do laboratório chinês Zhipu/zai-org) torna capacidades avançadas de hacking muito mais baratas e acessíveis. Avaliações independentes (Graphistry, Semgrep) colocam o modelo no mesmo nível de modelos de fronteira dos EUA em benchmarks de cibersegurança, por cerca de metade do custo. Por ser open-weight, ele pode ser baixado, ter as travas de segurança removidas e ser fine-tunado localmente — fóruns em russo já discutem como fazer jailbreak. É o ângulo quente do debate sobre modelos abertos de fronteira: o trade-off entre acesso/inovação e risco de uso ofensivo. No Hugging Face, o GLM-5.2 é hoje o modelo de geração de texto nº 1 em trending.
A Anthropic disse a senadores e a autoridades da Casa Branca que operadores ligados ao laboratório Qwen, da Alibaba, conduziram a maior campanha de "destilação" já registrada contra uma empresa de IA dos EUA: cerca de 25.000 contas fraudulentas geraram mais de 28,8 milhões de trocas com o Claude entre 22/04 e 05/06/2026, mirando especificamente as capacidades de engenharia de software e raciocínio agêntico do modelo. É a primeira vez que a Anthropic nomeia um grande conglomerado chinês — acusações anteriores (fevereiro) miraram DeepSeek, MiniMax e Moonshot (~16 mi de trocas via ~24 mil contas falsas). Os senadores Bill Hagerty e Andy Kim planejam emenda à lei de defesa para sancionar empresas chinesas que acessem indevidamente outputs de modelos dos EUA. A Alibaba não comentou.
A Mistral lançou (23/06/2026) o OCR 4, modelo de document intelligence que roda totalmente na infraestrutura do próprio cliente (sem enviar dados sensíveis para nuvem de terceiros). Cobre 170 idiomas, devolve bounding boxes por bloco, classificação de tipo de bloco e scores de confiança por página/palavra — saída "citation-ready" para pipelines de RAG, busca agêntica e enterprise. Disponível via API da Mistral, Amazon SageMaker e Microsoft Foundry, com opção self-hosted. Avaliadores independentes preferem o OCR 4 a todo sistema líder testado (win rate médio ~72%) e ele lidera o OlmOCRBench (85,20). Preço: US$ 4 / 1.000 páginas (US$ 2 com Batch API).
A DeepReinforce abriu (MIT) a família Ornith-1.0 de modelos de código — variantes 9B densa, 31B densa, 35B MoE e um carro-chefe 397B MoE — construídas sobre Gemma 4 e Qwen 3.5. A inovação central é o RL "auto-scaffolding": em vez de um harness de treino desenhado à mão, o modelo gera tanto a solução quanto o próprio scaffold de RL, que co-evolui com a política. O 397B reporta 82,4 no SWE-Bench Verified e 62,2 no SWE-Bench Pro — acima do Claude Opus 4.7 (80,8 Verified) e de pares abertos como MiniMax M3 e DeepSeek-V4-Pro. Lançado em 25/jun, disparou no trending do Hugging Face no fim de semana (variantes GGUF Ornith-1.0-9B/35B entre as mais quentes).
Segundo reportagem da Business Insider (replicada por Reuters e outros), o Google adiou a disponibilidade geral do Gemini 3.5 Pro de junho para julho de 2026. A empresa estaria revisando feedback de testers e refinando código, eficiência de tokens e desempenho em tarefas longas antes do lançamento. O modelo segue em teste interno e preview limitado no Vertex AI, enquanto o irmão menor (Gemini 3.5 Flash) já está disponível. O Google "declinou comentar" o novo cronograma. O atraso ocorre na mesma semana da debandada de pesquisadores sênior do DeepMind/Gemini para a Anthropic, reforçando a percepção de pressão competitiva frente a OpenAI (GPT-5.6) e Anthropic.
A Qwen publicou no Hugging Face (22/06/2026) o AgentWorld-35B-A3B, um modelo aberto (MoE, base Qwen3.5-35B-A3B, licença Apache-2.0) voltado a "world models" — simulação de ambientes para treinar e avaliar agentes. Vem acompanhado do dataset AgentWorldBench e do relatório técnico (arXiv 2606.24597). Subiu rápido no trending da Hub, reforçando o eixo de "modelos de mundo" para agentes que apareceu também em conversas de comunidade nesta semana.
Nota: o próprio release candidate da spec MCP 2026-07-28 já foi noticiado na base (23/05 e 03/06). O que há de NOVO na janela é uma onda de análises detalhadas (ex.: WorkOS, 25/06) à medida que o prazo final — 28/07 — se aproxima e SDKs/servidores precisam se preparar. O recado técnico: o protocolo-base vira STATELESS (removem-se sessões e o handshake de inicialização, então qualquer instância atende qualquer requisição, rodando atrás de load balancer round-robin simples) e a AUTORIZAÇÃO é endurecida — seis SEPs alinham o MCP ao OAuth 2.1/OpenID Connect na prática, com validação obrigatória do parâmetro `iss` por RFC 9207 (SEP-2468). Há ~10 semanas entre o RC e o final para validar contra cargas reais.
Spin-out da Medal, a General Intuition levantou US$ 320 mi a uma avaliação de US$ 2,3 bi — rodada liderada pela Khosla Ventures, com Jeff Bezos, Eric Schmidt e General Catalyst — chegando a US$ 454 mi totais. A tese: clips de gameplay em primeira pessoa, rotulados com as ações (quais botões o jogador apertou e quando), ensinam raciocínio espaço-temporal que transfere para robótica e veículos autônomos. Um robô quadrúpede teria navegado um escritório após apenas 8 minutos de fine-tuning no mundo real.
Ferramentas e código · techcrunch · general-intuition, funding, agentes, robotica, world-model, medal
A Patronus AI anunciou uma Série B de US$ 50 mi (liderada pela Greenfield Partners; com Lightspeed, Datadog e Samsung), elevando o total a US$ 70 mi, e lançou os "Digital World Models": ambientes de simulação em larga escala que replicam interfaces de sites e ferramentas internas para treinar e avaliar agentes de longo horizonte antes da produção. Fundada por ex-pesquisadores de IA da Meta (Anand Kannappan e Rebecca Qian), a empresa diz ter crescido a receita 15x no último ano, com praticamente todo lab de fronteira como cliente.
A LangChain publicou (25/06) sua atualização mensal. Destaques: um copiloto on-call no Fleet para triagem de alertas que percorre código, traces e runbooks; "computer use" (computador virtual isolado) para agentes; debugging de voice traces com player de áudio inline; e o RubricMiddleware, que faz Deep Agents avaliarem o próprio trabalho contra critérios definidos e iterarem até cumprir — com subagentes despachados a partir do código do interpretador para paralelizar e sintetizar resultados. Há ainda tracking de progresso ao vivo de experimentos no LangSmith, um curso de Deployment e a possibilidade de plugar áudio a qualquer agente LangGraph sem reconstruir o grafo. Reforça a tese de "harness" (auto-avaliação + orquestração) acima das bibliotecas-base.
Inspirado pelo novo MDN MCP server da Mozilla, Simon Willison converteu o repositório mdn/browser-compat-data (~66 MB) num banco SQLite servido via CDN do GitHub com CORS aberto. O pipeline (conversão + GitHub Actions) foi montado com uma combinação de agentes de código rodando lado a lado — Claude Code for web (Opus 4.8) e Codex Desktop (GPT-5.5). É um caso prático e replicável de "MCP + agentes de código gerando pipeline de dados", e mostra o fluxo multi-modelo na prática.
Em benchmark próprio de detecção de vulnerabilidades, a Semgrep mediu o GLM-5.2 (modelo aberto) com 39% de F1 na detecção de IDOR, batendo o Claude Code (32%) por 7 pontos, a cerca de US$ 0,17 por vulnerabilidade encontrada. A lição principal, porém, é outra: o pipeline multimodal proprietário da própria Semgrep, rodando num harness dedicado, supera ambos os modelos (53–61% F1). Ou seja, a orquestração (scaffolding) ao redor do modelo faz mais diferença que a troca do modelo em si — evidência concreta para o debate de "context engineering" e harness em tarefas agênticas de segurança.
A Qualcomm confirmou em 24/06/2026 a aquisição da Modular — criadora da linguagem Mojo e da plataforma de inferência MAX — por cerca de US$ 3,9 bilhões em ações. A Modular faz a camada de software que roda modelos de IA de forma eficiente em hardware de múltiplos fornecedores (Nvidia, AMD, Intel) sem reescrever código, atacando diretamente o maior fosso competitivo da Nvidia: o ecossistema CUDA. O negócio leva ~150 funcionários e os cofundadores Chris Lattner (criador do LLVM e do Swift) e Tim Davis; fechamento previsto para o 2º semestre de 2026, sujeito a aprovação regulatória.
Mercado · bloomberg · qualcomm, modular, mojo, max, chris-lattner, cuda
A OpenAI apresentou, junto com a Broadcom, o "Jalapeño" — seu primeiro acelerador de IA próprio, desenhado do zero exclusivamente para inferência de LLM. Do design ao tape-out em apenas 9 meses (que a OpenAI chama de um dos ciclos de ASIC de ponta mais rápidos já feitos), o chip já roda cargas em laboratório na frequência/potência-alvo de produção, incluindo o GPT-5.3-Codex-Spark. Promete desempenho por watt "substancialmente melhor" que o estado da arte atual, com primeiro deploy previsto para o fim de 2026 e data centers em escala de gigawatts (com Microsoft e outros parceiros). É o passo mais concreto da OpenAI rumo à verticalização "full-stack".
Comunidade · openai · openai, broadcom, jalapeno, chip, inferencia, hardware
A IBM apresentou (25/06) a primeira tecnologia de chip sub-1 nanômetro do mundo: nó de 0,7 nm (7 angstrom) com arquitetura 3D "nanostack" que empilha transistores em vez de só encolhê-los. São ~100 bilhões de transistores numa pastilha do tamanho de uma unha (~2x a densidade do chip de 2nm de 2021), com até +50% de desempenho OU -70% de consumo. Apresentado no VLSI 2026; caminho para produção estimado em ~5 anos. A IBM amarra o avanço às "demandas de largura de banda das cargas avançadas de IA".
Comunidade · ibm · hardware, semicondutores, ibm, nanostack, lei-de-moore, compute-ia
A SpaceX assinou com a startup de IA open-source Reflection AI um contrato de compute de até US$ 6,3 bi (US$ 150 mi/mês a partir de 01/07, somando ~US$ 6,3 bi até 2029) por acesso a chips Nvidia GB300 no data center Colossus 2 (Memphis). O movimento consolida o Colossus como "landlord" de compute, que já tem Anthropic (US$ 1,25 bi/mês), Google (US$ 920 mi/mês) e Cursor. Fato de 22/06 (CNBC/Bloomberg/TechCrunch) capturado agora — não havia sido registrado nas varreduras anteriores.
Comunidade · cnbc · infraestrutura, compute, spacex, colossus, reflection-ai, open-weights
Em entrevistas no palco de Cannes Lions (23-24/06), Demis Hassabis rebateu a narrativa de êxodo do DeepMind — após as saídas de Noam Shazeer (→OpenAI) e do Nobel John Jumper (→Anthropic), que chegaram a derrubar a ação do Google até ~7%. Ele afirma que o Google tem "a maior e mais ampla bancada de pesquisa de qualquer laboratório" e cita o acesso a TPUs como trunfo de recrutamento. Numa peça irmã, comenta a ligação entre IA para arte e IA para ciência. É a resposta direta do CEO ao tema mais quente da semana (a guerra de talentos Google × Anthropic/OpenAI).
Comunidade · semafor · demis-hassabis, deepmind, google, gemini, talentos, anthropic
Duas threads no topo do Hacker News (25/06) funcionam como retrato do sentimento dev atual sobre IA. Em "por que a turma do HN é tão anti-IA?", o consenso emergente é menos rejeição e mais fadiga com output bagunçado e expectativas infladas: workflows importam mais que demos, a verificação é o gargalo, "skills batem prompts" e orquestrar fluxos limitados (com humano supervisor) entrega mais que autonomia bruta. Em paralelo, "qual é seu tech stack/workflow de IA?" coleta práticas reais — manter as regras do projeto perto do repositório, codificar workflows repetíveis como skills/instruções locais, prompts curtos e específicos e preservar contexto em sessões longas. Bom mapa de context engineering aplicado.
Comunidade · hackernews · hacker-news, comunidade, agentes, workflows, context-engineering, ceticismo
A Assort Health captou US$ 120 mi em Série C (Menlo, Lightspeed, Felicis, First Round, Chemistry, Tau, Quiet Capital, entre outros), chegando a ~US$ 222 mi totais. O aporte faz parte de uma leva de investimento de 24/06 concentrada em "IA de produção" — sistemas que tomam decisões reais (roteiam pacientes, movem dinheiro, governam agentes), e não apenas demos. É um termômetro do apetite de funding em verticais regulados, numa janela em que IPOs seguem travados.
Comunidade · techstartups · funding, venture-capital, assort-health, saude, ia-de-producao, agentes
Andrej Karpathy (agora na Anthropic) postou que o X "nunca esteve tão tóxico e parecido com o Reddit", atribuindo o problema ao algoritmo de recomendação. Elon Musk respondeu publicamente concordando: "precisamos de uma revisão completa do algoritmo". O episódio acontece em meio ao debate, levantado pelo próprio Karpathy, de tratar o Claude como uma entidade/"harness" de nível organizacional, e reacendeu a discussão sobre toxicidade de plataforma e otimização por engajamento via RL.
Comunidade · americanbazaar · andrej-karpathy, elon-musk, x, algoritmo, anthropic, engajamento