Keynote do Google I/O 2026 começa hoje às 10h PT (14h BRT). Confirmados: nova versão do Gemini (provável 4.0, ou salto de tier), agentic coding como linha narrativa central, preview oficial dos Android XR glasses, debut do Aluminium OS (merge Android + ChromeOS, com primeiros Googlebooks da Acer/Asus/Dell/HP/Lenovo no fall) e Android 17. Pressão extra porque o Gemini ficou atrás de Mythos (Anthropic) e GPT-5.5 nos benchmarks recentes.
Google lançou Gemini 3.5 Flash hoje no I/O 2026. Bate Gemini 3.1 Pro em Terminal-Bench 2.1 (76.2% vs 70.3%), MCP Atlas (83.6% vs 78.2%), Finance Agent v2 (57.9% vs 43.0%) e GDPval-AA (1656 vs 1314 Elo). Trail em MRCR v2 e Humanity's Last Exam, onde conhecimento bruto pesa. Roda ~4x mais rápido em tok/s e custa 40% menos: US$1.50/M input, US$9.00/M output. Já está em produção em todo lugar onde o Google entrega Gemini — incluindo como motor padrão do AI Mode no Search. Gemini 3.5 Pro foi empurrado para junho. Sinal claro: Google bancando o Flash como cavalo de batalha de agentes.
Mistral anunciou a nova família Mistral 3 de modelos open-source multilíngues e multimodais, otimizada para a stack NVIDIA (do supercomputing ao edge). O Mistral Large 3 é um MoE com 41B parâmetros ativos sobre 675B totais e janela de contexto de 256K. Em paralelo, a casa lançou a suíte compacta Ministral 3 (nove modelos) preparada para rodar em NVIDIA Spark, RTX e Jetson — empurrando a "inteligência distribuída do cloud à borda". Disponível em plataformas open e cloud providers, com chegada prevista como NVIDIA NIM microservices.
Anthropic anunciou ontem (18/05) que vai revisar a NDA do Project Glasswing — parceiros (Amazon, Microsoft, Nvidia, Apple e outros) que usam o Claude Mythos Preview para fins de cibersegurança defensiva agora podem compartilhar achados de vulnerabilidade com times de segurança de outras empresas, órgãos da indústria, reguladores, mantenedores open-source, mídia e público, sujeito a normas de responsible disclosure. Resposta direta à pressão de pesquisadores que reclamavam que as cláusulas de confidencialidade originais bloqueavam alertas a quem estava exposto às mesmas falhas.
Spark é um agente pessoal proativo movido a Gemini 3.5 Flash, rodando em Google Cloud (não precisa do dispositivo ligado). Integra nativamente com Gmail, Calendar, Drive, Docs, Sheets, Slides, YouTube, Maps. Conecta via MCP a Canva, OpenTable e Instacart já no lançamento. Pode ser invocado por e-mail enviado pra um endereço Gmail dedicado. Usa o Chrome do usuário pra tarefas web. Em rollout para trusted testers esta semana e Beta US para Google AI Ultra na próxima. Direta concorrência ao OpenClaw/ChatGPT Agents.
O que era leak vira release. Gemini Omni Flash lançou hoje, rodando dentro do Flow e Flow Music para assinantes Google AI Plus, depois YouTube Shorts essa semana. Combina Gemini com Veo, Nano Banana e Genie — recebe texto + imagem + áudio + vídeo no mesmo prompt e raciocina entre eles antes de gerar o output. Hassabis chamou de 'passo rumo à AGI' e 'world model que entende e simula o mundo'. Clipes Flash capados em 10s — Google diz que é decisão de deploy, não limite do modelo. Feature mais arriscada (provavelmente geração de pessoas) ficou de fora desse ciclo.
Anthropic e KPMG fecharam aliança global e lançaram o "KPMG Digital Gateway Powered by Claude". Todos os 276.000+ funcionários da KPMG no mundo passam a ter acesso ao Claude, e o modelo é embarcado dentro da plataforma de entrega de cliente da firma — começando por Tax & Legal, depois expandindo para outras linhas de advisory. Implementação completa sobre Microsoft Azure até setembro/2026. A Anthropic também nomeou a KPMG parceira preferencial para Private Equity — vão construir produtos Claude-powered para portfolio de PE.
Anthropic anunciou duas features de privacidade/segurança no Managed Agents: MCP Tunnels (agentes acessam MCP servers dentro da rede privada do cliente sem expor à internet pública) e Self-Hosted Sandboxes (execução de código em ambiente do próprio cliente em vez de infra Anthropic). É o counter-strike direto ao Spark+Gemini do Google e responde à objeção #1 do enterprise: 'meus dados não saem'. Vem junto com Fast Mode em Claude Opus 4.7 e SEC filings ricos no web search tool.
Gemini está rolando uma nova opção 'Thinking level' no model picker para Gemini 3 Flash e 3.1 Pro: 'Standard' para tarefas comuns e 'Extended' para tarefas complexas (mais tempo de raciocínio). Auto-switch entre tiers quando a demanda do Pro está alta. Em paralelo, documentação interna sinaliza chegada de extensões oficiais para Canva (workflow criativo), Instacart (lista de compras) e OpenTable (reservas via Reserve with Google) — feature drop calculado às vésperas do I/O.
ByteDance Research lançou 'Lance' em 15/05 — modelo multimodal unificado nativo de apenas 3B parâmetros ativos que suporta image+video understanding, generation e editing dentro de um framework único. Treinado from scratch com budget de 128 A100s usando staged multi-task recipe. Licença Apache 2.0 (comercialmente usável). Trending score 137 no HF (top 10) com 171 downloads e 138 likes na primeira semana, sinalizando interesse de startups por compactness + permissive license.
Google está chamando de 'maior upgrade do Search em quase 30 anos'. A barra de busca foi reimaginada: expande dinamicamente, antecipa intent, sugere refinamentos com IA além de autocomplete. Aceita texto, imagens, arquivos, vídeos ou abas do Chrome como input (multimodal). A partir do verão US, usuários poderão criar 'information agents' que rastreiam mudanças na web 24/7 e alertam. Tudo movido por Gemini 3.5 Flash, agora motor padrão do AI Mode globalmente. TechCrunch resume: 'Google Search as you know it is over'.
Anunciado no Dell Technologies World, em Las Vegas — o Codex passa a ser distribuído via Dell AI Data Platform e Dell AI Factory para clientes que não podem mandar dado para o cloud público (financeiro, saúde, governo). É a primeira jogada explícita da OpenAI em distribuição enterprise híbrida / on-prem. O Codex já tem 4M+ desenvolvedores semanais e começa a sair do nicho "coding agent" para casos como roteamento de feedback de produto, qualificação de leads e coordenação de tarefas multi-sistema.
Google lançou Antigravity 2.0 — desktop app standalone agent-first, agora separado do navegador, com CLI, SDK, Managed Agents na Gemini API e Gemini Enterprise Agent Platform. Stitch ganhou modo colaborativo em tempo real com agente: design ao vivo + export pro Antigravity ou publish direto pro Netlify. Stack completo design→logic→deploy num único loop. Cursor / Lovable / Vercel v0 vão sentir.
Notion virou plataforma de desenvolvedor: lançou Workers (deploy de código custom), External Agent API (conexão com agentes externos) e Database Sync para automatizar workflows multi-passo dentro do app. Movimento estratégico pra não virar 'frontend de IA dos outros' — quer ser o substrato onde agentes rodam. Concorre com Zapier MCP, n8n e Replit Agents. Para usuários BR de Notion (incluindo MOSE), abre caminho pra automações nativas sem orquestrador externo.
Junto com o Lance (modelo), ByteDance Seed abriu o VeOmni — framework de treinamento any-modality que destrava treinar modelos com qualquer combinação de modalidades (texto, imagem, vídeo, áudio). Repete a jogada de 'modelo + receita' que a comunidade já viu com Llama 4 + torchtune. Sinaliza que ByteDance quer disputar não só o stack de modelo, mas o stack de TREINO open. Combinado com o Lance, vira plataforma para quem quer treinar um multimodal próprio sem reinventar pipeline.
Ferramentas e código · ByteDance Seed blog · bytedance, veomni, training-framework, multimodal, open-source
Padrão pi-autoresearch (Karpathy + David Cortés/Shopify) continua se espalhando. PR do Tobi Lütke no Liquid template engine (claim de -53% no parse+render via auto-research loop) segue não-merged neste fim de semana, com revisores alegando overfit no benchmark. Primeiro caso de auto-research loop de CEO virando estudo de caso público de como agentes podem produzir PRs grandes mas com claims duvidosos. Simon Willison vem documentando dia-a-dia.
Ferramentas e código · TechTimes / Simon Willison · karpathy, shopify, tobi-lutke, auto-research, ai-prs, code-review
Paper publicado na Nature em 13/05 (com circulação esta semana) descreve técnica para edição de longo-prazo de circuitos cerebrais em mamíferos. Time da Duke usou conexinas 34.7 e 35 do peixe Morone americana (white perch), engenheiradas via mutagênese para que os hemicanais se encaixem só entre si — sem interagir com conexinas mamíferas naturais. Resultado: em vez de reparar sinapses danificadas, o método cria um 'bypass elétrico' novo entre neurônios específicos. Validado em C. elegans e camundongos, com mudanças mensuráveis em comportamento social e resposta a estresse. Abre caminho terapêutico para desordens neurológicas sem alterar conexões existentes.
Pesquisa · Nature / Duke School of Medicine · neuroscience, synthetic-biology, brain-circuits, connexins, nature, duke
Pesquisadores do CISPA Helmholtz Center for Information Security (Alemanha) publicaram em março/2026 — com cobertura ampliando esta semana — o primeiro audit sistemático de 17 'shadow APIs' que prometem acesso a modelos oficiais (Claude, GPT, Gemini) sem restrições regionais. Achados: model substitution (paga pelo flagship, recebe small/cheap), version arbitrage (gateway move tráfego pra versão antiga sem avisar). As 17 APIs foram usadas em 187 artigos acadêmicos — a mais popular tem 5.966 citações e 58.639 stars no GitHub. Põe em xeque a reprodutibilidade de quase 200 papers que dependiam de outputs estáveis.
Pesquisa · arXiv / CISPA Helmholtz Center / The Hacker News · security, shadow-api, model-substitution, cispa, audit, academic-integrity
Paper 'Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models' (arXiv 2510.04618, com update 29/03/2026) propõe tratar contextos como playbooks evolutivos — acumulam, refinam e organizam estratégias via processo modular de generation, reflection e curation. Ganhos reportados: +10.6% em benchmarks de agentes, +8.6% em finance. Adapta-se sem labels supervisionados, usando feedback de execução natural. No leaderboard AppWorld, ACE empata com o top agente de produção no overall e supera no split test-challenge — usando modelo open-source menor.
Novo paper propõe a DashAttention — esquema de atenção esparsa hierárquica totalmente diferenciável que usa α-entmax adaptativa para selecionar um número variável de blocos por query no estágio 1, alimentando como prior o softmax do estágio 2. Diferente de outros métodos hierárquicos, é "non-dispersive" — melhor modelagem de contexto longo. Em LLMs, alcança acurácia comparável à atenção densa com 75% de sparsity, supera NSA e InfLLMv2 no Pareto frontier (sobretudo em alta sparsity) e tem implementação Triton GPU-aware que acelera inferência sobre FlashAttention-3.
Paper viabiliza treinar 3D Gaussian Splatting com mais de 1 bilhão de primitivas numa GPU única usando hierarquia SSD-CPU-GPU, pipeline assíncrono e streaming diferencial. Destrava reconstrução de cenas urbanas inteiras com fidelidade de varredura LIDAR — caso de uso direto em robótica, AR/VR e mapeamento. Continuou no topo de HF Papers no fim de semana.
Google Threat Intelligence Group (GTIG) disclosou em 11/05 (com cobertura ampliando ontem) o primeiro caso confirmado de atacantes usando um modelo de IA para construir um exploit zero-day deployado in-the-wild — um bypass de 2FA contra ferramenta open-source de administração web amplamente usada. Falha vinha de um 'if-this-trust-it' hard-coded; scanners tradicionais não pegariam porque o código está funcionalmente correto, só estrategicamente quebrado. Telltales de código gerado por IA: ANSI color classes 'limpas demais', prompts educacionais, CVSS score fabricado, help menus detalhados. Google patcheu junto com o vendor antes do deploy em massa.
Comunidade · The Hacker News / SecurityWeek · security, google-gtig, ai-generated-exploit, zero-day, 2fa-bypass, ai-attack
Andrej Karpathy, co-fundador da OpenAI e líder de IA na Tesla, se junta à Anthropic para trabalhar em pesquisa e desenvolvimento. Seu foco: usar Claude para acelerar pesquisa de pré-treinamento e push em direção à auto-melhoria recursiva.
Comunidade · CNBC, Gizmodo, The VC Corner · - Anthropic
Google + Samsung preview oficial dos primeiros 'Intelligent Eyewear' rodando Android XR — pareria com Warby Parker e Gentle Monster (couleur fashion). Primeira geração é audio-only: sem display nas lentes, output via speakers e câmera pro agente. Live translation, navegação, summaries de notificação. Launch confirmado pra outono 2026. Em paralelo, XREAL Project Aura — primeiras AR glasses globais com Android XR, com display, launch global ainda em 2026. Essa é a aposta do Google em comoditizar a categoria contra Meta Orion, Ray-Ban Meta, Apple Vision.
Comunidade · androidauthority · google, samsung, android-xr, smart-glasses, warby-parker, gentle-monster
Boston Dynamics publicou ontem 18/05 detalhes técnicos de como treinou o Atlas para tarefas industriais pesadas: reinforcement learning + simulação em escala massiva com variações absurdas do objeto (ex: 'simulei o levantamento da geladeira em milhares de variações dela'). Atlas levanta até 50kg, gira o torso 180 graus, agacha, opera entre -20°C e 40°C, é resistente a água para washdowns industriais, e a maioria das tarefas é ensinada em menos de um dia. Já está em trial na nova planta da Hyundai na Georgia (EUA), separando autonomamente racks de teto para linha de montagem.
Comunidade · Interesting Engineering / Boston Dynamics blog · boston-dynamics, atlas, humanoid, robotics, reinforcement-learning, hyundai
Em março, Karpathy abriu repo de 3 arquivos encodando o pattern 'autoresearch': dê a um coding agent um arquivo editável, um evaluator frozen, e um scalar metric — rode loop keep-or-revert overnight. Bateu 80k stars em abril. Tobi Lütke (CEO Shopify) usou pi-autoresearch (extensão da Pi do David Cortés) num PR de 93 commits que reivindica 53% speed-up — mas o PR ainda não foi merged e está flagged como provavelmente overfit no evaluator. Simon Willison documentou em tempo real. O caso virou estudo de 'autoresearch precisa de evaluator robusto', não só do pattern.
Comunidade · techtimes · karpathy, autoresearch, shopify, lutke, overfit, evaluation