Radar do FAROL15 notas

segunda-feira, 8 de junho de 2026

Modelos

WWDC 2026 hoje: Siri reconstruída no Gemini e Extensions multi-modelo (Claude/Gemini/ChatGPT)

No keynote de hoje (10h PT) — o último de Tim Cook como CEO — a Apple reapresenta a Siri rodando sobre um Gemini customizado de 1,2T de parâmetros (licença ~US$1bi/ano) e estreia um sistema de Extensions que deixa o usuário escolher qual IA processa os recursos do Apple Intelligence: ChatGPT, Gemini ou Claude, cada uma com voz própria. Gemini é o default e encerra a exclusividade da OpenAI no iPhone.

Modelos · web · apple, wwdc, siri, gemini, claude, openai

Gemini 3.5 Pro perto do GA em junho: 2M de tokens e modo Deep Think

Apresentado no Google I/O (19/5), o Gemini 3.5 Pro deve chegar à disponibilidade geral neste mês com janela de 2 milhões de tokens e modo de raciocínio Deep Think. Pichai pediu 'mais um mês' no palco; o modelo deve sair primeiro nas assinaturas Pro (US$20) e Ultra (US$250), esta última com o Deep Think exclusivo.

Modelos · web · google, gemini, deep-think, contexto-longo, multimodal

Xiaomi publica MiMo-V2.5-Pro em FP4 com 'DFlash' (block diffusion + decodificação especulativa)

A Xiaomi liberou no Hugging Face o MiMo-V2.5-Pro em quantização FP4 com a variante 'DFlash', que combina block diffusion e decodificação especulativa para acelerar a inferência. O modelo (licença MIT) é voltado a uso agêntico, código e contexto longo, e entra na onda de modelos abertos chineses otimizados para rodar localmente com menor custo de hardware.

Modelos · huggingface.co · xiaomi, mimo, open-weights, fp4, block-diffusion, agentico

Ferramentas e código

xAI emplaca Grok no governo dos EUA (US$0,42/agência) e lança Connectors com MCP

A GSA assinou um acordo OneGov de 18 meses com a xAI dando a todas as agências federais acesso ao Grok 4 e Grok 4 Fast por US$0,42 por agência (até março/2027) — o contrato de IA mais longo do governo até agora. Em paralelo, a xAI lançou Connectors no Grok Web (SharePoint, Outlook, OneDrive, Google Workspace, Notion, GitHub, Linear + MCP próprio).

Ferramentas e código · web · xai, grok, governo, gsa, onegov, mcp

OpenAI lança ChatGPT Lockdown Mode: restringe browsing, agente e downloads para uso corporativo

Junto com o update de memória Dreaming V3, a OpenAI lançou o ChatGPT Lockdown Mode: quando ativo, restringe capacidades em rede — navegação ao vivo, deep research, modo agente, downloads de arquivo e parte da geração de imagem via web. Usuários ativam em Configurações > Segurança; admins de workspace controlam por papéis.

Ferramentas e código · web · openai, chatgpt, seguranca, enterprise, privacidade, agent-mode

Simon Willison lança datasette-agent-edit e sandbox MicroPython+WASM

Em sequência de releases no início de junho, Simon Willison publicou o datasette-agent-edit e o micropython-wasm — um interpretador MicroPython compilado para WebAssembly como sandbox de execução de código gerado por LLM. Padrão emergente de execução segura e isolada para agentes.

Ferramentas e código · web · datasette, agentes, sandbox, micropython, wasm, context-engineering

Modelos de fronteira da OpenAI e o Codex chegam à AWS (ao lado do Claude no Bedrock)

A OpenAI anunciou (2/jun) que seus modelos de fronteira e o Codex agora rodam na AWS: clientes enterprise acessam GPT-5.5, Codex e a API da OpenAI pela infra e billing que já têm — do mesmo jeito que acessam o Claude via Amazon Bedrock. A AWS passa a hospedar todos os principais modelos de fronteira.

Ferramentas e código · web · openai, aws, codex, gpt-5.5, bedrock, enterprise

Pesquisa

Paper 'Code as Agent Harness': código como infraestrutura unificada de agentes

Com 213 upvotes no HF, o paper argumenta que LLMs viram cada vez mais o substrato operacional para raciocínio e execução de agentes, com código servindo como camada de infraestrutura unificada entre domínios (planejamento, memória, uso de ferramentas, controle por feedback, coordenação multi-agente, DevOps, workflows enterprise).

Pesquisa · arxiv · agentes, harness, context-engineering, llm, pesquisa

ContextBench: benchmark de recuperação de contexto em coding agents

O ContextBench avalia recuperação de contexto em agentes de coding com análise orientada a processo. Conclusão provocativa: designs de agente mais avançados trazem ganhos limitados no uso de contexto, e há um gap claro entre a informação explorada e a efetivamente utilizada (recall, precision e eficiência de contexto).

Pesquisa · arxiv · coding-agents, context-engineering, benchmark, rag, avaliacao

Less Context, Better Agents: poda de contexto para agentes que usam ferramentas

Estudo mostra que respostas verbosas de ferramentas causam overflow de contexto, erros de estado defasado e custo alto em agentes empresariais. Testando quatro configurações de GPT-5 num benchmark de 50 tarefas de itemização de despesas via MCP no Dynamics 365, poda para os últimos 5 pares de tool call/response (com sumarização) melhora desempenho e reduz custo — 'menos contexto, agentes melhores'.

Pesquisa · arXiv · agentes, context-engineering, mcp, poda-de-contexto, custo

Comunidade

Anthropic faz alerta raro: IA pode se auto-aperfeiçoar sem supervisão; pede 'pedal de freio

A Anthropic emitiu um aviso público raro de que seus sistemas avançam rápido demais e podem em breve ser capazes de auto-aperfeiçoamento sem supervisão humana, e pediu à indústria um 'pedal de freio' — salvaguardas técnicas que freiem um modelo que comece a se melhorar a um ritmo que humanos não conseguem monitorar. Junto com a OpenAI, pediu mais salvaguardas ao Congresso.

Comunidade · web · anthropic, seguranca, alignment, self-improving, governanca, regulacao

Pentágono acelera substituição do Claude no Maven e testa OpenAI, Google e Grok

Nova escalada: após a Anthropic recusar remover salvaguardas contra vigilância em massa e armas autônomas, o secretário Hegseth designou a empresa como risco de cadeia de suprimentos e o DoD passou a testar OpenAI, Google e Grok (xAI) com 25 power-users para substituir o Claude no Maven Smart System. A Anthropic contesta na Justiça, alegando perda de bilhões em receita. Prazo de 6 meses para desligamento — complexo, dado o quão embutido o Claude está nas redes classificadas.

Comunidade · web · anthropic, claude, pentagono, maven, defesa, governanca

LeCun × Hassabis: embate público sobre o que é 'inteligência geral

Reacende o debate de fundamentos: Yann LeCun sustenta que LLMs nunca chegarão à inteligência humana e que é preciso uma abordagem diferente; Demis Hassabis prevê AGI por volta de 2030. Uma edição dupla da revista Dædalus sobre 'IA e Ciência' traz entrevistas dos dois sobre compressibilidade computacional.

Comunidade · web · lecun, hassabis, agi, debate, fundamentos

Corrida de IPOs de IA: SpaceX (com xAI) precifica em 11/jun e estreia como SPCX em 12/jun

O roadshow do IPO da SpaceX fechou a 1ª semana (até 6/jun); precificação marcada para 11/jun e estreia na Nasdaq sob o ticker SPCX em 12/jun, mirando ~US$75 bi a valuation de US$1,75+ tri (potencial maior IPO da história). 30% do float vai a Robinhood/Fidelity/Schwab. xAI consumiu ~US$14 bi de caixa contra US$3,2 bi de receita. Em paralelo, OpenAI finaliza papelada de IPO (set/2026) e Anthropic mira out/2026.

Comunidade · web · ipo, spacex, xai, openai, anthropic, mercado

Alphabet busca capital fresco sob pressão de 4 semanas de queda nas ações

A Alphabet busca capital novo em meio a quatro semanas seguidas de queda nas ações. O sell-off mistura dúvidas sobre o Gemini frente a Claude Opus 4.8 e GPT-5.5, capex crescente de infra de IA e pressão do EU AI Office. Pano de fundo: o deal Apollo/Blackstone de US$36 bi em crédito privado para comprar TPUs do Google em nome da Anthropic sinaliza disputa pela própria infra do Google.

Comunidade · web · google, alphabet, gemini, mercado, capex, tpu