Radar do FAROL22 notas

segunda-feira, 22 de junho de 2026

Modelos

OpenAI expande Daybreak: 'Patch the Planet', GPT-5.5-Cyber completo e plugin de segurança no Codex

A OpenAI ampliou sua iniciativa de cibersegurança Daybreak com o lançamento completo do GPT-5.5-Cyber, um plugin de segurança no Codex (encontra, valida e corrige vulnerabilidades) e o programa 'Patch the Planet', feito com Trail of Bits e HackerOne, que já reúne 30+ projetos open-source (cURL, Go, Python, Sigstore) para ir de descoberta a correção de vulnerabilidades em velocidade de máquina.

Modelos · web · openai, daybreak, cybersecurity, gpt-5-5-cyber, codex, vulnerabilidades

GLM-5.2 vira (quase) self-hostável: Unsloth publica GGUFs e Interconnects chama de 'step change' para agentes abertos

A conversa da comunidade open-weights nesta janela gira em torno de rodar a GLM-5.2 localmente: a Unsloth quantizou o modelo (1,51 TB) para GGUFs de ~217-238 GB usando importance matrix, e o post 'How to Run Locally' subiu no Hacker News. Em paralelo, a Interconnects (Nathan Lambert) chama a GLM-5.2 de 'step change' para agentes abertos — o primeiro open-weight que 'parece certo' em harnesses de código, com a Z.ai sinalizando um modelo classe 'Open Fable' até dezembro.

Modelos · web · glm-5-2, open-weights, unsloth, gguf, local-llm, agentes

Baidu publica Unlimited-OCR: modelo aberto de visão-linguagem para OCR multilíngue

A Baidu publicou no Hugging Face o 'Unlimited-OCR' (criado em 19/06), um modelo aberto de visão-linguagem voltado a OCR multilíngue, entre os trending da janela. Mais um sinal do empurrão chinês em modelos abertos de extração documental, na esteira de PaddleOCR-VL e do datalab-to/lift.

Modelos · huggingface · baidu, ocr, vision-language, open-weights, image-text-to-text, huggingface

Datalab lança 'lift': modelo aberto (base Qwen3.5) para extração estruturada de PDFs e documentos

Novo modelo image-text-to-text baseado em Qwen3.5, voltado a extrair dados estruturados (JSON) de PDFs e documentos; publicado em 19/06 e entre os modelos em alta no HuggingFace na janela.

Modelos · web · open-weights, extracao-de-documentos, pdf, qwen, ocr, dados-estruturados

Ferramentas e código

Post viral: o 'Extended Thinking' exibido no Claude Code é um resumo, não o raciocínio real

Post de Patrick McCanna (253 pontos no Hacker News) argumenta que o texto mostrado sob 'Extended Thinking' no Claude Code (ctrl+o) é um RESUMO do raciocínio do modelo, não a cadeia de pensamento literal que dirigiu as ações — coerente com a doc oficial, que diz que a API devolve um resumo dos thinking tokens, não os tokens crus. Alerta prático para quem promete um 'audit trail' baseado nesse texto.

Ferramentas e código · web · claude-code, extended-thinking, transparencia, audit-trail, anthropic, hacker-news

AWS lança Continuum e Context no Summit NY: segurança agêntica e contexto de dados governado para agentes

No AWS Summit NY, a AWS apresentou dois serviços para agentes: Continuum, gestão de vulnerabilidades AI-native que detecta, prioriza por impacto, prova exploitabilidade e remedia em 'learn mode'; e Context, que monta um knowledge graph dos dados da empresa para busca agêntica governada em runtime.

Ferramentas e código · web · aws, agentes, seguranca, knowledge-graph, contexto, runtime

OpenAI publica 'Codex-Maxxing for Long-Running Work': guia de agentic coding de longo horizonte

A OpenAI publicou em 22/06 um guia prático (assinado por Jason Liu) sobre usar o Codex como um 'workspace persistente' que preserva contexto ao longo de fluxos de trabalho de escala-projeto — quebrando metas em passos verificáveis e decidindo quando delegar vs. manter supervisão humana. Conecta-se ao GPT-5.1-Codex-Max e a recursos de controle remoto, sinalizando aposta da OpenAI em coding agêntico durável — o mesmo território do Claude Code.

Ferramentas e código · web · openai, codex, agentic-coding, long-horizon, context-engineering, gpt-5-1-codex-max

OpenAI lança usage analytics e spend controls para ChatGPT Enterprise (e Codex), com Cost API unificada

O Global Admin Console passa a unificar o consumo de créditos de ChatGPT e Codex por usuário, produto e modelo; admins definem limite padrão por workspace, limites por grupo e overrides individuais; a mesma base fica disponível via Cost API para análise nos sistemas da empresa.

Ferramentas e código · web · openai, chatgpt-enterprise, codex, custos, governanca, cost-api

Tendência no GitHub: enxame de skills que emulam o comportamento 'Fable' no Claude Code

Com a Fable 5 offline, o GitHub está se enchendo de skills/plugins para Claude Code que tentam reproduzir o 'comportamento Fable' no Opus — planejamento multi-estágio explícito, delegação a sub-agentes e auto-verificação. Repos como fable-mode, fablize e fusion-fable acumulam centenas de estrelas, sinalizando demanda por disciplina agêntica reproduzível enquanto o modelo de fronteira segue inacessível.

Ferramentas e código · github · claude-code, skills, fable, opus, agentic, github-trending

Samsung Electronics implanta ChatGPT + Codex para seus funcionários

A Samsung Electronics está distribuindo ChatGPT e Codex para seus funcionários, segundo a OpenAI (21/06) — uma grande expansão de assentos enterprise/dev numa fabricante de hardware emblemática, em meio à competição acirrada no ecossistema de IA da Coreia.

Ferramentas e código · web · openai, samsung, chatgpt, codex, enterprise, coreia

Simon Willison lança sqlite-utils 4.0rc1: sistema de migrations e transações aninhadas

Primeiro release candidate da v4 do sqlite-utils incorpora um sistema de migrations (antes o projeto separado sqlite-migrate) e suporte a transações aninhadas — ferramenta-base no fluxo de dados de muitos projetos e devs de IA.

Ferramentas e código · web · sqlite, sqlite-utils, ferramentas, dados, python, simon-willison

Pesquisa

SelfCompact: agentes que decidem sozinhos quando compactar o próprio contexto

Traços longos de agentes (cadeias de raciocínio + chamadas de ferramentas) acumulam conteúdo obsoleto que "envenena" as próximas gerações e estoura a janela de contexto. Os scaffolds atuais compactam em intervalos fixos por limiar de tokens, descartando resultados parciais no meio de derivações. O SelfCompact combina uma ferramenta de compactação que o próprio modelo invoca com uma rubrica leve sobre QUANDO disparar (subtarefa resolvida) e quando suprimir (no meio de uma derivação ou quando travado), sem nenhum fine-tuning. Segundo os autores, iguala ou supera a sumarização de intervalo fixo gastando menos tokens, com ganhos em raciocínio matemático e busca agêntica. 10 upvotes no HF Papers.

Pesquisa · arxiv · arxiv, agentes, context-engineering, compactacao, contexto-longo, eficiencia

Tmax: uma receita aberta e simples de RL para agentes de terminal (Ai2/UW)

Time do Ai2/UW (Hamish Ivison, Nathan Lambert, Hannaneh Hajishirzi e outros) apresenta a Tmax, descrita como uma receita aberta e simples de RL para treinar agentes de terminal (linha de comando). A sacada é a geração barata de ambientes de treino via uma taxonomia que combina controle de dificuldade, personas e diversificação de verificadores, com um recurso "outcome-only" avaliado no Terminal-Bench 2.0. Segundo os autores, modelos menores treinados com a receita superam modelos bem maiores de trabalhos anteriores, e o trabalho é posicionado como aberto/reproduzível. 8 upvotes no HF Papers.

Pesquisa · arxiv · arxiv, agentes, terminal, rl, open-weights, ai2

Training Open Models for Agentic Phone Use (PhoneBuddy): agentes de celular com modelos abertos

Trabalho sobre treinar modelos ABERTOS para uso agêntico de smartphone — agentes de GUI móvel que operam apps via percepção visual e planejamento de múltiplos passos. A proposta, PhoneBuddy, combina ambientes de app reais e "mock" (o ambiente PhoneWorld) e mistura supervised fine-tuning com reinforcement learning para elevar a taxa de sucesso em tarefas, avaliada no AndroidWorld. Entra na onda recente de mobile-use agents abertos (OpenMobile, MobileRL), empurrando a automação de celular para fora dos modelos proprietários. 9 upvotes no HF Papers.

Pesquisa · arxiv · arxiv, agentes, gui, mobile, androidworld, rl

Sam Altman em Stanford: 'uma geração de pesquisadores atrasou a IA ao subestimar o scaling

Em palestra em Stanford, Altman afirmou que toda uma geração de pesquisadores 'segurou' a IA ao subestimar o que o scaling poderia fazer (citando LeCun), disse que LLMs já superam humanos em algumas áreas e afirmou que um modelo da OpenAI recém-refutou uma conjectura matemática.

Pesquisa · web · openai, sam-altman, scaling, agi, debate, matematica

Estudo UC Berkeley: IA inflou notas de alunos, sinal de trabalho terceirizado e não de mais aprendizado

Análise de ~500 mil notas em Berkeley mostra salto de ~13 pontos percentuais em conceitos 'A' após o ChatGPT, concentrado em tarefas de casa de escrita e código; apresentações orais não mudaram — indicando trabalho terceirizado à IA, não mais aprendizado.

Pesquisa · web · educacao, ia-na-educacao, avaliacao, integridade-academica, llms

Reuters Institute Digital News Report 2026: uso semanal de chatbots de IA para notícias sobe de 7% para 10%

Uso semanal de chatbots de IA para notícias subiu de 7% para 10% no último ano, puxado por Ásia, África, América Latina e Europa do Sul/Leste; só 1% têm IA como fonte principal, jovens lideram (17%), e a confiança nas notícias via chatbot é de 20% (vs. 37% de confiança nas notícias em geral).

Pesquisa · web · chatbots, jornalismo, confianca, consumo-de-noticias, llms, publishers

Estudo Black Duck: 97% dos devs usam IA para código; Claude Code chega a 63%, mas só 30% têm governança

Survey com 831 engenheiros (mar/2026, UserEvidence p/ Black Duck): 97% usam ferramentas de IA para código, com GitHub Copilot em 83% e Claude Code em 63% das equipes; só 30% têm governança completa, as ferramentas devolvem ~8h/semana, mas 64% temem que introduzam falhas de segurança.

Pesquisa · web · claude-code, copilot, adocao, governanca, seguranca, devs

MIT Technology Review: startup afirma ter quebrado um gargalo que trava os LLMs

A MIT Technology Review (19/06) perfila uma startup que afirma ter alcançado um avanço arquitetural sobre um gargalo de eficiência/escala que há tempos limita os LLMs. Bastante compartilhada em círculos de pesquisa como a história 'isso é real?' da semana — o tipo de alegação ousada que a comunidade gosta de estressar adversarialmente.

Pesquisa · web · llm, eficiencia, escala, arquitetura, pesquisa, claim

Mercado

Jane Street fecha US$ 6 bi de nuvem de IA com a CoreWeave e investe US$ 1 bi em equity

A firma de trading quantitativo Jane Street assinou um acordo de US$ 6 bilhões de nuvem de IA com a CoreWeave e fez um aporte de US$ 1 bilhão em equity, garantindo compute de próxima geração (NVIDIA Vera Rubin) e ampliando sua aposta em infraestrutura de IA.

Mercado · web · infraestrutura, coreweave, jane-street, compute, nvidia, neoclouds

Regulação e segurança

Five Eyes faz alerta conjunto raro: modelos de IA capazes de 'derrubar governos' a meses de distância

Em declaração conjunta rara, as agências de inteligência de sinais dos Five Eyes (EUA, Reino Unido, Austrália, Canadá e Nova Zelândia) afirmaram que modelos capazes de derrubar governos e empresas estão a 'meros meses' de distância — pela primeira vez nomeando um modelo de fronteira (a Claude Fable, da Anthropic) como ameaça soberana iminente. A saga do banimento da Fable 5/Mythos 5 ganha assim uma camada formal de segurança nacional.

Regulação e segurança · web · anthropic, fable-5, mythos, seguranca-nacional, five-eyes, export-controls

Comunidade

Andrew Ng (The Batch #358): controles de exportação e lock-in da Anthropic vão acelerar IA soberana e open-source

Na carta The Batch #358 (19/06), Andrew Ng argumenta que a Anthropic restringir seu modelo top somada aos controles de exportação dos EUA que a forçaram a desativar a 'Fable' no mundo todo foram uma 'demonstração crua de poder' — um momento 'cruzamos o Rubicão' que vai acelerar esforços globais de IA soberana e open-source.

Comunidade · web · andrew-ng, the-batch, export-controls, ia-soberana, open-source, anthropic