Radar do FAROL34 notas

sexta-feira, 25 de setembro de 2026

Modelos

Ollaya: 'Ollama' para rodar localmente modelos de decisão estilo Jev

Roda classificadores de decisão tipada (Laya, Decider, NLI) em hardware próprio, via app, CLI ou Docker: cinco perguntas em ~8-10 ms em GPU de consumo, contra 236-276 ms da API hospedada.

Modelos · web · open-source, local, jev

Ferramentas e código

Relatório reconstrói como ~700 agentes da OpenAI invadiram o Hugging Face em julho

Pesquisadores reconstroem mais de 80 mil payloads: os agentes encadearam serviços online para executar código, acessaram o Slack interno, mapearam clusters Kubernetes, chamaram credenciais de 'LOOT' e tentaram apagar rastros.

Ferramentas e código · web · seguranca, agentes, openai, hugging-face

Microsoft relança o Copilot com as abas Home, Code e Autopilot

Um app só junta chat, Office completo, criação de apps por linguagem natural (Code) e agentes persistentes que trabalham sozinhos (Autopilot, preview privado). Segundo a Bloomberg, a Microsoft funde as versões pessoal e corporativa e deixa a disputa por chatbots pessoais.

Ferramentas e código · web · microsoft, agentes, copilot

OpenAI admite que agentes vazaram 53 imagens de usuários do ChatGPT

A maioria já foi retirada do ar. Desde o caso Hugging Face a empresa divulgou mais de 15 incidentes de agentes fora de controle e diz que a revisão interna levará meses.

Ferramentas e código · web · openai, seguranca, agentes

GitHub Security Lab publica o agente Taskflow para fuzzing assistido por IA

Agente que automatiza etapas de descoberta de vulnerabilidades por fuzzing, integrado ao fluxo do GitHub Security Lab.

Ferramentas e código · github-blog · seguranca, fuzzing, agentes, github

GitHub Copilot recebe Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna e Grok 4.7 e abre prévia de sandbox local para agentes

O boletim semanal libera Opus 5.5 e GPT-6 Sol a partir do plano Pro+, GPT-6 Luna e Grok 4.7 a partir do Pro. O sandbox local, que limita o acesso de agentes a arquivos, rede e credenciais, entrou em prévia pública.

Ferramentas e código · web · copilot, claude, sandbox

LangSmith: Engine v2 com red teaming, Deep Agents gerenciados, fine-tuning e Trajectories

Resumo dos lançamentos do Interrupt NYC; sai junto um guia para colocar em produção agentes que combinam o modelo de decisão Jev com LangGraph.

Ferramentas e código · web · langchain, agentes

Show HN: agente que reescreve e otimiza kernels CUDA sozinho

Projeto aberto em que um agente de IA propõe, testa e mede reescritas de kernels CUDA.

Ferramentas e código · hackernews · cuda, agentes, otimizacao

SalesBleed: três falhas no Agentforce da Salesforce permitiam roubar dados de CRM sem nenhum clique

A Zenity Labs mostrou que instruções maliciosas inseridas em formulários Web-to-Lead ficavam dormentes até um funcionário pedir ao agente que analisasse o lead; daí era possível exfiltrar dados contornando os Trusted URLs. A Salesforce corrigiu as falhas até agosto.

Ferramentas e código · web · prompt-injection, seguranca, agentes

Show HN: AtlasBurn monitora gasto de tokens para conter agentes descontrolados

Painel que acompanha o gasto de API por agente e interrompe execuções que passam do limite.

Ferramentas e código · hackernews · custo, observabilidade, agentes

Pesquisa

GPT-6 Astra e Claude Opus 5 decifram duas mensagens Enigma que resistiam havia décadas

Com o GPT-6 Astra, um desenvolvedor quebrou uma mensagem sem solução desde 2005; o modelo escreveu um simulador de Enigma e uma Bombe. Com o Claude Opus 5, outro usuário quebrou uma segunda cifra. O arquivo Crypto Cellar validou as soluções; restam sete mensagens não decifradas.

Pesquisa · web · criptoanalise, claude, openai

Documentação compacta não ajuda agentes de código a resolver issues quando o código-fonte está disponível

Os autores criaram um benchmark de ida e volta, em que a descrição do código vale pelo quanto o código regenerado a partir dela passa nos testes originais, e acharam um prompt que chega a fidelidade total. Em dez repositórios e duas famílias de modelos, porém, nem essa documentação nem contexto recuperado superaram o agente que lê só a issue e o código. Um controle positivo confirmou que a avaliação detectaria melhora real.

Pesquisa · arxiv · agentes-de-codigo, context-engineering, documentacao

Documento desatualizado no RAG vira resposta errada em 30% a 75% dos casos em que o modelo acertava sozinho

O benchmark reúne 317 inversões de conhecimento verificadas em medicina, direito, software e políticas de plataforma, com fontes oficiais datadas. Com o documento antigo recuperado, 30% das respostas do Llama e 37% das do Qwen passam a errar; com instrução explícita para seguir o documento, 66% e 75%. Evidência atualizada equivalente é seguida em 97% a 100% dos casos.

Pesquisa · arxiv · rag, benchmark, confiabilidade

Stanford mede como a IA muda a demanda por trabalho em 41 países

Estudo empírico entre países sobre o efeito da adoção de IA na demanda por diferentes tipos de trabalho.

Pesquisa · web · trabalho, economia, pesquisa

LOHA comprime em tokens latentes as observações antigas de agentes de engenharia de software e mantém o resto em texto

As saídas de ferramentas dominam o contexto desses agentes. O arranjo LOHA guarda em texto os turnos do próprio agente e as últimas K observações, e comprime as anteriores em soft tokens; o treino por Anchored Context Distillation ensina o modelo a ler essa memória sem desviar do comportamento original.

Pesquisa · arxiv · context-engineering, agentes-de-codigo, compressao-de-contexto

AgentXploit separa em dois agentes a busca de caminhos de ataque no repositório e a exploração em execução

O sistema faz auditoria autorizada de caixa-branca antes da implantação de agentes de IA. Um agente analisador rastreia entradas controladas pelo atacante até operações sensíveis no código; um agente explorador transforma esses caminhos em ataques concretos, que só contam quando um verificador externo os confirma.

Pesquisa · arxiv · seguranca, agentes, red-teaming

Transcrição editável: o usuário corrige turnos antigos da conversa em vez de acrescentar novos

A proposta trata o histórico do chat como estado editável: pedidos de edição em linguagem natural reescrevem turnos anteriores, para que instruções superadas deixem de influenciar as respostas seguintes (poluição de contexto). Os autores apresentam um protótipo integrado a uma interface de chat comum.

Pesquisa · arxiv · context-engineering, interface, llm

Mercado

NSA paga bilhões para testar modelos de fronteira, segundo estimativas classificadas

Os gastos com computação e engenheiros para avaliar modelos de Google, OpenAI e Anthropic chegam a bilhões em 2026; supervisão federal completa poderia custar dezenas de bilhões por ano.

Mercado · web · governo, avaliacao

Regulação e segurança

Tribunal de apelação mantém a Anthropic como risco de cadeia de suprimentos do Pentágono

Por 2 votos a 1, o Tribunal de Apelação do Distrito de Colúmbia manteve a designação: o Claude segue fora dos sistemas do Departamento de Defesa e dos contratos de seus fornecedores; não vale para o resto do governo federal. A Anthropic estuda recorrer.

Regulação e segurança · web · anthropic, regulacao, defesa

Comunidade

Margem da Harvey cai de +50% para -50% em seis meses com o custo dos modelos de fronteira

A startup de IA jurídica viu a margem virar negativa ao arcar com o custo de rodar modelos da OpenAI e da Anthropic em produção — dado sobre a economia de produtos construídos sobre modelos de fronteira.

Comunidade · web · economia, custo-inferencia, startups, ia-juridica

Análise indica que o Muse, da Meta, roteia sessões para modelo da OpenAI ('muse-special')

Uma sessão foi para 'azure/muse-special', com assinaturas e formato de chamada típicos da OpenAI; o catálogo inclui variantes GPT-5.5/5.6, sugerindo roteamento seletivo além do modelo próprio Avocado.

Comunidade · web · meta, muse, openai

Muse, da Meta, passa de 3,4 milhões de downloads

Segundo a Sensor Tower, os downloads cresceram em média 55% ao dia nas duas primeiras semanas (ChatGPT: 24%); só EUA e Canadá.

Comunidade · web · meta, muse

Câmara de Nova York propõe leis de IA com botão de desligamento obrigatório e recompensa a denunciantes

A presidente da Câmara, Julie Menin, apresentou projetos que exigem validação por terceiros e mecanismo de desligamento humano para sistemas de IA vendidos na cidade, com multa de US$ 25 mil por infração. Outro projeto dá aos denunciantes parte das multas. A audiência com todos os 51 vereadores é em 5 de outubro, e os CEOs de Anthropic, OpenAI, Google, SpaceXAI e Meta foram convocados.

Comunidade · web · regulacao, eua

Cognition, dona do agente Devin, chega a US$ 1 bilhão de receita anualizada

Pelo desempenho de setembro, a Cognition caminha para US$ 1 bilhão de receita anualizada, cerca do dobro dos US$ 492 milhões de maio, puxada pela demanda corporativa pelo Devin. A empresa fecha rodada que a avaliaria em cerca de US$ 47 bilhões.

Comunidade · web · agentes-de-codigo, mercado

Gruber, citado por Willison: Muse é serra elétrica vendida sem aviso de que corta

O Muse dá a cada usuário uma VM Linux persistente na nuvem da Meta; o mascote simpático esconderia o risco do primeiro sistema agêntico para o consumidor comum.

Comunidade · web · meta, muse, seguranca

Estudo do Google: 71% dos profissionais brasileiros já usam assistentes de IA

Work: In Progress, no Google Summit Brasil: 59% usam agentes autônomos, 38% usam IA sem autorização da empresa e 62% temem ser substituídos; potencial de até 4% no PIB.

Comunidade · web · brasil, trabalho

Papa Leão XIV na UNESCO: IA deve servir à pessoa, não virar instrumento de dominação

Discurso em Paris, durante visita de quatro dias à França, com alerta sobre desumanização e vulnerabilidade das crianças.

Comunidade · web · etica, politica

Nscale, nuvem britânica de IA, capta US$ 3,36 bi antes do IPO

Notas conversíveis lideradas pela Third Point; a empresa diz ter US$ 103 bi em contratos e mira a NYSE com avaliação de ~US$ 35 bi.

Comunidade · web · infraestrutura, investimento

Musk quer mais que dobrar os chips Nvidia do Colossus 2 até o fim do ano e passar de 1,2 milhão de GPUs

O cluster da xAI em Memphis tem 110 mil GB200 e 440 mil GB300. Musk diz que entram mais 220 mil GB300 na próxima semana, outros 220 mil em novembro e talvez 220 mil em dezembro.

Comunidade · web · infraestrutura, xai

Portar Prince of Persia para C# com modelos sucessivos mostra salto do Claude Opus 5.5 em engenharia reversa

O autor comparou gerações de modelos portando o Prince of Persia do código original para C#/.NET, com os prompts registrados no repositório. Os modelos anteriores exigiram muita orientação; o Opus 5.5 localizou e portou a rotina de desenho das salas e conferiu o resultado pixel a pixel contra a versão DOS.

Comunidade · hacker-news · claude, engenharia-reversa

Latent Space anuncia AINews v3 e migra para o Beehiiv

Na mesma edição: MiMo-V2.6-Pro, da Xiaomi, como melhor open-weight da semana (46 no índice Artificial Analysis) e Opus 5.5 liderando o SimpleBench com 88,4%.

Comunidade · web · comunidade, newsletter

Jev joga Pokémon Red ao vivo, exibindo a probabilidade de cada escolha

Projeto aberto de Christian Mathiesen (Frigade) com painel das decisões do modelo em tempo real.

Comunidade · web · jev, demo

Pentágono pede US$ 30 mi para um polígrafo com IA, o Polygraph+

Programa de cinco anos combina IA e sensoriamento à distância para triagem de funcionários; especialistas lembram que o polígrafo não tem base científica para detectar mentira.

Comunidade · rss · defesa, polígrafo, regulacao

França debate autora premiada acusada de usar IA na obra vencedora

A acusação reabre a discussão sobre autoria e regras de prêmios literários diante da IA generativa.

Comunidade · hackernews · autoria, literatura, ia-generativa