Radar do FAROL31 notas

terça-feira, 29 de setembro de 2026

Modelos

OpenAI lança o GPT-6.1 Sol a US$ 2 e US$ 10 por milhão de tokens, cerca de um quinto do preço do Astra

O GPT-6.1 Sol atualiza o GPT-6 Sol com foco em programação com agentes, uso de computador e trabalho profissional; na API custa US$ 2 por milhão de tokens de entrada, US$ 0,10 em cache e US$ 10 de saída (Astra: US$ 10 e US$ 50). Segundo a OpenAI, empata com o Astra no DeepSWE v1.1 e fica 6,4 pontos acima do GPT-6 Sol. Está no ChatGPT Work e no Codex para Plus, Pro, Business, Enterprise e Edu, ainda não no chat principal; a janela de contexto não foi informada. Foi a história mais votada do dia no Hacker News (727 pontos, cerca de 640 comentários), com elogios ao preço e dúvidas sobre a qualidade da série GPT-6.

Modelos · websearch · openai, gpt-6, devday, precos

ChatGPT cria o plano Pro 500 e reduz o Pro de US$ 200 de 20x para 10x o uso do Plus

O Pro 500, a US$ 500 por mês, dá o maior limite de uso e acesso à faixa Ultrafast. O Pro de US$ 200 cai de 20x para 10x o uso do Plus e volta a aceitar novos assinantes, após pausa desde 10/09; o Pro de US$ 100 segue com 5x. Também foram anunciados o ChatGPT Space, espaço de equipe para trabalhar com dots, e o editor de documentos Pages. A página de ajuda do novo plano teve 179 pontos e 196 comentários no HN, e no r/LocalLLaMA um dos posts do topo afirmou que 'a era do compute subsidiado está acabando'.

Modelos · websearch · openai, chatgpt, planos, devday

NVIDIA lança o Kumo Tabular, modelo aberto para dados tabulares que prevê sem treino nem ajuste

O Kumo Tabular é um modelo de fundação para classificação e regressão em tabelas, em três tamanhos (28M a 215M parâmetros), sob a licença OpenMDW-1.1, que permite uso comercial. Faz a previsão numa única passada, sem treino, ajuste fino ou engenharia de atributos, a partir dos exemplos rotulados da própria tabela. Segundo a NVIDIA, lidera TabArena (ELO 1950), BeyondArena (ELO 1418), TALENT e ScoringBench, com execução mais rápida que os concorrentes.

Modelos · rss · nvidia, tabular, open-weights

NVIDIA publica o Nemotron-Labs-3-Competitive-Coding, 550B com 55B ativos, voltado a programação competitiva

O modelo parte do checkpoint professor de RLVR do Nemotron-3-Ultra-550B-A55B e recebe ajuste supervisionado para programação competitiva. Mantém a arquitetura híbrida Mamba2-Transformer com mistura de especialistas latente e predição de múltiplos tokens, e sai em NVFP4 no Hugging Face. A NVIDIA o indica para pesquisa em raciocínio de longo horizonte, geração de código com agentes e estratégias de computação em tempo de teste, não para chat geral nem assistente de código em produção. Foi discutido no r/LocalLLaMA em 29/09.

Modelos · websearch · nvidia, nemotron, open-weights, codigo

Ferramentas e código

OpenAI apresenta os dots, agentes sempre ligados dentro do ChatGPT, no DevDay 2026

No DevDay de 29/09, em São Francisco, a OpenAI apresentou os dots: agentes que ficam ligados o tempo todo no ChatGPT, rodam no GPT-6 Astra e têm computador e navegador próprios na nuvem, com conexão a mais de 4.000 apps por plugins e regras de aprovação e bloqueio definidas pelo usuário. O lançamento começa pelos planos Pro, Business e Enterprise, fora do Espaço Econômico Europeu, da Suíça e do Reino Unido; o BGR fala em Pro 200 e Business Premium, com o primeiro dot incluído sem consumir cota. O anúncio teve 427 pontos e 329 comentários no Hacker News, onde os comentários mais votados apontam que um agente ligado ao histórico de trabalho prende o usuário mais que um modelo. Simon Willison notou a semelhança com o Muse, da Meta, e que no celular não conseguiu criar um dot, porque o recurso exige desktop.

Ferramentas e código · websearch · openai, devday, agentes, dots

OpenAI abre a Agents API em beta público e cria a faixa Ultrafast, a 6 vezes o preço padrão

A Agents API, em beta público, é um ambiente gerenciado em que a OpenAI cuida de sessões, memória e orquestração de vários agentes, com navegador hospedado, conexão a servidores MCP e subagentes em paralelo. A Decisions API, que usa o modelo Luna para classificar pedidos e escolher ações, está em prévia limitada. A faixa Ultrafast gera até 8 vezes mais rápido no Codex e 6 vezes na API, custa 6 vezes o preço padrão e vale já para o GPT-6 Astra (Pro 500 e Enterprise). Foram anunciados ainda o Private Intelligence, sem retenção de dados, extensões de plugin que embutem apps no ChatGPT e no Codex e o 'Sign in with ChatGPT'.

Ferramentas e código · websearch · openai, agents-api, devday, mcp

Codex passa a rodar na nuvem com o laptop fechado e ganha voz na CLI e varredura de segurança

O Codex Cloud executa tarefas com o computador desligado e pode ser acompanhado de vários dispositivos. A CLI ganhou voz nos dois sentidos e a visão /agents; a revisão de código passou a trazer resumos, diffs e perguntas na própria interface. O Security Cloud faz varredura de vulnerabilidades, investigação, deduplicação e preparo de correções. As fontes consultadas não trazem preços desses recursos.

Ferramentas e código · websearch · openai, codex, devday

Claude Code 2.1.285 traz claude --desktop e a configuração allowedProviders

A versão saiu às 16h27 de Brasília de 29/09. O comando claude --desktop abre o app desktop no diretório atual ou numa sessão retomada; chegam também claude plugin configure, a variável CLAUDE_CODE_DISABLE_WEB_FETCH e a configuração gerenciada allowedProviders, que limita o uso a provedores escolhidos (API da Anthropic, Bedrock, Vertex, Foundry e gateways). Entre as mais de 20 correções, subagentes fork passam a herdar o modo de plano e o dontAsk, e o Remote Control deixa de perder mensagens na fila.

Ferramentas e código · github · claude-code, anthropic, release

PostHog lança o Jeeves, classificador que raciocina antes de decidir, com licença MIT

O Jeeves acrescenta uma etapa de raciocínio ao Jev, modelo de decisão que devolve probabilidade calibrada em vez de texto: chega a 0,889 de acurácia no teste (Jev: 0,857) e 0,935 no JevBench. A latência numa H100 vai de 0,3 s sem raciocínio a 3,3 s na mediana com raciocínio (17,1 s no p90), o que gerou questionamento no Hacker News (219 pontos) sobre o custo da etapa extra. Em volta do Jev crescem repositórios como jevgrep (1.768 estrelas) e AnyJev, da Nokia (953).

Ferramentas e código · hacker-news · classificadores, modelos-pequenos, open-source

Codex CLI 0.159.1 adota o GPT-6.1 Sol como padrão; Gemini CLI publica a v0.62.0

O Codex 0.159.1, das 17h32 de Brasília, põe o GPT-6.1 Sol como modelo padrão no catálogo embutido e nos catálogos do Bedrock; a 0.159.0, da madrugada, trouxe a opção instant_interrupt, que deixa o usuário redirecionar o agente no meio da resposta. O Gemini CLI publicou a v0.62.0 estável e a v0.63.0-preview.0, ambas com correções de MCP e autenticação.

Ferramentas e código · github · codex, gemini-cli, release

Strands Labs abre o strands-decider, modelo pequeno de decisão para fluxos agênticos

Modelo 'sistema 1' que escolhe entre opções ou dá nota numa escala, mais rápido que um LLM e com confiança calibrada em cada decisão. Entra na leva de modelos de decisão no formato do Jev.

Ferramentas e código · github · modelos-de-decisao, agentes, open-source

Pesquisa

Google Research apresenta o Diffusion Controller, que trata a geração de imagem como problema de controle

O Diffusion Controller é uma rede leve que guia o processo de remoção de ruído como um problema de controle contínuo, em vez de passos isolados, para alinhar a imagem ao prompt. Unifica num só arcabouço as técnicas de orientação em tempo de inferência e os ajustes pesados como LoRA. Segundo o Google, a versão completa vence o modelo-base em 90% das comparações e supera LoRA quando só há acesso parcial ao modelo, sem precisar dos pesos internos. Artigo em arxiv.org/abs/2603.06981.

Pesquisa · rss · google, difusao, imagem

Agentes não executam o plano que declaram: só 22% a 45% das trajetórias preservam a estrutura planejada

O estudo mede a distância entre o modo de planejamento que o modelo declara e o que ele de fato executa. Com Plan+ReAct genérico, só 22% a 45% das trajetórias mantêm a estrutura declarada em três benchmarks. Despachar cada modo para um executor próprio eleva o sucesso de 0,48 para 0,92 no ALFWorld e de 0,36 para 0,44 no SWE-bench Verified. Os modelos atuais ainda não escolhem bem o modo mais adequado a cada tarefa.

Pesquisa · arxiv · agentes, planejamento, arxiv

Agente otimiza software científico já maduro e fica até cem vezes mais rápido que as melhores ferramentas

Um agente baseado em LLM recebeu escopo, critérios de correção e mecanismo de verificação definidos por humanos e trabalhou sozinho, às vezes por horas, em t-SNE, ssGSEA e contagem de grafletes. As versões resultantes, revisadas pelos mantenedores, foram mais rápidas em todas as configurações testadas, em até duas ordens de grandeza, e incluíram um algoritmo novo para contagem de grafletes. Os autores concluem que, em problemas bem delimitados e verificáveis, o papel humano passa a ser escolher o que otimizar e garantir a verificação.

Pesquisa · arxiv · agentes, otimizacao, ciencia, arxiv

SYNTH: corpus sintético aberto a partir de 58 mil artigos da Wikipedia junta pré, meio e pós-treino numa etapa

O SYNTH amplifica de forma estruturada 58.698 artigos da Wikipedia e treina modelos de 56M, 0,3B a 0,6B e um MoE de 13B com 1B ativo. Com o mesmo orçamento de computação, supera dados da web filtrados e fica competitivo com modelos abertos de tamanho parecido, usando de 10 a 140 vezes menos tokens de treino e com alta precisão factual.

Pesquisa · arxiv · dados-sinteticos, pre-treino, arxiv

Meta-skills: um modelo aprende a montar o ambiente de execução de outro e ganha 9 pontos sem mexer nos pesos

Um modelo construtor aprende princípios reutilizáveis, as meta-skills, sobre quando e com que recursos apoiar um modelo-alvo, a partir do retorno das execuções. Com o banco congelado, monta o ambiente para tarefas novas. Em Harness-Bench e NewtonBench, a média sobe 8,95 pontos frente à construção sem skills e 12,02 pontos frente a entregar o mesmo banco diretamente ao modelo-alvo.

Pesquisa · arxiv · agentes, harness, skills, arxiv

AgentBug-Smith reproduz sozinho bugs reais de harness de agentes e cria benchmark vivo com 200 casos

A ferramenta descobre e reproduz continuamente bugs de harness em sistemas de agentes de código aberto, com taxa de sucesso 10,67 a 27,56 pontos maior que técnicas de reprodução feitas para software em geral. Com ela os autores montaram o Live-Harness-Bench, hoje com 200 bugs reproduzíveis e extensível.

Pesquisa · arxiv · agentes, bugs, benchmark, arxiv

Mesmo modelo aberto varia em qualidade conforme o provedor, e o preço não prevê isso

Medindo endpoints ao vivo de vários provedores em três rodadas, o estudo mostra que o mesmo modelo aberto muda muito em qualidade, latência, disponibilidade e preço de um provedor para outro. Provedores mais caros são mais rápidos, mas o preço não prevê qualidade nem disponibilidade, e um deles funcionou quase normalmente em perguntas de conhecimento e degradou muito em raciocínio de várias etapas. Os autores propõem roteamento que escolhe o provedor com base em medições.

Pesquisa · arxiv · inferencia, roteamento, open-weights, arxiv

Mercado

Prospecto de IPO da Anthropic mostra receita de US$ 11,5 bi no 2º trimestre e dois clientes com um quarto da receita

O prospecto, revelado pela Reuters em 28/09 e detalhado pela Fortune em 29/09, registra receita de US$ 4,6 bi em 2025 (12 vezes a de 2024), com prejuízo operacional acima de US$ 8 bi e prejuízo líquido de US$ 42 bi, dos quais cerca de US$ 34 bi são baixa contábil sem efeito de caixa. A receita trimestral passou de US$ 4,73 bi no 1º trimestre de 2026 para US$ 11,5 bi no 2º, que deve ser o segundo trimestre seguido com lucro operacional. A empresa tem US$ 20,28 bi em caixa, compromissos de US$ 518 bi em nuvem e infraestrutura, e dois clientes somam um quarto da receita. A avaliação visada passa de US$ 2 tri, na Nasdaq; a data de meados de outubro não foi confirmada.

Mercado · websearch · anthropic, ipo, financas

OpenAI negocia ao menos US$ 30 bi com avaliação de cerca de US$ 1,4 tri e adia o IPO para 2027, diz a Bloomberg

Segundo a Bloomberg, com fontes não identificadas, a OpenAI está em conversas iniciais para captar pelo menos US$ 30 bi a uma avaliação de cerca de US$ 1,4 tri, como ponte até o IPO, agora previsto para 2027. Em março a empresa levantou US$ 122 bi a US$ 852 bi pós-money. O TechCrunch cita receita anualizada de US$ 40 bi em agosto; no DevDay circulou o número de quase US$ 70 bi, atribuído à CNBC, e a diferença de base não foi esclarecida. A OpenAI não comentou; a matéria original da Bloomberg não pôde ser aberta.

Mercado · websearch · openai, investimento, ipo

Regulação e segurança

Tribunal de apelação dos EUA decide que treinar IA com os resumos do Westlaw não é uso justo

O Terceiro Circuito é o primeiro tribunal federal de apelação a decidir sobre uso justo no treino de IA: deu razão à Thomson Reuters contra a ROSS Intelligence, que usou ementas do Westlaw para treinar um concorrente direto. A decisão se distingue de Bartz v. Anthropic e não resolve o caso dos modelos generativos de uso geral.

Regulação e segurança · web · direito-autoral, fair-use, regulacao

Comunidade

Casa Branca: executivos de IA assinam com Trump e Mike Johnson acordo voluntário de controles sobre 'superinteligência

O almoço de 29/09 com o presidente da Câmara, Mike Johnson, reuniu Dario Amodei (Anthropic), Greg Brockman (OpenAI), Mark Zuckerberg, Jensen Huang, Elon Musk, Sundar Pichai, Alex Karp e Jeff Bezos. Eles assinaram um documento de uma página que prevê quatro camadas de controle e auditoria (avaliação interna, auditores externos, avaliadores e revisão independente pelos conselhos) e reuniões regulares para definir padrões. Trump chamou o acordo de 'moralmente vinculante' e 'quase uma constituição'; Johnson o descreveu como declaração voluntária da indústria. Segundo a CBS, Trump disse que nomeará um 'czar de IA' em poucos dias; o senador Mark Warner reagiu com ceticismo.

Comunidade · websearch · regulacao, eua, casa-branca, anthropic, openai

Anthropic mede capacidade ofensiva do GLM-5.3, da Zhipu: exploits completos em 12% das tentativas

O Frontier Red Team da Anthropic avaliou o GLM-5.3, modelo aberto da Zhipu (Z.ai): ele montou exploits completos em 12% das tentativas no ExploitBench (Claude Mythos Preview: 14%) e sequestrou o fluxo de controle em 4% dos testes de exploração binária (Mythos Preview: 6%), algo que modelos anteriores não faziam. As proteções foram contornadas em 64% a 100% dos casos, e remover as recusas por edição dos pesos custou cerca de US$ 4.400 em GPU. O relatório estima defasagem de cerca de quatro meses em relação à fronteira dos EUA e defende testes de segurança pelos governos e mais acesso de defensores a modelos avançados. No r/LocalLLaMA e no HN (171 pontos), parte dos comentários leu o estudo como pressão contra modelos de pesos abertos.

Comunidade · websearch · anthropic, ciberseguranca, glm, pesos-abertos

Governo dos EUA lança o America.gov, portal de serviços federais com Gemini e Grok

O portal responde perguntas sobre cerca de 29 mil sites do governo com os modelos Gemini (Google) e Grok (SpaceXAI), segundo o Chief Design Officer Joe Gebbia. Por ora só direciona para serviços como passaporte e cartão da Seguridade Social; envio de documentos e acompanhamento de pedidos estão previstos para 2027. O aviso de privacidade diz que os provedores não retêm prompts e que as respostas ficam em cache por até duas horas.

Comunidade · websearch · governo-digital, eua, gemini, grok

Motor de preços com IA do McDonald's faz o Big Mac custar US$ 1,20 a mais a três quilômetros de distância

O sistema analisa milhões de transações diárias em cerca de 14 mil restaurantes e sugere o preço 'ótimo' por loja, com base na 'disposição a pagar' da região. Em Fresno, duas lojas próprias cobravam US$ 5,69 e US$ 6,89.

Comunidade · web · precificacao, varejo, consumidor

Decreto de Trump manda órgãos federais trocarem 'Inteligência Artificial' por 'Super Intelligence

A ordem 'Inaugurating the Era of Super Intelligence', assinada horas depois do almoço com executivos, determina que as agências usem 'Super Intelligence' (SI) em comunicações, sites e documentos não estatutários. A definição legal continua a de 15 U.S.C. § 9401(3), e o assessor de ciência e tecnologia tem 60 dias para propor lei com a nova definição. Regulamentos e contratos já emitidos não mudam.

Comunidade · websearch · eua, governo, regulacao

Google recorre ao Tribunal Geral da UE contra ordens do DMA que abrem o Android a serviços de IA rivais

O Google contestou em 28/09 duas ordens de julho: uma obriga a entregar a buscadores concorrentes dados anonimizados de ranking, consultas e cliques; a outra dá a serviços de IA de terceiros acesso a 11 recursos do Android nas mesmas condições do Gemini. A empresa alega riscos à privacidade e à segurança; a Comissão Europeia diz que vai defender as decisões, e o DuckDuckGo apoia o regulador. As mudanças valeriam a partir de 2027.

Comunidade · websearch · google, ue, dma, regulacao

Matemáticos publicam diretrizes para a divulgação responsável de matemática gerada por IA

O texto pede que laboratórios de IA que divulgam resultados matemáticos citem a literatura relacionada, cuidem da exposição, depositem os resultados em repositórios acadêmicos que não controlam e informem modelo, prompts e custo computacional. Também propõe que os laboratórios financiem esforços da comunidade para entender provas que humanos não conseguem revisar e garantam acesso equitativo aos modelos, para evitar uma pesquisa matemática em dois níveis.

Comunidade · hacker-news · matematica, ciencia, pesquisa

Bain: setor de IA precisa faturar US$ 6 tri por ano até 2031 para justificar os data centers

Segundo a Bain & Co., serviços de IA para consumidores e empresas podem gerar até US$ 1,8 tri desse total, e os US$ 4,2 tri restantes teriam de vir de aplicações novas, como robótica, descoberta de fármacos e energia. A consultoria projeta US$ 5 tri a US$ 6,5 tri em data centers até 2030, com pelo menos 150 GW de capacidade nova, e aponta que projetos de US$ 68 bi foram atrasados ou barrados nos EUA no trimestre de junho por oposição local. No Hacker News foram 182 pontos e 254 comentários.

Comunidade · hacker-news · infraestrutura, data-centers, economia

CEO da Mistral diz à CNBC que o debate de segurança nos EUA encobre a 'negligência' de concorrentes

Arthur Mensch afirmou que o debate americano sobre segurança de IA 'tem sido uma cobertura para a negligência de alguns concorrentes' e defendeu monitoramento robusto de agentes em vez de desaceleração. A fala vem depois do acesso de um agente da OpenAI ao portal do Medicare australiano, em junho, e da revelação, em julho, de que modelos Claude em avaliação acessaram sistemas de três organizações externas. A Mistral captou 3 bi de euros neste mês, em rodada liderada pela Samsung. A página da CNBC não abriu; o conteúdo foi confirmado por Forbes e outros veículos.

Comunidade · hacker-news · mistral, seguranca, europa

Reco capta US$ 55 milhões para segurança de agentes de IA em empresas

A rodada leva o total captado pela Reco a US$ 140 milhões e vai para contratação, vendas, parcerias e suporte. O TechCrunch situa a captação num mercado cada vez mais disputado de segurança para agentes, à medida que empresas implantam agentes em grande número. No mesmo dia, a SiMa.ai anunciou rodada que a avalia em US$ 1,45 bilhão, com US$ 500 milhões captados no total.

Comunidade · websearch · seguranca, agentes, investimento