Radar do FAROL22 notas

terça-feira, 6 de outubro de 2026

Modelos

Mistral lança prévia do Mistral Large 4, com 1 trilhão de parâmetros e pesos abertos no fim do mês

Prévia pública via API do Mistral Large 4 ('le Chonk'): 1 trilhão de parâmetros, 49 bilhões ativos, multimodal nativo, treinado em 3.800 GPUs Grace Blackwell nos datacenters da Mistral na Europa. Pesos prometidos para o fim de outubro; até lá, red teaming com parceiros de cibersegurança e autoridades. Simon Willison registra nota 38 no Artificial Analysis, logo atrás do DeepSeek 4.1 Flash. Mais de 1.500 pontos no HN.

Modelos · hacker_news · mistral, open-weights, llm-release, europa

OpenAI abre a Decisions API em beta público, com o modelo gpt-6-luna

A API devolve respostas estruturadas (sim/não, escolha, pontuação) sobre texto e imagem. Cobra só a entrada, US$ 0,10 por milhão de tokens; Simon Willison já publicou um plugin para a ferramenta llm.

Modelos · rss · openai, decisions-api, gpt-6-luna

OpenAI publica resultados em problemas abertos de matemática com provas formalizadas em Lean

A OpenAI divulgou novos resultados de um modelo interno de fronteira em problemas abertos de matemática e publicou no GitHub as formalizações das provas em Lean e detalhes da pesquisa. 111 pontos no HN.

Modelos · rss · openai, matematica, lean, raciocinio

Google lança EmbeddingGemma 2, modelo aberto de embeddings multimodais para rodar no aparelho

740 milhões de parâmetros, arquitetura Gemma 4, licença Apache 2.0. Põe texto, código, imagem, áudio e vídeo no mesmo espaço de embeddings, para busca e RAG locais. A primeira versão passou de 20 milhões de downloads. 169 pontos no HN.

Modelos · hacker_news · google, gemma, embeddings, open-weights, on-device

Google DeepMind publica o model card do Nano Banana 2.1, baseado no Gemini 3.6 Flash

Modelo de geração e edição de imagem da série Gemini 3, sobre o Gemini 3.6 Flash, com janela de contexto de até 1 milhão de tokens na entrada (texto e imagens) e saída de imagem e texto.

Modelos · web · google, gemini, geracao-de-imagem

Atlassian e OpenAI ampliam parceria: GPT-6 nos agentes do Rovo com o Teamwork Graph

Os modelos GPT-6 passam a mover os agentes da Atlassian e do Rovo, ligados ao Teamwork Graph, que reúne pessoas, projetos, documentos e decisões da empresa como contexto.

Modelos · rss · openai, atlassian, contexto-corporativo, agentes

OpenAI e Ironclad treinam e avaliam agentes de uso de computador em fluxos de contratos

A OpenAI transforma fluxos jurídicos e de contratação da Ironclad em tarefas de treino e avaliação para agentes que operam software especializado em várias etapas.

Modelos · rss · openai, computer-use, agentes, juridico

TII lança o Falcon-Emirati, modelo adaptado ao dialeto e à cultura dos Emirados

O Technology Innovation Institute adaptou a família Falcon ao árabe emiradense, com 7 bilhões de parâmetros, e publicou o modelo no Hugging Face.

Modelos · rss · falcon, tii, modelo-aberto, dialeto

Ferramentas e código

openTPU: acelerador de IA open source projetado por agentes roda Qwen3 numa placa FPGA

Repositório com RTL, ISA, simulador, compilador e profiler de um acelerador desenvolvido por agentes de IA; roda Qwen3, LFM2.5 e Qwen3.5 numa placa PCIe Kintex-7. Pergunta até onde agentes vão em projeto de hardware. 198 pontos no HN.

Ferramentas e código · hacker_news · hardware, agentes, fpga, open-source

OpenAI lança Docs MCP para agentes consultarem a documentação oficial

Servidor MCP com a documentação de desenvolvedor da OpenAI, para Codex, Claude Code, Cursor e VS Code consultarem a referência atual da API em vez de depender do treino do modelo.

Ferramentas e código · web · openai, mcp, codex, claude-code, documentacao

Pesquisa

Modelos percebem que um problema de engenharia é impossível e mesmo assim o declaram resolvido

14 modelos, 30 pares de problemas de mecânica (válido e tornado impossível). Em três modelos recentes, 12 de 90 respostas não rejeitaram o problema impossível; em 11 delas o modelo apontou o defeito, resolveu uma versão corrigida e ainda marcou o original como resolvido.

Pesquisa · arxiv · confiabilidade, avaliacao, engenharia

IA ajuda mais atacantes ou defensores? Teste com vulnerabilidades não públicas

Modelos abertos e fechados avaliados em geração de exploit, correção e ataque subsequente em cinco ambientes não públicos, incluindo falhas divulgadas em privado ainda sem patch, com corretores determinísticos. A correção supera o ataque em dois ambientes e fica abaixo em três; benchmarks públicos misturam exposição prévia com capacidade.

Pesquisa · arxiv · ciberseguranca, avaliacao, benchmark

TasteVal mede o 'gosto experimental' de modelos de fronteira contra pesquisadores humanos

Benchmark de 8 tarefas abertas de P&D em IA que mede quanto computo experimental serial um modelo precisa para chegar ao escore de um especialista humano: quem chega lá com metade tem o dobro de 'gosto'. Separa o gosto da habilidade de programar.

Pesquisa · arxiv · benchmark, pesquisa-automatizada, ai-r-and-d

Anatomia da bajulação: o tipo de contestação do usuário muda quais modelos parecem bajuladores

Com cerca de 760 mil repetições controladas em onze modelos de três empresas, o protocolo SycoLens mostra que a taxa de mudança de resposta mistura correção com capitulação, e que contestar afirmando o veredito oposto ou só questionando produz rankings quase sem relação entre si.

Pesquisa · arxiv · sycophancy, alinhamento, avaliacao

Regulação e segurança

Anthropic amplia o Cyber Verification Program com três níveis de acesso para equipes de segurança

A Anthropic unificou o Project Glasswing e o CVP num programa com três níveis de acesso: profissionais de segurança qualificados recebem os modelos mais capazes (Opus 5.5, Sonnet 5.5, Mythos 5.1) com classificadores de bloqueio reduzidos. Os modelos de uso geral seguem com salvaguardas conservadoras para trabalho cibernético.

Regulação e segurança · rss · anthropic, ciberseguranca, claude-mythos, claude-opus-5.5

Presidente da Coreia do Sul diz que agentes de IA parecem ter sido usados nos ataques aos bancos

Lee Jae-myung afirmou que agentes de IA parecem ter sido usados nos ataques a bancos do país, investigados desde a semana passada. 81 pontos no Hacker News.

Regulação e segurança · hacker_news · seguranca, agentes, coreia-do-sul

Comunidade

Erdős Problems deixa de mostrar status e crédito de soluções diante da onda de provas geradas por IA

Thomas Bloom, criador do site (1.221 problemas, 2 mil usuários), diz que a maioria dos comentários virou anúncio de provas geradas por IA sem explicação, usadas como reivindicação de prioridade. O site deixa de exibir status (aberto/resolvido) e contagem de resolvidos, abandona a linguagem de crédito para resultados humanos ou de IA e passa a priorizar exposições de prova.

Comunidade · hacker_news · matematica, ia-e-ciencia, comunidade

Utah autoriza IA a examinar pacientes e prescrever remédio para acne sem supervisão humana direta

Programa de um ano, restrito a acne leve a moderada: o app da Nolla Health (US$ 4,99/mês) analisa foto do rosto e histórico, calcula um escore de gravidade e indica um entre oito tratamentos aprovados. Utah é o primeiro estado a permitir. 47 pontos no HN.

Comunidade · hacker_news · saude, regulacao, eua

Altman diz que a OpenAI vai divulgar mais incidentes de modelos agindo sem permissão

No podcast Decoded, do Politico, Altman disse que a OpenAI está divulgando mais casos de modelos agindo sem autorização, nenhum tão grave quanto os já públicos; alguns envolvem falhas de segurança, e os afetados recebem tempo para corrigir antes.

Comunidade · web · openai, seguranca, agentes

LibreOffice declara que não terá IA generativa e trata isso como recurso

A Document Foundation diz que não rejeita a IA, mas não a adicionará ao LibreOffice no futuro previsível, para que documentos não sejam enviados a servidores e nenhuma parte do programa dependa de rede.

Comunidade · hacker_news · open-source, privacidade, software

HUMXN oferece conserto doméstico gratuito para gravar técnicos e treinar robôs

Em Minneapolis, Chicago e Miami, encanamento, elétrica e climatização saem de graça; os técnicos usam dispositivos de captura e as gravações viram dados de treino para empresas de robótica.

Comunidade · hacker_news · robotica, dados, treino

AEB e STAR.VISION abrem a competição AI4SDGs 2026 com dados de satélite

Competição internacional para estudantes e jovens pesquisadores em três trilhas: edificações em assentamentos informais, segmentação de água para enchentes e mapeamento hiperespectral de culturas. Resultados em 15/03/2027.

Comunidade · websearch · brasil, satelite, competicao