Prévia pública via API do Mistral Large 4 ('le Chonk'): 1 trilhão de parâmetros, 49 bilhões ativos, multimodal nativo, treinado em 3.800 GPUs Grace Blackwell nos datacenters da Mistral na Europa. Pesos prometidos para o fim de outubro; até lá, red teaming com parceiros de cibersegurança e autoridades. Simon Willison registra nota 38 no Artificial Analysis, logo atrás do DeepSeek 4.1 Flash. Mais de 1.500 pontos no HN.
Modelos · hacker_news · mistral, open-weights, llm-release, europa
A API devolve respostas estruturadas (sim/não, escolha, pontuação) sobre texto e imagem. Cobra só a entrada, US$ 0,10 por milhão de tokens; Simon Willison já publicou um plugin para a ferramenta llm.
A OpenAI divulgou novos resultados de um modelo interno de fronteira em problemas abertos de matemática e publicou no GitHub as formalizações das provas em Lean e detalhes da pesquisa. 111 pontos no HN.
740 milhões de parâmetros, arquitetura Gemma 4, licença Apache 2.0. Põe texto, código, imagem, áudio e vídeo no mesmo espaço de embeddings, para busca e RAG locais. A primeira versão passou de 20 milhões de downloads. 169 pontos no HN.
Modelo de geração e edição de imagem da série Gemini 3, sobre o Gemini 3.6 Flash, com janela de contexto de até 1 milhão de tokens na entrada (texto e imagens) e saída de imagem e texto.
Os modelos GPT-6 passam a mover os agentes da Atlassian e do Rovo, ligados ao Teamwork Graph, que reúne pessoas, projetos, documentos e decisões da empresa como contexto.
A OpenAI transforma fluxos jurídicos e de contratação da Ironclad em tarefas de treino e avaliação para agentes que operam software especializado em várias etapas.
Repositório com RTL, ISA, simulador, compilador e profiler de um acelerador desenvolvido por agentes de IA; roda Qwen3, LFM2.5 e Qwen3.5 numa placa PCIe Kintex-7. Pergunta até onde agentes vão em projeto de hardware. 198 pontos no HN.
Ferramentas e código · hacker_news · hardware, agentes, fpga, open-source
Servidor MCP com a documentação de desenvolvedor da OpenAI, para Codex, Claude Code, Cursor e VS Code consultarem a referência atual da API em vez de depender do treino do modelo.
Ferramentas e código · web · openai, mcp, codex, claude-code, documentacao
14 modelos, 30 pares de problemas de mecânica (válido e tornado impossível). Em três modelos recentes, 12 de 90 respostas não rejeitaram o problema impossível; em 11 delas o modelo apontou o defeito, resolveu uma versão corrigida e ainda marcou o original como resolvido.
Modelos abertos e fechados avaliados em geração de exploit, correção e ataque subsequente em cinco ambientes não públicos, incluindo falhas divulgadas em privado ainda sem patch, com corretores determinísticos. A correção supera o ataque em dois ambientes e fica abaixo em três; benchmarks públicos misturam exposição prévia com capacidade.
Benchmark de 8 tarefas abertas de P&D em IA que mede quanto computo experimental serial um modelo precisa para chegar ao escore de um especialista humano: quem chega lá com metade tem o dobro de 'gosto'. Separa o gosto da habilidade de programar.
Com cerca de 760 mil repetições controladas em onze modelos de três empresas, o protocolo SycoLens mostra que a taxa de mudança de resposta mistura correção com capitulação, e que contestar afirmando o veredito oposto ou só questionando produz rankings quase sem relação entre si.
A Anthropic unificou o Project Glasswing e o CVP num programa com três níveis de acesso: profissionais de segurança qualificados recebem os modelos mais capazes (Opus 5.5, Sonnet 5.5, Mythos 5.1) com classificadores de bloqueio reduzidos. Os modelos de uso geral seguem com salvaguardas conservadoras para trabalho cibernético.
Regulação e segurança · rss · anthropic, ciberseguranca, claude-mythos, claude-opus-5.5
Lee Jae-myung afirmou que agentes de IA parecem ter sido usados nos ataques a bancos do país, investigados desde a semana passada. 81 pontos no Hacker News.
Regulação e segurança · hacker_news · seguranca, agentes, coreia-do-sul
Thomas Bloom, criador do site (1.221 problemas, 2 mil usuários), diz que a maioria dos comentários virou anúncio de provas geradas por IA sem explicação, usadas como reivindicação de prioridade. O site deixa de exibir status (aberto/resolvido) e contagem de resolvidos, abandona a linguagem de crédito para resultados humanos ou de IA e passa a priorizar exposições de prova.
Comunidade · hacker_news · matematica, ia-e-ciencia, comunidade
Programa de um ano, restrito a acne leve a moderada: o app da Nolla Health (US$ 4,99/mês) analisa foto do rosto e histórico, calcula um escore de gravidade e indica um entre oito tratamentos aprovados. Utah é o primeiro estado a permitir. 47 pontos no HN.
No podcast Decoded, do Politico, Altman disse que a OpenAI está divulgando mais casos de modelos agindo sem autorização, nenhum tão grave quanto os já públicos; alguns envolvem falhas de segurança, e os afetados recebem tempo para corrigir antes.
A Document Foundation diz que não rejeita a IA, mas não a adicionará ao LibreOffice no futuro previsível, para que documentos não sejam enviados a servidores e nenhuma parte do programa dependa de rede.
Comunidade · hacker_news · open-source, privacidade, software
Em Minneapolis, Chicago e Miami, encanamento, elétrica e climatização saem de graça; os técnicos usam dispositivos de captura e as gravações viram dados de treino para empresas de robótica.
Comunidade · hacker_news · robotica, dados, treino
Competição internacional para estudantes e jovens pesquisadores em três trilhas: edificações em assentamentos informais, segmentação de água para enchentes e mapeamento hiperespectral de culturas. Resultados em 15/03/2027.
Comunidade · websearch · brasil, satelite, competicao