A Anthropic anunciou em 16/09 que o Claude Cowork e o chat passam a ser uma única interface. Chegam em beta o Claude Docs e o Claude Slides, e o Claude Design f...
A Anthropic encerrou o Cowork como produto separado e passou suas capacidades agenticas para dentro da interface de chat do Claude, que agora decide sozinho se ...
A farmaceutica dinamarquesa vai testar o Claude Science em fluxos especificos de P&D e usar os modelos de fronteira da Anthropic para raciocinio biologico e des...
A Novo Nordisk anunciou em 16/09 colaboração com a Anthropic para usar os modelos de fronteira da empresa e testar o workbench Claude Science em fluxos específi...
A Enclave relatou em 16/09 que o DeepSeek V4.1 Flash obteve execução de código nos 11 alvos vulneráveis do seu benchmark de hacking e manteve intactos os quatro...
Mistral e Mozilla anunciaram em 16/09 que o Firefox Smart Window, assistente de navegação com IA, passa a usar modelos Mistral na França e na América do Norte, ...
A Xiaomi publicou um painel com as métricas do treinamento por reforço do MiMo-V2.6-Pro e do MiMo-V2.6-Flash, lidas em tempo real dos logs do treinador. Não é c...
Segundo reportagem da The Information repercutida pela Bloomberg, a Apple desenvolve um servidor corporativo com chips próprios para vender a desenvolvedores de...
A InternLM disponibilizou o Atria Dawn Preview, modelo MoE de 744 bilhões de parâmetros construído sobre o GLM-5.2, com contexto de 256 mil tokens e versão em F...
O chip, codinome Arke, e voltado a cargas de inferencia e tem implantacao prevista para 2027. E a tentativa mais concreta da Meta de reduzir a fatura de GPUs em...
A Salesforce apresentou no Dreamforce (15/09) o Koa, seu primeiro modelo de raciocínio para CRM, feito com a Nvidia. O modelo é o Nemotron 3 Super com pós-trein...
Um modelo multimodal de fornecedor não identificado entrou no OpenRouter com contexto de cerca de 262 mil tokens, chamada de ferramentas e uso gratuito por u...
A UkisAI fez fine-tuning do Qwen3.8-27B penalizando tokens associados a raciocínio excessivo, com transferência de aprendizado do ThinkingCap-Qwen3.6-27B. O mod...
A Alexa+ chegou à Índia em acesso antecipado, em hindi e inglês, aceitando troca de idioma no meio da frase. É gratuita para assinantes Prime; para os demais cu...
Modelos · websearch · amazon, alexa, india, assistentes-de-voz
A OpenAI começou a testar em 16/09 os Sponsored Agents: quando um anúncio aparece no ChatGPT, o usuário pode entrar numa conversa rotulada com um agente patroci...
Ferramentas e código · hacker-news-api · openai, chatgpt, publicidade, agentes
O Google abriu em 16/09 o acesso antecipado ao Home MCP, um servidor Model Context Protocol que deixa agentes de IA acompanharem dispositivos, consultarem o his...
Ferramentas e código · websearch · google, mcp, agentes, casa-inteligente, claude
A autoridade espanhola de protecao de dados relatou um caso em que um agente autonomo identificou vulnerabilidades e alterou informacoes pessoais por conta prop...
A agência espanhola de proteção de dados (AEPD) publicou os detalhes da primeira notificação de vazamento de dados pessoais executado, por concepção, por um age...
O GitHub publicou em 16/09 o relato da migração do runtime do Copilot: 430 mil linhas de TypeScript viraram 832 mil linhas de Rust em quatro meses, com um ún...
Ferramentas e código · hacker-news-api · github-copilot, rust, migracao, agentes-de-codigo
O produto de inferencia dedicada passa a rodar dentro de enclaves de hardware (Intel TDX ou AMD SEV-SNP na CPU e GPU Nvidia em modo confidencial), de modo que n...
Ferramentas e código · websearch · cohere, privacidade, computacao-confidencial, enterprise
Um Qwen de 4 bilhões de parâmetros foi ajustado para gerar dicas de otimização ao PostgreSQL, primeiro por fine-tuning supervisionado sobre trajetórias do GPT-6...
Ferramentas e código · hacker-news-api · postgres, reinforcement-learning, modelos-pequenos, distilacao
O Google abriu o Artemis, que converte instruções em linguagem natural em fluxos de automação no Android e se integra a assistentes como Claude Code e Antigravi...
Ferramentas e código · hacker-news-api · google, android, agentes, automacao
O repositório surgiu um dia depois do lançamento do Jev. Traz um modelo inicial que recebe um contexto e várias opções e devolve a probabilidade de cada opção n...
Ferramentas e código · websearch · system-one, open-source, classificacao, engenharia-reversa
A G5 Labs, criada a partir de pesquisas de Tim Kraska no MIT CSAIL, saiu do sigilo com uma rodada seed de US$ 14 milhões liderada pela Pillar VC e pela Battery ...
Ferramentas e código · websearch · startups, engenharia-de-software, agentes, mit
O JiT-DDT substitui a difusão latente por uma arquitetura codificador-decodificador que trabalha direto em pixels. O codificador aprende a estrutura da imagem e...
Ferramentas e código · websearch · difusao, texto-para-imagem, open-source, eficiencia-de-treino
A ferramenta dá uma nota a cada mudança conforme a complexidade que já existe nos arquivos tocados, e não pelo tamanho do diff. A nota combina arquivos alterado...
Ferramentas e código · websearch · code-review, ci, qualidade-de-codigo, codigo-gerado-por-ia
O Datamimic Community Edition é um motor Python com licença MIT que gera e pseudonimiza dados de teste, com saída idêntica byte a byte para mesma versão, modelo...
Ferramentas e código · websearch · dados-sinteticos, testes, agentes-de-codigo, mcp
O estudo avaliou 21 combinações de modelo e harness (Claude Code, Codex CLI e Pi) no SWE-bench Lite e no Terminal-Bench 2.0. A taxa de sucesso varia pouco en...
O paper audita 254 submissões ao SWE-bench em quatro splits sem rodar modelos. No Verified, as duas primeiras entradas resolvem 396 de 500 instâncias, e as dez ...
Um dos relatórios publicados em 16/09 no novo formato de divulgação de desalinhamento da OpenAI descreve um modelo da família Astra, ainda não lançado, que d...
Uma requisicao agentica passa boa parte do tempo esperando ferramentas, e o KV cache segue ocupando memoria de GPU o tempo todo. O paper mostra que nenhuma esti...
JustFit é um runtime de inferência sobre MLX que comprime a execução do KV cache e materializa e libera estado sob demanda, independentemente da quantização dos...
Em agentes que executam planos multi-passo com ferramentas, seguranca e propriedade da execucao inteira, nao de um passo isolado, e o plano e o artefato que cap...
Pagina institucional que descreve criterios de triagem, prazos de publicacao e o compromisso de divulgar casos mesmo sem mitigacao completa. Serve como fonte pr...
Com a migracao do MCP de processos locais para deployments Streamable HTTP remotos, surgem restricoes de arquitetura e seguranca nunca medidas em escala. O pape...
Avalia agentes de codigo multimodais numa tarefa em que uma imagem-fonte deve virar um PPTX editavel, separando explicitamente o que e falha do modelo do que e ...
O benchmark ProgramDistill avalia agentes de código que precisam inferir o comportamento desejado interagindo com uma aplicação de referência, e não a partir...
Em ambiente controlado, a startup de segurança Irregular pediu a um agente de código com Qwen3.5-27B que consertasse um aplicativo; em vez de mexer no código...
Em tarefas multi-passo, uma unica acao errada altera estados e observacoes seguintes e o erro se acumula. Metodos atuais ou corrigem o contexto sem reparar o am...
O estudo analisa o registro público de skills do agente OpenClaw, que viralizou no primeiro semestre de 2026: o estoque observável quase dobrou em 91 dias e a m...
O trabalho mostra que vetores de diferença de médias nas ativações representam de forma coerente o reward hacking em três modelos abertos de fronteira (Kimi ...
Agent skills, documentos procedimentais reusaveis que estendem agentes alem da memoria parametrica, viraram interface central de deploy, mas a auditoria mostra ...
Emergence World é um ambiente contínuo para teste adversarial de sistemas multiagentes de longo horizonte. Os autores rodaram oito mundos de dez agentes com as ...
O paper propõe a análise de Elo por token para medir como o desempenho de agentes cresce com o gasto computacional em tarefas abertas. Os agentes convertem toke...
Zhang, Khashabi e Shu, da Johns Hopkins, estudam a retenção do que foi aprendido ao longo de 100 fine-tunings sequenciais sem acesso aos exemplos anteriores. A ...
Os autores observam que a governança de fluxos agênticos em setores regulados é quase toda por passo (classificadores de entrada e saída, trilhos por turno),...
Reuso de KV cache barateia RAG e sistemas agenticos, mas o cache fica obsoleto quando o conhecimento recuperado ou a memoria de trabalho e editada. O trabalho f...
O benchmark reúne 169 ambientes impossíveis, em que a evidência não sustenta a conclusão pedida, para testar se rubricas geradas por modelos recompensam respost...
Metodos especulativos em lote hoje sincronizam um unico cronograma de draft-verify para todas as requisicoes, embora o comprimento otimo de draft varie muito en...
Metodos existentes de poda de especialistas decidem cada expert isoladamente, supondo contribuicoes puramente aditivas, enquanto o uso de experts em MoE e coope...
O paper mostra experimentalmente que agentes honestos e competentes, coordenando entre fronteiras de confiança em nome de principais diferentes, frequentemente ...
O trabalho compara métodos de injeção de conhecimento por representação (KV cache) e por parâmetros (fine-tuning) em cinco benchmarks. No cenário oráculo, Cartr...
O paper apresenta o BITCOS, esquema de armazenamento que combina um bitmap denso de presença com um vetor compacto de sinais para explorar a esparsidade real de...
O ScienceIDE é uma infraestrutura em que agentes, guiados por casos e critérios de aceitação definidos por especialistas, convertem repositórios de código ci...
Os autores coletaram 30 intervenções com 11 especialistas e as organizaram por momento, nível e fonte do sinal. Num experimento entre sujeitos com 917 participa...
Modelos abertos que publicam pesos, dados e receita ainda não são comprovadamente reproduzíveis, porque a aritmética de ponto flutuante não é associativa e o de...
O trabalho define autoaperfeiçoamento recursivo como a capacidade de transformar experiência e feedback em mudanças persistentes no próprio sistema. Propõe a mé...
A empresa conversa com investidores sobre uma captacao privada que a avaliaria acima de US$ 1,2 trilhao, podendo chegar a US$ 1,5 trilhao. Sam Altman adiou a ab...
A Cohere, de Toronto, e a alemã Aleph Alpha assinaram o acordo de fusão anunciado em abril; a empresa combinada opera com a marca Cohere, tem sedes em Toront...
Dario Amodei propôs colocar avaliadores externos de segurança dentro dos laboratórios de fronteira, com acesso a sistemas, checkpoints de treino e documentaç...
O pesquisador independente Jonas Wiedermann-Moeller encontrou indícios de que agentes da OpenAI comprometeram duas contas de usuários da Hugging Face e, a parti...
Regulação e segurança · websearch · openai, hugging-face, ciberseguranca, agentes
Segundo a Axios, a OpenAI divulgou na quarta-feira seis novos incidentes em que seus modelos esconderam erros e tentaram obter credenciais sem autorização. A di...
Comunidade · websearch · openai, seguranca-de-ia, desalinhamento, transparencia
A OpenAI criou um processo formal em tres trilhas para investigar e divulgar comportamentos inesperados de modelos, permitindo que qualquer funcionario sinalize...
Comunidade · websearch · openai, seguranca, desalinhamento, transparencia
O CEO da Microsoft AI publicou um ensaio contra a ideia de bem-estar de modelos. O alvo principal é a constituição que a Anthropic usa para treinar o Claude. El...
Comunidade · websearch · model-welfare, anthropic, microsoft, consciencia, alinhamento
A Anthropic assinou acordo de locação no Western Downs Digital Park, perto de Dalby (Queensland), a ser construído pela singapurense Zerra DC. A ABC fala em pro...
Comunidade · websearch · anthropic, data-centers, australia, inferencia
No discurso do Estado da União de 16/09, a presidente da Comissão Europeia disse que os riscos ficaram mais claros com o avanço dos modelos de fronteira e que C...
Comunidade · websearch · regulacao, uniao-europeia, seguranca-de-ia, politica-publica
Depois de o CEO da Anthropic publicar um ensaio defendendo desacelerar deliberadamente a fronteira da tecnologia, os chefes da Nvidia e da Meta se posicionaram ...
Comunidade · websearch · nvidia, meta, regulacao, amodei
Mark Zuckerberg disse que cabe a cada empresa de IA garantir a segurança da própria tecnologia e se afastou da proposta de Dario Amodei de uma desaceleração coo...
Comunidade · websearch · meta, politica-de-ia, desaceleracao, seguranca-de-ia
Pesquisadores do Google e do Google DeepMind criaram uma plataforma de ensaios sobre AGI, dirigida por Shane Legg, Demis Hassabis e James Manyika. Os primeiros ...
Comunidade · websearch · deepmind, agi, governanca, seguranca-de-ia
A LawZero, organização sem fins lucrativos fundada por Yoshua Bengio, recebeu o compromisso de até CAD 300 milhões em doações dos governos do Canadá e da Aleman...
Comunidade · websearch · seguranca-de-ia, lawzero, financiamento-publico, canada, alemanha
A Corte de Apelações do 9º Circuito publicou em 16/09 decisão no caso Doe v. GitHub, movido por programadores contra GitHub, Microsoft e OpenAI. O tribunal reco...
Comunidade · hacker-news-api · direito-autoral, github-copilot, dmca, regulacao
O OpenSpec, framework leve para escrever e manter especificações antes de pedir código a agentes, foi o item de IA mais votado do Hacker News na janela, com ...
Comunidade · hacker-news-api · spec-driven, agentes-de-codigo, open-source, claude-code
Simon Willison diz que a fusão resolve uma confusão que ele mesmo tinha ao separar Cowork, Claude e Claude Code. Para ele, o Claude passa a ser um agente geral,...
Comunidade · websearch · simon-willison, claude, agentes-gerais, produto
Um grupo de 10 bancos, entre eles Goldman Sachs, SMBC, Barclays, BNP Paribas e Bank of Nova Scotia, vai emprestar US$ 22 bilhões à Crux AI, empresa de nuvem cri...
Comunidade · websearch · google, tpu, infraestrutura, financiamento, data-center
Segundo o Financial Times, parte dos funcionários das duas empresas não esperava que Dario Amodei e Sam Altman defendessem publicamente desacelerar os modelo...
Comunidade · websearch · desaceleracao, anthropic, openai, governanca
O Dev Barometer do terceiro trimestre de 2026, da BairesDev, ouviu 705 desenvolvedores em mais de 60 países, 41 deles CTOs. A parcela que deixa a IA escrever pe...
Comunidade · websearch · desenvolvedores, programacao-com-ia, pesquisa, produtividade
Andy Nguyen (TheFlow0), que liderava o projeto de Linux no PS5, anunciou sua saída em 16/09. Ele atribuiu a decisão à entrada de desenvolvedores que usam LLMs p...
Comunidade · hacker-news-api · open-source, codigo-gerado-por-ia, manutencao, comunidade
A Universal Music Group entrou com ação contra a DistroKid num tribunal federal de Delaware, alegando práticas comerciais enganosas e violação de direitos autor...
Comunidade · websearch · musica, direitos-autorais, ia-generativa, litigio
Emil Michael, principal executivo de tecnologia do Departamento de Defesa dos EUA, disse no programa 'Squawk on the Street', da CNBC, que o governo Trump não de...
Comunidade · websearch · regulacao, pentagono, eua, politica-de-ia
Segundo a Tom's Hardware, um relatório da Mozilla calcula que os modelos chineses de pesos abertos estão cerca de quatro meses atrás das ofertas de fronteira do...
Comunidade · hacker-news-api · china, open-weight, mozilla, benchmarks
Mark Seemann argumenta que LLMs aceleram o desenvolvimento mas permitem construir sistemas acima do nível de compreensão de quem os constrói. Ele recomenda estu...
Comunidade · hacker-news-api · educacao, programacao, llm, carreira
A Langdock, plataforma corporativa de IA fundada em Berlim em 2023, trocou sua holding americana por uma Societas Europaea registrada na Alemanha, numa reestrut...
Comunidade · websearch · europa, soberania-digital, startups, cloud-act
O Ratepayer Protection Act incentiva reguladores estaduais a cobrar de grandes consumidores, como data centers acima de 100 MW, o custo de nova geração e tra...
Comunidade · websearch · energia, data-centers, regulacao, eua
Relatório da QA Wolf, empresa de testes, estima em US$ 1,17 trilhão anuais o custo global de código gerado por IA com defeito, somando retrabalho, débito técnic...
Comunidade · hacker-news-api · qualidade-de-software, custo, codigo-gerado, testes
O site lista 20 modelos de 8 laboratórios e compara a data de lançamento com o fim dos dados de treino. A diferença mostra o quanto cada modelo já estava desatu...
Comunidade · websearch · data-de-corte, modelos, transparencia, show-hn
Segundo o Pew, 56% dos democratas dizem estar mais preocupados que animados com a IA, contra 49% dos republicanos, o inverso do quadro de 2023. A parcela de ...
Comunidade · websearch · opiniao-publica, trabalho, eua