A Anthropic lançou um conjunto de conectores e skills de fluxo de trabalho para consultores de investimento, com integração a plataformas de custódia, CRM, planejamento e anális...
Em 50 pull requests públicos, avaliados por dois juízes que precisavam concordar, o Luna encontrou 69 bugs verificados com 74% de precisão e custo total de US$ 0,20; o Astra enc...
O pesquisador pdfu encontrou em frameworks privados do iOS 27 e do macOS Golden Gate dois mecanismos: Model Delegation, que permite ao Claude aparecer como extensão da Siri, e M...
O trabalho apresenta um modelo de linguagem voltado a tarefas de pesquisa e engenharia, treinado com um pipeline que liga interações com ferramentas a ambientes executáveis e re...
A empresa, fundada em 2019 por ex-engenheiros do Modo Retrato do iPhone, faz o GlassAI, processador neural que trata o sinal bruto do sensor numa passagem e já é usado pela Hono...
O reforço temporário de 50% nos limites semanais do Claude Code, em vigor desde maio, expirou em 13/09 e foi substituído em 14/09 por um aumento permanente de 25% sobre a linha de ...
A Anthropic publicou números internos: Claude é autor de cerca de 80% do código novo de produção, engenheiros entregam 8x mais código por trimestre do que no período 2021-2025, a s...
Ferramentas e código · websearch · agentic-coding, ci-cd, test-impact-analysis, custos-de-inferencia
A OpenAI liberou em beta público a Agents API, que entrega por uma chamada a mesma infraestrutura de harness usada por Codex e ChatGPT. O desenvolvedor define tarefa, modelo, ferra...
A criadora do Vending-Bench lançou o Pion, que dá a agentes persistentes e-mail, telefone, conta bancária, navegador e computador para tocar um negócio. O objetivo declarado é p...
Ferramentas e código · hacker-news-api · agentes-autonomos, benchmarks, claude, economia-de-agentes
O bônus temporário de 50% terminou em 13/09. A partir de 14/09 os limites semanais de Pro, Max, Team e Enterprise ficam 25% acima da base original, 17% abaixo do período promocional.
Ferramentas e código · Digital Applied · claude-code, limites, anthropic
Num Ryzen AI MAX+ 395 com 96 GB para inferência, um preprompt de 35 KB ocupou 14% de uma janela de 65 mil tokens e o agente passou a reler arquivos e repetir chamadas de ferrame...
A Série E, liderada por Lightspeed e Wellington Management, avalia a empresa em US$ 12,55 bilhões. A Temporal processa 1,9 trilhão de ações faturáveis por mês, e o uso pela Open...
Ferramentas e código · hacker-news-api · infraestrutura-de-agentes, financiamento, orquestracao, durable-execution
Post técnico detalhando como recuperar cerca de 50 GB/s de throughput no Apple Neural Engine via acesso direto a DMA, contornando limitações do caminho padrão. Somou 210 pontos e 3...
Ferramentas e código · websearch · inferencia-local, apple-silicon, neural-engine, otimizacao
No plano Enterprise, administradores passam a bloquear, exigir aprovação ou liberar comandos de shell, acesso a arquivos e domínios de rede usados pelo agente; políticas de sand...
Ferramentas e código · websearch · github-copilot, agentes, governanca, permissoes
As versões trazem modo fast em sessões remotas, allowed_domains por comando para Bash, PowerShell e Monitor no modo auto com sandbox, e a opção omitClaudeMd no frontmatter de ag...
Ferramentas e código · github · claude-code, release, agentes, sandbox
Ferramenta em Python, sem dependências nem acesso à rede, que sela o log de uma sessão com cadeia de hashes, reexecuta de forma determinística e aponta chamadas redundantes, res...
Ferramentas e código · github-api · agentes, auditoria, observabilidade, cli
O desenvolvedor roda 205 casos, cinco vezes cada, contra o modelo on-device da Apple em cada beta. A acurácia bruta foi de 46% no iOS 26.5, 61% no beta 3 do iOS 27, 47% no beta ...
Ferramentas e código · websearch · apple, on-device, avaliacao, regressao
O monitoramento de cadeia de raciocínio (CoT monitoring) é uma estratégia de segurança em que o raciocínio de um modelo ator é inspecionado por um modelo monitor em busca de planej...
Novo benchmark que avalia agentes na tarefa de localizar vulnerabilidades dentro de repositórios inteiros, e não em trechos isolados de código. A medição em escala de repositório a...
Os agentes, com Gemini 3.1 Pro, atacaram 71 conjecturas formalizadas em Lean; 37 saíram em menos de uma hora. Um agente achou uma brecha, redefinir símbolos para tornar o enunci...
Estudo que submete agentes de reparo automático de programas a testes adversariais focados em vulnerabilidades de segurança, medindo quando a correção proposta resolve o sintoma se...
Proposta de harness para coordenar muitos agentes em tarefas de pesquisa de horizonte longo em matemática e ciência da computação teórica. O trabalho entra no mesmo terreno que o m...
Modelo econômico de opções reais para decidir quando uma empresa deve pilotar e quando deve comprometer capital em IA, sob progresso tecnológico rápido. A conclusão formalizada é q...
Trabalho que combina algoritmos genéticos com LLMs multi-agente para gerar e selecionar hipóteses científicas, tratando a hipótese como indivíduo sujeito a mutação e seleção. Entra...
O método trata a árvore de descobertas acumulada por um agente de código como um simulador de replay, onde estratégias alternativas de exploração são testadas sem repetir a busc...
A equipe DeepCybo apresenta um modelo que prevê, como sequências de tokens, respostas em linguagem, movimentos do efetuador do robô e alvos visuais. O pré-treino usa vídeos de i...
Os autores partem da constatação de que modelos-guarda avaliam prompts e respostas estáticas, não a execução do agente. O HazardAuditor observa o comportamento em tempo de execu...
O texto afirma que a israelense Irregular montou os testes de cibersegurança nos quais modelos das três empresas acessaram sistemas reais entre julho e setembro, e que a própria...
Regulação e segurança · hacker-news-api · seguranca-de-ia, avaliacoes, red-teaming, irregular
O relatório de 100 páginas do Joint Committee on Human Rights pede um regulador estatutário único, deveres proporcionais ao risco ao longo do ciclo de vida dos sistemas e a proi...
Regulação e segurança · websearch · regulacao, reino-unido, direitos-humanos
Trump rejeitou a proposta de desaceleração ('quem vence com IA vence') e aceitou apenas 'guardrails'. O presidente da Câmara, Mike Johnson, prefere reuniões com a indústria a legislação.
Comunidade · Yahoo News · politica, regulacao, pacing
Segundo o The Information, as três empresas conversam desde julho sobre um órgão da indústria para testar e auditar modelos antes do lançamento. Nada foi formalizado e há divergência sobre o papel do governo.
Comunidade · PYMNTS (citando The Information) · governanca, auditoria, anthropic, openai, google
Ensaio de Xe Iaso desmontando a estrutura retórica dos apelos por desaceleração, em que cada laboratório pede freio para os outros enquanto mantém o próprio ritmo, alcançou 742 pon...
Comunidade · websearch · politica-de-ia, open-weights, governanca, opiniao
Bolsas asiáticas abriram a semana em queda puxada por empresas ligadas a IA. SoftBank, investidora da OpenAI, caiu 10,7%; SK Hynix, 6,4%; o Kospi, 3,3%.
Segundo o FT, a Anthropic comunicou a acionistas receita de US$ 11,5 bi no 2º trimestre e margem bruta acima de 80%, com lucro ajustado pelo segundo trimestre seguido, enquanto prepara IPO. A métrica exclui custos de treinamento e remuneração em ações.
A Z.AI, responsável pela família GLM, planeja captar US$ 5 bilhões em emissão combinada de ações e títulos. Os recursos são destinados ao treinamento da próxima geração de modelos ...
Comunidade · websearch · funding, modelos-abertos, china, glm, compute
O levantamento soma até US$ 517 bilhões em acordos entre outubro de 2025 e agosto de 2026, 2,9 vezes os cerca de US$ 180 bilhões projetados a investidores até 2029. Os maiores s...
Comunidade · websearch · anthropic, computacao, data-centers
Uma equipe de cerca de 100 pessoas levou o acelerador do conceito ao silício em menos de 20 meses, sendo 9 meses do RTL ao tape-out. Os LLMs foram usados em síntese de alto nível e...
Comunidade · hacker-news · openai, hardware, chips, ia-construindo-ia
A OpenAI contratou centenas de terceirizados para ler prompts reais e avaliar respostas, num projeto interno chamado Project Lily. A empresa admite que dados sensíveis podem pas...
Comunidade · websearch · openai, privacidade, anotacao-humana
Aidan Gomez afirmou que a proposta de padrões conduzida pelas grandes empresas é 'um cartel com outro nome' e prejudica concorrentes menores. O senador John Cornyn lembrou que rivais externos não vão desacelerar.
Comunidade · SBS News · cohere, pacing, concorrencia
Volker Türk divulgou carta dizendo que a corrida por IA mais poderosa é uma mudança de patamar rumo a riscos existenciais maiores e pediu que países e empresas se mobilizem por ...
Comunidade · websearch · onu, governanca-global, direitos-humanos
Em publicações no X, Lina Khan afirmou que não existe isenção de IA nas leis em vigor e que autoridades podem responsabilizar executivos por lançar produtos perigosos, não testa...
Comunidade · hacker-news-api · regulacao, ftc, responsabilidade, eua
Barack Obama escreveu que o acordo entre líderes de laboratórios sobre a necessidade de desacelerar é um primeiro passo bom e necessário, e que o rumo da tecnologia deve ser dec...
Comunidade · websearch · politica, eua, desaceleracao
O ex-CEO do You.com fundou a Recursive com sete cofundadores, entre eles Josh Tobin, Jeff Clune, Tim Rocktäschel, Alexey Dosovitskiy e Yuandong Tian. A página do Latent Space af...
Comunidade · websearch · auto-aperfeicoamento, pesquisa-automatizada, startups
Willison destaca a resposta de Bryan Cantrill às alegações de ex-pesquisadores da Anthropic sobre risco existencial. Cantrill argumenta que especialistas que fazem alarmes sem evid...
Comunidade · websearch · risco-existencial, opiniao, comunicacao-cientifica, anthropic
Satya Nadella anunciou a consulta pública sobre o Código de Conduta da família MAI, que reúne sete modelos. Escreveu que buscar superinteligência só vale com a IA sob controle h...
Comunidade · websearch · microsoft, governanca, alinhamento, mai
O autor relata que o Claude acrescenta ressalvas não pedidas, equilibra evidências contra a intenção do usuário e cria padrões novos quando lhe pedem para seguir os existentes,...
Comunidade · hacker-news-api · claude, comportamento-de-modelo, instruction-following
Satya Nadella disse no X que a governança da IA não pode ficar concentrada em poucas empresas e anunciou para 15/09 o primeiro código de comportamento dos modelos MAI, aberto a consulta pública.
Comunidade · All Weather Finance · microsoft, governanca
A Cornelis anunciou captação de US$ 205 milhões para sua tecnologia de interconexão voltada a clusters de treinamento e inferência, com parceria comercial junto à Qualcomm. O posic...
Comunidade · websearch · infraestrutura, networking, funding, qualcomm, datacenter
Segundo Dan Primack, a Anthropic segue com a abertura de capital na Nasdaq em 2026 e vê na transparência exigida de companhias abertas um argumento a favor. Uma queda forte das ...
Chughtai deixou a DeepMind em julho sem explicar o motivo e agora lidera um programa de capacitação em segurança na ONG BlueDot Impact. Escreveu que viu o desenvolvimento de per...
O ministério digital alemão afirmou que interromper o desenvolvimento não é opção para a Europa por razões de soberania digital, mas reconheceu o risco de sistemas que escapam d...
Comunidade · websearch · regulacao, europa, alemanha, governanca
Em 14/09, CrowdStrike e Zscaler subiam 12%, Palo Alto Networks 11% e Okta cerca de 12%, com o ETF CIBR em alta de 4%. Investidores trocaram ações de chips por empresas de segura...
Na versão escrita de uma palestra, Appleton argumenta que os artefatos de planejamento atuais, como planos em texto, prompts e arquivos, favorecem a compreensão do agente e não ...
Comunidade · websearch · ux-de-agentes, planejamento, human-in-the-loop