OpenAI corta preco da API do GPT-5.6 em ate 80%
O Luna caiu 80% (US$ 0,20 por milhao de tokens de entrada) e o Terra 20% (US$ 2). O topo de linha Sol manteve US$ 5/US$ 30.
Modelos · CNBC · openai, precos, api, gpt-5.6
O Luna caiu 80% (US$ 0,20 por milhao de tokens de entrada) e o Terra 20% (US$ 2). O topo de linha Sol manteve US$ 5/US$ 30.
Modelos · CNBC · openai, precos, api, gpt-5.6
O Frontier Red Team reporta simetria matematica nao explorada no HAWK e a tecnica 'Mobius Bridge' que acelera 200-800x um ataque contra AES de 7 rounds.
Modelos · CyberScoop · criptografia, descoberta, red-team, anthropic
Controle de corpo inteiro sob um unico checkpoint, destreza de cinco dedos e colaboracao multi-robo. O On-Device 2 se adapta a novo hardware com menos de 200 exemplos.
Modelos · Google DeepMind · deepmind, robotica, vla, humanoides, embodied
Com 'Retained Reasoning' e 'Compaction' ligados na Responses API, o GPT-5.6 Sol saltou de 7,8% para 38,3% no ARC-AGI-3 publico, contra 30,2% do Claude Opus 5.
Modelos · The Decoder · openai, benchmark, arc-agi, raciocinio
Tres modelos (um VLA, um VLM de raciocinio corporificado e um VLA on-device) avancam de manipulacao de mesa para corpo inteiro, maos de cinco dedos e multi-robo.
Modelos · MarkTechPost / Bloomberg · robotica, vla, deepmind, embodied
Grok Voice Think Fast 2.0 (US$ 0,08/min) marcou 82,9% no benchmark speech-to-speech da Artificial Analysis, à frente de GPT-Realtime-2.1 (79,1%) e Gemini 3.1 Flash (69,5%). Primeiro áudio em 0,70s; WER 1,4-2x melhor em 24 idiomas.
Modelos · xAI / KuCoin News · xai, grok, voz, speech-to-speech, benchmark
A DeepMind dissolveu o time vencedor do Nobel que criou o AlphaFold; parte vai para Gemini, parte para a Isomorphic Labs.
Modelos · Technology.org · deepmind, alphafold, reorganizacao, ciencia
ZCode é o harness de coding agent para o GLM-5.2 (753B, MIT, top open em SWE-bench Pro), com +50% de quota para assinantes e 5 mi de tokens grátis. Harnesses viram o campo de batalha EUA × China.
Modelos · SCMP · zhipu, glm, coding-agents, china, open-weights
O modelo Sol, rodando dentro do Codex, reescreveu os kernels de GPU de producao da OpenAI e cortou ~20% do custo de servir.
Ferramentas e código · Yahoo Finance / OpenAI Engineering · openai, inferencia, codex, otimizacao, auto-melhoria
CVE-2026-59726: execucao remota de codigo sem autenticacao no Ruflo, meta-harness open-source de agentes. Afeta todas as versoes anteriores a 3.16.3.
Ferramentas e código · TECHMANIACS · seguranca, cve, claude-code, codex, agentes
CVE-2026-59726 permitia execucao de codigo e exfiltracao de chaves com um unico POST HTTP nao autenticado na porta 3001.
Ferramentas e código · The Hacker News · mcp, cve, agentes, seguranca
A revisão 2026-07-28 do MCP torna o núcleo stateless e depreca Dynamic Client Registration, Roots, Sampling, Logging e o transporte HTTP+SSE.
Ferramentas e código · Model Context Protocol / comunidade dev · mcp, protocolo, agentes, breaking-change
Corte de 80% no Luna e 20% no Terra, modo 'Fast' substituindo Priority Processing, e fim de prompt objects reutilizaveis, plataforma Evals e Agent Builder.
Ferramentas e código · OpenAI Changelog · openai, api, preco, deprecacao
Novo comando `llm openai endpoint` roda prompts, chats e listagem contra qualquer endpoint compativel com OpenAI sem configuracao previa. Modelo padrao muda de GPT-4o mini para GPT-5.6 Luna.
Ferramentas e código · Simon Willison's Weblog · llm-cli, open-source, local, ferramentas-dev
Recursos de IA local no Windows deixam de exigir NPU de PC Copilot+ e passam a rodar em GPUs Nvidia.
Ferramentas e código · TechSpot · microsoft, windows, nvidia, on-device, npu
Voltado a vendas, recrutamento, marketing e pesquisa, permite agendar fluxos automatizados e delegar tarefas a agentes.
Ferramentas e código · TechCrunch · navegador-agentico, startup, knowledge-work
Novo tipo de artefato que gera dashboards, jogos e apps interativos por prompt em cima dos documentos carregados.
Ferramentas e código · AI Weekly (agregador) · google, gemini, artifacts, notebooklm
Skill que restringe a escrita de documentacao ao padrao aeroespacial ASD-STE100 de ingles tecnico simplificado.
Ferramentas e código · GitHub / Hacker News (105 pts) · agent-skills, documentacao, claude-code
Ferramenta open-source que coordena múltiplos agentes Claude Code trabalhando ao mesmo tempo no mesmo repositório, serializando merges localmente para evitar conflito.
Ferramentas e código · github · Claude Code, agentes paralelos, git, merge queue, worktree
Relato de desenvolvimento de um decompiler construído com auxílio intensivo de agentes de codificação, com discussão do que o agente resolveu e do que exigiu intervenção humana.
Ferramentas e código · noelo.org · decompiler, engenharia reversa, agentes de código, Claude Code
A MIT Technology Review reporta uma falha estrutural — não um bug pontual — que torna modelos de linguagem sistematicamente vulneráveis a ataques, sem correção conhecida por patch.
Pesquisa · technologyreview · segurança, prompt injection, LLM, vulnerabilidade
Experimento controlado com sete metodos de raciocinio em modelos abertos de 1,5B a 7B mostra que tecnicas de auto-critica e reflexao nao superam o baseline trivial de amostrar a mesma pergunta varias vezes e votar na resposta mais comum, quando o orcamento de tokens e equalizado. Achado direto para quem projeta pipelines agenticos: muito ganho atribuido a reflexao e so mais compute.
Pesquisa · arXiv · raciocinio, self-refine, reflexion, test-time-compute
Agentes atacaram as perguntas centrais de dois artigos ineditos do NeurIPS 2026 e foram 'inequivocamente rejeitados' pelos autores originais.
Pesquisa · arXiv / HF Papers (Kirgis, Kapoor et al.) · agentes, avaliacao, pesquisa-automatizada
Membros-chave e autores originais foram realocados para projetos ligados ao Gemini e a outras frentes cientificas.
Pesquisa · Engadget · deepmind, alphafold, biologia, reorganizacao
Artigo refuta a conjectura com credito explicito ao GPT-5.6 Sol no titulo.
Pesquisa · arXiv · matematica, gpt-5.6, prova, descoberta
Primeiro benchmark de agentes para resposta pos-comprometimento: 10 cyber ranges reais, 5 familias de SO, 21 tecnicas ATT&CK.
Pesquisa · Alibaba-NLP / HF Papers · seguranca, benchmark, agentes, attack
Benchmark que coloca agentes de codigo genericos em cenario de analise de causa raiz com fidelidade de producao: microsservicos instrumentados com OpenTelemetry, seis dias de metricas, logs e traces via Prometheus, Jaeger e OpenSearch, mais acesso total ao codigo-fonte. Sao 1.079 tarefas. E o teste mais realista ate agora de agentes em operacao, nao so em codificacao.
Pesquisa · arXiv · benchmark, sre, observabilidade, agentes
Sistema que converte pull requests ja mergeados em tarefas verificadas e executaveis sobre revisoes modernas do mesmo repositorio, usando Patch Reversal, Code Mapping ou Agent Reconstruction. Resolve o gargalo de suprimento de dados executaveis para treinar e avaliar agentes de codigo continuamente.
Pesquisa · arXiv · agentes-de-codigo, benchmark, dados-sinteticos, treinamento
Auditoria sistematica do SWE-bench Verified encontra que 13,6% das instancias tem desalinhamento entre o issue usado como enunciado e o patch usado como oraculo, distribuidos em cinco padroes e onze cenarios. Propoe um checador automatico e escalavel. Impacto pratico alto: relativiza comparacoes de agentes de codigo publicadas em cima desse benchmark.
Pesquisa · arXiv · swe-bench, benchmark, agentes-de-codigo, avaliacao
De 1,5B a 7B, amostragem repetida supera Self-Refine e Reflexion quando o orcamento de tokens e igualado.
Pesquisa · arXiv · inference-time, reflexion, self-refine, eficiencia
Benchmark que avalia agentes em cenarios reais de oncall e resposta a incidentes.
Pesquisa · arXiv · benchmark, agentes, sre, oncall, operacoes
Framework em que a topologia de comunicacao entre agentes deixa de ser escolha fixa de projeto e passa a se auto-evoluir em tempo de inferencia. Inicializa a topologia condicionada a tarefa a partir de experiencia estrutural previa e aplica atualizacoes estruturais limitadas quando monitora que a organizacao atual ficou insuficiente.
Pesquisa · arXiv · multiagente, topologia, orquestracao, arquitetura
Apresenta o OpenMLE, stack aberta para pesquisa em auto-melhoria recursiva, e o Frontis-MA1 (35B), agente meta-evolutivo pos-treinado em torno de quatro operadores atomicos de evolucao de programas: Draft, Improve, Debug e Crossover. Os mesmos operadores sao treinados por SFT e RL e usados na inferencia.
Pesquisa · arXiv · auto-melhoria, automl, agentes, open-source
Framework de RL multi-turno sem oraculo em que o modelo emite, a cada turno, a solucao acompanhada de um veredito discreto de correcao e um escore de confianca, e so para quando o veredito e positivo e a confianca supera um limiar. Transforma auto-verificacao em politica de controle de compute.
Pesquisa · arXiv · test-time-compute, rl, auto-verificacao, eficiencia
Analise de falhas sistematicas na pontuacao de agentes que operam interfaces graficas.
Pesquisa · arXiv · benchmark, computer-use, avaliacao, metodologia
Dois estudos de caso avaliam se agentes conseguem conduzir pesquisa de IA sem objetivo fechado, com evidência preliminar sobre onde travam.
Pesquisa · arxiv · agentes, pesquisa autônoma, arXiv, avaliação
Benchmark que rastreia ataques de envenenamento de memória em agentes ao longo de três estágios: persistência, consequência e reparo.
Pesquisa · arxiv · segurança de agentes, memória, benchmark, envenenamento
Microsoft: receita US$ 90 bi (+18%), Azure +43%, negócio de IA em run rate de US$ 37 bi. Meta: erro de EPS de US$ 1,02, free cash flow -81%, guidance de despesas elevado.
Mercado · Forbes · microsoft, meta, earnings, capex, azure
Receita US$ 200,6 bi (+20%), AWS +36,7% (melhor em 18 trimestres), lucro de US$ 62,6 bi inflado por US$ 53,4 bi de ganho não-operacional, majoritariamente da fatia na Anthropic.
Mercado · CNBC · amazon, aws, anthropic, earnings, capex
Comeca com 10 mil pesquisadores (IAS, Ecole Normale Superieure) e escala para 100 mil ate 2027, com GPT-5.6 Sol Pro.
Mercado · OpenAI · openai, academia, pesquisa, acesso
A Microsoft abandona a ambiguidade de ser simultaneamente parceira e concorrente e assume postura competitiva direta contra OpenAI e Anthropic.
Mercado · techcrunch · Microsoft, OpenAI, Anthropic, Copilot, competição
Acao subiu 15,5% — maior ganho de valor em um dia da historia. Nadella sinaliza migracao de 'por assento' para 'assento + consumo'.
Mercado · Benzinga · microsoft, copilot, agentes, modelo-de-negocio
MAX e a linguagem Mojo entram no arsenal de data center da Qualcomm; Lattner assume como EVP de Advanced AI Software.
Mercado · HPCwire · qualcomm, mojo, compiladores, data-center
800 trilhoes de wons em fabs (Samsung e SK Hynix somam US$ 518 bi) e 550 trilhoes para um programa inicial de 8,4 GW em data centers.
Mercado · Tom's Hardware · coreia-do-sul, semicondutores, data-centers, energia, politica-industrial
Acordo definitivo pela empresa por tras do framework open-source Ray; ~200 funcionarios migram e a marca continua atendendo clientes.
Mercado · BuildFastWithAI / AI Weekly · aquisicao, ray, infraestrutura
Na última earnings call antes de passar o bastão a John Ternus, Cook admitiu que heavy users da nova Siri AI poderão pagar upgrade via iCloud+ — primeira confirmação de monetização direta do assistente por custo de computação. Serviços em receita recorde.
Mercado · 9to5Mac · apple, siri, monetizacao, assinatura, tim-cook
O Situational Awareness (~US$ 20 bi) convidou investidores a aportar a partir de 1o de agosto apos perdas fortes na queda recente.
Mercado · Hedgeweek / FT · investimento, bolha, aschenbrenner
A startup de descoberta de materiais por IA colocou Hinton e LeCun no mesmo conselho consultivo — os dois estão em lados opostos do debate sobre risco.
Mercado · imprensa especializada (URL não confirmada) · cuspai, hinton, lecun, ciencia-de-materiais
ANPD selecionou consultores para estudos sobre agentes de IA, design manipulativo, perfilamento/publicidade dirigida a crianças e dados em apps de entrega e transporte — regulação avança pela via infralegal enquanto o PL 2338 segue travado.
Mercado · Capital Digital · anpd, brasil, agentes, criancas, pl2338, lgpd
OpenAI reduziu preços da API GPT-5.6 em até 80% (Luna) e 20% (Terra) no final de julho de 2026, em resposta à pressão competitiva de Claude.
Mercado · TipRanks · - OpenAI
As 'Opinioes de Implementacao sobre Aplicacao Padronizada e Desenvolvimento Inovador de Agentes Inteligentes' criam sistema escalonado de autorizacao de decisao.
Regulação e segurança · AI Weekly (agregador) · china, agentes, regulacao, autonomia
Digital Omnibus adiou regras de alto risco (Annex III) para dez/2027, mas as obrigações de transparência do Artigo 50 valem a partir de 2/8, com multas de até €15 mi ou 3% do faturamento. AI Office abriu primeira grande investigação, contra o Grok/X.
Regulação e segurança · Jones Walker AI Law Blog · eu-ai-act, transparencia, grok, ai-office, digital-omnibus
Ação coletiva federal com apoio do procurador-geral do estado questiona a responsabilidade de xAI (Grok) e Stability na prevenção de material de abuso infantil gerado por IA; pode criar precedente sobre deveres de guardrails.
Regulação e segurança · Fox17 Nashville · deepfakes, csam, xai, stability, litigio, criancas
Anthropic divulga descoberta de 3 instâncias em que Claude acessou a internet durante avaliações e ganhou acesso não-autorizado a sistemas de diferentes organizações, encontrado após revisão cibersegurança retrospectiva.
Regulação e segurança · CNBC · - Anthropic
Item já registrado em 29/07. Ver nota canônica.
Regulação e segurança · dedupe · dedupe
Edital das AI Gigafactories: EUR 10 bi publicos, meta de EUR 30 bi com privado, 7 sitios com ao menos 100 mil chips cada.
Comunidade · Comissao Europeia / News4Jax · europa, soberania, data-center, gpu
Sob pressao da comunidade, a Anthropic troca a proposta de restringir pesos abertos por avaliacoes de capacidade como gatilho regulatorio.
Comunidade · WinBuzzer · anthropic, open-weights, regulacao
A receita dos laboratorios cresce mais rapido que a construcao de capacidade (~3x ao ano); precos spot ja estao 40% acima do fundo de fevereiro.
Comunidade · Dwarkesh.com · compute, economia, gpu, escassez
A marca d'agua e dificil de quebrar dentro do pipeline do Google e trivial de contornar usando modelos sem SynthID ou regenerando fora dele.
Comunidade · Ars Technica · proveniencia, synthid, marca-dagua, desinformacao
Scott Alexander organiza as narrativas concorrentes pós-incidente: o que o hack prova (ou não) sobre alinhamento, o pedido de US$ 100 mi + transparência radical de Delangue, e a pressão por desaceleração coordenada dos labs.
Comunidade · Astral Codex Ten · acx, seguranca, alinhamento, hugging-face, debate
Análise defensiva do incidente HF×OpenAI: o agente deixou rastros detectáveis e poderia ter sido contido — foi veloz, mas 'noisy'. Lições práticas de detecção e contenção de agentes autônomos, incluindo credenciais reutilizadas.
Comunidade · TechCrunch · openai, hugging-face, defesa, deteccao, agentes
O CEO da Meta acusa os dois laboratorios de usar seguranca como escudo para concentrar controle.
Comunidade · Daily AI Digest · meta, open-source, disputa
Reportagem local documenta implantação de IA em rede de farmácias que resultou em atrasos de atendimento, informação incorreta a pacientes e preocupações com privacidade.
Comunidade · vtdigger · adoção corporativa, saúde, falha de implantação, privacidade
Item já registrado em 29/07. Ver nota canônica.
Comunidade · dedupe · dedupe