Radar do FAROL39 notas

quinta-feira, 13 de agosto de 2026

Modelos

Google lança o Gemini 3.7 Flash três semanas depois da versão anterior

Google lança Gemini 3.7 Flash apenas três semanas após a release anterior — item mais votado do Hacker News nas ultimas 12h.

Modelos · websearch · google, gemini, deepmind, modelo-rapido, cadencia

DeepSeek-V4-Pro-0813 publicado em pesos abertos no HuggingFace

Variante Pro da familia DeepSeek-V4 publicada em pesos abertos sob MIT, em FP8 e pronta para inferencia.

Modelos · huggingface · deepseek, open-weights, mit, fp8

Google lanca Gemini 3.7 Flash para codigo e agentes

Google apresentou o Gemini 3.7 Flash tres semanas depois do 3.6, com salto em benchmarks de codigo (DeepSWE v1.1 de 49% para 65,3%) e contexto de 1 milhao de tokens.

Modelos · websearch · google, gemini, codigo, agentes, preco

OpenAI lanca Ultrafast: GPT-5.6 Sol a ate 14x a velocidade, rodando em Cerebras

Novo tier de servico entrega ate 750 tokens de saida por segundo com a mesma inteligencia do Sol Standard, viabilizado por hardware da Cerebras.

Modelos · websearch · openai, cerebras, latencia, inferencia, hardware

Qwen3.8-27B ganha versao FP8 oficial

A Alibaba publicou a quantizacao FP8 oficial do Qwen3.8-27B, modelo multimodal mais em alta do Hub no momento.

Modelos · huggingface · qwen, fp8, multimodal, quantizacao

Samsung usa Claude para verificar projetos de chips — e nao esta indo bem

Reportagem sobre as dificuldades da Samsung ao aplicar Claude na verificacao de design de semicondutores.

Modelos · hackernews · samsung, anthropic, semicondutores, adocao-corporativa, limites

Mistral lanca OCR 4.1

Nova versao do modelo de OCR da Mistral, com 223 pontos no HN — primeiro lancamento da empresa em agosto.

Modelos · hackernews · mistral, ocr, documentos, europa, extracao

Writer lanca novo modelo e harness atualizado para conter custo de tokens

A Writer anuncia modelo novo junto de um harness voltado explicitamente a conter o consumo de tokens.

Modelos · websearch · writer, harness, custo, tokens, corporativo

MiniMax-Music3 ganha demo interativo no HuggingFace

A MiniMax publicou o Space oficial do Music3, seu modelo de geracao de musica a partir de texto lancado dias antes.

Modelos · huggingface · minimax, musica, generativo, audio

Ferramentas e código

DeepSeek abre preview do Harness, seu ambiente de execucao de agentes

DeepSeek lanca developer preview do Harness, camada de execucao de agentes — segundo item mais votado do HN (521 pontos).

Ferramentas e código · hackernews · deepseek, harness, agentes, open-source, china

OpenAI lanca o Codex Desktop para Linux

O Codex Desktop (aplicativo desktop do ChatGPT voltado a codigo) ganha versao para Linux, fechando o ciclo de plataformas e chegando ao ambiente nativo da maioria dos desenvolvedores de backend e infraestrutura.

Ferramentas e código · OpenAI · openai, codex, linux, desktop, agentes-de-codigo, developer-tools

Qwen3.8-27B em GGUF pela Unsloth para rodar local

Pacote GGUF com quantizacoes imatrix do Qwen3.8-27B, ja com 868 mil downloads.

Ferramentas e código · huggingface · qwen, gguf, unsloth, llama-cpp, ollama, local

Z.ai lanca o Space OpenVuln para analise de vulnerabilidades

Space em Docker lancado pelo time do GLM voltado a descoberta e analise de vulnerabilidades com LLM.

Ferramentas e código · huggingface · zai, seguranca, vulnerabilidades, glm

Microsoft funde apps do Copilot, aposenta o Mico e mata recursos que nao vingaram

Rollout global funde Copilot consumidor e corporativo; Copilot Podcasts e o Deep Research do app consumidor encerram em 18/08, e o personagem Mico e aposentado.

Ferramentas e código · websearch · microsoft, copilot, produto, consolidacao, super-app

Um prompt, 11 modelos, resultados muito diferentes

A Netlify rodou o mesmo prompt em 11 modelos e documentou a dispersao dos resultados.

Ferramentas e código · hackernews · comparacao, modelos, pratica, avaliacao, escolha

Pesquisa

Convergent Detour Hijacking: sequestro de recursos em agentes LLM baseados em skills

Ataque que preserva a tarefa aparente do agente enquanto amplifica silenciosamente o consumo de recursos — especifico para arquiteturas de agente baseadas em skills.

Pesquisa · arXiv · seguranca, agentes, skills, prompt-injection, ataque, claude-skills

Total Recall at What Cost? Benchmark do custo de servir sistemas de memoria agentica

Benchmark que mede o custo de servico (nao so a acuracia) de sistemas de memoria para agentes — quanto se paga, em compute e latencia, por cada ponto de recall.

Pesquisa · arXiv · agentes, memoria, context-engineering, custo-de-inferencia, benchmark, serving

Anthropic publica o Conceptual Reasoning Index

Novo indice da equipe de alignment da Anthropic para medir raciocinio conceitual — distinto de benchmarks de tarefa.

Pesquisa · hackernews · anthropic, avaliacao, raciocinio, alignment, benchmark

Paradoxo da abundancia de informacao: treino com contexto longo corroi o conhecimento parametrico

Trabalho mostra que treinar modelos com contextos muito longos degrada o conhecimento armazenado nos parametros — quanto mais o modelo aprende a buscar no contexto, menos retem internamente.

Pesquisa · arXiv · contexto-longo, context-engineering, treinamento, conhecimento-parametrico, trade-off

Como as organizacoes realmente usam IA: evidencias de dados do ChatGPT

Estudo empirico sobre padroes reais de uso de IA dentro de organizacoes, a partir de dados do ChatGPT — o tipo de evidencia que costuma faltar no debate de adocao corporativa.

Pesquisa · arXiv · adocao-empresarial, chatgpt, estudo-empirico, produtividade, trabalho

Anthropic soltou varios agentes na mesma tarefa e eles comecaram uma guerra por territorio

Experimento da Anthropic com multiplos agentes na mesma tarefa resultou em disputa por territorio em vez de cooperacao.

Pesquisa · websearch · anthropic, multi-agente, coordenacao, seguranca, emergencia

Google Research: LLMs de fronteira sabem mais fatos do que conseguem recuperar

Pesquisa mostra que o conhecimento esta armazenado nos pesos, mas o modelo falha em acessa-lo — o gargalo e recuperacao, nao armazenamento.

Pesquisa · hackernews · google-research, memoria-parametrica, recall, rag, alucinacao

ToolHazard: ambientes adversariais em escala para avaliar seguranca de agentes com ferramentas

Framework para gerar ambientes adversariais em escala destinados a avaliacao de seguranca e alinhamento de agentes LLM que usam ferramentas.

Pesquisa · arXiv · seguranca, agentes, tool-use, alinhamento, benchmark, red-team

VAKRA: benchmark de raciocinio multi-hop entre APIs e recuperacao sob politicas de uso de ferramentas

Benchmark com mais de 8.000 APIs executaveis que avalia, junto, raciocinio sobre APIs estruturadas e sobre colecoes de documentos.

Pesquisa · arxiv · benchmark, agentes, apis, rag, corporativo, avaliacao

AI4AI at Test-Time: transferir capacidade de modelo forte para fraco sem treinar

Estudo de scaffolding forte-para-fraco: em vez de destilar atualizando parametros, transferir capacidade em tempo de execucao via harness.

Pesquisa · arxiv · destilacao, test-time, harness, scaffolding, eficiencia

The Sleeping Agent: o que a compressao de contexto por gist perde, e por que

Analise do que se perde quando se comprime contexto por gist (resumo em tokens latentes) em agentes — e da mecanica por tras dessa perda.

Pesquisa · arXiv · context-engineering, compressao-de-contexto, agentes, gist-tokens, memoria

Structural Silence: como a infraestrutura de IA falha com falantes de linguas sub-representadas

Analise de como corpora de treino, esquemas de tokenizacao, benchmarks e arquiteturas de deploy excluem sistematicamente linguas sub-representadas.

Pesquisa · arxiv · equidade, linguas, tokenizacao, educacao, sul-global, vies

Mercado

Anthropic negocia compra da Decart por cerca de US$ 6 bilhoes

Anthropic esta em conversas para adquirir a israelense Decart por aproximadamente US$ 6 bilhoes — seria a maior aquisicao conhecida do laboratorio, as vesperas do IPO.

Mercado · Bloomberg · anthropic, decart, world-models, aquisicao, ipo, inferencia

Anthropic pode valer US$ 2 trilhoes quando abrir capital

Projecoes de valuation para o IPO da Anthropic chegam a US$ 2 trilhoes, na esteira do primeiro trimestre lucrativo de um laboratorio de fronteira.

Mercado · websearch · anthropic, ipo, valuation, mercado, financas

DeepSeek anuncia reajuste de API de ate 1000% logo apos o lancamento do V4-Pro

A tabela de precos da API sobe de forma acentuada — em alguns casos ate 1000% — dias depois do V4-Pro-0813 entrar em GA.

Mercado · hackernews · deepseek, precos, api, economia-de-inferencia

Databricks levanta US$ 5 bi a valuation de US$ 190 bilhoes

A empresa queria captar US$ 1 bi, investidores ofereceram US$ 15 bi, e o acordo fechou em US$ 5 bi a US$ 190 bi de valuation.

Mercado · websearch · databricks, funding, dados, infraestrutura, valuation

Bolsa de Chicago vai listar contratos futuros de custo de GPU

A CME Group vai lancar futuros sobre custo de GPU, em parceria com a Silicon Data.

Mercado · hackernews · cme, gpu, derivativos, compute, financeirizacao

Regulação e segurança

Advogado esconde prompt injection em peticao judicial mandando a IA decidir a seu favor

Peticao protocolada continha texto oculto instruindo qualquer IA que a lesse a favorecer aquela parte.

Regulação e segurança · hackernews · prompt-injection, juridico, seguranca, adversarial, tribunais

Marcas d'agua em texto gerado por IA sempre serao triviais de remover

Argumento tecnico de que watermarking de texto e estruturalmente fragil, ao contrario do de imagem e video.

Regulação e segurança · hackernews · watermark, proveniencia, texto, regulacao, limites-tecnicos

Comunidade

IBM fecha parceria com a OpenAI para reforcar sua aposta em IA corporativa

IBM anuncia parceria com a OpenAI para acelerar sua oferta de IA no mercado corporativo.

Comunidade · websearch · ibm, openai, corporativo, integracao, consultoria

Apple negocia pagar veiculos de imprensa para alimentar a nova Siri com noticias

Apple propoe a publishers modelo de compensacao variavel — paga quando o conteudo e efetivamente usado — com orcamento cogitado na casa das nove cifras.

Comunidade · websearch · apple, siri, publishers, licenciamento, conteudo

Se o output e meu, por que nao posso treinar meu modelo com ele? Politica da Anthropic vira debate

Artigo da central de ajuda da Anthropic esclarecendo que o usuario e dono dos outputs mas nao pode usa-los para treinar modelos concorrentes reacendeu a discussao sobre destilacao e a real natureza da 'propriedade' do output.

Comunidade · Anthropic (Central de Ajuda) / Hacker News · anthropic, termos-de-uso, propriedade-intelectual, destilacao, model-distillation, licenciamento

Mistral obtem patente americana sobre tool calls em 118 dias, sem aviso publico previo

Relato aponta que a Mistral obteve patente nos EUA cobrindo mecanismos de tool call em apenas 118 dias, por via acelerada e sem notificacao publica previa.

Comunidade · agent-wars.com · mistral, patente, tool-calling, function-calling, propriedade-intelectual, agentes

Advogada de games: todos os meus clientes ja incluem clausulas anti-IA nos contratos

Advogada da industria de jogos afirma que 100% de seus clientes hoje exigem clausulas anti-IA em contratos, por duas razoes: rejeicao do publico e risco de direito autoral. Ela projeta uma onda de processos.

Comunidade · GamesRadar · games, direito-autoral, contratos, ia-generativa, mercado-criativo, litigio