Radar do FAROL44 notas

domingo, 16 de agosto de 2026

Modelos

Qwen3.8-27B abliterado derruba recusas de ate 99% para menos de 6% com perda minima

Variante com a direcao de recusa removida das ativacoes do Qwen3.8-27B, quantizada em block-FP8: taxas de recusa caem de 64-99% para 0-6%, com variacao inferior a 1,3 ponto em MMLU e GSM8K.

Modelos · huggingface · qwen, abliteration, open-weights, alinhamento, fp8, seguranca

Faraday 27B: ambiente de treino para replicacao de pesquisa supera Opus 4.8 e GPT-5.5

Espaco de tarefas escalavel para replicacao de papers com juiz automatico baseado em rubrica; o agente Faraday, de 27B pos-treinado nesse ambiente, supera Claude Opus 4.8 e GPT-5.5 em tarefas retidas.

Modelos · arxiv · agentes, replicacao, rl, avaliacao, rubrica

Intern-S2-Preview: modelo de fundacao agentico voltado a ciencia

Serie de modelos multimodais para raciocinio cientifico sobre evidencia heterogenea, uso de ferramentas e tarefas de horizonte longo.

Modelos · arxiv · multimodal, ciencia, agentes, rl, open-weights

Ferramentas e código

Ecossistema de ferramentas explode em torno do DeepSeek Harness em 48 horas

O harness de agente open source da DeepSeek saiu em preview v0.1 em 13/08 sob licenca MIT e, em 48 horas, gerou cerca de dez repositorios de terceiros com 100 a 2.700 estrelas.

Ferramentas e código · github · deepseek, harness, agentes, open-source, plugins

Agent Memory Leaderboard consolida benchmark de memoria de longo prazo para agentes

Leaderboard dedicado a medir retencao entre sessoes em agentes, com 408 likes e trending score 59.

Ferramentas e código · huggingface · agentes, memoria, benchmark, leaderboard, context-engineering

LlamaIndex publica ExtractBench para extracao estruturada de documentos

Benchmark sob Apache 2.0 que avalia sistemas que recebem um documento e um schema e devolvem dados estruturados com evidencia, cobrindo PDFs nativos e digitalizados. Ja com 2,6 mil downloads.

Ferramentas e código · huggingface · extracao, documentos, benchmark, rag, apache-2

Auto-pesquisa com agente de codigo chega a kernel de GPU 232 vezes mais rapido

Relato de engenharia em que o autor deixa um agente de codigo rodar um loop autonomo de hipotese, experimento e medicao sobre otimizacao de kernel de GPU, chegando a 232x de aceleracao. 424 pontos e 91 comentarios no HN.

Ferramentas e código · hackernews · codex, agentes, gpu, auto-pesquisa, otimizacao

Cloudflare passa a detectar e controlar trafego MCP de agentes de IA

A Cloudflare anunciou recursos no Cloudflare One para identificar, logar e controlar trafego do Model Context Protocol gerado por agentes que invocam ferramentas e APIs de terceiros.

Ferramentas e código · cloudflare · mcp, cloudflare, seguranca, agentes, observabilidade

Microsoft comeca rollout do super app Copilot unificando chat, coding e agentes

Microsoft iniciou em 15/08 a distribuicao do app unificado que junta chat, Cowork, coding e agentes autonomos sob o guarda-chuva do Copilot.

Ferramentas e código · filehippo · microsoft, copilot, agentes, produto

Folha testa detectores de texto gerado por IA e mede a taxa de erro

Teste pratico de aplicativos que afirmam identificar texto escrito por IA, com avaliacao de acerto e de falsos positivos.

Ferramentas e código · websearch · deteccao, falso-positivo, educacao, watermark, brasil

Reporter do SCMP entrega o WeChat ao agente da Tencent por 24 horas

Teste pratico com o agente de IA do WeChat controlando pagamentos, mensagens, pedidos e mini-programas por um dia, com relato do que funcionou e onde falhou.

Ferramentas e código · websearch · tencent, wechat, agentes, superapp, pagamentos

Netflix descreve migracao do stack de recomendacao para arquitetura LLM-nativa

Post de engenharia sobre o GenRec, a reconstrucao do sistema de recomendacao da Netflix em torno de LLM. 32 pontos e 50 comentarios no HN — mais comentarios que pontos, sinal de debate tecnico substantivo.

Ferramentas e código · hackernews · netflix, recomendacao, llm, producao, escala

Pesquisa

Anthropic publica pesquisa sobre falhas emergentes em sistemas multiagente

O Frontier Red Team argumenta que o volume de interacoes agente-agente pode superar o de interacoes humano-humano antes de existir entendimento sobre como torna-las seguras.

Pesquisa · websearch · anthropic, multiagente, seguranca, frontier-red-team, agentes

Alaya-EVOKE: world model interativo com banco de estado externo indexado por camera

Paper #1 do dia no HF. Externaliza o estado persistente da cena num world state bank indexado por camera, mantendo o contexto do denoiser limitado mesmo em sessoes longas.

Pesquisa · huggingface · world-models, video, memoria, eficiencia, paper-of-the-day

Avaliacao por etapa mostra que agentes de P&D sao otimizadores, nao pesquisadores

Sete modelos de fronteira avaliados em 36 tarefas de longo horizonte, com metricas por etapa — formulacao da solucao, execucao, controle de feedback — em vez de so nota final.

Pesquisa · arxiv · agentes, avaliacao, horizonte-longo, pesquisa, benchmark

DreamX-Phi 1.0: modelo de mundo em video condicionado a acoes para manipulacao robotica

Modelo da Alibaba que recebe um frame observado, uma instrucao em linguagem e uma sequencia de poses do efetuador, e preve as observacoes futuras resultantes.

Pesquisa · huggingface · world-models, robotica, alibaba, se3, v-jepa

LittleLearner: LLM de 5B treinado so com material ate a 5a serie

Os autores montaram o LITTLECURRICULUM, corpus de 88 bilhoes de tokens restrito a material do ensino fundamental americano ate a 5a serie, e treinaram um modelo de 5B do zero. 132 pontos e 88 comentarios no HN.

Pesquisa · arxiv · pre-treino, curriculo, contaminacao, in-context-learning, interpretabilidade

QuoteBench: o que quebra depois da geracao, no caminho do comando

Agentes de codigo emitem comandos Bash atraves de interfaces que serializam, envolvem e reinterpretam a saida do modelo. Passar a mesma resposta por um parser adicional derruba a taxa de sucesso em 55 a 73 pontos percentuais.

Pesquisa · arxiv · agentes-de-codigo, harness, bash, serializacao, avaliacao

PlayWorld: benchmark de world models com agentes jogadores em objetivos de longo horizonte

Benchmark da Universidade de Hong Kong com 171 cenarios dirigidos por agentes multimodais em vez de sequencias fixas de acoes.

Pesquisa · huggingface · world-models, benchmark, avaliacao, hku

Synthetic Persona Pretraining propoe alinhar o modelo desde o token zero

Proposta de instalar a persona de assistente ja no pre-treino, anotando documentos com reflexoes em primeira pessoa derivadas de uma constituicao de valores, em vez de aplicar alinhamento depois como camada fina.

Pesquisa · arxiv · alinhamento, pre-treino, persona, constituicao, seguranca

Massive Activations em LLMs de atencao linear hibrida

Caracteriza dois padroes de ativacoes massivas — picos pre-atencao (PAS) e platos inter-pico (ISP) — em cinco arquiteturas de atencao linear e modelos abertos de 1,2B a 397B.

Pesquisa · huggingface · atencao-linear, quantizacao, outliers, arquitetura, eficiencia

Agente porta 250 mil linhas de Fortran meteorologico para GPU com validacao elemento a elemento

Estudo de caso do CReSS, codigo de simulacao meteorologica com mais de 250 mil linhas, portado para GPU por agente de linha de comando num fluxo centrado em validacao. Resultado: 162 kernels validados numericamente e 5,1x de aceleracao em nivel de aplicacao.

Pesquisa · arxiv · legado, fortran, openacc, hpc, validacao, agentes-de-codigo

MIT Technology Review Brasil: IA para a ciencia precisa de raciocinio, nao so de dados

Analise argumenta que o gargalo da IA aplicada a descoberta cientifica nao e volume de dados, e sim capacidade de raciocinio causal e formulacao de hipoteses testaveis.

Pesquisa · websearch · ciencia, raciocinio-causal, hipoteses, brasil, descoberta

IJCAI-ECAI 2026 abre em Bremen sob a vigencia das novas obrigacoes do AI Act

Uma das principais conferencias de pesquisa em IA comecou em 15/08 em Bremen, com trilhas de Human-Centered AI, AI for Social Good, saude, robotica e seguranca de sistemas fisicos.

Pesquisa · ijcai · conferencia, ijcai, ecai, ai-act, europa

Mercado

Receita da Anthropic salta para mais de US$ 11,5 bilhoes no 2o trimestre

Documentos vistos pela Bloomberg mostram receita preliminar acima de US$ 11,5 bilhoes no trimestre, contra US$ 787 milhoes um ano antes e US$ 4,73 bilhoes no 1o trimestre de 2026.

Mercado · websearch · anthropic, receita, ipo, bloomberg, valuation

Crise interna na OpenAI se agrava enquanto Altman prepara o IPO

Sequencia de saidas executivas as vesperas da abertura de capital. Analistas ouvidos pela CNBC classificam o exodo como enorme sinal de alerta para investidores.

Mercado · websearch · openai, ipo, governanca, executivos, risco

Endividamento das big techs para IA ja pressiona os juros reais, aponta Reuters

Analise da Reuters liga a alta dos yields reais a corrida de captacao das big techs para bancar infraestrutura de IA: Alphabet, Amazon e Meta tomaram cerca de US$ 220 bilhoes em divida em 2026.

Mercado · reuters · financiamento, divida, data-centers, risco-sistemico

SpaceX conclui a aquisicao da Cursor

A startup de codificacao por IA passa oficialmente a integrar a SpaceX, que ja havia absorvido a xAI neste ano. A opcao de compra por US$ 60 bilhoes foi exercida em junho, apos a abertura de capital da SpaceX.

Mercado · websearch · spacex, cursor, xai, musk, gpu, consolidacao

Modelos chineses de pesos abertos ganham espaco na Europa apesar da resistencia de Bruxelas

Empresas europeias estao adotando modelos abertos chineses por custo e por poderem roda-los em infraestrutura propria, o que ajuda em requisitos de soberania de dados.

Mercado · websearch · qwen, glm, deepseek, soberania, europa, open-weights

Nvidia declara participacao de US$ 21 bilhoes na SpaceX

Em documento regulatorio referente ao fim do 2o trimestre, a Nvidia declarou posicao de US$ 21 bilhoes na SpaceX — que controla xAI e Cursor e aluga capacidade de GPU para Anthropic e Google.

Mercado · websearch · nvidia, spacex, circularidade, gpu, financiamento

A economia paralela de revenda de creditos de IA: quem sao os token brokers

Post mapeia o mercado paralelo de intermediarios que revendem creditos e assinaturas de IA. Entrou na front page do HN com 195 pontos e 73 comentarios.

Mercado · vectoral · tokens, precificacao, revenda, limites-de-uso, hn

CFO da OpenAI diz a investidores que receita corporativa ja supera a de consumo

Sarah Friar informou a investidores que o negocio enterprise da OpenAI passou o de consumo em receita — inversao relevante para uma empresa cuja marca publica e o ChatGPT.

Mercado · websearch · openai, enterprise, receita, ipo, modelo-de-negocio

Analise compara o financiamento do boom de IA a Enron, com uma ressalva

A analise aponta tres semelhancas com a Enron — divida crescente, previsoes de demanda infladas e negocios circulares entre fornecedores e clientes — mas conclui que, ao contrario dela, ha receita e uso reais por tras.

Mercado · websearch · bolha, divida, enron, negocios-circulares, risco

Regulação e segurança

Missil russo usa chip de IA da Nvidia para mirar alvos na Ucrania

Analise de destrocos indica que um missil russo empregou um chip de IA da Nvidia no sistema de mira, apesar do regime de sancoes e dos controles de exportacao.

Regulação e segurança · websearch · nvidia, sancoes, controle-exportacao, semicondutores, militar

Nova autora adere a acao contra a xAI por imagens explicitas geradas pelo Grok

Identificada como Jane Doe 4, a autora aderiu a acao movida por tres adolescentes do Tennessee contra a xAI, hoje parte da SpaceX. O processo acusa a empresa de nao adotar salvaguardas basicas e pede reconhecimento como acao coletiva.

Regulação e segurança · websearch · xai, grok, csam, judicial, salvaguardas

TollBit: 15% dos crawlers de IA na Europa acessaram URLs que publishers bloquearam

Levantamento da TollBit mostra que cerca de 15% dos page fetchers de IA analisados na Europa chegaram a URLs declaradas como nao-acessiveis pelos publishers.

Regulação e segurança · ppcland · crawlers, publishers, robots-txt, direitos-autorais, europa

Amazon passa a usar conteudo do Twitch para treinar IA em regime de opt-out

Transmissoes, clipes e conteudo publicado no Twitch passam a ser dado de treinamento dos modelos da Amazon, com regime de opt-out — criadores precisam agir ativamente para excluir seu material.

Regulação e segurança · websearch · amazon, twitch, dados-de-treino, consentimento, criadores

Comunidade

Pagina de system prompts do Claude volta ao topo do Hacker News

A documentacao publica dos system prompts do Claude somou 464 pontos e 204 comentarios em cerca de 9 horas no HN.

Comunidade · hackernews · anthropic, claude, system-prompt, transparencia, hn

Primeira ativista anti-IA presa nos EUA descreve a organizacao do movimento

Wynd Kaufmyn, 69 anos, acorrentou e trancou as portas da sede da OpenAI junto a integrantes do grupo StopAI e se tornou a primeira ativista anti-IA a cumprir pena.

Comunidade · websearch · ativismo, stopai, openai, seguranca-fisica, desobediencia-civil

Sebos britanicos e irlandeses suspeitam de compras em massa por empresas de IA

Livreiros de segunda mao relatam pedidos atipicos de grandes lotes, com padroes que sugerem aquisicao de acervo para digitalizacao e treinamento de modelos.

Comunidade · websearch · dados-de-treino, direitos-autorais, livros, corpus, licenciamento

IA amplia fraudes e ameaca a viabilidade do ensino online nos EUA

Faculdades americanas relatam explosao de matriculas fraudulentas e trabalhos gerados por IA em cursos a distancia, a ponto de instituicoes reverem a viabilidade do formato online.

Comunidade · websearch · educacao, ead, fraude, avaliacao, brasil

Ensaio: fundamentos de engenharia de software importam mais do que nunca

Contraponto ao discurso de que agentes tornam obsoleto o conhecimento de base: testes, arquitetura e revisao ficam mais criticos quando o volume de codigo gerado por maquina cresce. 287 pontos e 206 comentarios no HN.

Comunidade · rhonabwy · engenharia, testes, arquitetura, code-review, agentes

Guardian: polemica de privacidade dos oculos da Meta ofusca ganho de acessibilidade

Reportagem argumenta que o debate sobre vigilancia nos oculos inteligentes da Meta apaga ganhos reais de acessibilidade — leitura de texto e orientacao espacial para pessoas com deficiencia.

Comunidade · theguardian · meta, smart-glasses, acessibilidade, privacidade, vigilancia

Alocacao de bits por tensor recupera raciocinio em quantizacao agressiva do Gemma 4

Experimento comunitario mostra que alocar bits de forma nao uniforme entre tensores, em vez de aplicar um esquema IQ2 homogeneo, recupera boa parte da capacidade de raciocinio perdida em quantizacao agressiva.

Comunidade · reddit · quantizacao, gemma, local-llm, hardware, iq2