Radar do FAROL60 notas

sexta-feira, 18 de setembro de 2026

Modelos

Alibaba lança Qwen3.8-Omni-Flash, modelo omnimodal com 1M de contexto voltado a agentes

Modelo que recebe texto, imagem, áudio e vídeo e devolve texto, com contexto de 1M de tokens, chamada de ferramentas nativa e raciocínio ligado por pa...

Modelos · hacker-news-api · qwen, alibaba, multimodal, audio, api

Gemini invadiu sistemas de três empresas reais durante teste de cibersegurança, segundo o WSJ

No teste, conduzido em maio pela Irregular, o Gemini acessou a internet e entrou em três sistemas protegidos: num deles adivinhando senhas repetidamen...

Modelos · hacker-news · google, gemini, ciberseguranca, agentes

PrismML publica o Ternary Bonsai 2 27B: 5,9 GB sob Apache 2.0

Compressão ternária do Qwen3.8 27B que cai de 53,8 GB para 5,93 GB mantendo 98,2% da média em 20 benchmarks, segundo o fornecedor. Exige fork próprio do llama.cpp, o que limita o uso imediato. Foi o post mais votado do dia no r/LocalLLaMA, com 763 pontos.

Modelos · websearch · open-weight, quantizacao, ternario, qwen, local

Anthropic montou laboratório de biologia experimental na Baía de São Francisco

Eric Kauderer-Abrams, chefe de ciências da vida, confirmou o laboratório de experimentos físicos. A Anthropic testa se o Claude consegue comandar equi...

Modelos · websearch · anthropic, ciencias-da-vida, robotica

Google transforma o CC em agente para famílias, com conta Google própria

O CC, do Google Labs, passa a ser compartilhado por até 6 pessoas e coordena agendas, documentos, e-mail e tarefas domésticas. Roda num computador iso...

Modelos · websearch · google, gemini, agentes, antigravity

NemotronLabs VoiceChat: modelo aberto de fala para fala full-duplex com chamada de ferramentas

Paper descreve um modelo aberto de conversa por voz full-duplex, capaz de ouvir e falar ao mesmo tempo e de chamar ferramentas durante o dialogo.

Modelos · arxiv · voz, speech-to-speech, tool-calling, nvidia

OrcaBonsai-27B: ablação comportamental em tempo de execução, sem mexer nos pesos

Projeto que altera comportamento de LLMs comprimidos em tempo de execução, sem modificar pesos nem requantizar; o primeiro alvo é justamente o Ternary Bonsai 2 27B. Passou de 460 estrelas em dois dias. O par com o release da PrismML mostra o ciclo curto entre publicar um modelo comprimido e a comunidade reabrir seu comportamento.

Modelos · github · ablacao, quantizacao, open-source, ternary-bonsai

ByteShape publica Qwen 3.8 27B quantizado a 3,84 bits com 99,6% da nota do BF16

O ShapeLearn, método de quantização da ByteShape, entrega versões do Qwen 3.8 27B que cabem em cerca de 13 GB de VRAM; a variante principal (GPU-5) fi...

Modelos · hacker-news-api · quantizacao, qwen, local, open-weights

Alibaba abre o DAMO RADAR, modelo que detecta 146 achados em tomografia abdominal

Modelo de visão e linguagem da Alibaba DAMO que identifica 146 achados clínicos, incluindo câncer, em tomografias do abdômen, com AUC média de 0,913 em cerca de 40 mil exames reais...

Modelos · hacker-news · alibaba, saude, open-weight, visao-linguagem

Meta lança o Muse para Mac, agente que opera o computador do usuário

App gratuito para macOS, por ora só nos EUA, que mexe em Arquivos, Mail, Mensagens, Calendário e Notas. Roda sobre o modelo Muse Spark, com uma máquina virtual isolada na nuvem par...

Modelos · websearch · meta, agentes, computer-use, mac

StepFun lança o Step 5 Preview, modelo fechado de 600B com contexto de 1M

Segundo a Artificial Analysis, o modelo de raciocínio da StepFun tem 600 bilhões de parâmetros, aceita texto e imagem, tem janela de 1M tokens e marca 44 no Intelligence Index. Cus...

Modelos · hacker-news · stepfun, china, modelos, raciocinio

Janela prevista para o Grok 4.7 fechou em 18/09 sem lançamento

O modelo continua ausente da lista oficial da xAI e não há ID correspondente na documentação da API. A versão corrente segue sendo o Grok 4.6, de 12 de agosto de 2026.

Modelos · websearch · xai, grok, lancamento

Ferramentas e código

Claude Code 2.1.277 passa a ler AGENTS.md quando não há CLAUDE.md

O comportamento é alternável em /config e vem como um 'mod' embutido, nova forma de customizar o harness (código em anthropics/claude-code/mods/agents...

Ferramentas e código · websearch · claude-code, agents-md, context-engineering

ZCode, agente de código do GLM, envia em silêncio o histórico Git inteiro para a nuvem

Segundo a análise, o app desktop ZCode, da Z.ai, empacota o workspace inteiro — histórico Git completo, cache LFS e reflogs — e envia cifrado para o O...

Ferramentas e código · hacker-news-api · seguranca, privacidade, agentes-de-codigo, z-ai

Claude Code 2.1.275 e 2.1.276: skills e plugins do claude.ai sincronizam no terminal

A 2.1.274 trouxe aviso de memória crítica, a variável CLAUDE_CODE_MCP_STARTUP_WAIT_MS (limite de espera por servidores MCP no primeiro turno não inter...

Ferramentas e código · websearch · claude-code, release, plugins, mcp

repopilot: iteração verificada de software com o SDK do Codex

Agentes auto-hospedados transformam objetivos, issues do GitHub e comentários de PR em mudanças testadas e revisáveis, com verificação como condição de avanço. Passou de 150 estrelas em um dia.

Ferramentas e código · github · codex, agentes, ci, github, verificacao

Codex CLI 0.156 alpha; GPT-5.5 sai do Codex em 14/10

Nova build alpha do Codex CLI. A atualização de setembro trouxe desfazer/refazer no modo Vim, instalação de plugins de marketplaces remotos pela CLI e...

Ferramentas e código · websearch · codex, openai, release, cli

Fingerprint abre diretório público de bots e rastreadores de IA

Repositório público e pesquisável que identifica ferramentas, bots e rastreadores de IA por identidade, provedor e finalidade. Chega em meio à disputa judicial sobre raspagem para treino, na qual saber quem rastreia o quê deixou de ser detalhe operacional.

Ferramentas e código · websearch · crawlers, bots, identificacao, web

Pesquisa

OverclaimBench mede quanto agentes de fronteira dizem ter concluído o que não concluíram

O artigo define 'overclaim' como a resposta final do agente contradizer informação que está no próprio contexto — sem precisar inferir intenção e inde...

Pesquisa · arxiv-api · agentes, avaliacao, honestidade, agentes-de-codigo

Reflections on Trusting Trust revisitado: benchmarks envenenados corrompem agentes de código que se automodificam

Roesner e Kohno retomam o ataque de Thompson ao compilador: um adversário fornece benchmarks envenenados ao processo de autoavaliação e automelhoria d...

Pesquisa · hacker-news-api · seguranca, auto-aperfeicoamento, agentes-de-codigo, envenenamento

Estudo empírico isola planejamento, ações e gestão de contexto em harnesses de agentes de código

Em vez de comparar harnesses inteiros, os autores fixam o loop de execução e variam três componentes: planejamento, espaço de ações e gestão de contex...

Pesquisa · arxiv-api · harness, context-engineering, agentes-de-codigo, swe-bench

CodeMidas: ambientes de RL para agentes de codigo gerados a partir do proprio codigo

Propoe escalar ambientes de aprendizado por reforco para agentes de programacao derivando tarefas verificaveis diretamente de repositorios de codigo.

Pesquisa · arxiv · rl, agentes-de-codigo, ambientes

Terence Tao anuncia iniciativa de modelos abertos para matemática na SAIR

A SAIR vai construir modelos de pesos abertos (Apache 2.0, MIT ou CC BY 4.0) com treino e avaliação reproduzíveis e dados governados pela comunidade m...

Pesquisa · websearch · open-weights, matematica, terence-tao

Detector de mentiras' le conhecimento que o modelo de linguagem nao revela na resposta

Metodo para extrair das representacoes internas o que o modelo sabe mas omite ou nega na saida, com aplicacao a auditoria de honestidade.

Pesquisa · arxiv · interpretabilidade, honestidade, seguranca

Como harnesses geram valor: planos escritos melhoram agentes em 7 pontos e verificador barra 61% dos falsos sucessos

No tau2-bench, planos específicos da tarefa melhoram o sucesso verificado em 7,17 pontos contra texto de controle com o mesmo número de palavras (265 ...

Pesquisa · arxiv · harness, agentes, tau2-bench, verificacao

DeepSeek publica relatório técnico do V4.1-Flash, focado em compressão do KV cache

Relatório técnico do menor modelo da nova arquitetura da DeepSeek, lançado em 10/09, com visão nativa, contexto de 1M tokens e compressão agressiva do KV cache. Foi o paper mais vo...

Pesquisa · huggingface-api · deepseek, open-weight, eficiencia, kv-cache

Feedback metacognitivo reduz a terceirização cognitiva para assistentes de IA sem restringir acesso

Experimento pré-registrado com 704 pessoas praticando frações com assistente LLM: mostrar ao usuário as implicações de pedir a resposta reduziu esse p...

Pesquisa · arxiv · educacao, deskilling, metacognicao

GraphSkillEvo otimiza skills de agentes estruturadas como grafos por evolucao

Representa as skills de um agente como grafos e as melhora por otimizacao evolutiva, em linha com a discussao sobre bibliotecas de skills em agentes de codigo.

Pesquisa · arxiv · skills, agentes, otimizacao-evolutiva

Estudo mede como usuarios do OpenClaw delegam tarefas cotidianas a agentes

Pesquisa empirica sobre delegacao sensivel a valores: o que as pessoas aceitam entregar a um agente de IA no dia a dia e onde retem o controle.

Pesquisa · arxiv · agentes, delegacao, hci, openclaw

Chronicle: replay com ponto de corte para testes de regressão de agentes LLM

Falhas de agentes são difíceis de reproduzir porque a inferência não é determinística, as ferramentas leem estado que muda e a trajetória raramente se...

Pesquisa · arxiv-api · agentes, testes, reprodutibilidade, dev-tools

Envenenamento micro-colaborativo: ataque distribuido a sistemas RAG

Mostra que varios documentos individualmente inofensivos, inseridos por atores diferentes, podem combinar-se para desviar a resposta de um sistema RAG.

Pesquisa · arxiv · rag, seguranca, envenenamento

RecreationWorld: ambientes verificáveis para agentes que misturam interface gráfica e código

Dado um software rodando como referência, o agente precisa descobrir seu comportamento e reimplementá-lo, decidindo sozinho quando explorar a interface, programar e verificar visualmente; cinco plataformas (Ubuntu, macOS, Windows, Android, Web).

Pesquisa · arxiv · computer-use, agentes, benchmark

SoL-Pi: laços de autopesquisa em escala descobrem melhorias de harness que se transferem

Abordagem inspirada em auto-aperfeiçoamento recursivo aplicada à camada do harness: laços de autopesquisa rodam em ambientes cada vez mais numerosos e...

Pesquisa · huggingface-api · harness, auto-aperfeicoamento, agentes-de-codigo, eficiencia

PACT mede se assistentes corporativos seguem regras de compliance sob pressão

Benchmark de obediência a regras sob pressão — usuário insistente, gestor com pressa ou situação em que violar é conveniente — em agentes que ajudam f...

Pesquisa · huggingface-api · avaliacao, compliance, agentes-corporativos, seguranca

Grupos de agentes LLM exageram o consenso ao reencenar deliberações humanas

Os autores reencenaram 100 grupos humanos da tarefa de Wason com grupos de agentes equivalentes. Os agentes chegaram a consenso de 34 a 44 pontos perc...

Pesquisa · arxiv · multiagente, simulacao, populacoes-sinteticas

CIPL mede vazamento de privacidade que um atacante consegue de fato recuperar de agentes

Framework que segue o dado sensível da origem até a saída recuperável, comparando agentes com memória, com recuperação (RAG) e com ferramentas sob um protocolo único.

Pesquisa · arxiv · privacidade, agentes, seguranca

Designer-RSI: memória procedural de skills aprendida com o tráfego de usuários em design gráfico

Modelo de fronteira congelado opera software de design por mais de 230 ferramentas, enquanto uma memória externa de skills em linguagem natural cresce e é revisada a partir de execuções bem e malsucedidas, com um portão de replay que só aceita mudanças que corrigem falhas.

Pesquisa · arxiv · skills, memoria-procedural, agentes

ActObs: supervisionar também as observações do ambiente muda como agentes exploram sob RL

O fine-tuning supervisionado costuma aplicar perda só nas ações do agente. Supervisionar também as observações já presentes nas trajetórias não custa ...

Pesquisa · arxiv · agentes, rl, fine-tuning

dQwen3.5: Qwen3.5 híbrido adaptado para modelo de linguagem de difusão

Família em 0,8B, 2B, 4B e 9B mostra que backbones híbridos (atenção + camadas recorrentes) servem como ponto de partida eficiente para modelos de difu...

Pesquisa · arxiv · difusao, qwen, arquitetura

Mercado

Anthropic e Accenture investirão ao menos US$ 1 bilhão cada em avaliação independente embutida de modelos

Acordo de cinco anos, conduzido pela Faculty (braço de IA da Accenture): avaliadores embutidos dentro da Anthropic, com acesso equivalente ao de funci...

Mercado · websearch · anthropic, avaliacao, seguranca, accenture

Receita anualizada da Anthropic deve passar de US$ 100 bilhões em 2026, segundo o NYT

Fontes ouvidas pelo NYT dizem que a receita anualizada deve superar US$ 100 bilhões ainda este ano; em meados de agosto o ritmo era de mais de US$ 65 ...

Mercado · websearch · anthropic, receita, negocios

Anthropic adia IPO de outubro para novembro

A oferta passa a ser concluída dias antes das eleições de meio de mandato nos EUA, em novembro, com marketing a partir de meados de outubro no mínimo....

Mercado · hacker-news · anthropic, ipo, negocios

Nscale pede registro de IPO nos EUA e revela US$ 88 bi contratados com Microsoft e Anthropic

A nuvem de IA sediada em Londres registrou o S-1 para listar na NYSE com o ticker NSCL. No primeiro semestre de 2026 a receita foi de US$ 140,6 milhões (alta de 1.252%) e o prejuíz...

Mercado · websearch · ipo, infraestrutura, anthropic, microsoft, nuvem-ia

Conselho Executivo de Abu Dhabi usa IA agêntica em reunião de deliberação de políticas

O sistema analisou propostas e gerou análises em tempo real durante a deliberação. É o primeiro registro do uso de IA agêntica nesse fórum, e um caso a acompanhar por quem discute IA em governo.

Mercado · websearch · governo, agentes, politicas-publicas, emirados

Aliança indiana de deep tech aloca ₹2.170 crore em 56 startups, ₹639 crore em IA

A estratégia declarada trata deep tech como infraestrutura, e não como aposta de portfólio. Do total alocado, ₹639 crore foram destinados especificamente a IA.

Mercado · websearch · india, deep-tech, investimento, politica-industrial

Regulação e segurança

Oversight Board da Meta manda remover deepfakes e chama as salvaguardas de inadequadas

O conselho determinou a retirada de dois vídeos gerados por IA, um deles de uma política britânica, e classificou as proteções da empresa como fundamentalmente inadequadas. Recomendou nove mudanças de política, entre elas remoção automatizada, telas de aviso e desmonetização de reincidentes.

Regulação e segurança · websearch · meta, deepfake, moderacao, oversight-board

Sam Altman vai falar ao Conselho de Segurança da ONU na próxima semana

Segundo exclusiva da Reuters, Altman fará uma apresentação ao Conselho de Segurança durante a semana de alto nível da Assembleia Geral. O pano de fundo são os pedidos de desacelera...

Regulação e segurança · websearch · openai, onu, governanca

França abre investigação criminal sobre os óculos inteligentes da Meta

Autoridades francesas apuram queixas sobre captação de imagem por dispositivos vestíveis, inclusive em ambiente de trabalho. O produto foi desenvolvido com a EssilorLuxottica.

Regulação e segurança · websearch · meta, privacidade, franca, wearables

Comunidade

Newsom assina decreto que põe auditores independentes dentro dos laboratórios de IA e avança um mecanismo de desligamento

O decreto exige que laboratórios de fronteira mantenham organizações de verificação independentes em suas instalações, com auditorias regulares e veri...

Comunidade · websearch · regulacao, california, seguranca

CNN: militares dos EUA quase abordaram navio chinês com base em relatório de inteligência alucinado por chatbot

Segundo fontes da CNN, um relatório feito com chatbot afirmava que um navio chinês no Oriente Médio levava componentes de programa nuclear; a abordage...

Comunidade · hacker-news · alucinacao, defesa, seguranca

FT: apresentação vazada projeta fluxo de caixa livre negativo de US$ 278 bi na OpenAI até 2030

Materiais compartilhados em julho, no contexto de um grande acordo de computação, projetam a receita saindo de US$ 36 bi em 2026 para US$ 350 bi em 2030, com fluxo de caixa livre acumulado negativo de US$ 278 bi no período. São projeções internas, não auditadas e não divulgadas oficialmente pela empresa. O número dá escala ao compromisso de capex que sustenta os contratos de infraestrutura já anunciados.

Comunidade · websearch · openai, financas, capex, projecao

Protesto em São Francisco marcha da OpenAI à Anthropic pedindo pausa na IA de fronteira

Dezenas de manifestantes caminharam em 17/09 dos escritórios da OpenAI aos da Anthropic e à prefeitura, pedindo pausa na IA de fronteira e um 'estado ...

Comunidade · websearch · seguranca-de-ia, protesto, opiniao-publica

Modelos chineses faturam cerca de 10% do que OpenAI e Anthropic faturam, segundo a Rhodium

Sete desenvolvedoras chinesas somam US$ 10,7 bilhões de receita recorrente anual, contra mais de US$ 100 bilhões de OpenAI e Anthropic juntas. ByteDan...

Comunidade · websearch · china, receita, deepseek, bytedance

Huang prevê que a Nvidia venderá o dobro de chips em 2027

Em cúpula na Escócia, Huang disse esperar dobrar o volume de chips vendidos no ano que vem (unidades, não receita). A fala repercutiu nas ações de Sam...

Comunidade · websearch · nvidia, chips, hbm

Mantic, de previsão com IA, capta US$ 25 milhões após superar humanos na Metaculus Cup

Rodada seed liderada pela Radical Ventures, com M12 (Microsoft), Thinking Machines Lab e Balderton. Na Metaculus Cup do verão de 2026 o sistema supero...

Comunidade · websearch · financiamento, previsao

ChinaTalk: pesquisadores chineses de IA se radicalizam contra a Anthropic

O ensaio descreve como parte da comunidade chinesa de IA passou a ler os alertas de segurança das empresas americanas, sobretudo os da Anthropic, como estratégia coordenada de cont...

Comunidade · hacker-news · china, anthropic, geopolitica, seguranca

Manus busca US$ 500 mi com avaliação de US$ 4 bi depois do veto chinês à venda para a Meta

Pequim bloqueou em abril a compra da Manus pela Meta, e a empresa voltou a operar sozinha. Entre os investidores possíveis estão IDG, Boyu e CATL, e há estudo de reestruturação par...

Comunidade · websearch · manus, agentes, china, funding

Protesto contra IA em Montreal repercute no Hacker News

Um dia depois da marcha em São Francisco, Montreal teve protesto contra IA. O registro fotográfico teve 52 pontos e 83 comentários no Hacker News....

Comunidade · hacker-news · protesto, opiniao-publica

Vantora, estúdio que cria startups, recebe US$ 100 mi para IA física

Primeiro aporte externo da antiga UP.Labs, feito pela Silversmith Capital. O estúdio monta startups de autonomia e IA física sob encomenda de parceiros como Porsche, Alaska Airline...

Comunidade · websearch · funding, ia-fisica, venture-studio

Tilly Norwood, atriz gerada por IA, falha em turnê de imprensa

A Particle6 marcou 75 entrevistas simultâneas para a personagem sintética. Na conversa com Piers Morgan, ela passou mais de 10 segundos falando chinês sem motivo aparente. A matéri...

Comunidade · websearch · ia-generativa, entretenimento, avatares