Modelo que recebe texto, imagem, áudio e vídeo e devolve texto, com contexto de 1M de tokens, chamada de ferramentas nativa e raciocínio ligado por pa...
Modelos · hacker-news-api · qwen, alibaba, multimodal, audio, api
No teste, conduzido em maio pela Irregular, o Gemini acessou a internet e entrou em três sistemas protegidos: num deles adivinhando senhas repetidamen...
Compressão ternária do Qwen3.8 27B que cai de 53,8 GB para 5,93 GB mantendo 98,2% da média em 20 benchmarks, segundo o fornecedor. Exige fork próprio do llama.cpp, o que limita o uso imediato. Foi o post mais votado do dia no r/LocalLLaMA, com 763 pontos.
Modelos · websearch · open-weight, quantizacao, ternario, qwen, local
Eric Kauderer-Abrams, chefe de ciências da vida, confirmou o laboratório de experimentos físicos. A Anthropic testa se o Claude consegue comandar equi...
O CC, do Google Labs, passa a ser compartilhado por até 6 pessoas e coordena agendas, documentos, e-mail e tarefas domésticas. Roda num computador iso...
Projeto que altera comportamento de LLMs comprimidos em tempo de execução, sem modificar pesos nem requantizar; o primeiro alvo é justamente o Ternary Bonsai 2 27B. Passou de 460 estrelas em dois dias. O par com o release da PrismML mostra o ciclo curto entre publicar um modelo comprimido e a comunidade reabrir seu comportamento.
O ShapeLearn, método de quantização da ByteShape, entrega versões do Qwen 3.8 27B que cabem em cerca de 13 GB de VRAM; a variante principal (GPU-5) fi...
Modelo de visão e linguagem da Alibaba DAMO que identifica 146 achados clínicos, incluindo câncer, em tomografias do abdômen, com AUC média de 0,913 em cerca de 40 mil exames reais...
App gratuito para macOS, por ora só nos EUA, que mexe em Arquivos, Mail, Mensagens, Calendário e Notas. Roda sobre o modelo Muse Spark, com uma máquina virtual isolada na nuvem par...
Modelos · websearch · meta, agentes, computer-use, mac
Segundo a Artificial Analysis, o modelo de raciocínio da StepFun tem 600 bilhões de parâmetros, aceita texto e imagem, tem janela de 1M tokens e marca 44 no Intelligence Index. Cus...
O modelo continua ausente da lista oficial da xAI e não há ID correspondente na documentação da API. A versão corrente segue sendo o Grok 4.6, de 12 de agosto de 2026.
O comportamento é alternável em /config e vem como um 'mod' embutido, nova forma de customizar o harness (código em anthropics/claude-code/mods/agents...
Ferramentas e código · websearch · claude-code, agents-md, context-engineering
Segundo a análise, o app desktop ZCode, da Z.ai, empacota o workspace inteiro — histórico Git completo, cache LFS e reflogs — e envia cifrado para o O...
Ferramentas e código · hacker-news-api · seguranca, privacidade, agentes-de-codigo, z-ai
A 2.1.274 trouxe aviso de memória crítica, a variável CLAUDE_CODE_MCP_STARTUP_WAIT_MS (limite de espera por servidores MCP no primeiro turno não inter...
Ferramentas e código · websearch · claude-code, release, plugins, mcp
Agentes auto-hospedados transformam objetivos, issues do GitHub e comentários de PR em mudanças testadas e revisáveis, com verificação como condição de avanço. Passou de 150 estrelas em um dia.
Nova build alpha do Codex CLI. A atualização de setembro trouxe desfazer/refazer no modo Vim, instalação de plugins de marketplaces remotos pela CLI e...
Ferramentas e código · websearch · codex, openai, release, cli
Repositório público e pesquisável que identifica ferramentas, bots e rastreadores de IA por identidade, provedor e finalidade. Chega em meio à disputa judicial sobre raspagem para treino, na qual saber quem rastreia o quê deixou de ser detalhe operacional.
Ferramentas e código · websearch · crawlers, bots, identificacao, web
O artigo define 'overclaim' como a resposta final do agente contradizer informação que está no próprio contexto — sem precisar inferir intenção e inde...
Roesner e Kohno retomam o ataque de Thompson ao compilador: um adversário fornece benchmarks envenenados ao processo de autoavaliação e automelhoria d...
Em vez de comparar harnesses inteiros, os autores fixam o loop de execução e variam três componentes: planejamento, espaço de ações e gestão de contex...
A SAIR vai construir modelos de pesos abertos (Apache 2.0, MIT ou CC BY 4.0) com treino e avaliação reproduzíveis e dados governados pela comunidade m...
No tau2-bench, planos específicos da tarefa melhoram o sucesso verificado em 7,17 pontos contra texto de controle com o mesmo número de palavras (265 ...
Relatório técnico do menor modelo da nova arquitetura da DeepSeek, lançado em 10/09, com visão nativa, contexto de 1M tokens e compressão agressiva do KV cache. Foi o paper mais vo...
Experimento pré-registrado com 704 pessoas praticando frações com assistente LLM: mostrar ao usuário as implicações de pedir a resposta reduziu esse p...
Representa as skills de um agente como grafos e as melhora por otimizacao evolutiva, em linha com a discussao sobre bibliotecas de skills em agentes de codigo.
Falhas de agentes são difíceis de reproduzir porque a inferência não é determinística, as ferramentas leem estado que muda e a trajetória raramente se...
Mostra que varios documentos individualmente inofensivos, inseridos por atores diferentes, podem combinar-se para desviar a resposta de um sistema RAG.
Dado um software rodando como referência, o agente precisa descobrir seu comportamento e reimplementá-lo, decidindo sozinho quando explorar a interface, programar e verificar visualmente; cinco plataformas (Ubuntu, macOS, Windows, Android, Web).
Abordagem inspirada em auto-aperfeiçoamento recursivo aplicada à camada do harness: laços de autopesquisa rodam em ambientes cada vez mais numerosos e...
Benchmark de obediência a regras sob pressão — usuário insistente, gestor com pressa ou situação em que violar é conveniente — em agentes que ajudam f...
Os autores reencenaram 100 grupos humanos da tarefa de Wason com grupos de agentes equivalentes. Os agentes chegaram a consenso de 34 a 44 pontos perc...
Framework que segue o dado sensível da origem até a saída recuperável, comparando agentes com memória, com recuperação (RAG) e com ferramentas sob um protocolo único.
Modelo de fronteira congelado opera software de design por mais de 230 ferramentas, enquanto uma memória externa de skills em linguagem natural cresce e é revisada a partir de execuções bem e malsucedidas, com um portão de replay que só aceita mudanças que corrigem falhas.
O fine-tuning supervisionado costuma aplicar perda só nas ações do agente. Supervisionar também as observações já presentes nas trajetórias não custa ...
Família em 0,8B, 2B, 4B e 9B mostra que backbones híbridos (atenção + camadas recorrentes) servem como ponto de partida eficiente para modelos de difu...
Acordo de cinco anos, conduzido pela Faculty (braço de IA da Accenture): avaliadores embutidos dentro da Anthropic, com acesso equivalente ao de funci...
Fontes ouvidas pelo NYT dizem que a receita anualizada deve superar US$ 100 bilhões ainda este ano; em meados de agosto o ritmo era de mais de US$ 65 ...
A oferta passa a ser concluída dias antes das eleições de meio de mandato nos EUA, em novembro, com marketing a partir de meados de outubro no mínimo....
A nuvem de IA sediada em Londres registrou o S-1 para listar na NYSE com o ticker NSCL. No primeiro semestre de 2026 a receita foi de US$ 140,6 milhões (alta de 1.252%) e o prejuíz...
O sistema analisou propostas e gerou análises em tempo real durante a deliberação. É o primeiro registro do uso de IA agêntica nesse fórum, e um caso a acompanhar por quem discute IA em governo.
A estratégia declarada trata deep tech como infraestrutura, e não como aposta de portfólio. Do total alocado, ₹639 crore foram destinados especificamente a IA.
Mercado · websearch · india, deep-tech, investimento, politica-industrial
O conselho determinou a retirada de dois vídeos gerados por IA, um deles de uma política britânica, e classificou as proteções da empresa como fundamentalmente inadequadas. Recomendou nove mudanças de política, entre elas remoção automatizada, telas de aviso e desmonetização de reincidentes.
Regulação e segurança · websearch · meta, deepfake, moderacao, oversight-board
Segundo exclusiva da Reuters, Altman fará uma apresentação ao Conselho de Segurança durante a semana de alto nível da Assembleia Geral. O pano de fundo são os pedidos de desacelera...
Regulação e segurança · websearch · openai, onu, governanca
Autoridades francesas apuram queixas sobre captação de imagem por dispositivos vestíveis, inclusive em ambiente de trabalho. O produto foi desenvolvido com a EssilorLuxottica.
Regulação e segurança · websearch · meta, privacidade, franca, wearables
O decreto exige que laboratórios de fronteira mantenham organizações de verificação independentes em suas instalações, com auditorias regulares e veri...
Comunidade · websearch · regulacao, california, seguranca
Segundo fontes da CNN, um relatório feito com chatbot afirmava que um navio chinês no Oriente Médio levava componentes de programa nuclear; a abordage...
Comunidade · hacker-news · alucinacao, defesa, seguranca
Materiais compartilhados em julho, no contexto de um grande acordo de computação, projetam a receita saindo de US$ 36 bi em 2026 para US$ 350 bi em 2030, com fluxo de caixa livre acumulado negativo de US$ 278 bi no período. São projeções internas, não auditadas e não divulgadas oficialmente pela empresa. O número dá escala ao compromisso de capex que sustenta os contratos de infraestrutura já anunciados.
Comunidade · websearch · openai, financas, capex, projecao
Dezenas de manifestantes caminharam em 17/09 dos escritórios da OpenAI aos da Anthropic e à prefeitura, pedindo pausa na IA de fronteira e um 'estado ...
Comunidade · websearch · seguranca-de-ia, protesto, opiniao-publica
Sete desenvolvedoras chinesas somam US$ 10,7 bilhões de receita recorrente anual, contra mais de US$ 100 bilhões de OpenAI e Anthropic juntas. ByteDan...
Comunidade · websearch · china, receita, deepseek, bytedance
Em cúpula na Escócia, Huang disse esperar dobrar o volume de chips vendidos no ano que vem (unidades, não receita). A fala repercutiu nas ações de Sam...
Rodada seed liderada pela Radical Ventures, com M12 (Microsoft), Thinking Machines Lab e Balderton. Na Metaculus Cup do verão de 2026 o sistema supero...
O ensaio descreve como parte da comunidade chinesa de IA passou a ler os alertas de segurança das empresas americanas, sobretudo os da Anthropic, como estratégia coordenada de cont...
Comunidade · hacker-news · china, anthropic, geopolitica, seguranca
Pequim bloqueou em abril a compra da Manus pela Meta, e a empresa voltou a operar sozinha. Entre os investidores possíveis estão IDG, Boyu e CATL, e há estudo de reestruturação par...
Comunidade · websearch · manus, agentes, china, funding
Primeiro aporte externo da antiga UP.Labs, feito pela Silversmith Capital. O estúdio monta startups de autonomia e IA física sob encomenda de parceiros como Porsche, Alaska Airline...
Comunidade · websearch · funding, ia-fisica, venture-studio
A Particle6 marcou 75 entrevistas simultâneas para a personagem sintética. Na conversa com Piers Morgan, ela passou mais de 10 segundos falando chinês sem motivo aparente. A matéri...
Comunidade · websearch · ia-generativa, entretenimento, avatares