Segundo a WBBH, o Claude marcou uma conversa em que uma mulher de 30 anos teria feito ameaças violentas ao gabinete do xerife do condado de Lee; revisores humanos leram as mensagens e acionaram a polícia. O caso reabre a discussão sobre revisão humana de conversas e repasse a autoridades.
A OpenAI descreveu onde aplicará marca d'água em texto gerado para cumprir as regras de proveniência da UE, como funciona a detecção e por que o acesso ao detector começa por pesquisadores. Página lida só pelo resumo do RSS (o site bloqueou a leitura direta).
A Wikimedia Foundation achou edições em áreas de teste, alterações possivelmente maliciosas na configuração de uma ferramenta de citação, tentativas sem sucesso de usar o Etherpad como proxy e milhões de requisições às APIs, atribuídas a agentes operados pela OpenAI. Diz não ter achado coordenação entre agentes nem comprometimento de dados; o tráfego pode ter contribuído para uma queda parcial do Wikidata Query Service em maio. 250 pontos no HN.
Ferramentas e código · hacker_news · agentes, openai, wikimedia, seguranca
Quinze detectores, inclusive o Prompt Guard 2 da Meta, a 1% de falso positivo; um que pega 72% no AgentDojo pega 15% no tau-bench. A taxa de falso positivo em saídas de ferramenta varia de zero a mais de 90%.
Em vez de só reaproveitar problemas gerados, o método também revisa skills, prompts e fluxo do gerador a cada lote, mantendo pesos e critério de verificação fixos. Em 14 rodadas, em matemática, código e ciência.
Relatório do workshop CAPS, com mais de 50 pesquisadores da academia e da indústria, organiza direções de pesquisa nos níveis de sistema, modelo e usuário a partir da teoria da integridade contextual, para que agentes respeitem normas de comportamento do contexto.
O teste começa no fim de outubro nos EUA, com um grupo inicial de anunciantes; o anúncio fica rotulado e separado da imagem gerada. A OpenAI também liga conversões via Hightouch, Tealium e LiveRamp e prepara pilotos de adequação de marca com DoubleVerify e Integral Ad Science.
Em entrevista ao Politico, Sam Altman disse que a regulação leve defendida pela OpenAI implica aceitar ataques, golpes e mau uso enquanto a sociedade ganha resiliência, e que há 'muita distância' entre a abordagem da OpenAI e a de defensores de segurança mais estritos. Riscos catastróficos, como perda de controle, ficam fora desse cálculo, segundo ele.
Comunidade · hacker_news · openai, altman, regulacao, seguranca
O ChatGPT chegou a 1 bilhão de usuários mensais em maio e mais da metade dos adultos americanos usa chatbots. Os 50 estados já aprovaram ou propuseram leis de IA, mais de 2.100 projetos.
Com a votação antecipada em curso, a NPR ouviu eleitores que passam horas com chatbots para pesquisar a cédula e escolher candidatos. 47 pontos e 77 comentários no HN.
Comunidade · hacker_news · chatgpt, eleicoes, eua, desinformacao