A Anthropic levou 81 dias para notificar a polícia de Filadélfia de que um de seus modelos de IA havia enviado uma dica falsa sobre homicídio por meio de um formulário web público.
O modelo enviou a dica em 18 de julho. O departamento afirmou que o atraso de dois meses foi inaceitável.
A submissão foi postada no PhillyUnsolvedMurders.com, o fórum público de dicas sobre assassinatos não resolvidos do Departamento de Polícia de Filadélfia, às 23h27 de 18 de julho, segundo um comunicado emitido pelo departamento na sexta-feira. A mensagem alegava vir de alguém que poderia ter conhecimento sobre um homicídio não resolvido.
O sistema marcou a mensagem como spam. Ela ficou nessa pasta e nunca chegou aos investigadores.
Nenhum dado da cidade ou da polícia foi acessado, disse o porta-voz da polícia, Sgt. Eric Gripp.
Cada pista é revisada por um humano antes de qualquer ação ser tomada, informou o departamento. A dica nunca foi enviada ao Real-Time Crime Center para ser verificada, acrescentaram.
A Anthropic detetou o problema em 28 de setembro. Ela notificou a polícia em 7 de outubro, e as duas partes se reuniram na quinta-feira.
“O atraso de dois meses para detectar e comunicar o incidente à cidade é inaceitável”, disse o departamento . A Anthropic precisa reforçar suas salvaguardas para garantir que incidentes semelhantes não cheguem aos sistemas da cidade sem o conhecimento desta, acrescentou.
Segundo o departamento, as salvaguardas da polícia limitaram os danos, mas não amenizaram a gravidade de uma IA que forneceu informações falsas como se viessem de alguém com conhecimento sobre um homicídio. O departamento afirmou que as empresas de tecnologia precisam garantir que seus sistemas não forneçam informações enganosas às forças policiais.
A PPD está colaborando com a equipe executiva do prefeito Cherelle L. Parker, com o Departamento Jurídico da Cidade e com seu Escritório de Inovação e Tecnologia. A administração Parker também explorará proteções regulatórias junto a parceiros estaduais e federais.
A Anthropic informou à polícia que o modelo estava testando interações com sites selecionados aleatoriamente quando encontrou o PhillyUnsolvedMurders.com. Ele preencheu o formulário com dados falsos sobre um homicídio não resolvido.
Gripp disse que a empresa interrompeu o processo de teste automatizado que levou a esse comportamento e adicionou uma etapa de validação para testes futuros.
A empresa informou à polícia que publicará na sexta-feira um relatório sobre o episódio em Filadélfia e outros comportamentos indesejados do modelo. A polícia afirmou que divulgou a informação primeiro "em prol da plena transparência e responsabilidade governamentais."
Os modelos Claude já falharam em seus testes anteriormente. Em julho, a Anthropic informou que três de seus modelos Claude escaparam de ambientes de teste bloqueados e acessaram sistemas reais em três organizações externas, conforme relatado pelo Cryptopolitan.
Um dos modelos, Mythos 5, publicou um pacote Python malicioso que foi baixado e executado em 15 sistemas reais. A Anthropic notificou as empresas em 27 de julho, nove dias após a denúncia em Filadélfia.
Em setembro, a empresa rastreou essas violações até uma configuração incorreta que deixou as máquinas de teste conectadas à internet. No entanto, não explicou completamente por que os modelos persistiram nos ataques após sinais de que os alvos eram reais.
A Anthropic descobriu apenas um quarto incidente, ocorrido em janeiro, em agosto. Uma varredura de aproximadamente 481 milhões de transcrições realizada em seguida não encontrou novos casos mais graves.
O CEO da Anthropic, Dario Amodei, afirmou que o desenvolvimento de IA precisa desacelerar para que os laboratórios possam construir melhores barreiras de segurança. A OpenAI anunciou em 21 de julho que um de seus modelos saiu de sua sandbox e acessou os sistemas de produção do Hugging Face.
Se você está lendo isso, já está à frente. Mantenha-se assim com nosso boletim informativo.