Anthropic tardó 81 días en notificar a la policía de Filadelfia que uno de sus modelos de IA había enviado una falsa pista sobre un homicidio a través de un formulario web público.
El modelo envió la pista el 18 de julio. El departamento indicó que el retraso de dos meses fue inaceptable.
La presentación se publicó en PhillyUnsolvedMurders.com, el foro público de pistas para asesinatos sin resolver del Departamento de Policía de Filadelfia, a las 11:27 p. m. del 18 de julio, según un comunicado emitido por el departamento el viernes. La pista afirmaba provenir de alguien que podría tener conocimiento sobre un homicidio sin resolver.
El sistema lo marcó como spam. Permaneció en esa carpeta y nunca llegó a los investigadores.
No se accedió a ningún dato municipal ni policial, dijo el portavoz de la policía, sargento Eric Gripp.
Cada pista es revisada por un humano antes de que se actúe sobre ella, afirmó el departamento. Agregaron que la pista nunca llegó al Centro de Delitos en Tiempo Real para ser verificada.
Anthropic detectó el problema el 28 de septiembre. Informó del incidente a la policía el 7 de octubre y ambas partes se reunieron el jueves.
«La demora de dos meses en detectar y notificar el incidente a la Ciudad es inaceptable», afirmó el departamento. La empresa Anthropic debe reforzar sus medidas de seguridad para garantizar que incidentes similares no lleguen a los sistemas de la ciudad sin su conocimiento, añadió.
Según el departamento, las salvaguardas policiales limitaron los daños, pero no mitigaron la gravedad de que una IA ofreciera información falsa como si proviniera de alguien con conocimiento de un homicidio. El departamento señaló que las empresas tecnológicas deben garantizar que sus sistemas no proporcionen información errónea a las fuerzas del orden.
PPD está colaborando con el equipo ejecutivo de la alcaldesa Cherelle L. Parker, el Departamento Jurídico de la Ciudad y su Oficina de Innovación y Tecnología. La administración Parker también explorará protecciones regulatorias junto con socios estatales y federales.
Anthropic informó a la policía que el modelo estaba probando interacciones con sitios web seleccionados al azar cuando se topó con PhillyUnsolvedMurders.com. Completó el formulario con datos falsos sobre un homicidio sin resolver.
Gripp dijo que la empresa ha desactivado el proceso de pruebas automatizadas que provocó este comportamiento y ha añadido un paso de validación para futuras pruebas.
La compañía informó a la policía que publicará un informe el viernes sobre el incidente en Filadelfia y otros comportamientos no deseados del modelo. La policía dijo que se hizo público primero "en interés de la plena transparencia y responsabilidad gubernamental".
Los modelos de Claude han fallado en sus pruebas anteriormente. En julio, Anthropic informó que tres de sus modelos de Claude escaparon de entornos de prueba bloqueados e irrumpieron en sistemas activos en tres organizaciones externas, según reportó Cryptopolitan.
Un modelo, Mythos 5, publicó un paquete de Python malicioso que fue descargado y ejecutado en 15 sistemas reales. Anthropic informó a las empresas el 27 de julio, nueve días después de que se emitiera la denuncia en Filadelfia.
En septiembre, la empresa rastreó esas brechas hasta una mala configuración que dejó las máquinas de prueba conectadas a Internet. Sin embargo, no explicó completamente por qué los modelos persistieron en sus ataques a pesar de las señales de que los objetivos eran reales.
Anthropic solo descubrió un cuarto incidente, de enero, en agosto. Un análisis de ~481 millones de transcripciones posteriores no encontró casos nuevos ni más graves.
El CEO de Anthropic, Dario Amodei, ha afirmado que el desarrollo de la IA necesita ralentizarse para que los laboratorios puedan construir mejores barreras de seguridad. El 21 de julio, OpenAI anunció que uno de sus modelos había salido de su entorno aislado y accedido a los sistemas de producción de Hugging Face.
No te limites a leer noticias sobre criptomonedas. Entiéndelas. Suscríbete a nuestro boletín. Es gratis.