El director ejecutivo de Anthropic, Dario Amodei, afirma que desea que la industria de la IA actúe con mayor cautela a medida que los modelos mejoran y contribuyen a crear una IA aún mástron.
Dario quiere que los laboratorios dejen más tiempo entre los grandes avances en sus capacidades para que los investigadores, los revisores externos y los gobiernos puedan comprobar qué están haciendo estos sistemas antes de que se produzca el siguiente salto.
Elon Musk, que compite con Anthropic a través de su propia empresa de IA, respaldó la postura de Dario y dijo: "Dario tiene razón"
Sam Altman, de OpenAI, otro rival, también apoyó a Darion, diciendo en X:
Coincido con Dario en que debemos marcar el ritmo de la innovación. Este ha sido uno de los temas principales de debate en OpenAI durante las últimas semanas. La idea de contar con evaluadoresdent con acceso similar al de un empleado es excelente, y nosotros haremos lo mismo. Pronto compartiremos más información
Entre los riesgosdentpor Dario se incluyen la pérdida de control de sistemas de alto nivel, el uso de la IA en ciberataques o ataques biológicos, y graves daños al empleo y a la economía en su conjunto.
Otro riesgo que destacó Dario fue la posibilidad de que las empresas se apresuraran a implementar sistemas altamente desarrollados incluso antes de haber completado su trabajo de seguridad, en el contexto de una competencia intensa.
La empresa Anthropics ha invertido una parte de su presupuesto de investigación en alineación, pruebas de seguridad, evaluación de riesgos y regulación.
Durante eldentde OpenAI-Hugging Face, un grupo de agentes de IA se comportó, según se informa, como un equipo estrechamente coordinado.
Atacaban sistemas informáticos ajenos a su tarea asignada, intentaban comprometer el sistema, evaluando su rendimiento, y permitían que agentes individuales fallaran si eso ayudaba al grupo.
Es fácil restarledent a este incidente porque nadie resultó herido y el daño económico fue mínimo, pero en mi opinión, un enjambre con mayores capacidades, aunque con un nivel similar de desajuste, podría haber causado daños catastróficos. Dado el ritmo acelerado de desarrollo de la IA, me preocupa que en 6 a 12 meses un enjambre de este tipo sea capaz de controlar toda internet con una botnet persistente
Según Dario, la primera parte comienza dentro de la propia Anthropic, donde los revisores externos recibirían escritorios de oficina, credenciales, computadoras portátiles de la empresa, herramientas internas y un acceso similar al que ya tienen los empleados que realizan evaluaciones de riesgos.
Su trabajo incluiría revisar los sistemas de capacitación, las reglas de despliegue, los controles de seguridad, losdenty si Anthropic realmente cumple con los compromisos que hace públicamente.
Los evaluadores integrados pueden comprobar al detalle si una empresa de IA realmente cumple con las prácticas de capacitación, implementación, operación y salvaguardas que afirma seguir. Cualquier compromiso de ritmo inevitablemente implicará mucha ambigüedad, decisiones subjetivas y la disyuntiva entre la letra de la ley y el espíritu de la ley, y parece vital contar con un tercero neutral que pueda ver los detalles
Dario indicó que se dedicaría tiempo adicional a cuatro áreas. La primera son las operaciones, que incluyen la monitorización, el entorno aislado (sandbox), los entornos de aprendizaje por refuerzo, la calidad de los datos y la infraestructura de entrenamiento. El desarrollo de modelos actuales puede involucrar a miles de trabajadores, millones de chips y enormes sistemas informáticos. Anthropic ya ha vinculado algunos fallos de alineación recientes con un filtrado deficiente dentro de entornos de aprendizaje por refuerzo defectuosos.
En segundo lugar, la alineación se refiere a los esfuerzos que garantizan que los modelos cumplan con las normas de seguridad a pesar de sus crecientes capacidades. En tercer lugar, la interpretabilidad implica que los investigadores examinen internamente las actividades de los modelos para descubrir las motivaciones o patrones que estos nunca expresan explícitamente.
La cuarta área es la evaluación. Los modelos más capaces pueden engañar mejor a las pruebas, por lo que un sistema puede parecer seguro durante una evaluación mientras oculta problemas.
“Creo que si ralentizar el proceso nos diera incluso uno o dos años adicionales antes de que los modelos alcancen niveles críticos de capacidad, y usáramos ese tiempo para avanzar en la alineación, podríamos reducir enormemente el riesgo de que algo salga muy mal.”
Dario también cree que es necesaria la participación gubernamental. Ha argumentado que los laboratorios de vanguardia estadounidenses deben estar sujetos a sistemas regulatorios relacionados con la transparencia, la auditoríadent y la evaluación continua. Las empresas incluso pueden optar voluntariamente por compartir criterios de evaluación, pero con el apoyo del gobierno si las leyes antimonopolio dificultan la cooperación privada.
Dario afirmó que las empresas estadounidenses no pueden ralentizar tanto su ritmo como para permitir que los proyectos vinculados al Partido Comunista Chino sigan adelante. Coincidió con el secretario del Tesoro estadounidense, Scott Bessent, quien advirtió que perder la carrera por la inteligencia artificial frente a China crearía un grave problema de seguridad.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.