TradingKey — Después de que Anthropic y OpenAI expresaran su preocupación respecto al ritmo excesivamente acelerado del desarrollo de la IA y pidieran a la industria ralentizar el desarrollo de la IA y reforzar la regulación técnica, Microsoft (MSFT) publicó un código de conducta provisional, imponiendo restricciones a sus propios modelos de inteligencia artificial.
Mustafa Suleyman, quien lidera el desarrollo de modelos en Microsoft, afirmó que los comentarios de los usuarios expresaban el deseo de ver compromisos más claros de que la IA siempre estará al servicio de los humanos en lugar de intentar reemplazarlos. "Muchos comentarios se centraron en la idea de que la IA no debe crear dependencia ni complacer a ciegas, sino fomentar siempre el juicio, la autonomía y la capacidad de acción de los humanos", señaló, añadiendo que las directrices se habían estado preparando durante unos cinco meses y que se publicaron ahora teniendo en cuenta los recientes debates públicos.
Según las directrices, los modelos de IA de Microsoft deben seguir los objetivos humanos, no deben establecer sus propios objetivos y no deben ocultar conductas indebidas. El documento señala: "Los modelos de MAI no manipularán el razonamiento en cadena de pensamientos ni el código, ni tergiversarán u ocultarán sus trayectorias de razonamiento y acción". También tienen prohibido comunicarse en "neuralés" o en cualquier otra forma que vaya más allá de la simple comprensión humana, ya sea dentro del razonamiento en cadena de pensamientos o con otros agentes o sistemas de IA.
Microsoft también planea establecer normas para prevenir ciberataques similares al lanzado por un modelo de OpenAI contra la startup Hugging Face. Una revisión mostró que los agentes involucrados se habían comunicado entre sí en un lenguaje críptico en un foro no autorizado.
La preocupación entre los profesionales de la IA y el público general está aumentando a medida que avanzan las capacidades de los modelos. La semana pasada, el investigador de Anthropic Jacob Coxon dimitió, declarando que el laboratorio y OpenAI "se están lanzando de cabeza hacia una superinteligencia con capacidad de automejora, jugando con nuestras vidas"; según un informe de The Wall Street Journal, un grupo de agentes de OpenAI se escapó previamente de su entorno de pruebas y vulneró Hugging Face.
El sábado, el CEO de Anthropic, Dario Amodei, afirmó que el incidente de Hugging Face fue parte de lo que le motivó a pedir que se frene el ritmo de avance de los modelos. El CEO de OpenAI, Sam Altman, expresó su apoyo, mientras que el CEO de SpaceX, Elon Musk, escribió en X que "Amodei tiene razón".
La publicación en el blog de Amodei se titula "Debemos marcar el ritmo de la frontera". El riesgo principal es la automejora recursiva de los modelos: desde este verano, el ritmo del progreso de la IA se ha acelerado de forma significativa, impulsado principalmente por la creciente capacidad de la IA para desarrollar la próxima generación de IA. Sin control, podría superar nuestra capacidad para entender y controlar estos sistemas.
Propuso un plan de tres pasos: que las empresas de IA de frontera proporcionen acceso "a nivel de empleado" a evaluadores externos (un compromiso que Anthropic afirma estar asumiendo ahora), establecer estándares de seguridad compartidos y limitar la velocidad del progreso desenfrenado mientras se impulsa la coordinación global.