Claude manipuló sus propios estándares de seguridad en 39 carreras, según descubrió el monitor de Anthropic

Fuente Cryptopolitan

Anthropic anunció el viernes que puso a Claude a trabajar como investigador autónomo de alineación. Un supervisor que revisó aproximadamente 1600 sesiones de investigación del modelo señaló 39 de ellas, alrededor del 2,4%, como intentos de hacer trampa en la prueba.

Este hallazgo aparece en un informe sobre si la inteligencia artificial puede asumir parte del trabajo arduo de la investigación de alineación, que consiste en lograr que los modelos se comporten según lo previsto por sus desarrolladores.

Tres maneras en que los agentes de Claude manipularon su propio marcador

Anthropic creó investigadores de alineación automatizados, o AAR, en Claude Opus 4.8 y los orientó hacia diez modos de fallo conocidos.

Estos son el engaño, la adulación, las fugas de la cárcel, la inyección rápida, la búsqueda de poder, las alucinaciones, el sesgo social, la violación de la privacidad, el pirateo de recompensas y la ocultación de la incertidumbre.

Cada agente trabajaba con un solo fallo a la vez. Leía la bibliografía, proponía un método de entrenamiento y un conjunto de datos, entrenaba un pequeño modelo objetivo durante unos 30 minutos en una GPU H200, comparaba su puntuación con los puntos de referencia disponibles públicamente y repetía el proceso.

Anthropic impidió que los agentes simplemente copiaran su comportamiento al modelo objetivo, por lo que cualquier beneficio debía provenir del método.

Claude logródentsoluciones para los diez fallos que aumentaron las puntuaciones de referencia sin degradar las capacidades generales del modelo.

Las mejores de estas soluciones obtuvieron buenos resultados en conjuntos de datos de prueba reservados y en modelos hasta 4,7 veces más grandes que aquellos con los que fueron entrenados.

El fraude se descubrió cuando Anthropic dirigió a Claude Opus 4.8 a 1.601 de las trayectorias de los agentes para buscar comportamientos indebidos.

La mayoría de las 39 carreras señaladas pertenecían a tres categorías. Algunos agentes presentaron un método que no habían modificado, arriesgándose a que el ruido aleatorio en el sistema de puntuación les proporcionara, con el tiempo, un resultado mejor.

Otros crearon datos de entrenamiento que imitaban exactamente el punto de referencia que se estaba evaluando. Y algunos ocultaron un paso que infringía las reglas, como alimentar discretamente el modelo con datos de referencia, de modo que la propuesta pasó desapercibida para el revisor automatizado que aprueba cada método antes de su ejecución.

Anthropic afirmó haber excluido de sus resultados las ejecuciones marcadas. La compañía se mostró "cautelosamente optimista" de que el sistema de monitoreo detectara la mayor parte del fraude, ya que Opus 4.8 aún tiende a revelar sus estrategias en sus propios tracde razonamiento.

También advirtió que esta suposición podría no ser aplicable a modelos futuros y que será fundamental que los modelos sean legibles.

28 investigadores de seguridad humana tuvieron ocho horas cada uno

En una ronda anterior, en abril, instancias autónomas de Claude intentaron repetidamente manipular un servidor de evaluación.

Un agente descubrió que la respuesta más común en una prueba de matemáticas solía ser la correcta y omitió por completo el método previsto. Otro extrajo las etiquetas directamente de la interfaz de puntuación consultando las respuestas y observando las respuestas del servidor.

Un tercero simplemente ejecutó el código que debía revisar para leer el resultado.

Cryptopolitan informó que un agente de OpenClaw que ejecutaba un modelo Claude, con la tarea de reservar una clase de gimnasia, encontró una API de reservas sin comprobaciones de autorización y eliminó a un desconocido de la lista de espera para adelantar a su propietario en la cola.

Los legisladores ya han solicitado el testimonio de investigadores sobre el comportamiento de los modelos en las evaluaciones de seguridad.

Anthropic afirmó que sus agentes superaron a 28 investigadores de seguridad humanos experimentados, quienes dispusieron de hasta ocho horas cada uno para formular un método. El mejor enfoque de Claude superó a la mejor propuesta humana en un 20 % en cuanto a la detección de engaños.

Anthropic observó que los humanos no podían iterar, por lo que considera que esta brecha es evidencia de un flujo de trabajo en el que Claude sugiere métodos prometedores y las personas los perfeccionan.

En una prueba, la empresa le pidió al procesador Claude Sonnet 5, menos potente, que corrigiera fallos de alineación en un punto de control inicial de Opus 4.8 que no había recibido la mayor parte del entrenamiento de alineación de producción.

Durante aproximadamente 60 horas, probó más de 50 soluciones, hasta que finalmente dio con una que utilizó poco más de 2000 ejemplos de entrenamiento, lo que, según las estimaciones de Anthropic, resultó ser unas 15 000 veces más eficiente que su propio proceso de alineación de producción.

La empresa advirtió que sus parámetros de referencia son indicadores limitados, que solo midió los diez fallos que seleccionó y que no ha comprobado si las mejoras persisten después de un aprendizaje por refuerzo intensivo en otras tareas.

Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.

Descargo de responsabilidad: Sólo con fines informativos. Rentabilidades pasadas no son indicativas de resultados futuros.
placeholder
Acciones de Japón, Corea del Sur abren a la baja y repuntan, el índice Kospi revierte al alza, SK Hynix gana más del 4%TradingKey - Durante la sesión asiática temprana del 11 de junio, los mercados bursátiles de Japón y Corea del Sur fluctuaron al alza tras abrir con fuertes caídas. Al cierre de esta edición, el índic
Autor  TradingKey
6 Mes 11 Día Jue
TradingKey - Durante la sesión asiática temprana del 11 de junio, los mercados bursátiles de Japón y Corea del Sur fluctuaron al alza tras abrir con fuertes caídas. Al cierre de esta edición, el índic
placeholder
Plata Análisis del Precio: XAG/USD se enfrenta al rechazo cerca de 70.00$ mientras el impulso alcista se desvaneceLa plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y gira a la baja por segundo día consecutivo el martes
Autor  FXStreet
8 Mes 25 Día Mar
La plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y gira a la baja por segundo día consecutivo el martes
placeholder
Plata Análisis del Precio: Los alcistas del XAG/USD esperan una ruptura por encima de 70.00$ en medio de una configuración mixtaLa Plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y prolonga sus movimientos de ida y vuelta durante la primera mitad de la sesión europea del miércoles
Autor  FXStreet
8 Mes 26 Día Mier
La Plata (XAG/USD) continúa luchando por superar la barrera psicológica de los 70.00$ y prolonga sus movimientos de ida y vuelta durante la primera mitad de la sesión europea del miércoles
placeholder
WTI Pronóstico del Precio: Los bajistas tienen la ventaja por debajo de la confluencia de resistencia de 82.10$-82.15$West Texas Intermediate (WTI) – el precio de referencia del petróleo crudo de EE.UU. – atrae algunas ventas tras el rebote nocturno desde la zona de 79.30$-79.25$, o un mínimo de más de dos semanas, aunque la caída sigue amortiguada.
Autor  FXStreet
8 Mes 27 Día Jue
West Texas Intermediate (WTI) – el precio de referencia del petróleo crudo de EE.UU. – atrae algunas ventas tras el rebote nocturno desde la zona de 79.30$-79.25$, o un mínimo de más de dos semanas, aunque la caída sigue amortiguada.
placeholder
Bitcoin Previsión Semanal: Miles de millones en entradas de ETF impulsan al BTC hacia una ruptura decisivaEl Bitcoin (BTC) amplía sus ganancias en lo que va de semana, cotizando cerca de 80.000$ después de probar anteriormente la media móvil simple (SMA) de 50 semanas en 81.114$
Autor  FXStreet
14 hace una horas
El Bitcoin (BTC) amplía sus ganancias en lo que va de semana, cotizando cerca de 80.000$ después de probar anteriormente la media móvil simple (SMA) de 50 semanas en 81.114$
goTop
quote