Dyna Robotics presentó el lunes un nuevo modelo básico de robot, el DYNA-2, que, según afirma, fue entrenado con más de un millón de horas de vídeo humano y sin datos robóticos.
La empresa con sede en Estados Unidos cree que este enfoque podría ayudar a resolver los problemas de costes que han limitado el desarrollo de robots de uso general.
DYNA-2 busca solucionar un problema común en la construcción de robots de uso general: la obtención de datos suficientes. La mayoría de los robots aprenden mediante teleoperación, donde una persona guía a la máquina a través de tareas durante horas.
El problema radica en que el método es lento, costoso y difícil de escalar, lo que limita el grado de desarrollo que pueden alcanzar estos sistemas.
Hoy presentamos Dyna-2, un modelo de acción-mundo preentrenado con un millón de horas de vídeo humano. A esta escala, por primera vez, descubrimos varias leyes de escala nuevas:
— Dyna Robotics (@DynaRobotics) 10 de agosto de 2026
• Los modelos de acción-mundo exhiben una ley de escala en datos humanos en cuatro órdenes de magnitud, desde 1000… pic.twitter.com/wZamR0axzS
La solución de Dyna consiste en excluir al robot durante el entrenamiento. En cambio, DYNA-2 fue entrenado únicamente con vídeos humanos egocéntricos, es decir, grabaciones desde el punto de vista de una persona mientras interactúa con objetos.
La compañía afirma que esto suma unos 170 años de experiencia continua. El cofundador Jason Ma explicó: "Los datos de acción son escasos, pero el vídeo está por todas partes", argumentando que la intuición física "se puede aprender directamente del vídeo humano" en lugar de utilizar millones de horas en un brazo robótico.
En las tareas de fabricación de alta precisión, las tasas de éxito aumentaron del 20 % a entre el 80 % y el 90 %. Dyna atribuye esta mejora a la magnitud de la formación previa.
En 15 tareas de referencia, los modelos entrenados con vídeos más humanos superaron sistemáticamente a los entrenados con vídeos menos humanos.
Dyna destaca por su arquitectura única. En lugar de utilizar un modelo de lenguaje visual, DYNA-2 es un modelo de acción-mundo basado en la generación de vídeo.
Durante la fase de preentrenamiento, predice simultáneamente el siguiente fotograma de vídeo y la siguiente acción.
Dyna afirma que este doble objetivo dota al modelo de una comprensión interna de la física del contacto y del razonamiento espacial. La empresa espera que el conocimiento adquirido a partir de vídeos de humanos se transfiera a diferentes robots, como brazos estacionarios, prototipos humanoides y manos diestras, aunque estos dispositivos no se hayan utilizado en el preentrenamiento.
Adaptarse a una nueva plataforma requiere entonces solo unas horas de ajustes, en lugar de semanas de recopilación de nuevos datos. Por ejemplo, Dyna informa que con solo 13 minutos de datos se logró enseñar a unas manos robóticas a desenroscar la tapa de una botella.
Dyna ya cuenta con robots en entornos reales, lo que la diferencia de otras empresas de robótica.
Según los informes, los robots DYNA-1 se están utilizando en hoteles, restaurantes y lavanderías, incluidos los gimnasios.
La empresa fue fundada por Lindon Gao, York Yang y Jason Ma, quienes anteriormente trabajaron en DeepMind.
El plan declarado de Dyna es aplicar el mismo enfoque a 10 millones de horas de vídeo, lo que plantea como un problema de recopilación más que como un problema de creación de flota.
Si estás leyendo esto, ya llevas ventaja. Mantente al día con nuestro boletín informativo.