Google DeepMind ha lanzado un modelo de conversión de lenguaje de señas a texto llamado SL2T, que estará integrado en Gboard y Live Transcribe en el nuevo Pixel 11.
La compañía afirma que es la primera IA de lenguaje de señas que se comercializa en un producto de consumo real.
Las personas que pueden oír y hablar han podido utilizar el dictado por voz para comunicarse con sus dispositivos durante años.
Ahora, quienes no pueden articular un discurso para utilizar el dictado por voz, pero usan el lenguaje de señas, pueden interactuar con Internet, redactar un mensaje o editar un documento utilizando su dispositivo Pixel 11, gracias a SL2T.
En Live Transcribe, un usuario puede firmar una respuesta durante una conversación cara a cara en lugar de escribirla tecleando.
Actualmente, este modelo solo traduce del lenguaje de señas americano (ASL) al inglés. Google afirma que en el futuro se implementará en más dispositivos y se añadirán más idiomas.
Según se informa, los usuarios que probaron el modelo describieron el lenguaje de señas estadounidense (ASL) como más rápido y natural que escribir en inglés.
DeepMind considera que los lenguajes de señas son lenguajes naturales completos, no "inglés escrito con las manos"
Sin embargo, su desarrollo se ha quedado rezagado en comparación con la IA del lenguaje hablado, debido en gran parte a dos desafíos.
En primer lugar, los lenguajes de señas tienen su propia gramática y vocabulario, por lo que el sistema debe traducirlos en lugar de transcribirlos. Además, transmiten significado a través de las manos, los brazos, el torso, la cabeza y el rostro simultáneamente, lo que supone un reto complejo para la visión artificial a la hora de realizar un tracpreciso.
Si bien ya se habían realizado intentos previos para desarrollar estas soluciones, la mayoría fracasaron. Uno de ellos, los guantes de lenguaje de señas, fracasó en parte porque solo reconocían la forma de las manos e ignoraban el resto del cuerpo. SL2T se diseñó para gestionar tanto la percepción visual como la traducción.
SL2T no envía el material grabado a la nube. Un componente de visión artificial integrado en el dispositivo, llamado MediaPipe Holistic, mapea el rostro, las manos, los brazos y el torso del intérprete en coordenadas geométricas, y solo esas coordenadas se envían a los servidores de Google. DeepMind afirma que esto mantiene el vídeo original en el teléfono y agiliza el proceso.
El modelo traduce esas secuencias de puntos de referencia directamente a texto, omitiendo las etiquetas intermedias conocidas como glosas. Según DeepMind, las glosas limitan el vocabulario y no incluyen los marcadores no manuales ni la gramática espacial en los que se basa el lenguaje de señas americano (ASL).
Google entrenó SL2T con más de 100 000 horas de datos que abarcan más de 50 lenguas de señas, aproximadamente una cuarta parte de ellas en ASL, y obtuvo una puntuación de 70 BLEURT en la prueba de referencia FLEURS-ASL. El modelo también admite la comunicación con una mano y con la mano izquierda, incluye optimizaciones de latencia y cuenta con mecanismos para evitar que genere texto de forma aleatoria cuando la cámara detecta movimientos que no corresponden a la comunicación con señas.
Google ha creado un Comité Asesor de Lenguaje de Señas con Inteligencia Artificial, integrado por organizaciones de personas sordas y expertos en lenguaje de señas, para orientar la implementación de esta tecnología. El comité elaborará conjuntamente un informe sobre las capacidades y limitaciones actuales del modelo.
El siguiente paso en la hoja de ruta es la incorporación de más lenguas de señas y modelos que generen lenguaje de señas en lugar de solo leerlo.
El lanzamiento para el consumidor lleva gestándose un tiempo. Android Authority descubrió una opción de conversión de signos a texto en una versión beta de Gboard el 17 de julio de 2026, después de que DeepMind hubiera presentado previamente un modelo de lenguaje de señas llamado SignGemma.
El lanzamiento también coincide con un periodo turbulento para el laboratorio. A principios de agosto de 2026, Demis Hassabis pasó de ser director ejecutivo de DeepMind a presidente, y Koray Kavukcuoglu asumió la dirección de las operaciones diarias, con la aplicación Gemini superando ya los 950 millones de usuarios mensuales.
Las mentes más brillantes del mundo de las criptomonedas ya leen nuestro boletín. ¿Te apuntas? ¡ Únete!