La escasez de datos físicos frena el avance de los robots humanoides, advierte ejecutiva de Telus Digital
Los desarrolladores de robótica se enfrentan a un gran cuello de botella debido al alto costo de los datos de video y a las discrepancias en las entradas de los sensores, según Sce Pike, líder de IA en Telus Digital. A diferencia de los modelos de IA basados en texto, los robots físicos requieren entrenamiento sensorial del mundo real para desenvolverse ante la gravedad, las leyes de la física y los riesgos de seguridad pública.

Un cuello de botella de datos golpea a la robótica humanoide
Si bien los rápidos avances en inteligencia artificial generativa durante los últimos cuatro años han acelerado las pruebas y el despliegue de robots humanoides, los desarrolladores se encuentran ahora en un punto muerto debido a una grave escasez de datos de entrenamiento. En declaraciones durante el pódcast Targeting AI, Sce Pike, vicepresidenta de crecimiento y soluciones de IA en la firma canadiense Telus Digital, advirtió que el flujo de datos que impulsó a los grandes modelos de lenguaje modernos no se puede replicar simplemente en máquinas físicas.
Aunque los modelos basados en texto escalaron con rapidez ingiriendo la internet pública, los robots físicos no pueden aprender a interactuar con el mundo real únicamente a través de texto. Como señaló Pike, quien lidera las iniciativas de robótica y modelos de mundo en Telus Digital, acortar la brecha entre el razonamiento digital y la acción física requiere arquitecturas de datos totalmente diferentes que a la industria le está costando estructurar a escala.
Costos de computación, ruido en los sensores y seguridad en el mundo real
Uno de los principales desafíos radica en la mecánica con la que las máquinas comprenden la realidad física. Pike citó una analogía popularizada por Yann LeCun, exdirector científico de IA en Meta AI, quien señaló que un niño de cuatro años posee aproximadamente cinco veces más comprensión que un LLM, ya que los niños humanos aprenden a través de estímulos sensoriales y nervios ópticos visuales. Al observar e interactuar con su entorno, los niños pequeños dominan de forma orgánica la gravedad, la física y la causa y efecto, conceptos que no pueden deducirse únicamente del lenguaje escrito.
Para replicar este entendimiento en los robots, los desarrolladores recurren a modelos de mundo entrenados con grabaciones del mundo real. Sin embargo, capturar y utilizar este material plantea importantes obstáculos operativos:
- Costos exorbitantes de almacenamiento y computación: Recopilar el enorme volumen de video en alta resolución necesario para enseñar física básica a las máquinas genera gastos masivos de infraestructura y cómputo.
- Fragmentación de sensores: Los datos de entrenamiento físico se recolectan mediante una mezcla dispar de lidar, sensores infrarrojos y diversos tipos de cámaras, lo que genera señales contradictorias y un ruido sustancial dentro de los conjuntos de datos.
- Altos riesgos de seguridad: A diferencia de un chatbot, donde los datos corruptos o deficientes dan lugar a texto erróneo, los datos físicos defectuosos ponen en peligro directo la seguridad humana. Pike destacó situaciones en las que un comportamiento errático del hardware —como un robot que se desploma y agita sus extremidades en un centro comercial concurrido— representa responsabilidades inaceptables en el mundo real.
El impulso hacia los modelos de mundo
La crisis de datos se produce en un momento en que la industria de la robótica pasa de centrarse en la mecánica pura a la inteligencia corporeizada. Mientras que la IA empresarial convencional se enfoca en conjuntos de datos sintéticos y automatización digital, los especialistas en robótica exploran cada vez más modelos de mundo fundacionales capaces de generalizar acciones con menos datos brutos. Startups como Skild AI, respaldada por Nvidia, por ejemplo, intentan sortear el déficit de datos entrenando a robots para ejecutar tareas a partir de una única demostración en video. Por ahora, sin embargo, superar el alto costo de la recolección de datos físicos y la ruidosa integración multisensorial sigue siendo el principal obstáculo entre los prototipos de laboratorio y un despliegue seguro y autónomo en espacios públicos.



