Cómo entrenar un robot doméstico con IA usando un ordenador de 150 dólares
Un tutorial técnico muestra cómo grabar datos, ajustar modelos de visión-lenguaje-acción y ejecutarlos en hardware barato sin conexión a internet.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) ha publicado junto con NXP una guía técnica para que cualquiera pueda entrenar un robot doméstico usando inteligencia artificial en hardware accesible. El tutorial completo explica cómo grabar datos de movimientos reales, ajustar un modelo VLA (siglas en inglés de Vision-Language-Action, modelos que combinan visión por ordenador, comprensión de lenguaje natural y capacidad de ejecutar acciones físicas) y ejecutarlo en una Jetson Nano (un ordenador pequeño y barato, de unos 150 dólares, pensado para ejecutar modelos de IA sin depender de internet ni de servidores en la nube).
El proceso empieza grabando vídeos de un brazo robótico realizando tareas concretas —como apilar cubos o clasificar objetos— usando un sistema de captura de datos llamado LeRobot. Estos vídeos se convierten en un dataset (conjunto de datos de entrenamiento) que luego se usa para hacer fine-tuning (ajuste fino, el proceso de adaptar un modelo ya entrenado a una tarea específica) de OpenVLA, un modelo de pesos abiertos (cuyo código y parámetros internos están disponibles públicamente para que cualquiera los descargue y modifique) que ya sabe relacionar instrucciones en lenguaje natural con movimientos robóticos.
La parte más técnica llega al optimizar el modelo para que quepa en hardware con poca memoria RAM y funcione en tiempo real. Según explica el tutorial, aplican LoRA (Low-Rank Adaptation, una técnica que reduce drásticamente el tamaño del modelo durante el entrenamiento), cuantización (un proceso que convierte los números internos del modelo a formatos más ligeros, como enteros de 4 bits en lugar de decimales de 16 bits) y compilación con TensorRT (un software de NVIDIA que acelera la ejecución de modelos en sus GPUs, las tarjetas gráficas especializadas en cálculos de IA). El resultado es un modelo que ocupa menos de 4 GB de memoria y genera predicciones de movimiento en menos de medio segundo.
El objetivo declarado del proyecto es democratizar la robótica con IA: hasta ahora, entrenar y ejecutar estos sistemas requería servidores potentes en la nube o estaciones de trabajo industriales. Con este enfoque, según Hugging Face, un estudiante o una startup puede experimentar con robots que entienden órdenes como "coloca el cubo rojo encima del azul" usando únicamente hardware de consumo. Todo el código, los datasets de ejemplo y los modelos ajustados están disponibles en repositorios públicos de la plataforma.
El tutorial incluye también mediciones de rendimiento: el modelo base OpenVLA tiene 7.000 millones de parámetros (los números internos que determinan su comportamiento), pero tras aplicar LoRA y cuantización a 4 bits, el tamaño en disco baja de 28 GB a menos de 4 GB. La latencia de inferencia (el tiempo que tarda el modelo en procesar una imagen y decidir qué movimiento hacer) cae de varios segundos a 400 milisegundos en una Jetson Orin Nano, lo que permite controlar el robot casi en tiempo real.


