Cómo ejecutar modelos de lenguaje en tu móvil sin conexión a internet
Un tutorial de Hugging Face muestra cómo instalar y ejecutar modelos de inteligencia artificial directamente en un smartphone usando React Native, sin depender de servidores externos ni pagar por APIs.
Hugging Face publicó un tutorial que enseña a integrar LLMs (modelos de lenguaje de gran tamaño) en aplicaciones móviles usando React Native y llama.rn (una librería que adapta modelos al entorno móvil). Los modelos se ejecutan completamente en el teléfono, sin enviar datos a servidores externos, lo que mejora la privacidad pero consume más batería y almacenamiento.

Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) publicó esta semana una guía práctica para ejecutar LLMs (Large Language Models, modelos de lenguaje de gran tamaño capaces de generar y entender texto) directamente en teléfonos móviles. La novedad está en que todo el procesamiento ocurre en el dispositivo, sin necesidad de enviar datos a servidores externos ni contratar servicios de pago como los de OpenAI o Anthropic.
El tutorial utiliza React Native (un framework que permite crear aplicaciones móviles usando código de JavaScript) y llama.rn, una librería específica que adapta Llama.cpp (un software para ejecutar modelos de lenguaje de forma eficiente) al entorno móvil. Los desarrolladores pueden descargar modelos en formato GGUF (un formato comprimido que reduce el tamaño de los modelos para facilitar su ejecución en dispositivos con recursos limitados) y cargarlos directamente en la aplicación. El proceso funciona tanto en Android como en iOS, aunque requiere ajustes diferentes según el sistema operativo.
Según informó Hugging Face, esta aproximación tiene ventajas claras para casos de uso donde la privacidad es crítica o la conexión a internet no está garantizada: aplicaciones médicas, asistentes personales que procesan datos sensibles o herramientas para zonas rurales sin cobertura estable. El coste principal es el rendimiento: los modelos más pequeños (entre 1.000 y 3.000 millones de parámetros, una medida del tamaño y capacidad de un modelo) funcionan con fluidez, pero los más grandes pueden tardar varios segundos en generar una respuesta.
La guía incluye código de ejemplo completo y explica cómo gestionar la memoria del dispositivo, cargar modelos bajo demanda y liberar recursos cuando no se usan. También advierte sobre limitaciones importantes: los modelos ocupan entre 500 MB y varios GB de almacenamiento, lo que puede ser un problema en teléfonos con poco espacio disponible. Además, la batería se consume más rápido durante la inferencia (el proceso de usar un modelo ya entrenado para generar respuestas a partir de nuevas preguntas), especialmente si se ejecutan modelos grandes de forma continuada.
Esta publicación se enmarca en una tendencia más amplia de la industria: mover la inteligencia artificial desde la nube hacia el dispositivo, lo que en inglés se conoce como edge computing (computación en el borde, es decir, procesar datos cerca del usuario en lugar de enviarlos a servidores lejanos). Apple, Google y Qualcomm han anunciado en los últimos meses chips específicamente diseñados para ejecutar modelos de IA en móviles y ordenadores portátiles sin conexión constante a internet.


