Seis modelos de IA en una semana, sin escribir código: así funciona ML Intern
Un desarrollador creó seis modelos especializados de inteligencia artificial en pocos días usando ML Intern, un agente que planifica, entrena y publica modelos completos a partir de instrucciones en lenguaje natural.
ML Intern es un agente de IA disponible en HuggingChat que automatiza la creación de modelos personalizados: a partir de instrucciones en lenguaje natural, planifica el proyecto, genera o busca datos de entrenamiento, entrena el modelo en servidores de Hugging Face, lo evalúa y lo publica. Un desarrollador lo usó para crear seis modelos especializados en una semana, con costes entre 2 y 24 dólares por proyecto.

La semana pasada, un desarrollador necesitaba una versión ligera del reescritor de prompts (el sistema que mejora las descripciones que le das a un modelo de imagen) que viene con Qwen-Image 2.1. El modelo oficial pesa 9.000 millones de parámetros (9B, la medida del tamaño de un modelo de IA), ocupa unos 20 GB de memoria y genera miles de palabras innecesarias antes de producir un solo párrafo útil. En Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados) solo encontró versiones comprimidas de ese mismo modelo gigante. Así que describió lo que necesitaba a ML Intern, un agente de inteligencia artificial que automatiza todo el proceso de crear modelos personalizados, y al día siguiente tenía una versión de 800 millones de parámetros que funciona en un procesador normal, sin necesidad de tarjeta gráfica. El nuevo modelo produce resultados válidos el 99,7% de las veces y usa solo una cuarta parte de las palabras que generaba el modelo original. El coste total del proyecto, incluyendo el tiempo de procesamiento para que el modelo grande etiquetara 8.797 ejemplos de entrenamiento, fue de 16 dólares.
Durante los días siguientes, el mismo desarrollador creó cinco modelos más siguiendo el mismo método, según explica en el blog de Hugging Face. Cada proyecto empezó como un mensaje de texto en HuggingChat (el chatbot de la plataforma) con ML Intern activado, y terminó como un modelo público en Hugging Face con su evaluación de rendimiento incluida en la documentación. ML Intern planifica el trabajo, pide permiso antes de gastar dinero en procesamiento, ejecuta una prueba pequeña antes del trabajo real, y luego entrena, evalúa y publica el modelo usando los servidores de Hugging Face.
El secreto está en cómo se le dan las instrucciones. El primer mensaje es donde el desarrollador concentra su esfuerzo: su primera petición tenía unas 450 palabras, pero para el sexto proyecto ya llegaba a 2.000, porque cada proyecto le enseñó algo que quería incluir en el siguiente. Cada instrucción empieza con la idea en una línea y por qué la necesita, luego nombra las piezas exactas: el conjunto de datos de entrenamiento, el modelo base sobre el que construir, el script de entrenamiento. Todo lo que ya ha verificado va bajo un encabezado que literalmente dice "Hechos verificados, no volver a derivar", para que el agente gaste su presupuesto en el trabajo real en lugar de redescubrir lo que ya se sabe. Dos instrucciones son críticas: pedir una medición de referencia antes de entrenar (para saber si el modelo mejoró realmente) y solicitar una prueba corta con verificación antes de pagar por el entrenamiento completo.
Entre los seis proyectos que documenta están: un modelo especializado en diagnosticar enfermedades de cítricos que pasó de un 14,9% a un 52,8% de precisión tras entrenarse con 3.017 fotos anotadas (coste: 1,90 dólares); un LoRA (un tipo de complemento ligero que añade capacidades a un modelo existente sin reentrenarlo por completo) para generar a Huggy, la mascota de Hugging Face, entrenado con 84 dibujos; un LoRA que permite rotar objetos 3D para verlos desde cualquier ángulo, entrenado con 24.722 imágenes renderizadas de objetos escaneados; y otro que inserta objetos dibujados a mano en fotografías reales manteniendo la iluminación original, construido con 6.042 pares de entrenamiento generados automáticamente. Cada uno de estos proyectos costó entre 2 y 24 dólares en tiempo de procesamiento.
ML Intern empieza cada tarea con presupuesto cero y necesita permiso antes de ejecutar trabajos que cuestan dinero, lo que mantiene el gasto bajo control estricto. Cuando no se especifica un presupuesto, el agente sugiere un par de opciones según el tamaño del proyecto y pregunta cuál prefieres. El desarrollador señala que no es necesario incluir todos los detalles desde el primer intento: su primer proyecto, el modelo de enfermedades de cítricos, no tenía la sección de hechos verificados y aun así ML Intern produjo un modelo que más que triplicó la precisión del modelo base. Todos los prompts exactos que usó están publicados en GitHub para que otros desarrolladores puedan aprender de ellos.


