Photoroom entrena un modelo de generación de imágenes en 24 horas por 1.000 dólares
La startup francesa demuestra que es posible crear un modelo text-to-image competitivo sin necesidad de presupuestos millonarios ni semanas de computación.

Photoroom, una empresa francesa especializada en edición de imágenes con IA, acaba de publicar los detalles de cómo entrenaron PRX-1.5B, un modelo capaz de generar imágenes a partir de texto, en apenas 24 horas y con un coste de solo 1.000 dólares. El experimento, según explican en su blog técnico alojado en Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), demuestra que no hace falta ser una gran tecnológica con presupuestos millonarios para crear herramientas competitivas de generación de imágenes.
El modelo se entrenó con 12 millones de pares de imágenes y descripciones de texto, utilizando una arquitectura basada en diffusion transformers o DiT (un tipo de red neuronal diseñada específicamente para generar imágenes de alta calidad). Para lograrlo en tan poco tiempo, el equipo empleó ocho GPUs NVIDIA H100 (las tarjetas gráficas más potentes actualmente para entrenar modelos de IA) durante un día completo. Según Photoroom, el resultado es un modelo que genera imágenes de 1024×1024 píxeles con una calidad comparable a la de herramientas comerciales mucho más grandes.
Lo interesante del proyecto no es solo la velocidad, sino la transparencia: Photoroom ha publicado el código, los pesos del modelo (los parámetros internos que determinan cómo funciona) y un análisis detallado del proceso de entrenamiento. La empresa usa una licencia de pesos abiertos (open weights), lo que significa que cualquiera puede descargar y usar el modelo, aunque con algunas restricciones dependiendo del uso comercial. Esta apertura permite que otros equipos repliquen el experimento o adapten el modelo a sus propias necesidades sin partir de cero.
El proyecto forma parte de una serie de tres publicaciones en las que Photoroom explora cómo optimizar el entrenamiento de modelos text-to-image. En las entregas anteriores, la compañía ya había compartido técnicas para mejorar la eficiencia del proceso y reducir costes. Ahora, con este tercer experimento, demuestran que es posible competir con gigantes como Stability AI o Midjourney sin necesidad de infraestructuras masivas ni meses de desarrollo.
Para quienes trabajan en startups o proyectos de investigación con presupuestos ajustados, este tipo de avances es especialmente relevante: rebaja la barrera de entrada para crear modelos de generación de imágenes personalizados, algo que hasta hace poco estaba reservado a empresas con recursos prácticamente ilimitados. El modelo completo y la documentación están disponibles de forma pública en Hugging Face.


