Cómo China construye modelos de IA abiertos sin depender de DeepSeek
Desarrolladores chinos están experimentando con arquitecturas alternativas y combinando modelos pequeños para crear sistemas potentes sin necesidad de GPUs de última generación.

Un año después de que DeepSeek pusiera en el mapa global a la inteligencia artificial china con modelos potentes y económicos, el ecosistema de código abierto del país asiático ha tomado un rumbo propio. Según documenta Hugging Face (una plataforma donde desarrolladores de todo el mundo comparten y descargan modelos de IA ya entrenados), los equipos chinos están apostando por arquitecturas experimentales y estrategias colaborativas que rompen con el enfoque dominante en Silicon Valley.
La tendencia más llamativa es el uso de MoE o "mixture of experts" (una técnica que divide un modelo grande en varios módulos especializados que sólo se activan cuando hace falta, ahorrando memoria y cómputo). Modelos como Qwen2.5-MoE o DeepSeek-V3 combinan decenas de "expertos" internos para resolver tareas complejas sin necesitar el hardware más caro. Esta arquitectura permite entrenar sistemas con billones de parámetros (los valores internos que determinan el comportamiento del modelo) usando menos GPU (chips especializados en cálculos paralelos, esenciales para entrenar IA) que los gigantes occidentales.
Otra apuesta diferencial es la colaboración entre modelos. Proyectos como Nous Research y 01.AI están experimentando con "agentic workflows" (sistemas donde varios modelos pequeños trabajan en cadena, cada uno resolviendo un paso de una tarea compleja). En lugar de un único modelo gigante que lo haga todo, combinan un LLM de razonamiento (un modelo de lenguaje grande, como ChatGPT, entrenado para responder preguntas) con otro especializado en código o análisis de datos. El resultado: sistemas más baratos de operar y más fáciles de ajustar para tareas específicas.
El informe de Hugging Face también destaca el protagonismo de modelos multimodales (capaces de procesar texto, imagen, audio y vídeo al mismo tiempo). Qwen2-VL y CogVideoX-5B lideran las descargas en Asia, impulsados por sectores como el e-commerce y la educación en línea, donde analizar imágenes de productos o generar vídeos explicativos tiene aplicación comercial inmediata. A diferencia de Occidente, donde los modelos de texto puro siguen dominando, en China el foco está en sistemas que integran varios tipos de información desde el principio.
Finalmente, la comunidad china está invirtiendo en fine-tuning distribuido (un proceso donde se ajusta un modelo ya entrenado para especializarlo en una tarea concreta, repartiendo el trabajo entre muchos ordenadores pequeños en lugar de uno grande). Herramientas como LLaMA-Factory y frameworks de Alibaba permiten que universidades y startups entrenen versiones personalizadas de modelos abiertos sin depender de centros de datos masivos. Esta democratización del entrenamiento podría acelerar la aparición de aplicaciones nicho que los modelos generalistas no cubren.
La estrategia china no busca competir en la carrera por el modelo más grande, sino en construir un ecosistema donde la eficiencia, la modularidad y la colaboración entre sistemas compensen la falta de acceso a los chips más avanzados. Según Hugging Face, esta filosofía ya está exportándose: desarrolladores en India, Brasil y países del sudeste asiático están replicando estas arquitecturas para adaptar IA a contextos con recursos limitados.


