Falcon-H1: la familia de modelos de lenguaje que mezcla arquitecturas para ganar velocidad sin perder calidad
El Instituto de Innovación Tecnológica de Abu Dabi presenta una nueva generación de modelos de inteligencia artificial que combinan dos tipos de atención —la clásica y una más ligera— para reducir costes de computación sin sacrificar rendimiento.
Falcon-H1 es una familia de tres modelos de lenguaje (con 1.000, 3.000 y 7.000 millones de parámetros, una medida de su tamaño) desarrollada por el Technology Innovation Institute de Abu Dabi. Combinan atención completa y atención lineal (dos formas de procesar relaciones entre palabras) para reducir hasta un 50% el uso de memoria y acelerar la generación de texto sin perder calidad en las respuestas.

El Technology Innovation Institute (TII) de Abu Dabi ha lanzado Falcon-H1, una nueva familia de modelos de lenguaje que promete resolver uno de los grandes problemas de la IA actual: el coste disparado de procesar textos largos. Según informa Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados), estos modelos mezclan dos tipos de arquitectura —atención completa y atención lineal— en sus "cabezas" (las unidades internas que procesan la información), una estrategia que reduce hasta un 50% el uso de memoria sin perder precisión en las respuestas.
La familia incluye tres versiones: Falcon-H1-1B, Falcon-H1-3B y Falcon-H1-7B (los números indican miles de millones de parámetros, una medida del tamaño y capacidad del modelo). Todos están disponibles con licencia Apache 2.0, lo que significa que cualquiera puede descargarlos, modificarlos y usarlos comercialmente sin restricciones. Fueron entrenados con un billón de tokens (unidades de texto que el modelo procesa durante su entrenamiento) en múltiples idiomas, aunque priorizan el inglés, árabe y francés.
La clave técnica está en cómo organizan sus cabezas de atención. En lugar de usar solo atención multi-cabeza (MHA, el mecanismo clásico que mira todas las relaciones entre palabras de un texto, pero que consume mucha memoria) o solo atención lineal (LA, más rápida pero menos precisa), Falcon-H1 combina ambas en proporciones variables según el tamaño del modelo. Por ejemplo, la versión de 3.000 millones de parámetros dedica el 50% de sus cabezas a MHA y el otro 50% a LA, logrando un equilibrio entre velocidad y calidad.
Los resultados en pruebas estándar (benchmarks como MMLU, que mide comprensión general, o HumanEval, que evalúa código) muestran que Falcon-H1-7B supera a modelos como Llama 3.2 o Gemma 2 de tamaño similar en varias tareas, especialmente en razonamiento matemático y traducción. Además, genera texto hasta un 25% más rápido que alternativas con arquitectura tradicional cuando procesa secuencias largas, como documentos completos o conversaciones extensas.
TII, el instituto público emiratí responsable de toda la saga Falcon, busca con esta familia democratizar el acceso a modelos eficientes que puedan correr en hardware más modesto. Los tres modelos ya están disponibles para descarga en Hugging Face, acompañados de código para reproducir el entrenamiento y evaluar el rendimiento. Aunque aún no se han publicado versiones multimodales (capaces de procesar imágenes o audio además de texto), el equipo ha anunciado que planea lanzarlas próximamente.


