En directo
[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go[Regulación]¿Es legal entrenar modelos de IA con libros protegidos por derechos de autor?[Negocios]Una IA jefa despidió a su primer empleado humano, pero solo después de que le recordaran sus propias normas[Herramientas]Cómo una comunidad mexicana volvió al adobe para reconstruir sus casas tras el huracán Otis[Investigación]Recrean la materia del Big Bang con átomos más pequeños que nunca[Regulación]La empresa de cámaras de vigilancia Flock pide un 'acuerdo' con sus críticos tras la ola de rechazo[Herramientas]Los Nothing Ear (3a) demuestran que los auriculares baratos ya no suenan peor[Modelos de IA]Ox Alpha, el modelo de IA anónimo que nadie sabe quién ha creado[Investigación]Moderna logra resultados prometedores con una vacuna contra el melanoma diseñada con inteligencia artificial[Regulación]Estados Unidos presiona a sus aliados para que elijan bando en la carrera de la inteligencia artificial[Investigación]Cómo AlphaGo cambió la ciencia diez años después de ganar al campeón de Go
Transmitiendo ·

Noticias.
Inteligencia Artificial

Inteligencia Artificial para Gente Real · ES / PT-BR

Modelos de IAHugging Face Blog2 min

DeepSeek-V4 llega con un millón de tokens de contexto que los agentes de IA pueden usar de verdad

El nuevo modelo chino de código abierto no solo procesa textos enormes, sino que permite a sistemas autónomos buscar información en ellos sin perderse ni inventar datos.

Por Redacción2 min
Compartir
DeepSeek-V4 llega con un millón de tokens de contexto que los agentes de IA pueden usar de verdad
Modelos de IA · Hugging Face Blog

DeepSeek, la empresa china que irrumpió en el mercado a principios de año con modelos de IA sorprendentemente capaces y baratos, acaba de lanzar DeepSeek-V4, según informó Hugging Face (una plataforma donde desarrolladores comparten y descargan modelos de IA ya entrenados). La novedad no es solo que este modelo pueda procesar hasta un millón de tokens de contexto (aproximadamente 750.000 palabras, el equivalente a unas diez novelas), sino que los agentes de IA (programas que toman decisiones y actúan de forma autónoma) pueden realmente trabajar con esa cantidad de información sin perderse ni alucinar datos falsos.

La mayoría de modelos con contextos largos tienen un problema: funcionan bien cuando un humano les hace una pregunta concreta sobre un documento extenso, pero fallan estrepitosamente cuando un agente intenta usarlos de forma autónoma para buscar datos específicos o razonar sobre información dispersa en miles de páginas. DeepSeek-V4 supera esa limitación gracias a una arquitectura mejorada que combina capas de atención (el mecanismo que permite al modelo decidir qué partes del texto son relevantes) con un sistema de enrutamiento más eficiente entre sus 671.000 millones de parámetros (los valores numéricos que determinan cómo responde el modelo), de los cuales solo activa 37.000 millones por cada consulta.

En pruebas con el benchmark HELMET (una batería de tests diseñada para medir si los agentes pueden realmente aprovechar contextos largos), DeepSeek-V4 obtuvo un 41,7% de acierto en tareas complejas que requieren rastrear información a lo largo de cientos de miles de palabras, frente al 23,3% de su predecesor. Eso significa que un asistente basado en este modelo podría, por ejemplo, analizar todos los contratos de una empresa, identificar cláusulas contradictorias y proponer correcciones sin que un humano tenga que revisar cada documento manualmente.

DeepSeek ha publicado los pesos del modelo (los valores numéricos entrenados que cualquiera puede descargar y ejecutar en su propia infraestructura) bajo una licencia permisiva, lo que permite a empresas y desarrolladores adaptarlo a casos de uso específicos mediante fine-tuning (un proceso de reentrenamiento con datos propios para especializar el modelo). Esto contrasta con los grandes modelos de OpenAI o Anthropic, que solo se pueden usar a través de sus APIs de pago (interfaces que cobran por cada consulta enviada a sus servidores).

El lanzamiento llega en un momento en que la industria debate si los modelos de pesos abiertos pueden competir con los cerrados en tareas complejas. DeepSeek-V4 demuestra que sí, al menos en capacidad de contexto largo utilizable por agentes, una funcionalidad crítica para automatizar trabajos que hasta ahora requerían supervisión humana constante. La empresa china no ha revelado el coste de entrenamiento ni los datos usados, pero su estrategia de publicar modelos potentes sin restricciones comerciales está acelerando la adopción de IA en sectores que no pueden permitirse las tarifas de los gigantes tecnológicos estadounidenses.

Fuente original
Hugging Face Blog
Más en · Modelos de IA