Inteligencia artificial · 26 de agosto de 2026
¡NUEVE VECES MÁS BARATO! Alibaba lanza Qwen3.8-Flash, su nuevo modelo abierto
El equipo de Tongyi Qianwen presentó un modelo MoE de 125,000 millones de parámetros que adelanta la arquitectura Qwen4 y reduce drásticamente el costo de entrenamiento.
9 VECES MÁS BARATO
Foto: Techmeme
Alibaba amplió su catálogo de inteligencia artificial de código abierto con el lanzamiento de Qwen3.8-Flash, un modelo multimodal que su equipo de Tongyi Qianwen presentó la noche del 26 de agosto en Pekín, según reportó el medio especializado chino ITHome. Junto con el modelo principal, la compañía liberó los pesos abiertos de Qwen3.8-Flash-Next, una variante cuya arquitectura —bautizada «Next»— funciona como prototipo de la próxima generación Qwen4.
Un modelo grande que activa solo una fracción de sus parámetros
Qwen3.8-Flash es un modelo de tipo Mixture of Experts (MoE) con 125,000 millones de parámetros en su cuerpo principal, más otros 51,000 millones dedicados a un módulo de N-gram Embedding que expande la capacidad del modelo mediante búsquedas de contexto local. Por cada token procesado, sin embargo, solo se activan 6,000 millones de parámetros, lo que reduce el costo computacional frente a un modelo denso del mismo tamaño.
El modelo admite de forma nativa una ventana de contexto de 262,144 tokens, que puede extenderse hasta 1 millón de tokens mediante la técnica YaRN. Para sostener ese contexto tan largo, el equipo combinó dos mecanismos de atención: GDN (Gated DeltaNet), que comprime de forma eficiente la información histórica, y QSA (Qwen Sparse Attention), que filtra los fragmentos de contexto relevantes a nivel de micro-bloque. Según ITHome, esta combinación acelera el kernel de atención hasta 7.6 veces en la fase de prefill y 4.9 veces en la fase de decode cuando se trabaja con el contexto máximo de 1 millón de tokens.
El equipo también introdujo un mecanismo de «Gated Residual» que expande el flujo residual en cuatro ramas paralelas controladas por compuertas dinámicas, con estados residuales almacenados en formato FP8 para reducir el uso de memoria. En el entrenamiento se usó el optimizador Muon, ajustado para las nuevas necesidades de precisión y división de parámetros que exige la arquitectura.
Nueve veces menos costoso de entrenar
El dato que más destaca ITHome es el ahorro en entrenamiento: Alibaba afirma que Qwen3.8-Flash costó entrenar apenas una novena parte de lo que costó su predecesor, Qwen3.7-Plus, pese a que el nuevo modelo ofrece mejores capacidades en tareas de programación y trabajo de oficina, de acuerdo con la compañía.
En cuanto a rendimiento, la versión base de Qwen3.8-Flash-Next —usando solo los 6,000 millones de parámetros activados por token— obtuvo los mejores resultados en ocho de catorce pruebas de referencia evaluadas, entre ellas MMLU-Pro, SuperGPQA, BBH, SWEBench-Pretrain, MGSM y MMMU, según los datos que reportó ITHome.
Alibaba planea integrar Qwen3.8-Flash a su plataforma Qwen AI para ofrecerlo como servicio de API, con un precio de 1 yuan por cada millón de tokens de entrada y 3 yuanes por cada millón de tokens de salida. Los pesos del modelo —incluida una versión cuantizada en FP8— ya están disponibles desde las 23:00 horas, tiempo de Pekín, del 26 de agosto en Hugging Face y ModelScope, y Qwen3.8-Flash-Next viene configurado por defecto con la ventana de 1 millón de tokens y herramientas oficiales integradas.
Qué significa esto para México
Para los desarrolladores mexicanos que ya trabajan con modelos abiertos, Qwen3.8-Flash suma una alternativa más con licencia abierta y un costo de API bajo, aunque conviene recordar que ese precio está en yuanes chinos y no hay, por ahora, información sobre distribución o soporte comercial directo en México. Quien quiera probarlo puede descargar los pesos desde Hugging Face sin pagar nada, siempre que cuente con el hardware necesario para correr un modelo de más de 100,000 millones de parámetros. Para empresas o startups locales que evalúan reducir gastos de entrenamiento o inferencia con modelos MoE de contexto muy largo, la promesa de un entrenamiento nueve veces más económico —si se confirma en la práctica— podría abrir la puerta a proyectos de inteligencia artificial generativa con presupuestos más ajustados que los que exigen los modelos cerrados de otras compañías.
FUENTE: Techmeme
DATOS VERIFICADOS: Fecha del anuncio: la noche del 26 de agosto de 2026, hora de Pekín · Nombre del modelo principal: Qwen3.8-Flash, con pesos abiertos de la variante Qwen3.8-Flash-Next · La arquitectura Next es prototipo de la futura serie Qwen4 · Parámetros del modelo principal: 125,000 millones (125B) · Parámetros del módulo N-gram Embedding: 51,000 millones · Parámetros activados por token: 6,000 millones · Contexto nativo: 262,144 tokens, extensible a 1 millón de tokens vía YaRN · Aceleración del kernel de atención: hasta 7.6x en prefill y 4.9x en decode con contexto de 1M tokens · Costo de entrenamiento: aproximadamente una novena parte del de Qwen3.7-Plus · Mejores resultados en 8 de 14 benchmarks, incluidos MMLU-Pro, SuperGPQA, BBH, SWEBench-Pretrain, MGSM y MMMU · Precio de API: 1 yuan por millón de tokens de entrada y 3 yuanes por millón de tokens de salida · Publicación de pesos: 26 de agosto, 23:00 horas de Pekín, en Hugging Face y ModelScope, con versión cuantizada FP8 · Mecanismos técnicos: Attention GDN+QSA, Gated Residual de 4 ramas con almacenamiento FP8, y optimizador Muon
¿Encontraste un error? Escríbenos a [email protected]. Corregimos en menos de 24 horas y dejamos constancia fechada.