Por Redacción Pangea IA ·
Qwen 3.8 es uno de los lanzamientos abiertos más importantes del verano, pero no es la “primera inteligencia artificial sin límites”. Alibaba ha presentado tres productos con el mismo apellido y capacidades muy distintas: un servicio avanzado en la nube, un modelo gigantesco pensado para centros de datos y una versión de 27.000 millones de parámetros que sí puede ejecutarse en un equipo personal bien preparado.
La precisión importa porque detrás del entusiasmo hay una noticia real. Por primera vez, la familia Qwen pone a disposición del público pesos de una categoría que la propia compañía equipara con Qwen‑Max. Además, el modelo más pequeño combina texto, imágenes y vídeo, razona, utiliza herramientas y admite una ventana de contexto nativa de 262.144 tokens. Es una propuesta poco habitual para su tamaño y, sobre todo, una demostración de cuánto se ha estrechado la distancia entre los sistemas alojados en la nube y la IA que una empresa o un particular puede controlar en sus propias máquinas.
Tres Qwen 3.8 distintos
Alibaba inició el despliegue el 2 de agosto con Qwen3.8‑Max, la versión comercial y alojada. Es la experiencia más completa: incorpora entrada visual, un contexto de un millón de tokens por defecto y herramientas oficiales. Puede probarse a través de los servicios de Qwen sin descargar el modelo, del mismo modo que se utiliza ChatGPT, Claude o Gemini.
El 12 de agosto llegó Qwen3.8‑2.4T‑A95B, el modelo abierto de mayor escala. El nombre contiene la pista decisiva: suma 2,4 billones de parámetros, aunque solo activa 95.000 millones para procesar cada token. Es una arquitectura de mezcla de expertos, capaz de seleccionar una parte especializada del modelo en cada paso y reducir así el cálculo. Sigue necesitando almacenar el conjunto completo de los pesos, por lo que no es una descarga realista para un ordenador doméstico.
Dos días después, el 14 de agosto, Alibaba publicó Qwen3.8‑27B. Este sí es un modelo denso, multimodal y manejable: tiene 27.000 millones de parámetros, entiende texto, imágenes y vídeo, y sus pesos se distribuyen con licencia Apache 2.0. La documentación contempla ejecución mediante Transformers, llama.cpp, aplicaciones compatibles como Ollama o LM Studio y MLX para ordenadores Apple Silicon.
Qué significa «sin límites»
La expresión funciona bien en redes sociales, pero mezcla tres ideas diferentes. Un modelo local no tiene el cupo diario, el límite de mensajes ni el precio por token que puede imponer un servicio en la nube. Una vez descargados los pesos, el usuario decide cuándo lo ejecuta y cuántas consultas realiza. También puede modificar su sistema de instrucciones, ajustar el modelo o integrarlo en una aplicación propia.
Eso no lo convierte en una inteligencia sin restricciones. Qwen 3.8 mantiene el comportamiento aprendido durante su entrenamiento y puede rechazar peticiones. Tiene una longitud de contexto finita, comete errores, arrastra sesgos y depende de la memoria y la velocidad del equipo. Tampoco es el primer modelo que funciona sin conexión: familias como Llama, Mistral, Gemma, DeepSeek o los anteriores Qwen llevan años ofreciendo pesos descargables.
La formulación correcta es más concreta: Qwen 3.8 permite ejecutar localmente un modelo abierto y potente, sin una cuota impuesta por el proveedor. La novedad que Alibaba sí reivindica es otra: es la primera vez que abre dentro de Qwen un modelo de categoría Max. No es lo mismo que ser la primera IA local de la historia ni equivale a carecer de límites técnicos, legales o de seguridad.
El modelo que sí cabe en casa
Qwen3.8‑27B es el candidato lógico para un profesional, un pequeño estudio o una pyme que quiera mantener documentos y consultas dentro de su red. En formato BF16, los pesos ocupan aproximadamente 54 GB antes de sumar la memoria necesaria para el programa, las imágenes y el contexto. Ese formato conserva mayor precisión, pero normalmente exige una estación de trabajo con varias GPU o una GPU profesional de mucha memoria.
La vía doméstica es la cuantización: representar los pesos con menos bits para reducir su tamaño, a cambio de una pérdida moderada de calidad. La cifra exacta cambia según el formato y la aplicación, pero el cálculo básico permite orientarse:
- 4 bits: unos 13,5 GB de pesos teóricos; en la práctica hay que reservar más memoria para el programa, la caché y el contexto.
- 8 bits: alrededor de 27 GB solo para los pesos, por lo que 32 GB de memoria total suelen resultar demasiado ajustados.
- BF16: cerca de 54 GB de pesos, antes de añadir el resto de la carga.
16, 32 o 64 GB: qué cambia
Con 16 GB de RAM o memoria unificada, Qwen3.8‑27B queda en el límite incluso con una cuantización agresiva. Puede arrancar alguna versión muy comprimida, pero habrá poco margen para conversaciones largas, análisis visual o cualquier otra aplicación abierta. No es la configuración que recomendaríamos para trabajar.
Con 32 GB y una cuantización de 4 bits, el modelo puede ser viable para texto y contextos moderados. Una tarjeta gráfica de 24 GB permite alojar muchas cuantizaciones de esta clase y ofrece una experiencia mucho más fluida que la CPU. En un Mac con 32 GB de memoria unificada también puede funcionar, aunque la velocidad dependerá del chip, del formato MLX y del tamaño de la conversación.
Los 64 GB ofrecen una zona de trabajo más cómoda: dejan espacio para una cuantización de mayor calidad, contextos más amplios y tareas multimodales. Aun así, nadie debería interpretar los 262.144 tokens nativos —o la ampliación experimental a un millón— como una promesa de que todo ese contexto cabrá en cualquier equipo. La caché crece con la conversación y puede consumir decenas de gigabytes adicionales. La documentación de Qwen advierte, además, de que el rendimiento varía notablemente según el motor utilizado.
Ejecutarlo solo con CPU es posible, pero normalmente será lento para un uso interactivo. La experiencia local depende tanto de la memoria como del ancho de banda: dos ordenadores capaces de cargar el mismo archivo pueden responder a velocidades muy diferentes.
El gigante que no cabe en casa
El apellido A95B del modelo de 2,4 billones puede inducir a error. Que active 95.000 millones de parámetros por token reduce el cálculo de cada respuesta, pero no elimina la necesidad de conservar los 2,4 billones de pesos. Como aproximación matemática, ocuparían unos 4,8 terabytes en 16 bits, 2,4 terabytes en 8 bits o 1,2 terabytes en 4 bits, sin contar memoria de ejecución ni redundancia.
Es un modelo para servidores con múltiples aceleradores y redes de alta velocidad. Incluso su licencia es distinta: Qwen3.8‑2.4T‑A95B utiliza una licencia específica que permite numerosos usos, pero introduce obligaciones para grandes productos y exige un acuerdo separado a determinados negocios de modelos como servicio o asistentes de trabajo que superen ciertos ingresos. El 27B, en cambio, se publica bajo Apache 2.0.
La distinción también afecta a las funciones. La versión abierta gigante es de texto, mientras que Qwen3.8‑Max añade visión, modo sin razonamiento, un millón de tokens por defecto y herramientas integradas. Descargar los pesos no reproduce automáticamente el producto comercial completo.
Potencia: promesa y cautela
Alibaba presenta el 27B como un salto en programación, investigación, trabajo profesional y tareas de agente prolongadas. El modelo razona por defecto y permite elegir tres niveles de esfuerzo —bajo, medio y muy alto— o desactivar el razonamiento para obtener una respuesta directa. También puede conservar el razonamiento entre mensajes, una función pensada para tareas de varios pasos.
Los resultados publicados por Qwen son llamativos para un modelo de este tamaño. La compañía le atribuye 61,7 puntos en SWE‑bench Pro, 70,7 en CoWorkBench y 84,3 en OSWorld‑Verified. En algunas de esas pruebas supera el resultado que Qwen comunica para modelos cerrados mucho mayores. Pero son evaluaciones ejecutadas o recopiladas por el propio fabricante, con configuraciones y andamiajes determinados; no equivalen a una garantía de superioridad en el trabajo cotidiano.
Las mediciones externas aportan una imagen más sobria, aunque positiva. LiveBench situaba Qwen3.8‑27B en 75,3 puntos en el momento de esta consulta. Artificial Analysis le otorgaba 52 puntos en su índice con el razonamiento al máximo, un resultado alto entre modelos abiertos de tamaño comparable, pero acompañado de una generación especialmente extensa. En LMArena compite dignamente, sin dominar de forma general las clasificaciones frente a los mejores sistemas alojados.
La conclusión razonable no es que un PC haya recibido de repente el mejor modelo del mundo. Es que un modelo de 27.000 millones de parámetros empieza a resolver tareas que hasta hace poco se asociaban a sistemas mucho mayores. Ese cambio reduce el coste de experimentar y eleva el listón de lo que una empresa puede mantener bajo su propio control.
Privacidad y coste real
La ventaja más clara de la ejecución local es la soberanía sobre los datos. Un despacho puede resumir contratos, un investigador revisar documentos internos o un programador analizar un repositorio sin enviar necesariamente ese material a una API externa. También se puede trabajar sin conexión y evitar que una subida de precios o un cambio de plan interrumpa el servicio.
La palabra importante es “necesariamente”. Instalar el modelo en el propio ordenador no garantiza por sí solo la privacidad. Una interfaz puede guardar historiales, descargar componentes o conectarse a buscadores y herramientas en la nube. Antes de utilizar información sensible conviene comprobar qué programa sirve el modelo, dónde almacena los registros y qué conexiones externas están activadas.
Tampoco desaparece el coste: se desplaza. No hay una factura por millón de tokens, pero sí una inversión en GPU, memoria, electricidad, refrigeración, copias de seguridad y mantenimiento. Para una persona que consulta la IA de forma ocasional, pagar un servicio puede seguir siendo más barato. Para una organización con uso constante, requisitos de confidencialidad o necesidad de personalización, el cálculo puede favorecer el despliegue propio.
Hay además una precaución especial con los agentes. Un modelo capaz de manejar terminales, archivos o navegadores puede ejecutar una instrucción equivocada o seguir órdenes ocultas dentro de un documento. Lo prudente es aislarlo, conceder permisos mínimos y exigir confirmación antes de enviar, borrar, comprar o publicar. Local no significa seguro por defecto.
¿Puede sustituir a ChatGPT?
Depende de qué se entienda por sustituir. Qwen3.8‑27B puede redactar, programar, resumir documentos, analizar imágenes y participar en flujos con herramientas. Para tareas privadas, repetitivas o muy personalizadas, puede resultar más conveniente que un asistente cerrado. También permite elegir la aplicación, cambiar el modelo y conservar una infraestructura compatible con una API de estilo OpenAI.
Pero el archivo de pesos no trae por sí solo búsqueda web fiable, generación de imágenes, voz, sincronización entre dispositivos, copias de seguridad, automatizaciones listas para usar ni el soporte de una plataforma comercial. Hay que añadir cada pieza y mantenerla. Su conocimiento puede quedar desactualizado y sus respuestas siguen necesitando verificación. La comodidad de un servicio en la nube continúa siendo una ventaja real.
También existe una conexión con la actual presión sobre el hardware. Cuanto más capaces son los modelos locales, mayor es la demanda de memoria y aceleradores. Pangea IA ha analizado cómo el auge de los centros de datos está afectando a la oferta mundial de memoria RAM y HBM. Qwen 3.8 muestra la otra cara del mismo fenómeno: parte de esa capacidad de cómputo empieza a trasladarse desde la nube hasta el escritorio.
Por qué importa
El lanzamiento refuerza dos tendencias. La primera es que China ya no compite únicamente con modelos baratos, sino también con propuestas abiertas capaces de presionar a los laboratorios occidentales. La segunda es que la frontera entre “usar una IA” y “operar una IA” se vuelve más accesible. Una pyme con una estación de trabajo potente puede desplegar un asistente interno sin depender para cada consulta de un tercero.
Eso no elimina a las plataformas comerciales. Las obliga a justificar su precio con mejores herramientas, fiabilidad, integración y facilidad de uso. Al mismo tiempo, ofrece a desarrolladores y empresas una alternativa negociadora: si un proveedor cambia sus condiciones, existe la posibilidad de trasladar una parte del trabajo a modelos bajo control propio.
Conclusión
Qwen 3.8 no es una inteligencia artificial infinita, sin normas ni requisitos. La versión más avanzada continúa en la nube; el modelo abierto de 2,4 billones necesita infraestructura de centro de datos; y el 27B exige un ordenador con bastante memoria si se quiere utilizar con comodidad.
La noticia importante sobrevive a esas precisiones. Un modelo multimodal, con razonamiento, herramientas y rendimiento competitivo puede descargarse, modificarse y ejecutarse sin una cuota por mensaje. Con 32 GB es posible empezar de forma ajustada; con 64 GB o una GPU de 24 GB se abre un escenario mucho más útil. No reemplazará automáticamente a ChatGPT, Claude o Gemini, pero sí reduce la distancia entre la IA de consumo y la infraestructura que una organización puede gobernar por sí misma.
Fuentes consultadas
- Qwen: presentación oficial de Qwen3.8‑Max, 2 de agosto de 2026.
- Repositorio oficial de Qwen 3.8, fechas de publicación y opciones de uso local.
- Ficha oficial de Qwen3.8‑27B, arquitectura, contexto, funciones y resultados.
- Ficha oficial de Qwen3.8‑2.4T‑A95B, escala, arquitectura y diferencias con Max.
- Licencia de Qwen3.8‑2.4T‑A95B.
- LiveBench, evaluación independiente consultada el 25 de agosto de 2026.
- LMArena, clasificación pública consultada el 25 de agosto de 2026.
- Artificial Analysis: Qwen3.8‑27B, evaluación consultada el 25 de agosto de 2026.
Lecturas relacionadas
¿Qué modelo puedes ejecutar en tu ordenador? Consulta nuestra comparativa de Qwen, Gemma y Nemotron para IA en local, con descargas, requisitos de memoria y dos ordenadores compactos. Las necesidades dependen de la versión y la cuantización elegidas.


Deja una respuesta