Un modelo de IA de 27 mil millones de parámetros que puedes ejecutar en casa iguala rivales solo en la nube en pruebas de programación
Qwen3.8-27B de Alibaba es gratuito para descargar, cabe en una laptop de gama alta, y obtuvo puntuación equiparable con modelos de nivel medio de OpenAI y Anthropic en pruebas de referencia independientes. Los desarrolladores la llaman la señal más clara hasta ahora de que la IA de frontera se está trasladando de la nube al hardware personal.

Puntos clave
- Alibaba lanzó Qwen3.8-27B en Hugging Face el viernes bajo una licencia Apache 2.0 abierta, lo que significa que cualquiera puede descargarla y modificarla gratuitamente.
- La firma de evaluación comparativa independiente Artificial Analysis le asignó una puntuación de 52 en su Índice de Inteligencia, igual al modelo en la nube GPT-5.6 Luna de OpenAI con razonamiento máximo.
- Comprimido a aproximadamente 17 gigabytes, el modelo se ejecuta en una PC de juegos de gama alta o en un MacBook Pro reciente con un chip M5 Max.
- El modelo superó 3 millones de descargas en Hugging Face dentro de sus primeros tres días de lanzamiento.
- Su configuración predeterminada "pensar profundamente" puede ralentizar drásticamente las respuestas: una solicitud simple de imagen tardó 21 minutos antes de producir una respuesta.
El lanzamiento de IA más comentado del viernes no provino de OpenAI ni de Google. Provino de Alibaba, el gigante chino del comercio electrónico y la nube, llegando tranquilamente a Hugging Face, un sitio web donde los investigadores comparten modelos de IA gratuitos que cualquiera puede descargar.
El modelo se llama Qwen3.8-27B, y el "27B" se refiere a 27 mil millones de parámetros: la configuración numérica interna que determina cómo un modelo piensa y responde. Los números más grandes generalmente significan más capacidad pero también hardware más exigente. Este se sitúa en un punto óptimo.
¿Qué puede hacer realmente?
Qwen3.8-27B maneja texto, imágenes y video en un único modelo. Puede escribir y depurar código, responder preguntas sobre una foto, y realizar tareas de múltiples pasos por sí solo. Los investigadores llaman a esto trabajo "agente", donde el modelo planifica y ejecuta una secuencia de acciones en lugar de simplemente responder una pregunta.
Su ventana de contexto, la cantidad de texto que puede mantener en mente a la vez, se extiende a 262.144 tokens. Un token es aproximadamente tres cuartos de una palabra.
¿Cómo se compara con los grandes modelos de pago?
Artificial Analysis, una firma que evalúa modelos de IA mediante pruebas estandarizadas, asignó a Qwen3.8-27B una puntuación de 52 en su Índice de Inteligencia, una combinación de nueve pruebas que cubren programación, ciencia, razonamiento y tareas profesionales. Esto iguala la puntuación que actualmente asigna al GPT-5.6 Luna de OpenAI en su configuración más capaz, un modelo disponible solo como servicio en la nube de pago. Cubrimos por primera vez la metodología de Artificial Analysis el 21 de agosto de 2026, y la historia del modelo local ya estaba en construcción entonces.
En un índice separado que mide tareas de agente, el modelo obtuvo una puntuación de 51, superando a Claude Opus 4.8 de Anthropic, que se lanzó hace menos de tres meses.
Las propias cifras de lanzamiento de Alibaba mostraron 61.7 en SWE-bench Pro (una prueba estándar de ingeniería de software), 90.3 en LiveCodeBench v6 (un desafío de programación), y 84.3 en OSWorld-Verified (una prueba para navegar interfaces de computadora). Algunas de esas comparaciones utilizan configuraciones de evaluación internas que no coinciden con las condiciones exactas que utilizan otros laboratorios, así que considéralas como indicativas en lugar de definitivas.
VentureBeat señaló que los puntos de referencia de Alibaba mostraron que el modelo de 27B superó a Claude Opus 4.6 Max en SWE-bench Pro, aunque Opus aún lidera en varias otras pruebas.
¿Qué hardware necesitas para ejecutarlo?
Con calidad completa, el modelo necesita aproximadamente 56 gigabytes de memoria GPU, lo que es territorio especializado. Comprimido a un formato llamado FP8, necesita aproximadamente 28 gigabytes. Comprimido aún más a cuantización de 4 bits, una técnica que reduce el archivo redondeando números agresivamente con solo una pequeña penalización de calidad, baja a alrededor de 17 gigabytes.
Esa versión de 17 gigabytes se ejecuta en un potente escritorio para juegos o en un MacBook Pro con un chip M5 Max. El desarrollador Simon Willison probó exactamente esa configuración y encontró que el modelo podía escribir código, interpretar imágenes y ejecutar un bucle de programación autónoma completamente en sus propias máquinas sin enviar datos a un servidor externo.
"El hecho de que un archivo de 17GB pueda hacer todo esto en mis máquinas caseras es un milagro", escribió Willison.
| Versión | Memoria necesaria | Hardware típico |
|---|---|---|
| 16 bits completo | ~56 GB GPU | Estación de trabajo de gama alta |
| FP8 comprimido | ~28 GB GPU | Servidor GPU profesional |
| Cuantizado de 4 bits | ~17 GB | PC para juegos o MacBook Pro M5 Max |
¿Hay algún inconveniente?
Sí. Qwen3.8-27B se establece por defecto en un modo donde "piensa profundamente" antes de responder, generando una larga cadena de razonamiento interno antes de producir una respuesta. Esto cuesta tiempo y esfuerzo computacional. Willison le pidió al modelo que dibujara un pelícano montando una bicicleta como una imagen SVG. Tardó 21 minutos y generó más de 22.000 tokens de razonamiento interno antes de producir la imagen.
El inversor y desarrollador Tomasz Tunguz realizó una comparación de nueve tareas contra un modelo rival y encontró que Qwen estaba ligeramente por delante en calidad pero aproximadamente 30 veces más lento y 4,5 veces más costoso de ejecutar cuando el razonamiento estaba activado. Tanto Willison como Tunguz recomiendan comenzar con el razonamiento configurado bajo o apagado para el uso diario.
La velocidad también varía según la configuración. Willison vio 15 a 30 tokens por segundo, notablemente más lento que la mayoría de modelos hospedados. Habilitar una característica llamada Predicción Multi-Token a través de una herramienta gratuita llamada llama.cpp le dio un aumento de velocidad del 72%, aunque los servicios hospedados siguen siendo más rápidos.
¿Qué significa esto para empresas y usuarios ordinarios?
Para las empresas, un modelo que se ejecuta dentro de tu propio edificio no puede filtrar datos a un servidor externo. La licencia Apache 2.0 significa que una organización puede inspeccionar el código, modificar el modelo y hospedarlo detrás de sus propios controles de seguridad, sin cuotas de suscripción o costos por consulta. Alibaba ha confirmado que el modelo funciona con marcos de servicio populares incluyendo vLLM y SGLang.
Para individuos curiosos, una descarga gratuita y una máquina casera capaz son todo lo que se interpone entre tú y un modelo que, en pruebas independientes, funciona a la par con servicios que cuestan dinero por uso hace apenas unos meses. Observa el costo de razonamiento: las ganancias de calidad son reales, pero también lo es la ralentización, y la mayoría de tareas cotidianas no necesitan 22.000 tokens de deliberación interna antes de que aparezca una oración.
Las cifras de descarga sugieren que la gente se dio cuenta rápidamente. El modelo superó 3 millones de descargas de Hugging Face en sus primeros tres días.



