IA en Ventas

Qwen3.8-Max de Alibaba, de pesos abiertos, apunta a tareas de IA de largo horizonte con 2,4 billones de parámetros

Alibaba lanzó su modelo insignia con 2,4 billones de parámetros y liberará los pesos la próxima semana. En las pruebas del equipo Qwen construyó software durante 16 días sin intervención humana y cuadruplicó su capital en una simulación de comercio de un año.

7 min de lecturaFuente: The Decoder
Logotipo de Qwen, la familia de modelos de inteligencia artificial de Alibaba, en referencia al lanzamiento de Qwen3.8-Max
Imagen: The Decoder

La noticia en 30 segundos

Alibaba presentó Qwen3.8-Max el 3 de agosto de 2026: 2,4 billones de parámetros totales, 95.000 millones activos por consulta y un millón de tokens de contexto. Es el primer modelo Qwen-Max con pesos abiertos, que llegarán a Hugging Face la próxima semana. Está diseñado para tareas autónomas de días: en las pruebas de Alibaba construyó una herramienta de software durante 16 días sin ayuda humana y superó a 458 de 526 equipos humanos en un desafío multimodal. Habla los protocolos de OpenAI y Anthropic, así que se conecta a Claude Code y Codex sin cambios.

Alibaba presentó Qwen3.8-Max, su modelo de lenguaje más capaz hasta la fecha. Escala a 2,4 billones de parámetros totales, con 95.000 millones activos por consulta bajo una arquitectura de mezcla de expertos, y ventana de contexto de un millón de tokens. El foco declarado por el equipo Qwen no es responder mejor un prompt aislado, sino completar tareas complejas de forma autónoma durante días.

Es el primer modelo de la clase Qwen-Max cuyos pesos se publicarán abiertamente. Alibaba anunció que los liberará en Hugging Face y ModelScope la próxima semana. El modelo ya está disponible vía QwenCloud y soporta tanto el formato Chat Completions de OpenAI como el protocolo de API de Anthropic, lo que le permite conectarse directamente a Claude Code, Codex, Qoder CLI, Qwen Code y OpenClaw.

¿Qué logró el modelo trabajando solo?

El equipo publicó cinco casos de estudio sin intervención humana. En el primero, Qwen3.8-Max pasó 16 días construyendo la herramienta de línea de comandos oh-my-cli: tomaba solicitudes de usuarios, las convertía en issues de GitHub, se las autoasignaba, escribía el código y corría los tests. Al 30 de julio de 2026 acumulaba 265 commits, 127 pull requests y 151 issues, sin que una persona tocara el repositorio.

En el segundo caso recibió un paper de investigación sin código base y debió reproducir sus resultados y mejorarlos. En unos cinco días y cerca de 125 horas de cómputo escribió 7.600 líneas de código, corrió 33 trabajos de entrenamiento en GPU, reprodujo los seis resultados principales y superó el método original del paper por 2,7 puntos en el benchmark de matemáticas AIME24.

En el tercero compitió en un desafío de reconocimiento de intención en diálogo multimodal donde participaban 526 equipos humanos. En 24 horas y 45 envíos subió la exactitud de 0,60 a 0,853, quedando por delante de 458 de esos 526 equipos.

¿Por qué importan las pruebas de horizonte largo?

Dos casos adicionales apuntan a tareas que se extienden por cientos de rondas de interacción. En el primero, el modelo diseñó un bloque criptográfico partiendo de una versión funcional pero sobredimensionada de 8.298 compuertas lógicas y la redujo a 678 compuertas tras unas 500 iteraciones. Con una pasada de layout automático, el área física del chip bajó de 106x106 a 46x46 micrómetros, una reducción del 81%.

El segundo es E-Commerce-Bench, una simulación de un año fiscal completo de comercio online construida con datos anonimizados de Taobao y Tmall. El modelo parte con 100.000 yuanes y debe operar varias tiendas en paralelo: comprar productos, negociar con proveedores en lenguaje natural, ajustar precios, gestionar devoluciones y sortear crisis como tifones o quiebres de cadena de suministro. Entre los proveedores hay 152 estafadores escondidos que debe detectar. Qwen3.8-Max cerró con 416.252 yuanes, cuadruplicando su capital inicial, un 38% más que el segundo lugar y más de 2,5 veces lo que logró su antecesor Qwen3.7-Max.

¿Cómo se compara con Claude, GPT y los modelos chinos?

En las tablas publicadas por el equipo Qwen, el modelo se ubica cerca o por encima de Claude Opus 4.8, Claude Fable 5 y GPT-5.6 Sol en varias categorías. Alcanza 93 en PaperBench, el puntaje más alto de la comparación, y 86,6 en TerminalBench 2.1, por detrás del 88,8 de GPT-5.6 Sol. Como ocurre con todo número autorreportado por un fabricante de modelos, estos resultados provienen de corridas internas y aún no hay verificación independiente.

Su rival más directo también es chino: Moonshot AI liberó Kimi K3 con pesos abiertos el 27 de julio, un modelo multimodal de 2,8 billones de parámetros y un millón de tokens de contexto. Las pruebas independientes moderaron esas afirmaciones, ya que K3 quedó bastante por debajo de los modelos frontera occidentales en capacidades de ciberseguridad y matemáticas complejas.

¿Qué cambia para una empresa en Chile o Latinoamérica?

Para un equipo comercial en Chile o Latinoamérica el dato relevante no es el conteo de parámetros, sino dos cosas concretas. La primera es que los pesos abiertos permiten desplegar el modelo en infraestructura propia, algo que importa cuando el dato de clientes no puede salir del país o del proveedor cloud contratado. La segunda es la compatibilidad de protocolo: al hablar el formato de OpenAI y el de Anthropic, cambiar de modelo deja de ser un proyecto de migración y pasa a ser un cambio de configuración.

Alibaba también presentó RecreationBench, un benchmark que exige reconstruir aplicaciones en funcionamiento sin acceso al código fuente, observando la aplicación solo mediante clics y teclado, con pruebas en Ubuntu, macOS, Windows, Android y web. Junto con eso liberó Qwen-MM-Plugins, una librería que agrega procesamiento de imagen y video, uso de herramientas visuales y memoria multimodal a sistemas de agentes existentes.

Análisis de Revenue Hub

La noticia real aquí no es que un modelo chino se acerque a la frontera occidental. Es que el precio de la autonomía está cayendo. Un modelo que sostiene 16 días de trabajo sin supervisión y que administra una operación de comercio simulada durante un año fiscal cambia la conversación sobre qué tareas de un equipo comercial son delegables. Hasta ahora la discusión giraba en torno a redactar correos y resumir llamadas. Ahora se abre la pregunta por procesos completos: mantener la higiene del CRM, reconciliar datos entre sistemas, monitorear señales de cuentas.

Para un líder comercial en Chile o Latinoamérica esto tiene una implicancia de costo directa. La combinación de pesos abiertos más compatibilidad con los protocolos de OpenAI y Anthropic reduce el costo de cambio entre proveedores de modelo. Quien diseñe hoy su capa de agentes acoplada a un único proveedor va a pagar esa decisión en 12 meses. La recomendación es simple: separa la lógica de negocio del modelo que la ejecuta, y trata al proveedor como una pieza reemplazable, no como una plataforma.

El riesgo también es concreto. Los números son autorreportados y los casos de estudio están diseñados por el propio fabricante. Antes de mover un proceso productivo a un modelo nuevo, corre tu propia evaluación con tus datos y tus criterios de éxito. Si quieres entender cómo se traduce esto a la operación de ingresos, revisa nuestra sección de IA en ventas y el blog de Revenue Hub.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a The Decoder.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Qué es Qwen3.8-Max de Alibaba?

Es el modelo de lenguaje insignia de Alibaba presentado el 3 de agosto de 2026. Usa una arquitectura de mezcla de expertos con 2,4 billones de parámetros totales y 95.000 millones activos por consulta, y una ventana de contexto de un millón de tokens. Está diseñado para completar tareas complejas de forma autónoma durante días.

¿Qwen3.8-Max es de código abierto?

Es de pesos abiertos, no exactamente de código abierto. Alibaba anunció que publicará los pesos en Hugging Face y ModelScope la semana siguiente al lanzamiento. Es el primer modelo de la clase Qwen-Max cuyos pesos se hacen públicos.

¿Qwen3.8-Max es mejor que Claude o GPT-5.6?

Según los benchmarks internos publicados por Alibaba, se ubica cerca o por encima de Claude Opus 4.8, Claude Fable 5 y GPT-5.6 Sol en varias categorías: 93 en PaperBench, el puntaje más alto de la comparación, y 86,6 en TerminalBench 2.1 frente al 88,8 de GPT-5.6 Sol. Son cifras autorreportadas y aún no hay verificación independiente.

¿Cuántos parámetros tiene Qwen3.8-Max?

Tiene 2,4 billones de parámetros totales, de los cuales se activan 95.000 millones por consulta gracias a su arquitectura de mezcla de expertos. Esa activación parcial es lo que permite que un modelo tan grande sea económicamente viable de operar.

¿Qué significa que un modelo haga tareas de largo horizonte?

Significa que sostiene una misma tarea durante días y cientos de rondas de interacción sin perder contexto ni supervisión humana. En las pruebas de Alibaba, el modelo construyó una herramienta de software durante 16 días seguidos y operó una simulación de comercio electrónico por un año fiscal completo.

¿Cómo se conecta Qwen3.8-Max a herramientas existentes?

Soporta el formato Chat Completions de OpenAI y el protocolo de API de Anthropic, por lo que funciona con Claude Code, Codex, Qoder CLI, Qwen Code y OpenClaw sin cambios de integración. También expone un parámetro reasoning_effort con tres niveles que intercambian velocidad por profundidad.

¿Qué implica esto para empresas B2B en Chile y Latinoamérica?

Dos cosas. Los pesos abiertos permiten desplegar el modelo en infraestructura propia cuando los datos de clientes no pueden salir del país. Y la compatibilidad de protocolos baja el costo de cambiar de proveedor de modelo, lo que hace recomendable diseñar la capa de agentes desacoplada de un único vendor.

¿Qué otro modelo chino compite con Qwen3.8-Max?

Kimi K3 de Moonshot AI, liberado con pesos abiertos el 27 de julio de 2026, con 2,8 billones de parámetros y un millón de tokens de contexto. Pruebas independientes lo ubicaron bastante por debajo de los modelos frontera occidentales en ciberseguridad y matemáticas complejas.

Comparte este análisis con tu equipo

Continúa explorando

Ver toda la categoría