Tendencias SaaS

Qwen3.8-Omni-Flash cobra 0,15 dólares por millón de tokens de entrada: una quinta parte del precio de Gemini 3.8 Flash con rendimiento multimodal cercano

Alibaba posicionó su modelo multimodal de pesos abiertos muy por debajo del precio introductorio de Google, que además está fijado para duplicarse el 1 de enero de 2027.

6 min de lecturaFuente: The Decoder
Ir a comentarios
Logo de Qwen, la familia de modelos de Alibaba
Imagen: The Decoder

La noticia en 30 segundos

Alibaba presentó el 19 de septiembre de 2026 Qwen3.8-Omni-Flash, un modelo multimodal con ventana de contexto de 1 millón de tokens y precios de 0,15 dólares por millón de tokens de entrada y 0,47 por millón de salida. Google cobra por Gemini 3.8 Flash 0,75 dólares de entrada y 3,75 de salida en tarifa introductoria, con un alza programada al doble el 1 de enero de 2027. El modelo de Alibaba procesa audio por menos de 0,01 dólares la hora y video de 720p con audio a un cuadro por segundo por cerca de 0,20 dólares.

Alibaba presentó el sábado 19 de septiembre de 2026 Qwen3.8-Omni-Flash, un modelo multimodal de pesos abiertos con una ventana de contexto de 1 millón de tokens. La noticia no es la capacidad técnica sino el precio: la compañía lo posicionó muy por debajo del competidor directo de Google en la misma categoría.

El contraste es de un orden de magnitud en la salida. Qwen3.8-Omni-Flash cobra 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida. Gemini 3.8 Flash cobra 0,75 dólares de entrada y 3,75 dólares de salida, y esas cifras corresponden a una tarifa introductoria que está fijada para duplicarse el 1 de enero de 2027.

¿Cuánto cuesta procesar audio y video con este modelo?

La parte multimodal es donde el precio se vuelve más llamativo para una operación comercial:

  • Audio: menos de 0,01 dólares por hora procesada.
  • Video de 720p con audio, a un cuadro por segundo: alrededor de 0,20 dólares.

Según el reporte, el modelo se acerca al desempeño de Gemini 3.8 Flash en tareas de audio y video, aunque no se publicaron puntajes numéricos específicos de benchmark en la cobertura disponible. Ese matiz importa: la comparación firme es de precio, no de calidad medida.

¿Por qué el precio del token empieza a decidir arquitecturas comerciales?

Durante los últimos dos años, el costo por token fue una preocupación de equipos de ingeniería. Dejó de serlo. Cuando una operación comercial transcribe y resume todas sus llamadas, enriquece cada cuenta y hace que un agente redacte seguimientos, el consumo deja de ser marginal y pasa a ser una línea de costo variable que escala con la actividad comercial.

Ese es el punto donde una diferencia de cinco veces en entrada y de ocho veces en salida deja de ser un detalle de proveedor y se convierte en una decisión de margen. Y el alza programada de Google para enero de 2027 convierte además al precio actual en una referencia temporal, no en una base de planificación.

¿Qué significa para las empresas en Chile y Latinoamérica?

Para las empresas de Chile y Latinoamérica hay un factor adicional que rara vez aparece en las comparaciones publicadas en inglés: el costo se paga en dólares mientras los ingresos se facturan en moneda local. Una diferencia de precio que en Estados Unidos es una optimización, en la región puede ser la diferencia entre un caso de uso viable y uno que no cierra.

El volumen de audio también juega a favor de este tipo de modelo. Las operaciones comerciales de la región siguen siendo intensivas en llamadas y reuniones, y un costo de menos de 0,01 dólares por hora de audio cambia por completo el cálculo de transcribir el total de las conversaciones en lugar de una muestra.

Análisis de Revenue Hub

La conclusión operativa no es cambiar de proveedor. Es dejar de tratar el modelo como una decisión permanente. Lo que este lanzamiento deja en evidencia es que los precios de inferencia se mueven en ciclos de meses, en ambas direcciones, y que el alza programada de Gemini para enero de 2027 es tan relevante como el precio de lanzamiento de Qwen. Una arquitectura que amarra la lógica de negocio a un proveedor específico convierte un movimiento de precios en un proyecto de migración.

La recomendación concreta para un líder comercial es separar dos capas que hoy suelen estar mezcladas. La capa de negocio, donde viven los prompts, las reglas de calificación, los criterios de escalamiento y los datos del CRM, debe ser independiente del proveedor. La capa de modelo debe poder cambiarse por configuración. En la práctica esto significa enrutar las llamadas a través de una capa intermedia y no contra el endpoint del proveedor, y mantener una evaluación propia con casos reales de la operación para poder comparar candidatos con evidencia y no con benchmarks publicados.

El segundo punto es de disciplina financiera. Conviene medir el gasto de inferencia por oportunidad creada y por oportunidad ganada, no como un total mensual de infraestructura. Ese ratio es el que permite decidir si un caso de uso con IA merece más volumen o menos. Sin él, el gasto crece con la actividad y nadie detecta cuándo dejó de pagar. Seguimos la evolución de precios y modelos de negocio en tendencias SaaS y publicamos criterios de arquitectura comercial en el blog de Revenue Hub.

Fuente y criterio editorial

Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a The Decoder.

Leer la fuente original

Para profundizar

Preguntas frecuentes

¿Cuánto cuesta Qwen3.8-Omni-Flash?

Cobra 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida. El procesamiento de audio cuesta menos de 0,01 dólares por hora y el video de 720p con audio a un cuadro por segundo alrededor de 0,20 dólares.

¿Cómo se compara con Gemini 3.8 Flash?

Gemini 3.8 Flash cobra 0,75 dólares por millón de tokens de entrada y 3,75 por millón de salida en tarifa introductoria. Eso deja a Qwen3.8-Omni-Flash en una quinta parte del precio de entrada y cerca de una octava parte del de salida.

¿El precio de Gemini se va a mantener?

No. Las tarifas actuales de Gemini 3.8 Flash son introductorias y están fijadas para duplicarse el 1 de enero de 2027, según la información publicada junto al lanzamiento de Qwen.

¿Qwen3.8-Omni-Flash iguala la calidad de Gemini?

El reporte señala que se acerca al desempeño de Gemini 3.8 Flash en tareas de audio y video, pero no publica puntajes numéricos de benchmark. La comparación verificable es de precio, no de calidad medida.

¿Qué ventana de contexto tiene el modelo?

Qwen3.8-Omni-Flash trabaja con una ventana de contexto de 1 millón de tokens, lo que permite procesar documentos extensos o historiales largos de conversación en una sola pasada.

¿Por qué importa el precio del token para una empresa en Chile o Latinoamérica?

Porque el costo de inferencia se paga en dólares mientras los ingresos se facturan en moneda local. Una diferencia de precio que en otros mercados es una optimización puede definir en la región si un caso de uso es viable o no, sobre todo en operaciones intensivas en llamadas y reuniones.

¿Conviene cambiar de proveedor de modelo ahora?

La decisión relevante no es cambiar de proveedor sino dejar de tratarlo como permanente. Conviene mantener la lógica de negocio independiente del modelo, enrutar las llamadas por una capa intermedia y sostener una evaluación propia con casos reales para comparar candidatos con evidencia.

¿Cómo se mide si el gasto en IA está justificado?

Midiendo el gasto de inferencia por oportunidad creada y por oportunidad ganada, en lugar de mirar solo el total mensual de infraestructura. Ese ratio indica si un caso de uso merece más volumen o si dejó de pagar.

De la lectura a la conversación

¿Cómo se vive esto en tu equipo?

Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.

Cargando comentarios…

Revisamos cada comentario antes de publicarlo.

0/1500 · Evita datos privados de clientes o de tu empresa.

Comparte este análisis con tu equipo

Continúa explorando

Ver toda la categoría