---
title: "Qwen3.8-Omni-Flash cobra 0,15 dólares por millón de tokens de entrada: una quinta parte del precio de Gemini 3.8 Flash con rendimiento multimodal cercano"
description: "Alibaba posicionó su modelo multimodal de pesos abiertos muy por debajo del precio introductorio de Google, que además está fijado para duplicarse el 1 de enero de 2027."
slug: "qwen3-8-omni-flash-015-dolares-millon-tokens-quinta-parte-gemini-26-09-19"
canonical: "https://www.revenuehublatam.com/noticias/tendencias-saas/qwen3-8-omni-flash-015-dolares-millon-tokens-quinta-parte-gemini-26-09-19"
language: "es"
section: "Noticias"
category: "Tendencias SaaS"
published: "2026-09-19T19:20:00+00:00"
updated: "2026-09-19T19:20:00+00:00"
tags: ["Qwen", "Alibaba", "precios de IA", "modelos multimodales", "costo de inferencia"]
keywords: ["Qwen3.8-Omni-Flash precio", "precio por millón de tokens", "Gemini 3.8 Flash tarifa", "costo de inferencia para agentes", "modelos multimodales de pesos abiertos", "costo de IA para empresas en Chile", "adopción de IA en Latinoamérica"]
source_name: "The Decoder"
source_url: "https://the-decoder.com/qwen3-8-omni-flash-undercuts-gemini-flash-pricing-while-matching-its-multimodal-benchmarks/"
publisher: "Revenue Hub Latam"
publisher_url: "https://www.revenuehublatam.com"
---

# Qwen3.8-Omni-Flash cobra 0,15 dólares por millón de tokens de entrada: una quinta parte del precio de Gemini 3.8 Flash con rendimiento multimodal cercano

> Alibaba presentó el 19 de septiembre de 2026 Qwen3.8-Omni-Flash, un modelo multimodal con ventana de contexto de 1 millón de tokens y precios de 0,15 dólares por millón de tokens de entrada y 0,47 por millón de salida. Google cobra por Gemini 3.8 Flash 0,75 dólares de entrada y 3,75 de salida en tarifa introductoria, con un alza programada al doble el 1 de enero de 2027. El modelo de Alibaba procesa audio por menos de 0,01 dólares la hora y video de 720p con audio a un cuadro por segundo por cerca de 0,20 dólares.

**Alibaba** presentó el sábado 19 de septiembre de 2026 **Qwen3.8-Omni-Flash**, un modelo multimodal de pesos abiertos con una ventana de contexto de **1 millón de tokens**. La noticia no es la capacidad técnica sino el precio: la compañía lo posicionó muy por debajo del competidor directo de Google en la misma categoría.

El contraste es de un orden de magnitud en la salida. Qwen3.8-Omni-Flash cobra **0,15 dólares por millón de tokens de entrada** y **0,47 dólares por millón de tokens de salida**. **Gemini 3.8 Flash** cobra **0,75 dólares de entrada** y **3,75 dólares de salida**, y esas cifras corresponden a una tarifa introductoria que está fijada para **duplicarse el 1 de enero de 2027**.

## ¿Cuánto cuesta procesar audio y video con este modelo?

La parte multimodal es donde el precio se vuelve más llamativo para una operación comercial:

-   **Audio**: menos de **0,01 dólares por hora** procesada.
-   **Video de 720p con audio**, a un cuadro por segundo: alrededor de **0,20 dólares**.

Según el reporte, el modelo se acerca al desempeño de Gemini 3.8 Flash en tareas de audio y video, aunque no se publicaron puntajes numéricos específicos de benchmark en la cobertura disponible. Ese matiz importa: la comparación firme es de precio, no de calidad medida.

## ¿Por qué el precio del token empieza a decidir arquitecturas comerciales?

Durante los últimos dos años, el costo por token fue una preocupación de equipos de ingeniería. Dejó de serlo. Cuando una operación comercial transcribe y resume todas sus llamadas, enriquece cada cuenta y hace que un agente redacte seguimientos, el consumo deja de ser marginal y pasa a ser una línea de costo variable que escala con la actividad comercial.

Ese es el punto donde una diferencia de cinco veces en entrada y de ocho veces en salida deja de ser un detalle de proveedor y se convierte en una decisión de margen. Y el alza programada de Google para enero de 2027 convierte además al precio actual en una referencia temporal, no en una base de planificación.

## ¿Qué significa para las empresas en Chile y Latinoamérica?

Para las empresas de Chile y Latinoamérica hay un factor adicional que rara vez aparece en las comparaciones publicadas en inglés: el costo se paga en dólares mientras los ingresos se facturan en moneda local. Una diferencia de precio que en Estados Unidos es una optimización, en la región puede ser la diferencia entre un caso de uso viable y uno que no cierra.

El volumen de audio también juega a favor de este tipo de modelo. Las operaciones comerciales de la región siguen siendo intensivas en llamadas y reuniones, y un costo de menos de 0,01 dólares por hora de audio cambia por completo el cálculo de transcribir el total de las conversaciones en lugar de una muestra.

## Análisis de Revenue Hub

La conclusión operativa no es cambiar de proveedor. Es dejar de tratar el modelo como una decisión permanente. Lo que este lanzamiento deja en evidencia es que los precios de inferencia se mueven en ciclos de meses, en ambas direcciones, y que el alza programada de Gemini para enero de 2027 es tan relevante como el precio de lanzamiento de Qwen. Una arquitectura que amarra la lógica de negocio a un proveedor específico convierte un movimiento de precios en un proyecto de migración.

La recomendación concreta para un líder comercial es separar dos capas que hoy suelen estar mezcladas. La capa de negocio, donde viven los prompts, las reglas de calificación, los criterios de escalamiento y los datos del CRM, debe ser independiente del proveedor. La capa de modelo debe poder cambiarse por configuración. En la práctica esto significa enrutar las llamadas a través de una capa intermedia y no contra el endpoint del proveedor, y mantener una evaluación propia con casos reales de la operación para poder comparar candidatos con evidencia y no con benchmarks publicados.

El segundo punto es de disciplina financiera. Conviene medir el gasto de inferencia por oportunidad creada y por oportunidad ganada, no como un total mensual de infraestructura. Ese ratio es el que permite decidir si un caso de uso con IA merece más volumen o menos. Sin él, el gasto crece con la actividad y nadie detecta cuándo dejó de pagar. Seguimos la evolución de precios y modelos de negocio en [tendencias SaaS](/noticias/tendencias-saas) y publicamos criterios de arquitectura comercial en el [blog de Revenue Hub](/blog).

## Preguntas frecuentes

### ¿Cuánto cuesta Qwen3.8-Omni-Flash?

Cobra 0,15 dólares por millón de tokens de entrada y 0,47 dólares por millón de tokens de salida. El procesamiento de audio cuesta menos de 0,01 dólares por hora y el video de 720p con audio a un cuadro por segundo alrededor de 0,20 dólares.

### ¿Cómo se compara con Gemini 3.8 Flash?

Gemini 3.8 Flash cobra 0,75 dólares por millón de tokens de entrada y 3,75 por millón de salida en tarifa introductoria. Eso deja a Qwen3.8-Omni-Flash en una quinta parte del precio de entrada y cerca de una octava parte del de salida.

### ¿El precio de Gemini se va a mantener?

No. Las tarifas actuales de Gemini 3.8 Flash son introductorias y están fijadas para duplicarse el 1 de enero de 2027, según la información publicada junto al lanzamiento de Qwen.

### ¿Qwen3.8-Omni-Flash iguala la calidad de Gemini?

El reporte señala que se acerca al desempeño de Gemini 3.8 Flash en tareas de audio y video, pero no publica puntajes numéricos de benchmark. La comparación verificable es de precio, no de calidad medida.

### ¿Qué ventana de contexto tiene el modelo?

Qwen3.8-Omni-Flash trabaja con una ventana de contexto de 1 millón de tokens, lo que permite procesar documentos extensos o historiales largos de conversación en una sola pasada.

### ¿Por qué importa el precio del token para una empresa en Chile o Latinoamérica?

Porque el costo de inferencia se paga en dólares mientras los ingresos se facturan en moneda local. Una diferencia de precio que en otros mercados es una optimización puede definir en la región si un caso de uso es viable o no, sobre todo en operaciones intensivas en llamadas y reuniones.

### ¿Conviene cambiar de proveedor de modelo ahora?

La decisión relevante no es cambiar de proveedor sino dejar de tratarlo como permanente. Conviene mantener la lógica de negocio independiente del modelo, enrutar las llamadas por una capa intermedia y sostener una evaluación propia con casos reales para comparar candidatos con evidencia.

### ¿Cómo se mide si el gasto en IA está justificado?

Midiendo el gasto de inferencia por oportunidad creada y por oportunidad ganada, en lugar de mirar solo el total mensual de infraestructura. Ese ratio indica si un caso de uso merece más volumen o si dejó de pagar.

---

Fuente original: [The Decoder](https://the-decoder.com/qwen3-8-omni-flash-undercuts-gemini-flash-pricing-while-matching-its-multimodal-benchmarks/) (the-decoder.com)
