
La tabla de precios, y los cuatro medidores que hay detrás
Aquí está el precio publicado, completo, tal como se aplica en realidad.
| Tamaño del prompt | Entrada / 1M | Salida / 1M | Lectura de caché / 1M | Escritura de caché / 1M |
|---|---|---|---|---|
| Menos de 32K tokens | $0.03 | $0.13 | $0.006 | $0.038 |
| 32K a 256K | $0.10 | $0.40 | $0.02 | $0.125 |
| 256K a 1M | $0.20 | $0.80 | $0.04 | $0.25 |
Estas tarifas provienen de la API de modelos de OpenRouter, el mismo feed del que se alimenta la página del modelo Qwen3.7 Flash. La tarjeta de modelo en Alibaba Cloud Model Studio muestra la misma estructura de tres tramos en CNY.
Cuatro cosas mueven la cifra que se te factura, y solo una de ellas está en esa tabla.

Introduce tu propia carga de trabajo en las cuatro:
El resto de este artículo trata sobre lo que realmente hace cada una de esas cuatro variables.
Medidor 1: el tramo de tamaño del prompt, y cómo los bucles de agentes se van deslizando hacia él
El precio se escalona según el tamaño del prompt, no según cuántos tokens compras en un mes. Una llamada con 32,001 tokens de prompt se factura a $0.10 por millón en cada uno de ellos, no solo en los que superan el límite. Al pasar de 256K, toda la solicitud se recalcula de nuevo a $0.20.
Eso hace que el tramo superior sea 6.7x la tarifa de entrada anunciada y 6.2x la tarifa de salida anunciada. También significa que las dos cifras de cada titular sobre este modelo, "el modelo de visión más barato" y "1M de contexto", no pueden ser ciertas a la vez en la misma llamada. Mi colega Rama repasó ese equilibrio en detalle en la reseña de Qwen 3.7 Flash; la versión de ficha técnica está en la descripción general de Qwen 3.7 Flash.
Lo menos evidente es cómo se llega hasta ahí sin quererlo. Los bucles de agentes se deslizan de tramo por sí solos:
- Un prompt de sistema con esquemas de herramientas a menudo ya son 3K a 8K tokens antes de que el usuario diga nada.
- Los documentos recuperados se suman encima. Cuatro artículos del centro de ayuda de 2K cada uno son otros 8K.
- Cada turno vuelve a enviar toda la conversación, así que el turno 1 puede ser de 12K y el turno 6 de 40K.
El turno 1 se factura a $0.03. El turno 6 se factura a $0.10, retroactivamente sobre todo el prompt. Nada cambió en tu código. Es el mismo tipo de problema que elegir un modelo por su tarifa de etiqueta en otros contextos, por lo que Opus 5 frente a Sonnet 5 termina siendo una discusión sobre coste por tarea completada en lugar de coste por token.
La prueba de que esto le pasa a usuarios reales está en la propia página del proveedor. OpenRouter publica un promedio ponderado móvil de 30 días de lo que pagan los clientes tras el caching, y para este modelo es de $0.044 de entrada y $0.149 de salida con una tasa de aciertos de caché del 51.0%. El precio efectivo está por encima del de lista, lo cual solo es aritméticamente posible si una parte relevante del tráfico está pagando los tramos superiores.
Si estás comparando modelos por sus tablas de precios, la misma trampa existe en otros sitios, con distinto disfraz. Los precios de GPT-5.6 duplican la entrada y añaden un 50% a la salida por encima de 272K tokens, y los precios de Claude cobran una prima por las escrituras de caché. Solo Qwen3.7 Max mantiene un precio plano en toda la ventana, y eso cuesta 49x más por token de entrada.
Medidor 2: el caching, donde escribir la caché cuesta más que no cachear
Este es el medidor que la gente calcula mal con más frecuencia, y merece la pena hacer las cuentas una vez.
Qwen 3.7 Flash expone dos tipos de caché. El caching implícito lee al 20% de la tarifa de entrada estándar y no cuesta nada crearlo. El caching explícito se divide en dos: pagas una tarifa de creación y luego una tarifa de lectura mucho más baja. En el listado en USD de OpenRouter, la caché explícita de cinco minutos se crea a $0.038 y se lee a $0.003, frente a una tarifa de entrada estándar de $0.03.
Léelo otra vez. Escribir una entrada de caché cuesta 1.27x lo que habría costado simplemente enviar los tokens.

La cuenta se rompe a tu favor rápido. Escribe una vez y lee una vez, y habrás gastado $0.041 por millón frente a $0.060 sin caché, así que la caché ya está siendo rentable. Cada lectura posterior es casi gratis. Todo esto solo sale mal en un caso concreto: la caché caduca antes de que alguien la lea, y pagaste una prima del 27% para nada.
Que es exactamente la forma que tiene una cola de soporte. Los tickets no llegan en una ráfaga concentrada contra el mismo contexto, entran poco a poco durante todo el día. Un tiempo de vida de cinco minutos es generoso para una sesión de chat e inútil para una bandeja de entrada. La tasa de aciertos de caché del 51% que mide OpenRouter en todo el tráfico de este modelo es una suposición de planificación razonable, no el 90% que obtienes en un script de benchmark.
De ahí salen dos reglas prácticas. Usa el caching implícito por defecto, ya que no tiene coste de creación y sigue leyendo al 20%. Reserva el caching explícito para prefijos en los que confíes en que se van a repetir dentro de la ventana, como un prompt de sistema largo en un endpoint de alto rendimiento. Si además estás construyendo retrieval encima, aquí también importa el equilibrio de RAG frente a LLM, porque un contexto recuperado más pequeño es a la vez más barato por llamada y menos propenso a hacerte caer en el siguiente tramo.
Medidor 3: el descuento por batch existe en exactamente una región
La propia tarjeta de modelo de Alibaba pone precio a este modelo en CNY, en cuatro tablas regionales separadas, y las diferencias no son cosméticas.
| Concepto de facturación (por 1M, tramo base) | Pekín | Singapur | Fráncfort | Tokio |
|---|---|---|---|---|
| Entrada | 0.2 CNY | 0.225 CNY | 0.2 CNY | 0.2 CNY |
| Salida | 0.8 CNY | 0.974 CNY | 0.8 CNY | 0.8 CNY |
| Lectura de caché implícita | 0.04 CNY | 0.045 CNY | 0.04 CNY | 0.04 CNY |
| Entrada (Batch File) | 0.1 CNY | — | — | — |
| Salida (Batch File) | 0.4 CNY | — | — | — |
Tres hallazgos en esa tabla.
Los precios de Batch File reducen a la mitad ambos medidores, y eso solo existe en Pekín. Batch Inference aparece marcado como no compatible en las tablas de capacidades de Singapur, Fráncfort y Tokio, así que el descuento del 50% que cualquier otro proveedor ofrece globalmente aquí depende de dónde despliegas. Fíjate también en la trampa dentro de la trampa: las filas de Batch Chat tienen precio de 0.2 y 0.8, idéntico al estándar. Solo la ruta de batch basada en archivos recibe el descuento.
Singapur cuesta más por el mismo modelo. La entrada va un 12.5% por encima de la tarifa base y la salida alrededor de un 22% por encima. Nada en la tabla de capacidades lo explica; es simplemente una lista de precios distinta.
La búsqueda web también está limitada por región, compatible en Pekín y Singapur y no compatible en Fráncfort y Tokio. Eso es una cuestión de funcionalidad más que de precio, hasta que tienes que añadir una API de búsqueda separada y pagarla dos veces.

Una cosa más sobre la moneda. La tarjeta de modelo muestra CNY en cada pestaña y no aparece ninguna cifra en USD en ningún lado; las tarifas en dólares que todos citan vienen del listado de reventa de OpenRouter. Son dos storefronts para un mismo esquema de precios, no una contradicción que resolver, y convertir entre ellos te dará una cifra que no coincide con ninguna de las dos facturas. Calcula el precio según el storefront por el que realmente compras. Cualquiera que compare entre proveedores se topará con el mismo problema, que es parte de por qué la comparación de OpenAI frente a Anthropic frente a Gemini es más difícil que leer tres páginas de precios.
Medidor 4: los reintentos, la partida que nadie presupuesta
OpenRouter mide una tasa de error en llamadas a herramientas del 8.88% para este modelo, frente al 6.45% de Qwen3.7 Plus. En un bucle de agente, una llamada a herramienta fallida no es gratis. Pagaste por el prompt que la produjo, y volverás a pagar por el reintento que incluye el fallo en su contexto, con un tamaño de prompt ligeramente mayor.
Un nueve por ciento no es catastrófico, pero pertenece al modelo, por lo que la calculadora de arriba lo añade como multiplicador en lugar de dejarlo como nota al margen.
La cola de latencia cuenta la misma historia, pero en tiempo en lugar de dinero. El P50 de extremo a extremo es de unos cómodos 3.56 segundos. El P99 es de 90.19 segundos. Si tu timeout está por debajo de eso, estás cancelando y reemitiendo aproximadamente una de cada cien llamadas, y pagando por las dos. Y como exactamente un solo proveedor sirve este modelo, no hay ninguna ruta alternativa a la que recurrir cuando se ralentiza.
"Flash" es una promesa sobre precio, no sobre velocidad. Con 59 tokens de salida por segundo, este modelo es aproximadamente una sexta parte de la velocidad de Gemini 3.5 Flash-Lite, lo cual importa de verdad si algo está esperando la respuesta. También es, curiosamente, unas cinco veces más rápido que su propio hermano Plus.
Cómo se compara frente al resto del segmento barato con visión
Cada cifra de abajo viene de la propia página de precios del proveedor, en el tramo síncrono estándar.
| Modelo | Entrada $/1M | Salida $/1M | Contexto | Visión | La trampa en la tabla de precios |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0.03 | $0.13 | 1M | Texto, imagen, video | Tres tramos; el batch solo está en Pekín |
| Mistral Small 4 | $0.15 | $0.60 | 256K | Texto, imagen | Precio plano, pero la ventana más pequeña aquí |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05M | Texto, imagen | 2x entrada por encima de 272K; el batch lo reduce a la mitad |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | No publicado | Texto, imagen | Más barato que el más reciente 3.5 Flash-Lite |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1,048,576 | Texto, imagen, video | El almacenamiento de caché se factura por hora |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200K | Texto, imagen | Las escrituras de caché cuestan 1.25x la entrada |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 | Texto, imagen, video | Con precio 5x por encima del tramo Lite |
Qwen gana la fila superior por un orden de magnitud, y es el único modelo aquí que acepta entrada de video por menos de $0.10. Pero la comparación es más ajustada de lo que sugieren las cifras en bruto una vez aplicas los descuentos propios de cada proveedor. Los precios de Mistral son planos, así que lo que ves es lo que pagas. El modo batch reduce a la mitad ambos tramos de Google en todo el mundo sin restricción de región, como detalla el desglose de precios de Gemini 3.5 Flash-Lite.
Y GPT-5.6 recortó el precio de Luna un 80% el 30 de julio de 2026, lo que reorganizó esta tabla días antes de que yo escribiera esto. El mapa completo de tramos está en el artículo de precios de GPT-5.6, y la parte alta del rango de Google está en precios de Gemini 3.6 Flash.
Dos filas merecen que te fijes bien. Más nuevo no significa más barato dentro de la propia gama de Google, donde 3.1 Flash-Lite todavía es más barato que 3.5. Y los pesos abiertos no significan barato, como demuestran los precios de Kimi K3 con $3 de entrada y $15 de salida. Si lo que buscas aquí son pesos abiertos, ten en cuenta que Qwen 3.7 es cerrado, y el resumen de mejores agentes de IA de código abierto es mejor punto de partida.
Dentro de la familia Qwen, la escalera de precios es empinada:
| Modelo | Entrada $/1M | Salida $/1M | Recargo por contexto largo | Modalidad |
|---|---|---|---|---|
| Qwen3.7 Flash | $0.03 | $0.13 | Sí, a los 32K y 256K | Texto, imagen, video |
| Qwen3.7 Plus | $0.32 | $1.28 | Sí, a los 256K | Texto, imagen |
| Qwen3.7 Max | $1.475 | $4.425 | Ninguno publicado | Solo texto |
Flash es 10.7x más barato en entrada que Plus y 49x más barato que Max, y es el único de los tres que acepta video. Max, el buque insignia, no tiene visión en absoluto. El contexto más amplio de la gama está en el desglose de precios de Qwen, y el nivel de vista previa más reciente se cubre en precios de Qwen3.8-Max.
Si ninguno de los tres te encaja, alternativas a Qwen cubre qué más hay en la carrera, y la descripción general de la familia Qwen es la versión sencilla y fácil de entender de esta escalera.
Lo que dice la comunidad, que es casi nada
Merece la pena decirlo con claridad, porque cambia cuánto peso debería tener el precio por sí solo: no hay datos independientes de rendimiento por precio sobre este modelo. No aparece en Artificial Analysis, no tiene entrada en LMArena, y Qwen no publicó ningún benchmark con él. Una búsqueda en Hacker News del nombre del modelo devuelve cero resultados entre historias y comentarios, de todos los tiempos.
Lo más parecido a una explicación vino de un hilo no relacionado la misma semana:
"Qwen/Alibaba han dejado de hacer lanzamientos de pesos abiertos por un tiempo. Sin rencor ni nada, desde luego no voy a mirarle los dientes a un caballo regalado, pero tanto DeepSeek como Moonshot han sido muy constantes con los pesos abiertos y también compartiendo investigación realmente detallada."
La comunidad que normalmente pone a prueba un lanzamiento de Qwen dejó de mirar cuando la línea pasó a pesos cerrados, así que un lanzamiento solo por API llegó sin nadie que lo evaluara. En el mismo hilo, otro comentarista señaló que el modelo barato rival "no tiene capacidades de visión, lo cual es un gran atractivo para tareas agénticas" — que es precisamente el argumento de venta de este modelo, escrito por alguien que no sabía que había salido cuatro días antes.
En la práctica: puedes confiar en el precio, porque el proveedor lo publicó. Todavía no puedes confiar en ninguna afirmación de nadie sobre lo que obtienes por él. Presupuesta tu propia evaluación antes de comprometer una carga de trabajo, igual que harías con cualquier modelo en la conversación sobre los mejores agentes de IA.
Lo que esto realmente cuesta en una cola de soporte
Aquí es donde tengo que salirme de la tabla de precios, porque esta es la pregunta con la que llega la mayoría de la gente.
Ejecuta la calculadora sobre una carga de trabajo de soporte plausible: 200,000 conversaciones al mes, 12K tokens de prompt cada una una vez que incluyes un prompt de sistema y algunos artículos recuperados, 700 tokens de salida, la mitad con acierto de caché, con el margen de reintentos activado. Eso da aproximadamente $67 al mes — por debajo de la estimación de referencia, porque la caché está haciendo su trabajo con un tamaño de prompt que nunca sale del tramo base. Es una cifra suficientemente pequeña como para sentirse un error de redondeo, y es la cifra que hace que construir tu propia solución parezca obviamente lo correcto.
En eesel vemos esta decisión repetirse regularmente, y el patrón es constante. De una revisión interna de bajas de clientes, varios clientes técnicos — incluyendo una empresa de tecnología de construcción con RA y una marca de belleza DTC — se fueron para construir directamente sobre una API de LLM. Lo que hace que los equipos vayan en la otra dirección es lo que los tokens no cubren. Del lado de quienes compran, un líder de ingeniería de una empresa de hardware de cajeros de Bitcoin, que gestiona una base de conocimiento en Confluence y Telegram con más de 300 artículos, lo expresó así:
"Podríamos intentar escribir nuestra propia aplicación de LLM, pero no queríamos invertir nuestro tiempo en eso. Queríamos algo que no tuviéramos que mantener."
El mantenimiento es el coste real. Una llamada directa a un modelo no tiene idea de cuál de tus artículos del centro de ayuda está actualizado, ninguna regla sobre cuándo transferir a un humano, ninguna forma de probarse a sí misma contra tu historial antes de responder a un cliente real. Equivocarse en eso es más caro que cualquier tramo de tokens: hemos visto a un bot con apariencia segura dar respuestas incorrectas en silencio, por lo que cada despliegue de eesel se simula contra tickets históricos antes de tocar una conversación real.
Si quieres la cifra honesta y global en lugar de la línea de la API, el desglose de coste del servicio de atención al cliente con IA y la comparación de coste por resolución son mejores puntos de partida que cualquier tabla por token, y coste de IA frente a agente humano enmarca la cifra que realmente pregunta finanzas.
El trabajo de ingeniería que una tarifa de $0.03 no incluye, aproximadamente en el orden en que te muerde:
- Retrieval que se mantiene actualizado, que es todo lo que trata entrenar IA con una base de conocimiento.
- Umbrales de confianza y escalado de IA para que el modelo solo responda lo que debe.
- Grounding y guardrails, ya que las alucinaciones de IA en soporte son el fallo que cuesta clientes.
- Triaje y clasificación de tickets antes de que se intente siquiera una respuesta.
- Medición, porque la tasa de resolución de IA es la única cifra que dice si algo de esto funcionó.
- QA de soporte con IA continua, que nunca termina.
Nada de eso es un argumento contra los modelos baratos. Es un argumento para saber qué factura estás leyendo realmente. Un modelo tan barato es un gran componente y un producto pobre, y la diferencia entre ambos es a lo que realmente se reduce un agente de IA frente a un chatbot tradicional.
Prueba eesel
Si llegaste aquí haciendo cálculos sobre si un modelo de $0.03 puede sostener tu cola de soporte, la respuesta honesta es que los tokens nunca fueron la parte difícil. eesel es la versión de ese proyecto que no tienes que construir: se conecta a Zendesk, Freshdesk, Gorgias o tu bandeja de entrada en pocos minutos, lee el centro de ayuda y los tickets pasados que ya tienes, y responde solo aquello de lo que está seguro, escalando todo lo demás.
La parte que más importa para cualquiera que se haya quemado con una demo: puedes simularlo contra miles de tus propios tickets históricos antes de que un solo cliente lo vea, así que conoces la tasa de resolución y el coste por ticket de antemano en lugar de descubrir ambos en producción. Gratis para probar, sin necesidad de reconstruir nada.

La versión corta
Los precios de Qwen 3.7 Flash son reales y son la tarifa de visión más barata disponible, siempre que tus prompts se mantengan por debajo de 32K, despliegues en Pekín, tu caché realmente se lea, y tu agente no reintente mucho. Cambia cualquiera de esas condiciones y la cifra se mueve, en un caso hasta 6.7x.
Modélalo antes de migrar. Y si la carga de trabajo al otro extremo del cálculo es una cola de soporte, calcula el precio de todo el sistema, no de los tokens: el mejor LLM para soporte suele ser el que no tienes que mantener tú mismo.
Fuentes
- Qwen3.7 Flash en OpenRouter
- API pública de modelos de OpenRouter
- Tarjeta de modelo de Qwen3.7-Flash, Alibaba Cloud Model Studio
- Qwen3.7-Flash en QwenCloud
- Changelog de modelos de QwenCloud
- Qwen3.7 Plus en OpenRouter
- Qwen3.7 Max en OpenRouter
- Precios de la API de Gemini
- Página del modelo Gemini 3.5 Flash-Lite
- Página del modelo Gemini 3.6 Flash
- Precios de la API de OpenAI
- Página del modelo GPT-5.6 Luna
- Documentación de precios de Claude
- Precios de la API de Mistral
- Hacker News, hilo DeepSeek-V4-Flash Update
Preguntas frecuentes
¿Cuánto cuesta Qwen 3.7 Flash por 1M de tokens?
¿Por qué mi factura de Qwen 3.7 Flash es más alta que el precio anunciado?
¿Es Qwen 3.7 Flash más barato que Gemini 3.5 Flash-Lite?
¿Tiene Qwen 3.7 Flash un nivel gratuito?
¿Cómo se comparan los precios de Qwen 3.7 Flash con Plus y Max?
¿Es Qwen 3.7 Flash lo bastante barato para hacer funcionar una cola de soporte?
¿Ofrece Qwen 3.7 Flash un descuento por batch?
¿En qué moneda tiene precio Qwen 3.7 Flash?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








