
Qué es realmente Qwen 3.7 Flash
Me dedico a construir integraciones y APIs. Así que mi primer instinto ante cualquier lanzamiento es ignorar el anuncio e ir directamente a leer la ficha del modelo, y con Qwen 3.7 Flash eso fue fácil, porque no había ningún anuncio que ignorar.
No existe ninguna entrada de blog de Qwen para este modelo. El feed de artículos de qwen.ai contiene publicaciones de lanzamiento de Qwen 3.7 Max y Qwen 3.7 Plus, y nada en absoluto para Flash. Una única línea en el registro de cambios de QwenCloud, fechada el 25 de julio de 2026, es el único aviso oficial que existe.
Se lanzó en OpenRouter el 27 de julio de 2026, bajo el slug canónico qwen/qwen3.7-flash-20260727, con una instantánea fijada llamada qwen3.7-flash-2026-07-15.
Esta es la declaración de posicionamiento completa, tomada tal cual de la ficha del modelo de Alibaba Cloud:
"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."
Ese es el discurso completo. Sin tabla de benchmarks, sin nombre de evaluación, sin porcentaje, sin arquitectura. Qwen no ha publicado el número de parámetros. Tampoco si es denso o de mezcla de expertos, ni cuántos tokens vio. Para una empresa que construyó su reputación con lanzamientos abiertos, esta es una postura distinta, y la comunidad lo ha notado.
Los datos mecánicos son más útiles. Entra texto, imagen y video; sale texto. El contexto es de 1,000,000 tokens, con una entrada utilizable limitada a 991,808 y una salida a 65,536, la mitad de lo que permiten Plus y Max. El presupuesto de cadena de pensamiento llega hasta 262,144 tokens y el razonamiento está activado por defecto. La llamada a funciones funciona. También hay herramientas integradas para interpretación de código y extracción web, además de búsqueda de imágenes y texto.

El mapa de la familia guarda una sorpresa real. Flash es el más barato de los tres y el más rápido de los tres, con 59 tokens por segundo frente a los 12 de Plus, y también es el único que acepta video. Qwen 3.7 Max, el buque insignia, es solo texto. Normalmente el nivel económico es el que sale mutilado; aquí el nivel económico es el que más ve.
El precio, y la parte que la etiqueta no te cuenta
Si solo leyeras una sección de este artículo, sería esta. La cifra de $0.03 que todo el mundo cita es real. También es el mejor de los tres escenarios posibles.
| Tamaño del prompt | Entrada / 1M | Salida / 1M | Lectura de caché / 1M | Escritura de caché / 1M |
|---|---|---|---|---|
| Menos de 32K tokens | $0.03 | $0.13 | $0.006 | $0.038 |
| 32K a 256K | $0.10 | $0.40 | $0.02 | $0.125 |
| 256K a 1M | $0.20 | $0.80 | $0.04 | $0.25 |
Esas tarifas provienen de la API de modelos de OpenRouter, y la misma estructura de tres tramos aparece en yuanes en la propia ficha de Alibaba: 0.2, 0.6 y 1.2 CNY por 1M de entrada en Pekín, Fráncfort y Tokio. Son dos vistas de un mismo esquema de precios, así que no hay contradicción que resolver.

Así que el marketing empareja "el modelo de visión más barato" con "contexto de 1M" y te deja asumir que obtienes ambas cosas a la vez. No es así. El contexto de 1M y el precio de $0.03 son mutuamente excluyentes. Cualquier caso que realmente necesite una ventana larga cae en el tramo superior, a 6.7 veces la tarifa que presupuestaste, ya sea una base de código grande, un video o una pila de documentos.
Nada de esto es teórico. OpenRouter publica lo que pagan sus clientes después del caché como una media móvil de 30 días, y para este modelo es de $0.044 de entrada y $0.149 de salida con una tasa de acierto de caché del 51.0%. Que esa media quede por encima del precio de lista solo es posible si una parte significativa del tráfico real ya está pagando los tramos de 32K y 256K. El descuento por caché tampoco te rescata.
Prueba a introducir tus propias cifras.
Vale la pena conocer un par de peculiaridades regionales antes de elegir un endpoint. En el mismo modelo, Singapur cuesta aproximadamente un 22% más que Pekín, Fráncfort y Tokio. La búsqueda web solo funciona en Pekín y Singapur. La inferencia por lotes solo funciona en Pekín, y el ajuste fino no está disponible en ninguna parte.
Cómo se compara con el resto del nivel económico
Incluso teniendo en cuenta los tramos, el precio sigue siendo la historia principal. Este es el panorama actual de modelos económicos con capacidad de visión, con todas las cifras tomadas de las páginas de precios de cada proveedor. Lanzamientos con precios de frontera como Kimi K3 quedan fuera de este alcance.
| Modelo | Entrada $/1M | Salida $/1M | Contexto | Visión | Lanzamiento |
|---|---|---|---|---|---|
| Qwen 3.7 Flash | $0.03 | $0.13 | 1M | Texto, imagen, video | 27 jul 2026 |
| Mistral Small 4 | $0.15 | $0.60 | 256K | Texto, imagen | 16 mar 2026 |
| GPT-5.6 Luna | $0.20 | $1.20 | 1.05M | Texto, imagen | 9 jul 2026 |
| Gemini 3.1 Flash-Lite | $0.25 | $1.50 | No publicado | Texto, imagen | No publicado |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 1,048,576 | Texto, imagen, video | 21 jul 2026 |
| Claude Haiku 4.5 | $1.00 | $5.00 | 200K | Texto, imagen | 15 oct 2025 |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 | Texto, imagen, video | 21 jul 2026 |
Hay un par de cosas que llaman la atención. Qwen es un orden de magnitud más barato aquí, 5 veces menos que Mistral Small 4 y 10 veces menos que Gemini 3.5 Flash-Lite en entrada. También es el único modelo del grupo que acepta video con una tarifa de entrada por debajo de $0.10, mientras que GPT-5.6 Luna y Mistral Small 4 solo aceptan imagen.
Hay una trampa que evitar si comparas por tu cuenta. Gemini 3.1 Flash-Lite sigue siendo más barato que 3.5 Flash-Lite, a $0.25/$1.50 frente a $0.30/$2.50. Lo más nuevo no es automáticamente más barato en la línea de Google, donde Gemini 3.6 Flash está en la gama alta. Y GPT-5.6 Luna recortó su precio un 80% el 30 de julio de 2026, un día antes de que escribiera esto, lo que lo convierte en un competidor mucho más cercano de lo que era hace una semana.
El modelo al que realmente supera, sin embargo, es a su propio predecesor. Frente a Qwen 3.6-Flash, a $0.1875/$1.125, el nuevo nivel base es 6.25 veces más barato en entrada y 8.65 veces más barato en salida. Alibaba acaba de recortar su propio suelo de precios en visión en un orden de magnitud con un solo lanzamiento, sea lo que sea lo demás cierto sobre este lanzamiento.
Aquí "Flash" significa barato, no rápido
Aquí es donde el nombre confunde. Flash significa baja latencia en la línea de Google. Aquí significa precio bajo. Son productos muy distintos.
OpenRouter mide al único proveedor en 59 tokens de salida por segundo en P50, con 1.20s de tiempo hasta el primer token. Artificial Analysis mide Gemini 3.5 Flash-Lite en 382 tokens por segundo y GPT-5.4 mini en 177. Son arneses y condiciones distintas, así que hay que tomar la proporción con cautela. Aun así, una brecha de 6 veces sigue siendo demasiado amplia para ser ruido de medición, y que el razonamiento esté activado por defecto arrastra la cifra aún más hacia abajo.
Hay un dato discordante. Un desarrollador que lo probó en una herramienta de codificación reportó un rendimiento mucho mejor del que muestra la telemetría de OpenRouter:
"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."
Sus 150 TPS son aproximadamente 2.5 veces el P50 medido por OpenRouter, y con prompts cortos y una caché caliente eso es posible. Yo seguiría planificando sobre los 59, no los 150, porque el tráfico de producción es lo que está muestreando OpenRouter.
La cola es la parte que me quitaría el sueño. La latencia de extremo a extremo es de 3.56s en P50 y 8.54s en P75, lo cual está bien. Luego llega a 17.96s en P90, 29.03s en P95, y 90.19s en P99.

Para un trabajo por lotes esa cola es invisible. Para cualquier cosa que una persona esté esperando, que una de cada cien solicitudes tarde un minuto y medio deja de ser una métrica y se convierte en una decisión de producto. Y esto se agrava dentro de un bucle de agente de IA, donde una sola llamada de herramienta lenta bloquea cada paso posterior.
Dos cifras más del mismo panel. La tasa de error en llamadas de herramientas es del 8.88%, frente al 6.45% de Plus, lo que significa que aproximadamente una de cada once llamadas de herramienta falla en un modelo comercializado explícitamente para trabajo de agentes. Y hay exactamente un proveedor que lo ofrece. Sin enrutamiento de respaldo, entonces, si Alibaba Cloud tiene una mala tarde.
También hay un pequeño conflicto de documentación que no pude resolver. La ficha del modelo de Alibaba indica que las salidas estructuradas están soportadas. La lista de parámetros de OpenRouter no expone el indicador de salidas estructuradas para Flash, solo response_format, aunque sí lo expone para Plus y Max. Si la aplicación estricta de esquemas importa para tu proceso, pruébalo antes de comprometerte, en lugar de confiar en ninguna de las dos páginas.
El único benchmark independiente que existe
Qwen no publicó nada, así que fui a buscar a alguien que realmente lo hubiera puntuado. Existe exactamente uno.
Artificial Analysis no tiene listado este modelo. La página del modelo devuelve un 404, y un grep del mapa del sitio confirma que las únicas páginas de Qwen 3.7 son Max y Plus. LMArena tampoco tiene entrada para Flash. Ningún índice de inteligencia de las fuentes habituales, entonces, ni Elo, ni ninguna puntuación de calidad publicada de ningún tipo.
Las evaluaciones de visión de Roboflow son la excepción, y no son favorables:
| Tarea | Puntuación | Posición |
|---|---|---|
| General | 61.7% | #22 de 23 |
| Identificación | 84.4% | #10 de 23 |
| Transcripción OCR | 84.1% | #23 de 23 |
| Extracción de datos | 78.4% | Sin clasificar |
| Detección de objetos | 42.8% mAP@50 | #16 de 23 |
| Conteo de objetos | 46% coincidencia exacta | Sin clasificar |
| Coste por muestra | ~$0.0001 | #1 de 23 |
Queda en el puesto 22 de 23 en general con un 61.7%, justo detrás de GPT-5.4 mini con 63.5%, y primero de 23 en coste. Siendo justos: el resultado de OCR es el último puesto en un grupo muy reñido y no es un fallo, ya que un 84.1% de coincidencia media es respetable en términos absolutos. Y Qwen nunca afirmó OCR ni control de GUI como fortalezas de Flash. Eso pertenece a Plus. Así que "queda último en OCR" es coherente con lo que dijo Alibaba, en lugar de ser una promesa incumplida.
Pero sí aclara qué estás comprando exactamente. La identificación es su punto fuerte con un 84.4%; la localización es su punto débil con un 42.8%. Puede decirte qué hay en la imagen mucho mejor que dónde está. Si tu carga de trabajo es "etiquetar diez millones de imágenes por categoría", eso encaja de maravilla a una décima de centavo por cada mil muestras. Si es "leer esta factura y extraer las partidas", busca otra cosa.
Lo que dice la comunidad, y por qué hay tan poco
Esto es lo más extraño del lanzamiento, y creo que es lo más revelador.
Un modelo de visión a $0.03 por millón de tokens se lanzó hace cuatro días y no hay ni un solo comentario sobre él en Hacker News. Una búsqueda de texto completo en HN de qwen3.7-flash devuelve cero resultados entre historias y comentarios, en todo momento. Nunca se envió ningún hilo de lanzamiento. La única historia titulada con Qwen en ese periodo, "Qwen 3.7 or 3.8 30B – 100B. QWhen?", no atrajo ningún comentario.
Y hay más. La conversación viva de HN sobre Qwen la semana de su lanzamiento estaba ocurriendo dentro de un hilo de DeepSeek, donde la gente se preguntaba si Qwen alguna vez lanzaría visión, cuatro días después de que Qwen lanzara un modelo de visión.
"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."
"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."
Ese segundo comentario apunta directamente a la razón. La audiencia que solía seguir los lanzamientos de Qwen es la comunidad de pesos locales, y Qwen dejó de atenderla. El mismo punto salió a la luz en un hilo sobre GLM 5.2:
"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."
Flash también es cerrado. Hugging Face devuelve un array vacío para él, y Roboflow indica que la licencia es propietaria. Alguien todavía tenía esperanzas de lo contrario el día del lanzamiento:
"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"
Eso se traduce como la esperanza de que Qwen 3.7 esté pronto disponible para IA local. No lo estará.
Debo ser honesto sobre qué es esta sección. Ninguna de estas citas trata sobre Flash, porque todavía no existen citas así. Tratan sobre la familia 3.7 y el hueco que Flash fue construido para llenar. Los veredictos sobre la familia van en ambas direcciones, desde un comentarista de HN que reporta un mes de uso diario y califica a 3.7 Pro como "totalmente inutilizable", hasta chewz, que califica a 3.7 Max por encima del nivel de Opus en velocidad. Una frase de ese hilo se me quedó grabada, dado que Qwen no publicó ningún benchmark en absoluto para Flash:
"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."
Hay cierta simetría en lanzar un modelo sin puntuaciones de benchmark a una audiencia que había dejado de creer en ellas.
Mientras tanto, la gente lo está usando en silencio. El panel de actividad de OpenRouter muestra a Hermes Agent como el mayor consumidor, por delante de Claude Code y un puñado de herramientas de codificación. El uso es real; el discurso simplemente nunca ocurrió.
Quién debería usarlo realmente
Mi opinión, sin rodeos.
Recúrrele si ejecutas trabajo de visión de alto volumen y bajo riesgo, donde equivocarse de vez en cuando sale barato y que sea caro resulta fatal. Etiquetado masivo de imágenes. Clasificación de contenido de primera pasada, selección de miniaturas, "¿hay una persona en este fotograma?", filtrado previo antes de que un modelo mejor haga la pasada cuidadosa. A aproximadamente una centésima de centavo por muestra, cambia lo que resulta económicamente viable procesar, y eso es importante.
Sáltatelo si necesitas OCR o extracción de documentos, localización precisa de objetos, latencia predecible, pesos que puedas alojar, o cualquier señal de calidad publicada que mostrar a un interesado. Sáltatelo también si tus prompts son habitualmente largos, porque en ese punto GPT-5.6 Luna, tras su recorte de precio del 80%, empieza a parecer razonable, y lo mismo pasa con Gemini 3.5 Flash-Lite. Ambos son también mucho más rápidos.
Si quieres específicamente la familia Qwen pero necesitas más capacidad, Qwen 3.8 Max está en el otro extremo del rango, y nuestro resumen de alternativas a Qwen cubre el resto.
El factor decisivo es si una respuesta incorrecta te cuesta algo. Esa es una cuestión de producto más que de benchmark, y es la pregunta que yo resolvería antes de escribir cualquier código de integración.
Si esto va a acercarse a una cola de soporte, lee esto primero
Aquí tengo que ser directo, porque esta es la parte donde de verdad tengo cicatrices.
Construyo integraciones en eesel, y llevamos años ejecutando IA en colas de soporte reales a través de miles de tickets de verdad. El malentendido más caro que veo es precisamente el que fomenta la tabla de precios de este artículo: creer que el modelo es el producto. Un modelo de $0.03 hace que construir tu propio bot de soporte parezca casi gratis. Las cuentas de coste por ticket también se ven estupendas en una hoja de cálculo. Pero el modelo nunca fue la parte cara.
Las partes caras son la recuperación de información sobre un centro de ayuda que se contradice a sí mismo, la clasificación de tickets que enruta al lugar correcto, y saber cuándo callarse. El escalado que no deja tirado al cliente. Una forma de descubrir que te has equivocado antes de que lo descubra el cliente. Nada de eso viene incluido en el precio por token. Lo aprendimos por las malas al ver bots que sonaban seguros dando respuestas confiadamente erróneas, razón por la cual ahora cada implementación que hacemos se simula contra tickets históricos antes de tocar una cola real.
No voy a fingir que a nadie le funciona la vía de construirlo por su cuenta. Parte de nuestras propias bajas es exactamente esto: clientes que se fueron para construir directamente sobre una API de LLM, incluyendo una empresa de tecnología de construcción/RA y una marca de belleza DTC. Es una opción real, y a veces la correcta. Pero los equipos que lo analizaron más a fondo normalmente acabaron en otro sitio. Un líder de ingeniería en una empresa de hardware de cajeros automáticos de Bitcoin, que gestiona una base de conocimiento de 300 artículos repartida entre Confluence y Telegram, lo expresó así:
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Y lo que realmente decide si la IA de soporte funciona es la contención, algo que ninguna puntuación de modelo captura. Un responsable de CX en una marca que gestiona 7,000 tickets al mes lo formuló mejor que cualquier benchmark:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Ahora pon a Qwen 3.7 Flash a la altura de ese listón. Una tasa de error en llamadas de herramientas del 8.88%, un P99 que se estira hasta 90 segundos, y ninguna puntuación de calidad publicada, además de ninguna evaluación independiente salvo una que lo sitúa 22º de 23. Son cifras perfectamente aceptables para etiquetar un millón de imágenes. No son las cifras que yo querría entre mi marca y un cliente molesto. La guía de desvío de tickets y nuestras notas sobre la tasa de resolución de IA profundizan en por qué el umbral de confianza importa más que el modelo en bruto.
Si de todos modos quieres ir por la vía de construirlo, empezaría con RAG frente a ajuste fino, y después leería sobre el entrenamiento en la base de conocimiento. Luego dedicaría tiempo de verdad a prevenir alucinaciones. Ninguno de esos problemas se abarata cuando lo hacen los tokens.
Prueba eesel
Si lo que realmente querías de un modelo de $0.03 era automatización de soporte más barata, puedes saltarte el montaje. eesel se conecta al helpdesk que ya usas y aprende de tus tickets pasados y tu centro de ayuda, y luego responde a las preguntas de las que está seguro, dejando el resto en paz.
La parte que vale la pena robar, sea cual sea lo que construyas: antes de que nada salga a producción, lo ejecutas contra tu historial real de tickets y obtienes un informe puntuado de lo que habría respondido. Así es como descubres que un modelo se equivoca sin que lo descubra primero un cliente. Es la comprobación que ningún precio por token puede comprarte.

Puedes probar eesel gratis, o reservar una demo si prefieres verlo funcionar primero contra tu propia cola.
Preguntas frecuentes
¿Cuánto cuesta Qwen 3.7 Flash?
¿Es bueno Qwen 3.7 Flash para OCR?
¿Los pesos de Qwen 3.7 Flash son de código abierto?
Qwen 3.7 Flash frente a Gemini 3.5 Flash-Lite: ¿cuál es más rápido?
¿Puedo usar Qwen 3.7 Flash para atención al cliente?
¿Qué pasa si Qwen 3.7 Flash deja de funcionar?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







