Análisis de Qwen 3.7 Flash: un modelo de visión de $0.03 con truco

Rama Adi Nugraha
Escrito por

Rama Adi Nugraha

Katelin Teen
Revisado por

Katelin Teen

Última edición July 31, 2026

Verificado por expertos
Ilustración de un desarrollador trabajando con paneles de imagen, video y documentos, con el logo de Qwen

Qué es realmente Qwen 3.7 Flash

Me dedico a construir integraciones y APIs. Así que mi primer instinto ante cualquier lanzamiento es ignorar el anuncio e ir directamente a leer la ficha del modelo, y con Qwen 3.7 Flash eso fue fácil, porque no había ningún anuncio que ignorar.

No existe ninguna entrada de blog de Qwen para este modelo. El feed de artículos de qwen.ai contiene publicaciones de lanzamiento de Qwen 3.7 Max y Qwen 3.7 Plus, y nada en absoluto para Flash. Una única línea en el registro de cambios de QwenCloud, fechada el 25 de julio de 2026, es el único aviso oficial que existe.

Se lanzó en OpenRouter el 27 de julio de 2026, bajo el slug canónico qwen/qwen3.7-flash-20260727, con una instantánea fijada llamada qwen3.7-flash-2026-07-15.

Esta es la declaración de posicionamiento completa, tomada tal cual de la ficha del modelo de Alibaba Cloud:

"The Qwen3.7 native vision-language series Flash models comprehensively enhance multimodal understanding and Agent execution capabilities compared to 3.6-Flash. Key improvements include strengthened foundational multimodal abilities, enhanced object recognition, improved real-world perception and spatial intelligence."

Ese es el discurso completo. Sin tabla de benchmarks, sin nombre de evaluación, sin porcentaje, sin arquitectura. Qwen no ha publicado el número de parámetros. Tampoco si es denso o de mezcla de expertos, ni cuántos tokens vio. Para una empresa que construyó su reputación con lanzamientos abiertos, esta es una postura distinta, y la comunidad lo ha notado.

Los datos mecánicos son más útiles. Entra texto, imagen y video; sale texto. El contexto es de 1,000,000 tokens, con una entrada utilizable limitada a 991,808 y una salida a 65,536, la mitad de lo que permiten Plus y Max. El presupuesto de cadena de pensamiento llega hasta 262,144 tokens y el razonamiento está activado por defecto. La llamada a funciones funciona. También hay herramientas integradas para interpretación de código y extracción web, además de búsqueda de imágenes y texto.

Tres tarjetas comparando Qwen 3.7 Flash, Plus y Max en precio, rendimiento y modalidad de entrada
Tres tarjetas comparando Qwen 3.7 Flash, Plus y Max en precio, rendimiento y modalidad de entrada

El mapa de la familia guarda una sorpresa real. Flash es el más barato de los tres y el más rápido de los tres, con 59 tokens por segundo frente a los 12 de Plus, y también es el único que acepta video. Qwen 3.7 Max, el buque insignia, es solo texto. Normalmente el nivel económico es el que sale mutilado; aquí el nivel económico es el que más ve.

El precio, y la parte que la etiqueta no te cuenta

Si solo leyeras una sección de este artículo, sería esta. La cifra de $0.03 que todo el mundo cita es real. También es el mejor de los tres escenarios posibles.

Tamaño del promptEntrada / 1MSalida / 1MLectura de caché / 1MEscritura de caché / 1M
Menos de 32K tokens$0.03$0.13$0.006$0.038
32K a 256K$0.10$0.40$0.02$0.125
256K a 1M$0.20$0.80$0.04$0.25

Esas tarifas provienen de la API de modelos de OpenRouter, y la misma estructura de tres tramos aparece en yuanes en la propia ficha de Alibaba: 0.2, 0.6 y 1.2 CNY por 1M de entrada en Pekín, Fráncfort y Tokio. Son dos vistas de un mismo esquema de precios, así que no hay contradicción que resolver.

Tres escalones ascendentes que muestran cómo el precio sube de $0.03 a $0.20 por millón de tokens de entrada a medida que crece el tamaño del prompt
Tres escalones ascendentes que muestran cómo el precio sube de $0.03 a $0.20 por millón de tokens de entrada a medida que crece el tamaño del prompt

Así que el marketing empareja "el modelo de visión más barato" con "contexto de 1M" y te deja asumir que obtienes ambas cosas a la vez. No es así. El contexto de 1M y el precio de $0.03 son mutuamente excluyentes. Cualquier caso que realmente necesite una ventana larga cae en el tramo superior, a 6.7 veces la tarifa que presupuestaste, ya sea una base de código grande, un video o una pila de documentos.

Nada de esto es teórico. OpenRouter publica lo que pagan sus clientes después del caché como una media móvil de 30 días, y para este modelo es de $0.044 de entrada y $0.149 de salida con una tasa de acierto de caché del 51.0%. Que esa media quede por encima del precio de lista solo es posible si una parte significativa del tráfico real ya está pagando los tramos de 32K y 256K. El descuento por caché tampoco te rescata.

Prueba a introducir tus propias cifras.

Calculadora de tramos de contexto
Lo que realmente cuestan 10M de tokens de entrada + 2M de salida al mes
Elige el tamaño de prompt típico de tu carga de trabajo.
$0.56 / mes
$0.03 de entrada, $0.13 de salida. Esta es la tarifa que aparece en todos los titulares sobre este modelo, y solo se sostiene para prompts cortos.
$1.80 / mes
$0.10 de entrada, $0.40 de salida. Un solo documento largo o un historial de chat modesto te sitúa aquí. Eso es 3.2 veces la factura del titular.
$3.60 / mes
$0.20 de entrada, $0.80 de salida. Esto es lo que cuesta el contexto de 1M anunciado: 6.4 veces la factura total, con el mismo volumen de tokens.

Vale la pena conocer un par de peculiaridades regionales antes de elegir un endpoint. En el mismo modelo, Singapur cuesta aproximadamente un 22% más que Pekín, Fráncfort y Tokio. La búsqueda web solo funciona en Pekín y Singapur. La inferencia por lotes solo funciona en Pekín, y el ajuste fino no está disponible en ninguna parte.

Cómo se compara con el resto del nivel económico

Incluso teniendo en cuenta los tramos, el precio sigue siendo la historia principal. Este es el panorama actual de modelos económicos con capacidad de visión, con todas las cifras tomadas de las páginas de precios de cada proveedor. Lanzamientos con precios de frontera como Kimi K3 quedan fuera de este alcance.

ModeloEntrada $/1MSalida $/1MContextoVisiónLanzamiento
Qwen 3.7 Flash$0.03$0.131MTexto, imagen, video27 jul 2026
Mistral Small 4$0.15$0.60256KTexto, imagen16 mar 2026
GPT-5.6 Luna$0.20$1.201.05MTexto, imagen9 jul 2026
Gemini 3.1 Flash-Lite$0.25$1.50No publicadoTexto, imagenNo publicado
Gemini 3.5 Flash-Lite$0.30$2.501,048,576Texto, imagen, video21 jul 2026
Claude Haiku 4.5$1.00$5.00200KTexto, imagen15 oct 2025
Gemini 3.6 Flash$1.50$7.501,048,576Texto, imagen, video21 jul 2026

Hay un par de cosas que llaman la atención. Qwen es un orden de magnitud más barato aquí, 5 veces menos que Mistral Small 4 y 10 veces menos que Gemini 3.5 Flash-Lite en entrada. También es el único modelo del grupo que acepta video con una tarifa de entrada por debajo de $0.10, mientras que GPT-5.6 Luna y Mistral Small 4 solo aceptan imagen.

Hay una trampa que evitar si comparas por tu cuenta. Gemini 3.1 Flash-Lite sigue siendo más barato que 3.5 Flash-Lite, a $0.25/$1.50 frente a $0.30/$2.50. Lo más nuevo no es automáticamente más barato en la línea de Google, donde Gemini 3.6 Flash está en la gama alta. Y GPT-5.6 Luna recortó su precio un 80% el 30 de julio de 2026, un día antes de que escribiera esto, lo que lo convierte en un competidor mucho más cercano de lo que era hace una semana.

El modelo al que realmente supera, sin embargo, es a su propio predecesor. Frente a Qwen 3.6-Flash, a $0.1875/$1.125, el nuevo nivel base es 6.25 veces más barato en entrada y 8.65 veces más barato en salida. Alibaba acaba de recortar su propio suelo de precios en visión en un orden de magnitud con un solo lanzamiento, sea lo que sea lo demás cierto sobre este lanzamiento.

Aquí "Flash" significa barato, no rápido

Aquí es donde el nombre confunde. Flash significa baja latencia en la línea de Google. Aquí significa precio bajo. Son productos muy distintos.

OpenRouter mide al único proveedor en 59 tokens de salida por segundo en P50, con 1.20s de tiempo hasta el primer token. Artificial Analysis mide Gemini 3.5 Flash-Lite en 382 tokens por segundo y GPT-5.4 mini en 177. Son arneses y condiciones distintas, así que hay que tomar la proporción con cautela. Aun así, una brecha de 6 veces sigue siendo demasiado amplia para ser ruido de medición, y que el razonamiento esté activado por defecto arrastra la cifra aún más hacia abajo.

Hay un dato discordante. Un desarrollador que lo probó en una herramienta de codificación reportó un rendimiento mucho mejor del que muestra la telemetría de OpenRouter:

"Qwen 3.7 flash is already available in Command Code. Cheap tiered pricing, super fast 150 TPS. // Capabilities include. 💬 Text input ✓ 👁️ Vision ✓ 🧠 Reasoning ✓ Testing it out. It's gonna be a fun competitor to DeepSeek V4 Flash."

Sus 150 TPS son aproximadamente 2.5 veces el P50 medido por OpenRouter, y con prompts cortos y una caché caliente eso es posible. Yo seguiría planificando sobre los 59, no los 150, porque el tráfico de producción es lo que está muestreando OpenRouter.

La cola es la parte que me quitaría el sueño. La latencia de extremo a extremo es de 3.56s en P50 y 8.54s en P75, lo cual está bien. Luego llega a 17.96s en P90, 29.03s en P95, y 90.19s en P99.

Gráfico de barras horizontal que muestra la latencia de extremo a extremo subiendo de 3.6 segundos en P50 a 90.2 segundos en P99
Gráfico de barras horizontal que muestra la latencia de extremo a extremo subiendo de 3.6 segundos en P50 a 90.2 segundos en P99

Para un trabajo por lotes esa cola es invisible. Para cualquier cosa que una persona esté esperando, que una de cada cien solicitudes tarde un minuto y medio deja de ser una métrica y se convierte en una decisión de producto. Y esto se agrava dentro de un bucle de agente de IA, donde una sola llamada de herramienta lenta bloquea cada paso posterior.

Dos cifras más del mismo panel. La tasa de error en llamadas de herramientas es del 8.88%, frente al 6.45% de Plus, lo que significa que aproximadamente una de cada once llamadas de herramienta falla en un modelo comercializado explícitamente para trabajo de agentes. Y hay exactamente un proveedor que lo ofrece. Sin enrutamiento de respaldo, entonces, si Alibaba Cloud tiene una mala tarde.

También hay un pequeño conflicto de documentación que no pude resolver. La ficha del modelo de Alibaba indica que las salidas estructuradas están soportadas. La lista de parámetros de OpenRouter no expone el indicador de salidas estructuradas para Flash, solo response_format, aunque sí lo expone para Plus y Max. Si la aplicación estricta de esquemas importa para tu proceso, pruébalo antes de comprometerte, en lugar de confiar en ninguna de las dos páginas.

El único benchmark independiente que existe

Qwen no publicó nada, así que fui a buscar a alguien que realmente lo hubiera puntuado. Existe exactamente uno.

Artificial Analysis no tiene listado este modelo. La página del modelo devuelve un 404, y un grep del mapa del sitio confirma que las únicas páginas de Qwen 3.7 son Max y Plus. LMArena tampoco tiene entrada para Flash. Ningún índice de inteligencia de las fuentes habituales, entonces, ni Elo, ni ninguna puntuación de calidad publicada de ningún tipo.

Las evaluaciones de visión de Roboflow son la excepción, y no son favorables:

TareaPuntuaciónPosición
General61.7%#22 de 23
Identificación84.4%#10 de 23
Transcripción OCR84.1%#23 de 23
Extracción de datos78.4%Sin clasificar
Detección de objetos42.8% mAP@50#16 de 23
Conteo de objetos46% coincidencia exactaSin clasificar
Coste por muestra~$0.0001#1 de 23

Queda en el puesto 22 de 23 en general con un 61.7%, justo detrás de GPT-5.4 mini con 63.5%, y primero de 23 en coste. Siendo justos: el resultado de OCR es el último puesto en un grupo muy reñido y no es un fallo, ya que un 84.1% de coincidencia media es respetable en términos absolutos. Y Qwen nunca afirmó OCR ni control de GUI como fortalezas de Flash. Eso pertenece a Plus. Así que "queda último en OCR" es coherente con lo que dijo Alibaba, en lugar de ser una promesa incumplida.

Pero sí aclara qué estás comprando exactamente. La identificación es su punto fuerte con un 84.4%; la localización es su punto débil con un 42.8%. Puede decirte qué hay en la imagen mucho mejor que dónde está. Si tu carga de trabajo es "etiquetar diez millones de imágenes por categoría", eso encaja de maravilla a una décima de centavo por cada mil muestras. Si es "leer esta factura y extraer las partidas", busca otra cosa.

Lo que dice la comunidad, y por qué hay tan poco

Esto es lo más extraño del lanzamiento, y creo que es lo más revelador.

Un modelo de visión a $0.03 por millón de tokens se lanzó hace cuatro días y no hay ni un solo comentario sobre él en Hacker News. Una búsqueda de texto completo en HN de qwen3.7-flash devuelve cero resultados entre historias y comentarios, en todo momento. Nunca se envió ningún hilo de lanzamiento. La única historia titulada con Qwen en ese periodo, "Qwen 3.7 or 3.8 30B – 100B. QWhen?", no atrajo ningún comentario.

Y hay más. La conversación viva de HN sobre Qwen la semana de su lanzamiento estaba ocurriendo dentro de un hilo de DeepSeek, donde la gente se preguntaba si Qwen alguna vez lanzaría visión, cuatro días después de que Qwen lanzara un modelo de visión.

Hacker News

"You have to remember DeepSeek v4 flash even though a bit cheaper, does not have vision abilities, which is a big draw for agentic tasks."

Hacker News

"Most interesting part IMO is whatever Qwen open weight will include image / video capabilities since its where they are strongest."

Ese segundo comentario apunta directamente a la razón. La audiencia que solía seguir los lanzamientos de Qwen es la comunidad de pesos locales, y Qwen dejó de atenderla. El mismo punto salió a la luz en un hilo sobre GLM 5.2:

Hacker News

"That's because Qwen's flagship models are not, in fact, open weight. Qwen3.7 Max, Qwen3.7 Plus and others are closed weight."

Flash también es cerrado. Hugging Face devuelve un array vacío para él, y Roboflow indica que la licencia es propietaria. Alguien todavía tenía esperanzas de lo contrario el día del lanzamiento:

"Qwen3.7 Flash vient de faire son apparition sur OpenRouteur, il y a une petite chance que Qwen3.7 soit bientôt dispo pour de l'IA locale !"

Eso se traduce como la esperanza de que Qwen 3.7 esté pronto disponible para IA local. No lo estará.

Debo ser honesto sobre qué es esta sección. Ninguna de estas citas trata sobre Flash, porque todavía no existen citas así. Tratan sobre la familia 3.7 y el hueco que Flash fue construido para llenar. Los veredictos sobre la familia van en ambas direcciones, desde un comentarista de HN que reporta un mes de uso diario y califica a 3.7 Pro como "totalmente inutilizable", hasta chewz, que califica a 3.7 Max por encima del nivel de Opus en velocidad. Una frase de ese hilo se me quedó grabada, dado que Qwen no publicó ningún benchmark en absoluto para Flash:

Hacker News

"Another thing I experience with the Qwen models is that I do not trust their benchmark scores at all."

Hay cierta simetría en lanzar un modelo sin puntuaciones de benchmark a una audiencia que había dejado de creer en ellas.

Mientras tanto, la gente lo está usando en silencio. El panel de actividad de OpenRouter muestra a Hermes Agent como el mayor consumidor, por delante de Claude Code y un puñado de herramientas de codificación. El uso es real; el discurso simplemente nunca ocurrió.

Quién debería usarlo realmente

Mi opinión, sin rodeos.

Recúrrele si ejecutas trabajo de visión de alto volumen y bajo riesgo, donde equivocarse de vez en cuando sale barato y que sea caro resulta fatal. Etiquetado masivo de imágenes. Clasificación de contenido de primera pasada, selección de miniaturas, "¿hay una persona en este fotograma?", filtrado previo antes de que un modelo mejor haga la pasada cuidadosa. A aproximadamente una centésima de centavo por muestra, cambia lo que resulta económicamente viable procesar, y eso es importante.

Sáltatelo si necesitas OCR o extracción de documentos, localización precisa de objetos, latencia predecible, pesos que puedas alojar, o cualquier señal de calidad publicada que mostrar a un interesado. Sáltatelo también si tus prompts son habitualmente largos, porque en ese punto GPT-5.6 Luna, tras su recorte de precio del 80%, empieza a parecer razonable, y lo mismo pasa con Gemini 3.5 Flash-Lite. Ambos son también mucho más rápidos.

Si quieres específicamente la familia Qwen pero necesitas más capacidad, Qwen 3.8 Max está en el otro extremo del rango, y nuestro resumen de alternativas a Qwen cubre el resto.

El factor decisivo es si una respuesta incorrecta te cuesta algo. Esa es una cuestión de producto más que de benchmark, y es la pregunta que yo resolvería antes de escribir cualquier código de integración.

Si esto va a acercarse a una cola de soporte, lee esto primero

Aquí tengo que ser directo, porque esta es la parte donde de verdad tengo cicatrices.

Construyo integraciones en eesel, y llevamos años ejecutando IA en colas de soporte reales a través de miles de tickets de verdad. El malentendido más caro que veo es precisamente el que fomenta la tabla de precios de este artículo: creer que el modelo es el producto. Un modelo de $0.03 hace que construir tu propio bot de soporte parezca casi gratis. Las cuentas de coste por ticket también se ven estupendas en una hoja de cálculo. Pero el modelo nunca fue la parte cara.

Las partes caras son la recuperación de información sobre un centro de ayuda que se contradice a sí mismo, la clasificación de tickets que enruta al lugar correcto, y saber cuándo callarse. El escalado que no deja tirado al cliente. Una forma de descubrir que te has equivocado antes de que lo descubra el cliente. Nada de eso viene incluido en el precio por token. Lo aprendimos por las malas al ver bots que sonaban seguros dando respuestas confiadamente erróneas, razón por la cual ahora cada implementación que hacemos se simula contra tickets históricos antes de tocar una cola real.

No voy a fingir que a nadie le funciona la vía de construirlo por su cuenta. Parte de nuestras propias bajas es exactamente esto: clientes que se fueron para construir directamente sobre una API de LLM, incluyendo una empresa de tecnología de construcción/RA y una marca de belleza DTC. Es una opción real, y a veces la correcta. Pero los equipos que lo analizaron más a fondo normalmente acabaron en otro sitio. Un líder de ingeniería en una empresa de hardware de cajeros automáticos de Bitcoin, que gestiona una base de conocimiento de 300 artículos repartida entre Confluence y Telegram, lo expresó así:

"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."

Y lo que realmente decide si la IA de soporte funciona es la contención, algo que ninguna puntuación de modelo captura. Un responsable de CX en una marca que gestiona 7,000 tickets al mes lo formuló mejor que cualquier benchmark:

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

Ahora pon a Qwen 3.7 Flash a la altura de ese listón. Una tasa de error en llamadas de herramientas del 8.88%, un P99 que se estira hasta 90 segundos, y ninguna puntuación de calidad publicada, además de ninguna evaluación independiente salvo una que lo sitúa 22º de 23. Son cifras perfectamente aceptables para etiquetar un millón de imágenes. No son las cifras que yo querría entre mi marca y un cliente molesto. La guía de desvío de tickets y nuestras notas sobre la tasa de resolución de IA profundizan en por qué el umbral de confianza importa más que el modelo en bruto.

Si de todos modos quieres ir por la vía de construirlo, empezaría con RAG frente a ajuste fino, y después leería sobre el entrenamiento en la base de conocimiento. Luego dedicaría tiempo de verdad a prevenir alucinaciones. Ninguno de esos problemas se abarata cuando lo hacen los tokens.

Prueba eesel

Si lo que realmente querías de un modelo de $0.03 era automatización de soporte más barata, puedes saltarte el montaje. eesel se conecta al helpdesk que ya usas y aprende de tus tickets pasados y tu centro de ayuda, y luego responde a las preguntas de las que está seguro, dejando el resto en paz.

La parte que vale la pena robar, sea cual sea lo que construyas: antes de que nada salga a producción, lo ejecutas contra tu historial real de tickets y obtienes un informe puntuado de lo que habría respondido. Así es como descubres que un modelo se equivoca sin que lo descubra primero un cliente. Es la comprobación que ningún precio por token puede comprarte.

El panel de informes de eesel mostrando el volumen de tareas, eventos desencadenantes por tipo, y el uso de aprobación o rechazo por herramienta
El panel de informes de eesel mostrando el volumen de tareas, eventos desencadenantes por tipo, y el uso de aprobación o rechazo por herramienta

Puedes probar eesel gratis, o reservar una demo si prefieres verlo funcionar primero contra tu propia cola.

Preguntas frecuentes

¿Cuánto cuesta Qwen 3.7 Flash?
Empieza en $0.03 por 1M de tokens de entrada y $0.13 por 1M de tokens de salida, pero solo para prompts de menos de 32K tokens. Por encima de 32K pasa a $0.10/$0.40, y por encima de 256K pasa a $0.20/$0.80. La media móvil de 30 días de OpenRouter sobre lo que realmente pagan los clientes es de $0.044 de entrada y $0.149 de salida, cifras superiores al precio de lista. Para más contexto sobre el resto de la familia, consulta nuestro desglose de precios de Qwen.
¿Es bueno Qwen 3.7 Flash para OCR?
Las evaluaciones de visión de Roboflow lo sitúan en el último puesto de 23 modelos en transcripción OCR, aunque con un 84.1% de coincidencia media en un grupo muy reñido. Qwen nunca afirmó que el OCR fuera un punto fuerte de Flash, así que esto es coherente y no una promesa incumplida. Si la tarea es leer documentos, este no es el modelo al que recurrir.
¿Los pesos de Qwen 3.7 Flash son de código abierto?
No. Hugging Face no devuelve ningún repositorio para él y Roboflow indica que la licencia es propietaria, por lo que solo está disponible vía API. Toda la línea 3.7 de Qwen tiene pesos cerrados, un cambio respecto a la reputación anterior de la empresa. Si necesitas pesos que puedas alojar tú mismo, nuestro resumen de los mejores agentes de IA de código abierto es un mejor punto de partida.
Qwen 3.7 Flash frente a Gemini 3.5 Flash-Lite: ¿cuál es más rápido?
Gemini, por un amplio margen. Artificial Analysis mide a Flash-Lite en 382 tokens de salida por segundo, mientras que OpenRouter mide a Qwen 3.7 Flash en 59. Qwen gana claramente en precio y pierde claramente en velocidad. Las cifras completas están en nuestro artículo de precios de Gemini 3.5 Flash-Lite.
¿Puedo usar Qwen 3.7 Flash para atención al cliente?
Puedes invocarlo, pero un modelo en bruto no es un agente de soporte. Sigues necesitando recuperación de información sobre tu centro de ayuda, reglas de escalado y una forma de probarlo antes de ponerlo en producción. Nuestra guía para elegir un LLM para soporte cubre las contrapartidas, y la prevención de alucinaciones cubre la parte que realmente muerde.
¿Qué pasa si Qwen 3.7 Flash deja de funcionar?
Solo un proveedor lo ofrece, así que no hay enrutamiento de respaldo. OpenRouter reporta un 99.99% de tiempo de actividad en tres días, una ventana corta para un modelo tan nuevo. Su latencia P99 de extremo a extremo de 90.2 segundos es el riesgo práctico mayor, especialmente dentro de un bucle de agente, donde una llamada de herramienta lenta bloquea todo lo que viene detrás. Consulta gestión de escalado de IA para saber cómo manejar el camino del fallo.

Share this article

Rama Adi Nugraha

Article by

Rama Adi Nugraha

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Ilustración de dos personas revisando tarjetas de precios escalonados en una pantalla, con el logo de Qwen
Trending

Precios de Qwen 3.7 Flash: lo que realmente pagas en 2026

La tarifa de $0.03 es real, y es solo uno de los cuatro medidores de tu factura. Aquí te explicamos cómo el tramo del prompt, la caché, la región de batch y la tasa de reintentos se combinan en la cifra que realmente te cobran.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 31, 2026
Ilustración de paneles de imagen, video y documentos alimentando un modelo de visión y lenguaje, con el logo de Qwen
Trending

Qwen 3.7 Flash: especificaciones, precios y qué hace realmente

Qwen 3.7 Flash se lanzó sin entrada de blog, sin benchmarks y sin pesos. Aquí está la hoja de especificaciones completa, los precios escalonados y lo que Qwen nunca afirmó.

Alicia Kirana UtomoAlicia Kirana UtomoJul 31, 2026
Ilustración editorial de un modelo de lenguaje grande razonando sobre un largo flujo de documentos
Trending

Análisis de Kimi K3: el modelo de frontera abierto de Moonshot, puesto a prueba

Un análisis práctico de Kimi K3: la arquitectura del modelo abierto de 2,8 billones de parámetros, sus benchmarks, el precio real y lo que piensa realmente la comunidad en la semana de lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoJul 21, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Banner principal del análisis de Gemini 3.5 Pro en azul Google
Trending

Análisis de Gemini 3.5 Pro: el estado honesto del buque insignia de Google

Un análisis honesto de Gemini 3.5 Pro: todavía no ha salido. Esto es lo que Google ha confirmado, por qué llega tarde, los benchmarks que sí existen y qué usar hoy.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab
Trending

Inkling explicado: el modelo de IA de pesos abiertos de Thinking Machines

Qué es realmente Inkling: el primer modelo de pesos abiertos de Thinking Machines Lab, sus benchmarks reales, cuánto cuesta ejecutarlo y si tiene algo que hacer cerca de una cola de soporte.

Alicia Kirana UtomoAlicia Kirana UtomoJul 20, 2026
Ilustración que representa el gran modelo de lenguaje Kimi K3 de Moonshot AI
Trending

Kimi K3 explicado: el modelo de frontera abierto de Moonshot

Una guía clara sobre Kimi K3, el modelo abierto de 2,8 billones de parámetros de Moonshot AI: qué es, cómo rinde, cuánto cuesta y si vale la pena cambiarse a él.

Alicia Kirana UtomoAlicia Kirana UtomoJul 17, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis