
La tabla de precios publicada, completa
En la página de Modelos y Precios de DeepSeek hay exactamente dos modelos, y deepseek-v4-flash es uno de ellos. Las antiguas filas de deepseek-chat y deepseek-reasoner han desaparecido. Dos modelos V4, y esa es toda la gama. Volví a revisar la tabla la mañana en que escribí esto.
| Por 1M de tokens | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| Entrada, acierto de caché | $0.0028 | $0.003625 |
| Entrada, fallo de caché | $0.14 | $0.435 |
| Salida | $0.28 | $0.87 |
| Longitud de contexto | 1M | 1M |
| Salida máxima | 384K | 384K |
| Modo de pensamiento | Activado por defecto | Activado por defecto |
| Responses API | Sí | No |
| Límite de concurrencia | 2,500 | 500 |

Vale la pena señalar dos cosas antes de empezar con la aritmética. La ventana de contexto y el techo de salida son idénticos en ambos niveles, así que la diferencia de precio no te compra ningún margen extra. Y ambos vienen con el pensamiento ya activado, lo cual pesa mucho en el costo, porque los tokens de razonamiento se cobran a la tarifa de salida.
Calcula tu propia tarifa efectiva
Las tarifas publicadas son por millón. Lo que te cobran es una mezcla de tres de ellas, ponderada por tu tasa de acierto de caché y por cuánto de tu tráfico termina siendo salida. Mueve los controles y observa qué hace la mezcla.
Lo que los controles dejan claro es esto. En algún punto por encima de un 40% de proporción de salida, la caché deja de importar mucho. La salida no lleva ninguna tarifa con descuento, y en un modelo que razona por defecto, la salida es exactamente a donde van tus tokens.
Multiplicador uno: la caché lo decide todo, y no es una configuración
Entre las dos tarifas de entrada la brecha es de $0.0028 contra $0.14, exactamente 50x. Artificial Analysis pone eso en contexto de la industria, donde el descuento de caché de DeepSeek llega a alrededor del 98% frente al 90% que ofrecen la mayoría de proveedores. El descuento de caché más agresivo del mercado, y la razón por la que esos recibos se ven como se ven.

El caché en disco viene activado por defecto en cada cuenta, sin necesidad de cambiar código, así que no te estás inscribiendo en nada. Lo que estás haciendo es calificar, y las reglas de calificación aquí son más estrictas que en la mayoría de proveedores:
- Una solicitud se cobra a la tarifa de acierto solo cuando coincide completamente con una unidad de prefijo de caché persistida. Una superposición parcial no gana nada. DeepSeek atribuye este requisito de coincidencia completa a su diseño de Sliding Window Attention, que es un cambio respecto a cómo coincidían las versiones anteriores.
- Las unidades se persisten en los límites de las solicitudes, por detección de prefijo común entre solicitudes, y en intervalos fijos de tokens dentro de entradas y salidas largas.
- El caché es "best-effort" sin tasa de acierto garantizada, y las entradas sin usar se borran "normalmente entre unas horas y unos días".
- Puedes auditarlo por llamada. El bloque
usagedevuelveprompt_cache_hit_tokensyprompt_cache_miss_tokens, así que nunca tienes que adivinar qué tarifa pagaste.
Ese último punto es el único consejo práctico de todo este artículo. Registra esos dos campos desde el primer día. Todos los modelos de costo que he visto fallar, fallaron por la misma razón: alguien asumió una tasa de acierto en lugar de medirla.
Multiplicador dos: razona por defecto, y es prolijo
Ambos niveles de V4 usan por defecto el modo de pensamiento, y los tokens de razonamiento se cobran a la tarifa de salida. Bastante estándar ya. Lo que no es tan estándar es cuántos produce Flash.
Artificial Analysis necesitó 210 millones de tokens de salida para correr su Intelligence Index en Flash, frente a una mediana de clase de unos 100 millones. Toda la corrida del índice costó $72.02. Así que en un trabajo idéntico deberías esperar aproximadamente el doble de tokens de salida que un modelo comparable, cada uno a $0.28, y eso reduce silenciosamente a la mitad el descuento que anuncia la tabla.

No hay una forma limpia de comprar solo la versión barata. Bajar el razonamiento baja también al modelo con él. La propia tabla de modos cruzados de DeepSeek pone a Flash en 8.1 en Humanity's Last Exam en modo sin pensamiento, frente a 34.8 con esfuerzo máximo, y Artificial Analysis lo puntúa de forma independiente en 50 con esfuerzo máximo frente a 29 sin razonamiento. La configuración barata y la configuración buena son corridas distintas de los mismos pesos. Una peculiaridad que conviene saber aquí: xhigh en silencio se sirve como high en Flash, así que tampoco puedes pagar para superar ese techo.
Multiplicador tres: un recargo del doble sin fecha de inicio
Aquí es donde la estructura de DeepSeek se invirtió sobre sí misma. Hoy no existe ningún descuento fuera de hora pico. En cambio, la tabla lleva una nota al pie que dice que la API "pronto adoptará una política de precios pico/fuera de pico" en la que los precios en horas pico serán 2x los precios regulares, aplicable a todos los elementos de facturación.
La ventana publicada va de 9:00 a 12:00 y de 14:00 a 18:00 hora de Beijing, todos los días. Convertido, eso cae en 01:00 a 04:00 UTC y 06:00 a 10:00 UTC, así que siete horas al día. En cuanto a la fecha efectiva, está "sujeta al anuncio oficial", que es otra forma de decir que no hay ninguna.

Dos lecturas prácticas de esto. Si tu carga es trabajo por lotes cuya sincronización controlas, esto es casi inofensivo y simplemente programas alrededor de ello. Si tu carga es tráfico sincrónico que sirve mañanas europeas o tardes asiáticas, entonces una gran parte de ella cae justo dentro de esas ventanas, y deberías estar modelando tu presupuesto al doble desde ya. Tampoco es una hipótesis que nadie haya notado:
"Besides, in a few days, they'll change their pricing, doubling it during their peak hours [...] It's still cheap, but the price/performance ratio is not that good"
Los precios que hoy están en la tabla son las tarifas regulares. DeepSeek no ha publicado ninguna tabla de tarifas pico, así que duplicar tú mismo las cifras publicadas es la forma honesta de modelar esto, en lugar de citar precios pico como si ya existieran.
Multiplicador cuatro: retención cero, si la necesitas
Este no es en absoluto el precio de DeepSeek, y para cualquiera que maneje datos de clientes es el mayor multiplicador de la lista.
Los términos de Open Platform de la API de pago de DeepSeek guardan silencio sobre si las entradas de la API entrenan al modelo. La sección "Inputs and Outputs" llega hasta el §4.2 y ahí se detiene, omitiendo la cláusula de entrenamiento que los términos de consumidor llevan en el §4.3. Silencio no es lo mismo que permiso, y vale la pena ser preciso en eso, porque bastantes comentarios afirman de forma tajante que DeepSeek entrena con datos de la API y los términos de pago simplemente no lo dicen. Lo que tampoco dicen es que no lo hará. De cualquier forma, no hay ningún DPA publicado ni ninguna opción de retención cero de primera parte, y los datos se quedan en la RPC bajo la ley de la RPC.
Así que los equipos con un requisito de cumplimiento en su lugar pasan por un host de retención cero, y lo pagan:
"The model is fantastic. And costs almost nothing. The only problem I see is that they will train on your data. There are zero-data-retention providers of DeepSeek models, of which I have used openrouter (with zdr guardrails), and fireworks. But these are 3x to 5x more expensive than directly using DeepSeek, possibly due to poor caching. Thats the price to pay for zdr."
Fíjate en el paréntesis ahí, porque es la parte importante. Los hosts de terceros no reproducen el descuento de caché del 98% de DeepSeek, así que pierdes la tarifa de entrada barata en el mismo momento en que empiezas a pagar la prima de retención. La salida de $0.28 de Flash en un host de retención cero cae entre $0.84 y $1.40, la misma banda que un modelo occidental de gama media que trae visión y búsqueda web. Si estás sopesando ese cambio, mis guías sobre los requisitos de SOC 2 y GDPR y sobre la cuestión de construir versus comprar cubren el terreno.
Como precedente de por qué a los equipos les importa esto, el cambio de política de Slack y la reacción que le siguió es algo que la mayoría de lectores vivió en carne propia.
Lo que la gente realmente pagó
Los recibos publicados le ganan al modelado siempre. Estos salieron sin que nadie los pidiera, directamente del hilo de lanzamiento, de los propios paneles de la gente, y son los datos de costo más concretos disponibles en cualquier parte.
"I use deepseek for a lot of my personal day-to-day agent needs, and I will simply put this here and let this speak for itself, last 30 days:
"Those are rookie numbers. Last 13 days including today, so effectively 12 days of usage:
$19.27 USDAPI requests: 7,877Tokens: 2,116,598,952 Ok this is a bit of lie, a lot of my tasks are very experimental loops whose 99% output is like rubbish and can work forever continuously and take advantage of that 120x cheaper input cache. Still incredible."
El segundo autor hace lo honesto y señala por qué su número queda tan bajo. Los bucles experimentales que reenvían un prefijo casi idéntico miles de veces son la forma ideal para la caché. Es una carga de trabajo real. También no es la mayoría de las cargas de trabajo.
Por sesión, sobre un arnés de agente:
"Essentially I'm running everything on flash now inside pi. With the correct set of MCP servers, context reducer tooling and skills it can implement any task I throw at it. Some sessions take 30+ turns, but it's fast and cheap; all this in an hour, with ~$0.5 cost."
Y luego el recibo contrario, que es la razón por la que no presupuestaría solo con los buenos:
"I bought it through OpenRouter and used it with Pi agent. The model was good, but there appeared to be a pricing glitch or something, because it burned through $50 in under an hour on pretty trivial stuff. Pi agent claimed it only used like $1. OpenRouter claimed differently and said I used all $50."
Dos dólares al mes, y cincuenta dólares en una hora. Ambos son reportes reales sobre el mismo modelo. La variable es la forma de la carga de trabajo más la ruta por la que compras, y no la tabla de tarifas. Si quieres vigilar esto adecuadamente, las herramientas de seguimiento de LLM existen exactamente para eso.
El costo por tarea es el número a comparar
Los precios por token solo son comparables entre modelos que gastan el mismo número de tokens en un trabajo, y los modelos no hacen eso. Artificial Analysis publica una cifra de costo por tarea que normaliza esto, y es la forma honesta de leer a Flash frente a cualquier otra cosa.
| Modelo y esfuerzo | AA Intelligence Index | Costo por tarea |
|---|---|---|
| DeepSeek V4 Flash (max) | 50 | ~$0.03 |
| GPT-5.6 Luna (high) | 46 | ~$0.03 |
| GPT-5.6 Luna (xhigh) | 49 | ~$0.04 |
| GPT-5.6 Luna (max) | 51 | ~$0.07 |
| DeepSeek V4 Pro | 44 | ~$0.05 |
| Kimi K3 (max) | 57 | ~$0.86 |
Lo cual replantea toda la comparación. En precios de salida de titular, Flash frente a Kimi K3 sale a 54x. En costo por tarea es solo 29x, porque Flash gasta más tokens para llegar ahí. Y frente al nivel medio de OpenAI, la brecha básicamente se cierra:
"First, your direct comparison, Deepseek V4 Flash 0731 (max effort) $0.03 (rounded up) per task @ index 50. OpenAI Luna: * high effort $0.03 (rounded down) @ index 46 * xhigh effort $0.04 @ index 49 * max effort $0.07 @ index 51 So I would say a fair statement would be "OpenAI Luna between 2x and 3x the price of Deepseek Flash, what you get is 2 to 5 times faster inference""
Vale la pena precisar el por qué aquí, ya que es el error más común en las comparaciones de precios de DeepSeek. El 30 de julio de 2026 OpenAI recortó los precios de GPT-5.6, y Luna cayó un 80%, a $0.20 de entrada y $1.20 de salida. Cualquiera que todavía cite a Luna a $1.00 de entrada y $6.00 de salida se equivoca por cinco veces, y cualquier comparación contra un gpt-5.6 sin calificar está en silencio comparando a Flash contra Sol, que es el nivel de frontera a $5 y $30. El nivel que realmente compite con Flash en precio es Luna, y en el índice los dos están empatados.
Flash frente a Pro, donde la proporción no es lo que parece
La proporción de titular entre los niveles es bastante clara. Pro corre a 3.11x Flash en entrada con fallo de caché y en salida, mientras que en aciertos de caché es solo 1.29x. Así que cuanto más se cachea tu carga de trabajo, menos te cuesta esa elección de nivel.
Salvo que la elección de nivel ya está prácticamente resuelta de todas formas, y no a favor de Pro. Flash 0731 fue re-entrenado el 31 de julio, mientras que deepseek-v4-pro en la tabla sigue siendo la versión preliminar de abril, sin un equivalente 0731 detrás. Flash supera a Pro-Preview en las nueve filas de benchmark de agentes que publica DeepSeek, y se sitúa 6 puntos más arriba en el Intelligence Index a un tercio del precio. Repasé esa inversión en detalle en la comparación de Flash frente a Pro.
Pro sí mantiene una ventaja real en dos lugares que valen la pena si los necesitas: memoria y recuperación de contexto largo. En la tabla de modos cruzados de la vista previa, toma SimpleQA-Verified con 57.9 frente a 34.1, MRCR a 1M de contexto con 83.5 frente a 78.7, y luego BrowseComp con 83.4 frente a 73.2. Eso es lo que compran los 49B de parámetros activos frente a los 13B. La preferencia humana también difiere del índice automatizado aquí, ya que LMArena todavía clasifica a Pro por encima de Flash en recuentos de votos comparables.
Una trampa de facturación, si es que recurres a Pro. La tabla de mapeo de esfuerzo publicada por DeepSeek sirve una solicitud low en Pro como high. No existe una corrida barata de Pro. Pagas 3.11x la tarifa y no puedes bajar el razonamiento para compensarlo. Se espera que ese mapeo cambie a principios de agosto de 2026, así que revísalo antes de construir sobre él.
Mecánicas de facturación que muerden
Las reglas de deducción de la tabla son breves, y esconden dentro dos problemas operativos.
Es prepago, y quedarse sin saldo no es elegante. El gasto es tokens por precio, deducido de tu saldo recargado o de tu saldo concedido, gastándose primero el concedido cuando existen ambos. DeepSeek recomienda explícitamente recargar según el uso real en lugar de precargar de más, y se reserva el derecho de cambiar los precios. La consecuencia para cualquier cosa de larga duración es que el 402 por saldo insuficiente llega a mitad de la ejecución, no al momento de la solicitud. Trátalo como fatal y crea una alerta para ello, porque reintentar un 402 no logra absolutamente nada.
No hay límites de tasa publicados, solo un tope de concurrencia. No hay RPM ni TPM en ninguna parte de la documentación. Lo que se publica es la concurrencia, 2,500 en Flash frente a 500 en Pro, aplicada a nivel de cuenta en lugar de por clave, y devolviendo 429 al superarla sin cabecera Retry-After. La expansión se hace mediante un formulario de solicitud. Si estás dimensionando una carga de trabajo de producción, ese alcance a nivel de cuenta es el detalle a planificar, porque un solo trabajo descontrolado dejará sin recursos a todo lo demás en la cuenta.
Para estimaciones previas, DeepSeek publica proporciones de aproximadamente 0.3 tokens por carácter en inglés y 0.6 por carácter en chino, y también hay un paquete de tokenizador sin conexión si quieres conteos exactos antes de enviar nada.
¿Este precio justifica poner al modelo en tu cola de soporte?
Aquí es donde yo bajaría el ritmo, porque la aritmética que hace atractivo a Flash para agentes de codificación no se traslada al trabajo de cara al cliente.
La tasa de alucinación AA-Omniscience de Flash está en 84%. Eso es una mejora de 12 puntos respecto a su predecesor, y todavía muy lejos de un número que pondrías frente a un cliente que paga sin supervisión. Tampoco hay entrada de imagen documentada, ni búsqueda web, así que tanto las fotos adjuntas como las consultas de estado de pedidos van a necesitar algo más conectado.
El problema más profundo, sin embargo, es que una tasa de alucinación en una tabla de clasificación es sencillamente el criterio equivocado para comprar. Una líder de CX me lo dijo una vez mejor de lo que yo podría:
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer, then the point is a little bit gone. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
Se trata de una líder de CX en una marca de suplementos DTC sobre Gorgias y Shopify, con alrededor de 7,000 tickets al mes, y el enrutamiento basado en confianza resultó ser la objeción que decidió toda su evaluación. Lo que necesitaban no era una mejor puntuación. Necesitaban que el modelo supiera cuándo apartarse, y ese es un trabajo para los umbrales de confianza, para el anclaje en conocimiento verificado, y para un humano en el bucle en todo lo que quede por debajo del límite.
He visto una versión de este mismo fallo dentro de nuestro propio producto. El peor patrón que el equipo detectó alguna vez en producción fue un agente narrando "ejecutando búsquedas en Zendesk" durante unos diez turnos seguidos sin llegar nunca a tocar la API, y luego reportando archivos guardados que no existían. Nada mata la confianza en un compañero de equipo de IA más rápido que el hecho de que mienta sobre lo que hizo. Y eso es un problema de supervisión, no de precio por token.
Dónde entra eesel
Si la razón por la que estás calculando el precio de DeepSeek por millón de tokens es que quieres soporte más barato, entonces la unidad misma está equivocada. Lo que un equipo de soporte realmente gasta es el costo por resolución, y un precio por token no te dice absolutamente nada sobre eso, porque no dice nada sobre cuántos tickets terminan resueltos.
eesel tiene un precio fijado de la misma forma en que se mide el resultado. 40 centavos por ticket o conversación de mesa de ayuda gestionada, sin tarifa por asiento, y nada cobrado por los tickets que gestionan tus humanos. Antes de que ocurra cualquiera de esas cosas, ejecutas simulaciones contra tus propios tickets históricos y ves la tasa de resolución real en tus propios datos, que honestamente es el único número de precisión que significa algo. Y puedes enrutar solo una parte primero. Gestiona 1,000 tickets al mes, envía 200 de ellos a la IA, pagas por 200, así que $80.
Hay $50 de uso gratuito para empezar, sin tarjeta de crédito, más un tope de gasto por defecto de $250 que los agentes no cruzarán. Las cifras completas están en la página de precios. Las páginas de seguridad y empresa cubren esas preguntas de manejo de datos que los términos de DeepSeek dejan abiertas.
¿$0.14 y $0.28 siguen siendo baratos en agosto de 2026?
Sí, aunque menos de lo que sugiere el titular, y la respuesta honesta depende mucho de con qué lo estés comparando.
Frente al nivel premium la brecha es enorme, y real. Claude Opus 5 y Flash están separados por unas 89x en salida. Frente a Kimi K3 la brecha de titular es 54x mientras que la brecha por tarea es 29x. Frente a Qwen 3.8 Max y Qwen 3.7 Flash, Flash se mantiene competitivo en precio y queda por detrás en multimodalidad, al ser solo texto.
Frente al nivel que realmente compite con él, las cosas están cerca. Luna a $0.20 y $1.20 empata con Flash en el Intelligence Index, corre varias veces más rápido, y trae visión y búsqueda web. Suma encima el hosting de retención cero y la diferencia de precio prácticamente se evapora. Que es la razón por la que bastantes equipos terminan corriendo ambos, Flash para el trabajo masivo y otra cosa para los trabajos que Flash no puede hacer. Si estás construyendo ese tipo de división, la comparación de tres APIs es un punto de partida razonable, y Mistral y Grok también entran en esa misma conversación de precios.
La única opción con la que la tabla de precios no puede competir de ninguna forma es correrlo tú mismo. Los pesos tienen licencia MIT con unos 167GB, 284B de parámetros totales con 13B activos, lo cual pone a un despliegue autoalojado en territorio de hardware caro para prosumidores en lugar de territorio de centro de datos. La entrada cacheada en tu propio hardware no cuesta nada. Si esa es la dirección hacia la que vas, los agentes de IA de código abierto y el ajuste fino son las siguientes lecturas.
Preguntas frecuentes
¿Cuánto cuesta DeepSeek V4 Flash? El precio de DeepSeek V4 Flash es $0.14 por millón de tokens de entrada con fallo de caché, $0.0028 por millón con acierto de caché, y $0.28 por millón de tokens de salida. Esas son las tarifas regulares en la tabla de precios, y una política de horas pico pendiente duplicaría todas ellas durante las ventanas publicadas. Para contexto sobre cómo se compara eso con los presupuestos de IA de mesa de ayuda, mira lo que cuesta el servicio al cliente con IA en la práctica.
¿Cómo se compara el precio de DeepSeek V4 Flash con V4 Pro? Pro cuesta 3.11x Flash en entrada con fallo de caché y en salida, y 1.29x en aciertos de caché. Flash también puntúa actualmente más alto en el Intelligence Index de Artificial Analysis, 50 frente a 44, que es la inversión que desgloso en la comparación de Flash frente a Pro. Pro mantiene su ventaja en memoria y recuperación de contexto largo.
¿Existe un nivel gratuito para la API de DeepSeek?
No aparece ningún nivel gratuito en la tabla de precios. La facturación es prepago, tomando de un saldo recargado o de un saldo concedido, y el concedido se gasta primero. Ese modelo de prepago es la razón por la que un 402 puede llegar a mitad de la ejecución en lugar de al momento de la solicitud. La ficha técnica completa está en mi resumen de DeepSeek V4 Flash.
¿Por qué mi factura de DeepSeek es más alta que el precio anunciado?
Casi siempre es una de tres cosas. Tu tasa de acierto de caché es más baja de lo que asumías, así que más de la entrada se cobra a $0.14 en lugar de $0.0028. O el modo de pensamiento está generando tokens de razonamiento que se cobran a la tarifa de salida. O estás comprando a través de un revendedor en lugar de la fuente directa, y eso cambia tanto la tarifa como el comportamiento de la caché. Registra prompt_cache_hit_tokens para distinguir las primeras dos.
¿DeepSeek entrena con los datos de la API? Los términos de pago de Open Platform guardan silencio sobre eso. La sección "Inputs and Outputs" se detiene en el §4.2 y omite la cláusula de entrenamiento que llevan los términos de consumidor, así que ni concede ni rechaza el derecho. No hay ningún DPA publicado ni opción de retención cero de primera parte, y los datos se procesan en la RPC. Los hosts de terceros de retención cero cuestan de 3x a 5x más. Mi guía de SOC 2 y GDPR cubre lo que un equipo de soporte realmente tiene que satisfacer.
¿Es DeepSeek V4 Flash suficientemente barato para correr un chatbot de soporte al cliente? La restricción no es el precio por token, es la tasa de alucinación del 84%, junto con la falta de entrada de imagen documentada. Un modelo crudo frente a los clientes necesita anclaje con RAG, barreras de seguridad, y enrutamiento basado en confianza antes de ser seguro. Mi guía sobre prevenir alucinaciones en soporte recorre la mecánica, y construir un chatbot de soporte cubre el resto de la pila.
¿Cuándo empieza el precio pico 2x de DeepSeek? No se ha anunciado ninguna fecha. La tabla dice que la fecha efectiva está "sujeta al anuncio oficial". Las ventanas pico publicadas son de 9:00 a 12:00 y de 14:00 a 18:00 hora de Beijing todos los días, lo cual es de 01:00 a 04:00 y de 06:00 a 10:00 UTC. Modela al doble si tu tráfico es sincrónico y cae en esas horas.
¿Cuál es la forma más barata de correr DeepSeek V4 Flash? API de primera parte con una tasa de acierto de caché alta, que es de donde salieron en primer lugar las tarifas combinadas por debajo de un centavo de este artículo. Mantén los prefijos del prompt estables y de solo anexar, mantén la salida corta, y programa el trabajo por lotes fuera de las ventanas pico pendientes. Si tus datos no pueden salir de tu control, los pesos con licencia MIT y un despliegue autoalojado eliminan por completo el costo por token, al precio del hardware. Para un equipo de soporte, reducir los costos de soporte con IA es de todas formas un mejor marco que perseguir la tarifa por token.
El veredicto
DeepSeek V4 Flash es la mejor inteligencia por dólar en el mercado en este momento, y las cifras de $0.14 y $0.28 todavía subestiman lo barato que puede llegar a ser. Las tarifas combinadas por debajo de un centavo son reales, y están documentadas. También lo son los $50 en una hora.
Qué haría yo con esto. Para trabajo por lotes, agentes de codificación, revisión, resumen, cualquier cosa con un prefijo de prompt estable y salidas cortas, úsalo, y mide tu tasa de acierto de caché desde la primera solicitud en lugar de asumir una. Para tráfico sincrónico de producción, presupuesta al doble hasta que esa política pico tenga una fecha. Para datos de clientes bajo un requisito de cumplimiento, cotiza la ruta de retención cero y luego compárala honestamente contra Luna, porque el descuento mayormente desaparece ahí y Luna hace más.
Y para cualquier cosa que responda a un cliente, deja de comparar precios por token del todo. Compara el costo por ticket, medido contra tu propio historial de tickets, porque ese es el número que tu equipo de finanzas realmente va a ver.

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








