Precios de Cohere Embed 5: lo que cuestan realmente Pro y Fast en 2026

Rama Adi
Escrito por

Rama Adi

Katelin Teen
Revisado por

Katelin Teen

Última edición October 1, 2026

Verificado por expertos
Ilustración de dos personas revisando un panel de precios de Cohere Embed 5 con el logotipo de Cohere

Precios de Cohere Embed 5 de un vistazo

Cohere lanzó la familia Embed 5 el 30 de septiembre de 2026 en dos niveles, y ambos comparten 128K de contexto y más de 100 idiomas, además de entradas que pueden ser texto, imagen o la combinación fusionada de texto e imagen. Repasé todos los precios publicados y los reuní en una tabla, tomados directamente de la página de precios de Cohere, la publicación del lanzamiento y los listados de los marketplaces en la nube:

OpciónPrecioFacturación porIdeal para
Clave de pruebaGratis, 1.000 llamadas/mesn/d (sin uso en producción)Pruebas
Embed 5 Pro, texto$0,12 / 1M de tokensTokens de entradaIndexar documentos
Embed 5 Fast, texto$0,08 / 1M de tokensTokens de entradaConsultas, bucles de agentes
Embed 5 Pro o Fast, imágenes$0,40 / 1M de tokensTokens de imagenImágenes de páginas, diapositivas
Model Vault Small (Pro o Fast)$3,00/h o $2.000/mesInstancia dedicadaVolumen alto y constante
Model Vault Medium (Pro o Fast)$5,00/h o $3.250/mesInstancia dedicadaVolumen muy alto
Amazon SageMaker$2,39 a $8,48/host/h de tarifa de software + instanciaHoraEquipos que ya usan AWS
Microsoft FoundryListado en vista previa, aún sin precion/dEquipos en Azure
Página de precios de Cohere con Embed 5 Pro a $0,12 y Embed 5 Fast a $0,08 por 1M de tokens, junto a Rerank 4 y Parse 5, tomada de Cohere
Página de precios de Cohere con Embed 5 Pro a $0,12 y Embed 5 Fast a $0,08 por 1M de tokens, junto a Rerank 4 y Parse 5, tomada de Cohere

La misma pestaña lista también Parse 5 a $1,50 por 1.000 páginas y Rerank 4 desde $2,00 por 1.000 búsquedas, y junto con Embed 5 forman todo el stack de recuperación que vende Cohere. Al leer las tarjetas, dos cosas me llamaron la atención. La primera: Model Vault cobra la misma tarifa por Pro y Fast, así que en una instancia dedicada desaparece toda la lógica de "Fast es más barato", y la única razón para elegir Fast ahí es la velocidad. La segunda: Embed 4 ha desaparecido por completo de la página de precios, aunque la documentación de modelos todavía lo lista sin aviso de obsolescencia. Si hoy usas Embed 4 no se rompe nada, pero la señal sobre dónde quiere Cohere que estés es bastante clara. (Mi reseña de Cohere AI cubre el resto de la gama.)

En eesel me dedico a construir integraciones, y la parte de eesel que convierte un centro de ayuda y unos años de tickets en algo que una IA puede buscar es exactamente esta capa. Así que cuando leo tarjetas de precios de embeddings, las leo como un fontanero lee un presupuesto de tuberías. El precio por unidad importa, claro, pero lo que de verdad estás valorando es todo aquello a lo que se conectan las tuberías.

Qué cambió respecto a Embed 4

La versión corta: Cohere mantuvo el precio y movió casi todo lo demás. Aquí va la comparación lado a lado, con las tarifas de Embed 4 de los precios de Cohere en Azure y la instantánea de precios de Cohere de agosto:

Embed 4Embed 5 ProEmbed 5 Fast
Texto, por 1M de tokens$0,12$0,12$0,08
Imágenes, por 1M de tokens$0,47$0,40$0,40
Model Vault Small$4,00/h, $2.500/mes$3,00/h, $2.000/mes$3,00/h, $2.000/mes
Dimensiones por defecto153620482048
Puntuación ViDoRe V3 (Cohere)77,085,884,5

Es decir, un salto de calidad de 8,8 puntos al mismo precio de texto, imágenes un 15 % más baratas y una instancia dedicada $500 al mes más barata. Fast, en cambio, no existía antes.

La fila que yo rodearía es la de dimensiones por defecto. El precio por token es el mismo, pero cada vector sale un tercio más grande por defecto. Si cambias de modelo y mantienes la configuración por defecto, tu factura de embeddings se queda igual y la de tu base de datos vectorial sube. Llegaré a la solución más abajo, ya que es sencilla y ahorra dinero de verdad.

Qué cuenta como token facturable

La documentación de facturación de Cohere dice que embed se factura según el número de tokens embebidos, y los tokens que Cohere añade internamente no se cobran. Solo pagas por la entrada. No hay ningún cargo por tokens de salida, ya que lo que devuelve una llamada de embedding es una lista de números y no texto.

Hay algunos detalles que conviene conocer porque moldean la factura real:

  • El batching no cambia el precio. Cada llamada de embed admite hasta 96 textos o entradas, lo que es bueno para el rendimiento, pero el coste por token sigue igual.
  • Las imágenes se facturan por token, pero la conversión no está publicada. La documentación explica el redimensionado (las imágenes de más de 2.458.624 píxeles se reducen), pero no da una fórmula de tokens por imagen. Conviene ejecutar primero una muestra pequeña antes de fijar un presupuesto para un archivo grande de PDF.
  • No hay un descuento por lotes indicado. La publicación del lanzamiento dice que el embedding por lotes está disponible, pero la guía de Embed Jobs aún dice que solo funciona con modelos v3.0. No planifiques con una tarifa de lotes del 50 % como la de Google.
  • Las claves de prueba son estrechas. El embedding de texto va a 2.000 entradas por minuto tanto en prueba como en producción, pero el de imágenes es de 5 entradas por minuto en prueba frente a 400 en producción.

Todo lo demás es aritmética simple: tokens de entrada por la tarifa. Es el mismo modelo de facturación que la API de OpenAI y la mayoría de los demás servicios de embeddings alojados.

El truco de indexar con Pro y consultar con Fast

Para mí es lo más útil de todo el lanzamiento, y en realidad es una característica de precio disfrazada de técnica. Pro y Fast comparten un espacio de embeddings, así que una consulta que Fast ha embebido puede buscar en un índice construido por Pro, sin reconstruir nada.

"For many customers, we recommend the following deployment pattern: index with Pro, query with Fast."

Cohere probó todas las combinaciones en 40 conjuntos de datos de desarrollo. Con una configuración totalmente Pro puntuada como 100, un índice Pro consultado con Fast obtuvo 98,4, un índice Fast consultado con Pro 97,3 y todo Fast 96,6. Hay una trampa escondida en las notas al pie: ambos lados deben usar la misma dimensión de salida.

Indexar una vez con Pro a $0,12 por 1M, consultar con Fast a $0,08 por 1M, conservando el 98,4 % de la calidad totalmente Pro
Indexar una vez con Pro a $0,12 por 1M, consultar con Fast a $0,08 por 1M, conservando el 98,4 % de la calidad totalmente Pro

¿Por qué importa para el coste? Porque en la mayoría de los sistemas de búsqueda y RAG (aquí tienes un pipeline RAG de soporte si quieres ver la forma completa), la indexación ocurre una vez (más las actualizaciones), mientras que las consultas ocurren para siempre. Así pagas la tarifa Pro en la parte que haces rara vez, y la tarifa Fast en la parte que haces cada segundo. Fast además procesó 377,3 documentos por segundo frente a 159,7 de Pro en la prueba de rendimiento de Cohere, de modo que las consultas son más rápidas además de más baratas.

Gráfico de barras del rendimiento de Embed 5: Fast con 377,3 documentos por segundo frente a Pro con 159,7, tomado de Cohere
Gráfico de barras del rendimiento de Embed 5: Fast con 377,3 documentos por segundo frente a Pro con 159,7, tomado de Cohere

Aquí es donde yo matizaría la lectura habitual, porque para la mayoría de los equipos el lado de las consultas es minúsculo. Un bot de soporte que atiende 30.000 preguntas al mes con unos 100 tokens cada una envía 3 millones de tokens de consulta: son $0,36 en Pro o $0,24 en Fast. El titular de que "Fast ahorra dinero" es real a escala de bucles de agentes, donde un modelo lanza decenas de búsquedas por tarea. Para un centro de ayuda normal, elige Fast por la latencia y deja de preocuparte por su coste.

El coste que la página de precios no muestra: almacenamiento vectorial

Cada vector que creas tiene que vivir en algún sitio, normalmente una base de datos vectorial, y ese sitio te factura cada mes. De todo un presupuesto de embeddings, esta es la parte que más veo subestimada, porque la API de embeddings es un coste único por documento mientras que la base de datos es un alquiler.

Embed 5 te permite elegir el tamaño de salida (256, 512, 768, 1024, 1536 o 2048 dimensiones) y el formato (float, int8, binary y algunas variantes). El ejemplo de Cohere: 100 millones de chunks con las 2048 dimensiones float por defecto ocupan 819 GB, mientras que 256 dimensiones binary ocupan 3,2 GB, es decir, 256 veces menos.

Almacenamiento para 100M de chunks: 2048-dim float a 819 GB cuesta unos $270/mes, 1024-dim int8 a 102 GB unos $34/mes, 256-dim binary a 3,2 GB unos $1/mes
Almacenamiento para 100M de chunks: 2048-dim float a 819 GB cuesta unos $270/mes, 1024-dim int8 a 102 GB unos $34/mes, 256-dim binary a 3,2 GB unos $1/mes

Puse precio a esos tres tamaños en el plan serverless de Pinecone a $0,33 por GB al mes (solo bytes de vector en bruto, antes de la sobrecarga del índice y los metadatos). Eso deja la diferencia en $270 al mes frente a $34 frente a aproximadamente $1. En dos años, la configuración float por defecto cuesta unos $6.500 solo en almacenamiento, más que los $6.000 que cuesta embeber 50.000 millones de tokens con Pro en primer lugar.

Lo que pierdes en calidad al reducir es menos de lo que imaginas. El gráfico de Cohere traza la calidad de recuperación frente al coste relativo de almacenamiento, y las líneas int8 quedan casi encima de las float. La propia recomendación de Cohere es int8 de 1024 dimensiones, y es también la configuración con la que yo empezaría.

Gráfico de Cohere de calidad de recuperación frente al coste relativo de almacenamiento vectorial para Embed 5 Pro, Embed 5 Fast y Voyage 4 Large en float32, int8 y binary, tomado de Cohere
Gráfico de Cohere de calidad de recuperación frente al coste relativo de almacenamiento vectorial para Embed 5 Pro, Embed 5 Fast y Voyage 4 Large en float32, int8 y binary, tomado de Cohere

Otras bases de datos fijan precios de otra manera, y con ellas cambia la forma de la factura. Weaviate Cloud cobra por millón de dimensiones vectoriales almacenadas (desde $0,00465 en Flex), así que 2048 dimensiones cuestan literalmente el doble que 1024. Pinecone además cobra de $16 a $18 por millón de unidades de lectura en Standard, con un mínimo mensual de $50, y para índices pequeños eso importa más que el almacenamiento. Comparé las opciones de bases de datos con más detalle en mi desglose de precios de Weaviate y en el repaso de alternativas a Weaviate.

Si prefieres no gestionar una base de datos en absoluto, la opción alojada de OpenAI se cubre en mi guía de vector stores, aunque te ata a los propios modelos de embeddings de OpenAI.

Estima tu factura de Embed 5

Introduce aquí tu propio corpus y tu propio tráfico. La calculadora usa las tarifas publicadas de la API y la tarifa de almacenamiento de Pinecone de $0,33/GB, así que la línea de almacenamiento conviene tomarla como un mínimo.

Prueba a pasar de int8 de 1024 dimensiones a float de 2048 dimensiones, que son los valores por defecto de Embed 5. Con un millón de chunks la factura de indexación no se mueve en absoluto, mientras que la línea de almacenamiento se multiplica por 8.

API vs Model Vault vs marketplaces en la nube

Model Vault cambia el contador por token por un alquiler fijo de una instancia dedicada de un solo inquilino. La cuenta del punto de equilibrio es bastante sencilla:

InstanciaMensualEquilibrio en ProEquilibrio en Fast
Small$2.000~16.700M tokens/mes~25.000M tokens/mes
Medium$3.250~27.100M tokens/mes~40.600M tokens/mes

Dieciséis mil millones de tokens al mes son unos 550 millones al día. Muy pocos equipos embeben tanto, así que para casi todos la API sigue siendo la opción más barata. Cohere tampoco publica cuántos tokens puede mover al mes una instancia Small, así que consulta el rendimiento con ventas antes de asumir que una instancia cubrirá tu pico.

Aun así la gente compra Model Vault, y el motivo es más el control que el precio. No hay multitenencia compartida y el rendimiento está garantizado, lo que también da un argumento más limpio para las revisiones de seguridad. Encaja con todo el planteamiento de Cohere en torno al despliegue empresarial. Si necesitas que funcione por completo dentro de tu propia red, ambos modelos pueden alojarse por tu cuenta en vLLM mediante un despliegue privado, con el precio fijado por ventas.

Los marketplaces son una tercera vía. En Amazon SageMaker, Embed 5 se factura como una tarifa de software por hora y host ($2,39 en una ml.g5.xlarge, hasta $8,48 en la instancia Pro más grande) más la propia instancia de SageMaker. Microsoft Foundry lista ambos modelos en vista previa, aún sin precio. Amazon Bedrock y Oracle OCI solo tienen Embed 4 a fecha del 1 de octubre, a $0,12 por 1M de tokens en Bedrock. Si tu empresa tiene gasto en la nube comprometido, la vía del marketplace puede seguir teniendo sentido aunque la tarifa en bruto sea peor.

Ejemplos prácticos: lo que paga un equipo real

A continuación, tres escenarios con las tarifas publicadas y almacenamiento int8 de 1024 dimensiones salvo que indique otra cosa.

El centro de ayuda y el historial de tickets de un equipo de soporte. 2.000 artículos de ayuda de unos 800 tokens y 50.000 tickets anteriores de unos 400 tokens suman 21,6 millones de tokens. Indexar con Pro cuesta $2,59, una sola vez. Las consultas, a 30.000 al mes en Fast, cuestan $0,24 al mes. Los vectores caben en el nivel gratuito de 2 GB de Pinecone. La factura de embeddings en este caso es un error de redondeo. El coste real está en la ingeniería para construir el chunking y la sincronización, más los permisos y la capa de LLM encima, el mismo compromiso que recorro en búsqueda semántica sobre Zendesk Guide.

Un archivo de documentos para una herramienta de búsqueda interna. 20 millones de chunks de 500 tokens son 10.000 millones de tokens. Indexar con Pro cuesta $1.200; con Fast serían $800. El almacenamiento en float de 2048 dimensiones es de unos 164 GB, o $54 al mes en Pinecone. Con int8 de 1024 son unos 20 GB, o $6,76 al mes. Cuando salga el próximo modelo, un reindexado cuesta otra vez los $1.200 completos, y si los PDF necesitan análisis previo, Parse 5 añade su propia factura por página.

Un agente de alto volumen que busca en cada paso. 500 millones de tokens de consulta al día son 15.000 millones al mes. En Fast son $1.200 al mes; en Pro, $1.800. Ninguno cruza la línea de $2.000 de Model Vault, así que la API sigue ganando a menos que necesites capacidad dedicada.

La lección de los tres: la API de embeddings casi nunca es la parte cara. Lo son el almacenamiento y el reindexado, y también las personas que mantienen el pipeline.

Cómo se comparan los precios de Embed 5

Alineé Embed 5 con los demás modelos de embeddings insignia, cada precio tomado de la página de precios del proveedor. Las puntuaciones son las cifras ViDoRe V3 de Cohere de su publicación del lanzamiento, así que léelas como la prueba de la propia Cohere y no como una independiente.

Precio por 1M de tokens de texto: Embed 5 Fast $0,08, Embed 5 Pro $0,12, Voyage 4 Large $0,12, OpenAI 3-large $0,13, Gemini Embedding 2 $0,20, con puntuaciones ViDoRe V3 informadas por Cohere
Precio por 1M de tokens de texto: Embed 5 Fast $0,08, Embed 5 Pro $0,12, Voyage 4 Large $0,12, OpenAI 3-large $0,13, Gemini Embedding 2 $0,20, con puntuaciones ViDoRe V3 informadas por Cohere
ModeloTexto / 1M de tokensLotesPlan gratuitoViDoRe V3 (Cohere)
Cohere Embed 5 Pro$0,12No indicadoPrueba de 1.000 llamadas/mes85,8
Cohere Embed 5 Fast$0,08No indicadoPrueba de 1.000 llamadas/mes84,5
Voyage 4 Large$0,1233 % de descuento200M de tokens83,7
Gemini Embedding 2$0,20$0,10Sí83,2
OpenAI text-embedding-3-large$0,13n/dNinguno75,5
OpenAI text-embedding-3-small$0,02n/dNingunon/d
Jina Embeddings v5$0,045 a $0,05n/d10M de tokens, no comercial74,5 (v5 Small)
Mistral embed$0,10n/dn/dn/d

Embed 5 Fast es el modelo más barato del grupo de mayor puntuación, y Pro iguala a Voyage 4 Large en precio mientras lo supera ligeramente en la prueba de Cohere. Gemini Embedding 2 cuesta 2,5 veces lo que Fast a tarifa completa, aunque su precio por lotes de $0,10 lo reduce mucho para la indexación offline (las tarifas completas, en mi guía de precios de Gemini). La API de embeddings de OpenAI cuesta un centavo más que Pro por una puntuación mucho más baja en este benchmark.

Gráfico ViDoRe V3 de Cohere: Embed 5 Pro 85,8, Embed 5 Fast 84,5, Gemini Embedding 2 83,2, Voyage 4 Large 83,7, Embed 4 77,0, Jina v5 Small 74,5, OpenAI text-embedding-3-large 75,5, tomado de Cohere
Gráfico ViDoRe V3 de Cohere: Embed 5 Pro 85,8, Embed 5 Fast 84,5, Gemini Embedding 2 83,2, Voyage 4 Large 83,7, Embed 4 77,0, Jina v5 Small 74,5, OpenAI text-embedding-3-large 75,5, tomado de Cohere

Hay dos salvedades honestas que señalar. Si el precio puro por token es tu único objetivo, 3-small de OpenAI y Voyage 4 Lite están ambos a $0,02, una cuarta parte de Fast. Y la propia tabla multilingüe de Cohere muestra a Gemini Embedding 2 por delante de Pro en 9 de los 10 idiomas asiáticos y de Oriente Medio que probó, con el telugu como mayor diferencia (91 vs 80). Si tu corpus está sobre todo en hindi, japonés o árabe, vale la pena probar Gemini antes de comprometerte. El modelo embed de Mistral a $0,10 es otra opción para datos europeos; consulta mis notas sobre los precios de Mistral AI. Para una lista más amplia, mi artículo de alternativas a Cohere AI compara a los proveedores más allá de los embeddings.

Qué dicen los desarrolladores

Embed 5 tiene un día mientras escribo esto, así que todavía no hay reseñas reales de usuarios. Lo que sí existe es un historial constante de los embeddings de Cohere en general, y el tema que sigue apareciendo es la fiabilidad:

Hacker News

"It has the most crisp, steady P50 of any external service I've used in a long time."

Las críticas suelen ser sobre el coste a gran volumen y sobre depender de una API cerrada, algo que es cierto en cualquier modelo de embeddings alojado:

G2

"The API can also become expensive when you start using it more frequently."

Reddit

"Voyage for embeddings + rerank is totally defensible - Cohere is popular partly because it's been the default in a lot of examples, not because it's always better."

Creo que lo último es justo, y los números de Embed 5 respaldan ambos lados: Pro gana el propio benchmark de Cohere, pero por 2,1 puntos sobre Voyage 4 Large al mismo precio. Si ya usas bien Voyage, no hay una razón urgente para migrar. Si estás en Embed 4, pasar a Embed 5 no cuesta nada extra por token y es casi una victoria pura. La integración de Cohere en LangChain convierte el cambio en una modificación de una línea del modelo, aunque tendrás que volver a embeber el corpus.

Qué camino de precios de Embed 5 te conviene

Estas son mis recomendaciones, según la situación:

  • Estás prototipando. Usa la clave de prueba y luego una clave de producción de pago por uso. No pienses todavía en Model Vault.
  • Estás construyendo búsqueda o RAG sobre un corpus fijo. Indexa con Pro, consulta con Fast, almacena en int8 de 1024 dimensiones. Es la configuración de alta calidad más barata que ofrece Cohere.
  • Ejecutas agentes que buscan constantemente. Fast en ambos lados si necesitas el rendimiento 2,4 veces mayor; índice Pro más consultas Fast si importa más la calidad.
  • Embebes decenas de miles de millones de tokens al mes o necesitas aislamiento. Valora Model Vault y pide a ventas el rendimiento por instancia antes de firmar. En AWS, compáralo con SageMaker y con los precios de agentes de Bedrock que quizá ya pagas.
  • Embebes sobre todo contenido en idiomas asiáticos. Haz primero un benchmark de Gemini Embedding 2 frente a Pro con tus propios datos.
  • Solo quieres un bot de soporte que responda a partir de tus documentos. Sáltate por completo la decisión de embeddings y mira una base de conocimiento con IA o un compañero de helpdesk que gestione la recuperación por ti.

Prueba eesel cuando el objetivo sean respuestas de soporte

La mayoría de quienes valoran modelos de embeddings no están construyendo un buscador por el simple hecho de hacerlo. A menudo están eligiendo entre RAG y fine-tuning para un centro de ayuda. Lo que quieren al final es un bot que responda a los clientes a partir de un centro de ayuda y de tickets anteriores. Ahí es donde yo pararía y preguntaría si realmente necesitas ser dueño del stack.

En eesel he visto a equipos tomar esta decisión desde ambos lados. Una empresa neerlandesa de alojamiento web en Zendesk, que gastaba unos $1.700 al mes, dejó eesel para construir su propia IA internamente. La lectura del equipo después no tuvo nada que ver con el coste de los modelos:

"A lot of their friction came from setup complexity (handovers, Zendesk integration, business hours logic) and a lack of clear guidance on how to configure things correctly."

Esa es la parte que las páginas de precios de embeddings nunca muestran. Los vectores son baratos. Lo que da trabajo de verdad son los traspasos y las integraciones, además de las reglas que los rodean.

Vista de actividad de eesel con las conversaciones resueltas y pendientes de un compañero de IA en una instancia de Zendesk conectada
Vista de actividad de eesel con las conversaciones resueltas y pendientes de un compañero de IA en una instancia de Zendesk conectada

eesel es un compañero de helpdesk con IA que se une a tu cola actual en Zendesk, Freshdesk y otros helpdesks, aprende de tu base de conocimiento y de tus tickets anteriores, y te permite reproducir tickets reales a través de él antes de que hable con un cliente. No hay modelo de embeddings que elegir ni número de dimensiones que ajustar, y tampoco recibes una factura de base de datos vectorial.

El precio son planes fijos de créditos desde $299 por 500 créditos al mes, donde un ticket o chat gestionado es un crédito.

Si eres desarrollador, ir por este camino no significa perder el control, algo que cubro con más profundidad en mi guía de la API de agente de atención al cliente. La CLI de eesel te permite conectar integraciones, editar las instrucciones del compañero, aprobar o denegar acciones pendientes y leer su registro de actividad desde un terminal, con salida JSON y un indicador --dry-run para scripts. Agentes de programación como Claude Code también pueden manejarla por MCP.

He escrito más sobre ese flujo de trabajo en gestionar agentes desde el terminal y en el recorrido por la CLI para soporte.

Prueba eesel gratis y mira cómo se ve tu centro de ayuda como un compañero de soporte en funcionamiento, sin escribir una sola llamada de embedding.

Preguntas frecuentes

¿Cuánto cuesta Cohere Embed 5?
Según la página de precios de Cohere, Embed 5 Pro cuesta $0,12 por 1M de tokens en la API de pago por uso, y Embed 5 Fast cuesta $0,08 por 1M de tokens. Las entradas de imagen cuestan $0,40 por 1M de tokens en ambos niveles. Para el resto de la oferta de Cohere, consulta mi desglose de precios de Cohere AI.
¿Cuál es la diferencia de precio entre Embed 5 Pro y Embed 5 Fast?
Fast es un tercio más barato en texto ($0,08 vs $0,12 por 1M de tokens) y aproximadamente 2,4 veces más rápido, con 84,5 frente a 85,8 en la prueba ViDoRe V3 de Cohere. Los tokens de imagen cuestan lo mismo, $0,40, en ambos. Como comparten un único espacio vectorial, muchos equipos indexan con Pro y consultan con Fast, el patrón que la propia Cohere recomienda.
¿Es Cohere Embed 5 más caro que Embed 4?
No. Embed 5 Pro mantiene los $0,12 por 1M de tokens de texto de Embed 4, los tokens de imagen bajan de $0,47 a $0,40, y la instancia más pequeña de Model Vault baja de $2.500 a $2.000 al mes. El único coste que puede subir es el almacenamiento, ya que Embed 5 usa 2048 dimensiones por defecto frente a las 1536 de Embed 4. Más contexto en mi reseña de Cohere AI.
¿Hay un plan gratuito para Cohere Embed 5?
Cada cuenta recibe una clave de prueba gratuita, pero según la documentación de límites de uso está limitada a 1.000 llamadas a la API al mes y Cohere no permite usarla en producción ni con fines comerciales. Las claves de producción son de pago por uso, facturadas cada mes o cuando tu saldo llega a $250.
¿Cuándo sale más barato Cohere Model Vault que la API de Embed 5?
La instancia Small de $2.000/mes alcanza el punto de equilibrio en unos 16.700 millones de tokens Pro o 25.000 millones de tokens Fast al mes. Por debajo de eso, la API por token es más barata. La mayoría de los equipos eligen Model Vault por aislamiento y rendimiento garantizado, no para ahorrar en embeddings de RAG.
¿Cómo se comparan los precios de Cohere Embed 5 con los embeddings de OpenAI?
text-embedding-3-large de OpenAI cuesta $0,13 por 1M de tokens y text-embedding-3-small cuesta $0,02. Embed 5 Pro es un centavo más barato que 3-large y puntúa 85,8 frente a 75,5 en el propio benchmark de Cohere. Mi guía de la API de embeddings de OpenAI cubre el lado de OpenAI en detalle.
¿Necesito Cohere Embed 5 para crear un agente de soporte con IA?
Solo si estás construyendo tú mismo el stack de recuperación. Un agente de helpdesk con IA como eesel se encarga del embedding, el almacenamiento y la búsqueda por un solo precio, así que nunca tienes que dimensionar una base de datos vectorial ni elegir un número de dimensiones. Aprende directamente de tu base de conocimiento y de tus tickets anteriores.

Share this article

Rama Adi

Article by

Rama Adi

Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.

Related Posts

All posts →
Dos personas buscando en un índice de documentos impulsado por embeddings de Cohere Embed 5
Trending

Cohere Embed 5: Pro vs Fast, benchmarks, precios y cómo usarlo

Cohere Embed 5 explicado: qué son Pro y Fast, el truco de indexar con Pro, cómo se sostienen los benchmarks, cuánto cuesta y cuándo deja de importar el precio por token.

KiraKiraOct 1, 2026
Ilustración que compara los planes de modelo DeepSeek V4 Flash y V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro: ¿qué plan deberías usar?

El plan barato de DeepSeek ahora puntúa más alto que el caro en el ranking independiente. Aquí está exactamente dónde eso se cumple, y los dos sitios donde no.

Rama AdiRama AdiAug 3, 2026
Ilustración dibujada a mano de dos personas mirando una etiqueta de precio pequeña y otra mucho más grande junto a una gran chispa azul de Gemini, para una guía de precios de Gemini 4 Argon
Trending

Precios de Gemini 4 Argon: la promo de $2/$10, la factura de $4/$20 y lo que cuesta de verdad una tarea

Gemini 4 Argon cuesta por ahora $2/$10 por millón de tokens, y luego $4/$20. Qué significa eso por tarea, por ticket y frente a GPT-6.1 Sol y Claude Opus 5.5.

KiraKiraOct 1, 2026
Banner principal de precios de TypeSafe Jev en rosa y blanco roto, mostrando un coste bajo por millón de tokens
Trending

Precios de TypeSafe Jev (2026): 0,042 $ por millón de tokens, salida gratis

Los precios de TypeSafe Jev explicados: 0,042 $ por millón de tokens de entrada, salida gratis, sin niveles de plan todavía, y lo que realmente cuesta operar un modelo System One en producción.

Kurnia KharismaKurnia KharismaSep 22, 2026
Banner principal de TypeSafe Jev en rosa y blanco roto, que ilustra un modelo de decisiones tipadas rápido
Trending

Análisis de TypeSafe Jev: el modelo «System One» que le da a la IA las propiedades del código

Un análisis práctico de TypeSafe Jev: qué hace realmente el modelo System One, si las afirmaciones sobre velocidad, precio y que «no puede alucinar» se sostienen, y dónde encaja un modelo de decisiones tipadas en el trabajo real.

Rama AdiRama AdiSep 21, 2026
Ilustración anunciando Claude Fable 5.1, el nuevo modelo de frontera de Anthropic
Trending

Claude Fable 5.1: precios, capacidades y qué significa para tu equipo

Claude Fable 5.1 es el modelo más capaz de Anthropic hasta la fecha. Aquí están los precios reales, qué cambió respecto a Fable 5 y dónde encaja para equipos de soporte y contenido.

KiraKiraSep 2, 2026
Dos personas revisando medidores de tokens, tarjetas de precio por millón de tokens y una larga factura impresa
Trending

Precios de la API de Anthropic en 2026: todas las tarifas y las palancas reales de coste

La tarifa completa de la API de Anthropic para cada modelo Claude, más los cuatro multiplicadores que deciden tu factura real: caché, batch, effort y dos recargos.

Kurnia KharismaKurnia KharismaAug 13, 2026
Precios de Grok 4.6 en 2026: cada tarifa y lo que los equipos pagan de verdad
Trending

Precios de Grok 4.6 en 2026: cada tarifa y lo que los equipos pagan de verdad

Grok 4.6 tiene un precio de lista de 2,00 $ de entrada y 6,00 $ de salida por millón de tokens. El precio efectivo de entrada medido por OpenRouter es de 0,74 $. Aquí está cada partida de la factura y por qué puerta conviene comprar.

Kurnia KharismaKurnia KharismaAug 13, 2026
DeepSeek V4 Flash: precios y lo que pagarás realmente
Trending

DeepSeek V4 Flash: precios y lo que pagarás realmente

DeepSeek V4 Flash figura a $0.14 de entrada y $0.28 de salida por millón de tokens. Usuarios reales han publicado tarifas combinadas por debajo de un centavo. Esto es lo que decide cuál te toca a ti.

KiraKiraAug 4, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis