Cohere Embed 5: Pro vs Fast, benchmarks, precios y cómo usarlo

Kira
Escrito por

Kira

Katelin Teen
Revisado por

Katelin Teen

Última edición October 1, 2026

Verificado por expertos
Dos personas buscando en un índice de documentos impulsado por embeddings de Cohere Embed 5

Qué es realmente Cohere Embed 5

Cohere es la empresa de IA empresarial detrás de los modelos Command, Rerank y el analizador de documentos Parse 5. Un modelo de embeddings es la parte silenciosa de cualquier sistema de búsqueda o RAG: la pieza que convierte un fragmento de texto (o una imagen) en una lista de números, y los fragmentos con significado parecido acaban cerca unos de otros. Cuando un usuario pregunta algo, esa pregunta también se convierte en números, y el sistema recupera los fragmentos más cercanos.

Cuando el modelo de embeddings es débil, la respuesta correcta simplemente nunca se recupera, y un prompt ingenioso no lo va a arreglar. Es la misma capa que impulsa la búsqueda empresarial con IA.

Embed 5 toma el relevo de Embed 4 como modelo estrella de Cohere y viene en dos niveles: Pro, "optimized for maximum quality across multimodal, multilingual, financial, code, and parsed-document retrieval", y Fast, que "brings highly competitive performance to latency- and cost-sensitive workloads".

La página de producto de Cohere Embed anunciando Embed 5 en los niveles Pro y Fast, tomada de Cohere

Construyo agentes de IA para vivir en eesel, y la recuperación es la capa donde se va la mayor parte de mi tiempo de depuración, así que estas especificaciones fueron lo primero que busqué. Aquí están lado a lado, sacadas de la documentación del modelo de Cohere y de su publicación de lanzamiento:

Embed 5 ProEmbed 5 FastEmbed 4 (anterior)
ID del modelo en la APIembed-v5.0-proembed-v5.0-fastembed-v4.0
Precio del texto (por 1M de tokens)0,12 $0,08 $0,12 $
Precio de la imagen (por 1M de tokens)0,40 $0,40 $0,47 $
Longitud de contexto128K tokens128K tokens128K tokens
EntradasTexto, imágenes, texto + imagen fusionadosTexto, imágenes, texto + imagen fusionadosTexto, imágenes, mixtas
Dimensiones de salida256 a 2048 (por defecto 2048)256 a 2048 (por defecto 2048)256 a 1536 (por defecto 1536)
Formatosfloat, int8, binaryfloat, int8, binaryfloat, int8, binary
Idiomas100+100+Multilingüe
Ideal paraIndexación sin conexión, búsqueda donde la calidad es críticaConsultas en vivo, bucles de agentes, alto volumen

Las tarifas de Embed 4 vienen de los precios de Cohere en Microsoft Foundry, ya que la página de precios de Cohere ya no lista Embed 4. Si vienes de la serie 3 de OpenAI, ten en cuenta que sus precios de API siguen llegando como máximo a 0,13 $ para text-embedding-3-large. En la tabla de Cohere hay dos detalles pequeños que la gente suele pasar por alto. La salida por defecto subió de 1536 a 2048 dimensiones, algo que importa para el almacenamiento (más sobre esto abajo), y además la entrada de imágenes se abarató, de 0,47 $ a 0,40 $ por 1M de tokens.

Cómo funciona Embed 5: indexar con Pro, consultar con Fast

Esta es la función alrededor de la que yo construiría, y es la que menos bombo lleva. La mayoría de las familias de embeddings, incluida la API de embeddings de OpenAI, te obligan a elegir un modelo y quedarte con él, porque los vectores de dos modelos distintos no son comparables. Cohere entrenó Pro y Fast en un único espacio compartido, de modo que una consulta convertida en embedding con Fast se puede comparar directamente con documentos convertidos con Pro.

Esto importa porque indexar y consultar piden cosas opuestas. La indexación ocurre una vez (o en cada actualización de un documento) y nadie espera por ella, así que aquí quieres la mejor calidad que el dinero pueda comprar. La consulta es otra historia: ocurre en cada petición del usuario y dentro de tu presupuesto de latencia, lo que significa que lo que cuenta es la velocidad. Tener un espacio compartido te permite elegir cada lado por separado.

Diagrama del patrón indexar con Pro, consultar con Fast: los documentos pasan por Embed 5 Pro, las consultas en vivo pasan por Embed 5 Fast, y ambos acaban en un índice compartido al 98,4% de la calidad de usar solo Pro
Diagrama del patrón indexar con Pro, consultar con Fast: los documentos pasan por Embed 5 Pro, las consultas en vivo pasan por Embed 5 Fast, y ambos acaban en un índice compartido al 98,4% de la calidad de usar solo Pro

Cohere probó todas las combinaciones en 40 conjuntos de datos de desarrollo y luego normalizó las puntuaciones de modo que documentos de Pro más consultas de Pro sea igual a 100:

Calidad media de recuperaciónDocumentos indexados con FastDocumentos indexados con Pro
Consultas con Fast96.698.4
Consultas con Pro97.3100

Así que índice de Pro más consultas de Fast llega a 98,4, una pérdida del 1,6%, mientras Fast hace el trabajo de tiempo de consulta con aproximadamente 2,4 veces el rendimiento de Pro (377,3 frente a 159,7 documentos por segundo en la prueba de Cohere). El propio Cohere recomienda exactamente este patrón, y en la nota al pie está la condición que conviene conocer: ambos lados deben usar la misma dimensión de salida. El emparejamiento sigue funcionando al añadir truncamiento Matryoshka y cuantización int8, así que también sirve con un índice comprimido.

Gráfico de barras del rendimiento en documentos: Embed 5 Fast procesa 377,3 documentos por segundo frente a 159,7 de Embed 5 Pro, tomado de Cohere
Gráfico de barras del rendimiento en documentos: Embed 5 Fast procesa 377,3 documentos por segundo frente a 159,7 de Embed 5 Pro, tomado de Cohere

Algunos detalles de la API, de la referencia de Embed, que condicionan cómo la llamas:

  • input_type es obligatorio. Usa search_document al indexar y search_query al consultar. También hay modos classification y clustering.
  • 96 entradas por llamada. Cada entrada puede mezclar partes de texto e imagen, con un tope de 20 MB de carga total.
  • El truncamiento por defecto es END. Con un contexto de 128K es raro llegar a él, pero si prefieres recibir un error antes que perder en silencio el final de un documento largo, pon truncate en NONE.
  • Los límites de uso son por entrada, no por solicitud: 2.000 entradas de texto por minuto tanto con claves de prueba como de producción, y 5 frente a 400 entradas de imagen por minuto, según la página de límites de uso. Las claves de prueba son gratuitas pero limitadas a 1.000 llamadas al mes y no se permiten en producción.

Los benchmarks: sólidos, pero lee la letra pequeña

Los números que publicó Cohere son buenos. Abajo está la tabla principal de ViDoRe V3, que cubre documentos empresariales de ocho dominios:

ModeloPromedio ViDoRe V3Precio del texto por 1M de tokens
Cohere Embed 5 Pro85.80,12 $
Cohere Embed 5 Fast84.50,08 $
Voyage 4 Large83.70,12 $
Gemini Embedding 283.20,20 $
Cohere Embed 477.00,12 $
OpenAI text-embedding-3-large75.50,13 $
Jina Embeddings v5 Text Small74.50,05 $

En la misma prueba, Pro gana 8,8 puntos sobre Embed 4, y los mayores saltos están en RR. HH. (+11,4) y en documentos industriales (+10,3). También lidera la suite de PDF analizados de Cohere con 84,8. En recuperación financiera queda primero en FinanceBench (80,1) y FinQA (90,0), además de ViDoRe V3 Finance (85,0), con Fast en segundo lugar en todos.

Gráficos de barras agrupados de la calidad de recuperación en PDF analizados para siete modelos de embeddings, con Embed 5 Pro más alto en el promedio y en RepairBench, CoFiF, FinanceBench y MPQMA, tomado de Cohere
Gráficos de barras agrupados de la calidad de recuperación en PDF analizados para siete modelos de embeddings, con Embed 5 Pro más alto en el promedio y en RepairBench, CoFiF, FinanceBench y MPQMA, tomado de Cohere

Para mí el resultado más impresionante es en realidad Fast. Frente a otros modelos compactos en ViDoRe V3 puntúa 84,5, donde Voyage 4 Nano saca 77,6 y Qwen3-VL-Embedding saca 64,2. La leyenda del propio gráfico de Cohere (abajo) lista Fast con unos 1B de parámetros, 500M de texto más 500M de visión, y la publicación de lanzamiento dice que supera a Qwen3-VL-Embedding-2B por unos 20 puntos pese a tener aproximadamente la mitad de tamaño.

Gráfico de barras de la calidad de recuperación en ViDoRe V3 para modelos compactos: Embed 5 Fast 84,5, Voyage 4 Nano 77,6, Jina Embeddings v5 Text Small 74,5, Perplexity pplx-embed-v1 74,4, Microsoft Harrier OSS v1 73,4, Qwen3-VL-Embedding 64,2, tomado de Cohere
Gráfico de barras de la calidad de recuperación en ViDoRe V3 para modelos compactos: Embed 5 Fast 84,5, Voyage 4 Nano 77,6, Jina Embeddings v5 Text Small 74,5, Perplexity pplx-embed-v1 74,4, Microsoft Harrier OSS v1 73,4, Qwen3-VL-Embedding 64,2, tomado de Cohere

Ahora la letra pequeña, porque una lectura justa la necesita.

Es una métrica nueva, ejecutada por el proveedor. Embed 5 es la primera familia de modelos puntuada con RCP-nDCG@10, un método que Cohere publicó el mismo día. La propia nota al pie de Cohere dice que evalúa los modelos reordenando un conjunto fijo de candidatos, así que "scores therefore reflect reranking quality rather than first-stage retrieval performance." Es una forma razonable de medir, y el código es público, pero no es el mismo número que obtendrías ejecutando una búsqueda top-10 simple sobre todo tu índice. Además, algunos de los conjuntos de datos son internos, como el de "High Finance", que Cohere anotó por sí misma.

Gemini Embedding 2 gana en la mayoría de los idiomas no europeos. Pro lidera el conjunto europeo (77 de promedio entre alemán, francés, español, italiano y ruso). Pero en la tabla de diez idiomas del propio Cohere, Gemini Embedding 2 supera a Pro en 9 de 10: japonés, coreano, árabe, farsi, hindi, bengalí, telugu, indonesio y tailandés. Pro solo lo supera por poco en chino (82 frente a 81). El telugu es la mayor brecha, 91 frente a 80.

Tabla de resultados que muestra dónde lidera Embed 5 Pro (ViDoRe V3 85,8, PDF analizados 84,8, idiomas europeos 77) y dónde lidera Gemini Embedding 2 (telugu 91 vs 80, bengalí 89 vs 83, 9 de 10 idiomas asiáticos e indios)
Tabla de resultados que muestra dónde lidera Embed 5 Pro (ViDoRe V3 85,8, PDF analizados 84,8, idiomas europeos 77) y dónde lidera Gemini Embedding 2 (telugu 91 vs 80, bengalí 89 vs 83, 9 de 10 idiomas asiáticos e indios)

Si tu cola de soporte o tu base de documentos depende mucho del hindi, el tailandés o el bengalí, esa tabla es lo más útil de todo el lanzamiento, y hay que reconocerle a Cohere que la haya publicado. Para un equipo que sirve una base de conocimiento multilingüe en Europa y en inglés, Pro es la opción más fuerte según estos números.

La reacción de la comunidad aún es temprana y escasa, lo esperable un día después de un lanzamiento. La voz más útil de un profesional que encontré es más antigua y trata de los embeddings de Cohere en general, no de Embed 5 en sí:

Hacker News

"My experience with Cohere and interacting with their sales engineers has been boring, I say that is the most flattering way possible. Embeddings are a core service at this point like VMs and DBs. They just need to work and work well and thats what they're selling."

Eso encaja bastante bien con la propuesta. Embed 5 no intenta ser emocionante, intenta ser la capa aburrida y fiable que va debajo de tu búsqueda.

Precios de Cohere Embed 5

La facturación de Embed 5 es por token de entrada, y no hay cargo por la salida. Esto es todo lo que Cohere publica, de la página de precios y de la publicación de lanzamiento:

OpciónEmbed 5 ProEmbed 5 FastUnidad de facturación
API de Cohere, texto0,12 $ por 1M de tokens0,08 $ por 1M de tokensTokens de entrada
API de Cohere, imágenes0,40 $ por 1M de tokens0,40 $ por 1M de tokensTokens de imagen
Clave de pruebaGratis, 1.000 llamadas al mesGratis, 1.000 llamadas al mesNo apta para producción
Model Vault Small3,00 $/hora o 2.000 $/mes3,00 $/hora o 2.000 $/mesPor instancia dedicada
Model Vault Medium5,00 $/hora o 3.250 $/mes5,00 $/hora o 3.250 $/mesPor instancia dedicada
Amazon SageMaker2,39 $ a 8,48 $ por hora de host2,39 $ a 3,36 $ por hora de hostTarifa de software más coste de la instancia AWS
Microsoft FoundryAún sin publicar (vista previa)Aún sin publicar (vista previa)

Las tarifas de SageMaker vienen de los listados de AWS Marketplace para Embed 5 Pro, con un listado equivalente para Fast. Cohere factura al final de cada mes, o antes si llegas a 250 $ pendientes. Para el resto del catálogo (Rerank, Parse, Command), consulta mi guía completa de precios de Cohere. Si además analizas PDF, el desglose de precios de Parse 5 cubre ese medidor.

Tres notas de facturación que me gustaría haber sabido antes de fijar un presupuesto:

  1. El conteo de tokens de imagen no está documentado. El precio es por 1M de tokens de imagen, pero Cohere no publica una fórmula de tokens por imagen. La respuesta de la API reporta las imágenes como un conteo ("images": 1), así que haz una prueba con un lote pequeño y lee la factura antes de generar embeddings de un millón de imágenes de página.
  2. Model Vault solo compensa con un volumen muy alto. Una instancia Small a 2.000 $ al mes equivale a unos 16.700 millones de tokens de Pro, o 25.000 millones de Fast, a tarifas de API. Por debajo de eso, la API sale más barata. Si eliges Vault, las razones reales son el aislamiento y la capacidad garantizada, no el precio.
  3. Aún no está en Bedrock. Amazon Bedrock sigue listando Embed 4 a 0,12 $ por 1M de tokens, sin SKU de Embed 5. OpenRouter no incluye ningún modelo de embeddings de Cohere.

Por qué el precio por token es el número menos importante aquí

Hagamos las cuentas de una configuración de soporte realista, ya que es el mundo en el que paso mis días de trabajo. Supón que tienes 2.000 artículos del centro de ayuda (unos 1.500 tokens cada uno) y 200.000 tickets pasados (unos 600 tokens cada uno), aproximadamente 123 millones de tokens en total. Generar embeddings de todo una vez con Pro cuesta unos 14,76 $. Con Fast, unos 9,84 $. Cincuenta mil preguntas de clientes al mes con 30 tokens cada una son 1,5 millones de tokens, unos 12 centavos con Fast. Es decir, la factura de embeddings es básicamente un error de redondeo.

Lo que no se redondea es el almacenamiento, que escala con dimensiones y precisión. El ejemplo del propio Cohere: un vector float32 de 2048 dimensiones pesa 8 KB, un vector int8 de 1024 dimensiones pesa 1 KB y un vector binario de 256 dimensiones pesa 32 bytes.

Gráfico de barras del almacenamiento bruto de vectores para 100 millones de fragmentos: 819 GB a 2048 dimensiones float32, 102 GB a 1024 dimensiones int8, 3,2 GB a 256 dimensiones binario, 256 veces menos
Gráfico de barras del almacenamiento bruto de vectores para 100 millones de fragmentos: 819 GB a 2048 dimensiones float32, 102 GB a 1024 dimensiones int8, 3,2 GB a 256 dimensiones binario, 256 veces menos

Con 100 millones de fragmentos, la salida float32 por defecto son unos 819 GB de vectores en bruto. En el plan Standard de Pinecone (o un almacén de vectores alojado) a 0,33 $ por GB al mes, eso son unos 270 $ al mes antes de la sobrecarga del índice, cada mes. Los mismos fragmentos en int8 de 1024 dimensiones son unos 102 GB, unos 34 $ al mes. Generar embeddings de esos 100 millones de fragmentos una sola vez (a unos 500 tokens cada uno) cuesta unos 6.000 $ con Pro, un cargo único. Elige tus dimensiones y precisión antes de indexar, porque cambiarlas después implica volver a generar todos los embeddings desde cero.

La recomendación de Cohere coincide: "For most deployments, we recommend 1,024-dimensional int8 vectors as the ideal performance-efficiency point," y int8 "retains near-full-precision retrieval quality." El binario es el más pequeño, pierde algo de precisión y funciona bien como primera pasada rápida antes de un reranker.

Migrar desde Embed 4: qué planificar

Si hoy usas Embed 4, la migración es más que cambiar el nombre del modelo. Cosas que planificar:

  • Reindexa todo. Cohere dice que Pro y Fast comparten espacio entre sí. No dice nada sobre que los vectores de Embed 4 sean comparables con los de Embed 5, así que asume que no lo son y presupuesta una regeneración completa. Con los precios de arriba suele ser barato en dólares, aunque caro en tiempo de ingeniería.
  • Cuidado con la dimensión por defecto. Embed 4 usaba 1536 por defecto, Embed 5 usa 2048. Si el índice de tu base de datos vectorial está fijado en 1536, pasa output_dimension=1536 (Embed 5 lo admite) o reconstruye el índice.
  • Revisa tu nube. Si llamas a Cohere a través de Bedrock u Oracle OCI, Embed 5 aún no está allí. Los canales de lanzamiento son la API de Cohere, Model Vault, Microsoft Foundry y SageMaker.
  • Trabajos por lotes. Cohere dice que el embedding por lotes está disponible para ingestas a gran escala, pero la tabla de la documentación solo lista el endpoint estándar de Embed para los modelos v5, así que confirma que Embed Jobs sea compatible con tu modelo antes de diseñar un pipeline masivo alrededor de ello.

Antes de culpar (o elogiar) al modelo, revisa primero el resto del pipeline. Esta respuesta en un hilo de r/Rag sobre ajustar embeddings es el consejo más práctico sobre cambios de modelo que he encontrado:

Reddit

"more than I expected. but only after chunking was already clean. dirty chunks make every embedding model look bad."

Eso coincide con mi propia experiencia. Si quieres un ejemplo práctico, la guía de búsqueda semántica sobre Zendesk Guide recorre la parte de la fragmentación. Un mejor modelo de embeddings ayuda más cuando la fragmentación ya es sólida y tienes búsqueda híbrida y un reranker en su sitio.

Dónde encaja Embed 5 y dónde no

Embed 5 es una gran elección si eres un equipo de plataforma que construye su propio stack de búsqueda o RAG, sobre todo con documentos largos, visualmente ricos o financieros. El contexto de 128K significa menos cortes incómodos de fragmentos, y la entrada fusionada de texto más imagen se encarga de presentaciones y páginas escaneadas. Además, la división Pro/Fast te da un mando limpio entre velocidad y calidad. Combínalo con Parse 5 para convertir PDF en Markdown y con Rerank para ordenar las coincidencias, y tendrás todo el stack de recuperación de Cohere. Cohere también anunció que su plataforma de búsqueda gestionada, Compass Cloud, está ahora en beta privada.

Hacker News

"Cohere seems to be doing a lot on the search side this year with their parsing model, Compass Cloud announcement, and now Embed 5... exciting stuff"

Es el nivel equivocado del stack si tu objetivo real es una herramienta de uso diario, como una base de conocimiento con IA para tu equipo o una IA que responda a las preguntas de clientes desde tu centro de ayuda y tickets pasados. Un modelo de embeddings te da vectores. Aún necesitas fragmentación, una base de datos vectorial, un reranker, un modelo de generación como GPT-6.1 Sol, salvaguardas y una forma de conectar las respuestas a tu helpdesk.

Si quieres los compromisos con más detalle, empieza por RAG frente a LLM puros. Para centros de ayuda en concreto, hay una guía aparte sobre RAG frente a ajuste fino.

La lección más dura que me llevé de ejecutar IA en colas de soporte en vivo no tiene nada que ver con la calidad de la recuperación, sino con lo que pasa cuando la recuperación vuelve vacía. He visto bots de clientes de pago responder a clientes reales con afirmaciones seguras e inventadas porque la base de conocimiento no tenía nada relevante y el modelo llenó el hueco con sus datos de entrenamiento. Un mejor modelo de embeddings lo hace menos frecuente, pero no imposible. La solución está en la capa superior: una respuesta alternativa firme cuando no se encuentra nada relevante, y pruebas con tickets reales antes del lanzamiento.

Prueba eesel si quieres las respuestas, no el pipeline

Si estás leyendo sobre modelos de embeddings por un problema de soporte, eesel es el atajo. eesel es una plataforma de compañeros de IA, y su compañero de IA para el helpdesk es todo el stack de recuperación, ya montado: se conecta a tu centro de ayuda, tu documentación y tus tickets pasados, y redacta o envía respuestas dentro de tu helpdesk, Slack o un enlace compartible. Sin vectores que dimensionar, sin índice que reconstruir cuando sale un modelo nuevo.

Se integra con los helpdesks que ya usan la mayoría de los equipos de soporte. En Zendesk responde a partir de macros y tickets resueltos; en Freshdesk y Gorgias trabaja la misma cola que tus agentes.

La vista de Actividad de eesel filtrada a una instancia de Zendesk, con las conversaciones que el compañero de IA resolvió o dejó pendientes
La vista de Actividad de eesel filtrada a una instancia de Zendesk, con las conversaciones que el compañero de IA resolvió o dejó pendientes

Antes de tocar a un cliente en vivo, eesel simula el despliegue sobre tus tickets históricos, de modo que ves de antemano las respuestas que habría enviado y la tasa de resolución. Así es como querría que cualquier resolución automatizada de tickets se ganara su lugar en una cola en vivo.

Y si has llegado aquí porque te gusta trabajar desde una terminal, la CLI de eesel te permite ejecutar el mismo compañero desde la línea de comandos: conectar una integración con eesel integrations connect, editar sus instrucciones permanentes, aprobar o denegar acciones pendientes y leer cada ejecución con eesel activity. Cada comando devuelve JSON y admite --dry-run, así que scripts y agentes de programación como Claude Code también pueden manejarlo. Hay una guía completa sobre gestionar agentes desde una terminal y una más breve sobre la CLI para atención al cliente.

Prueba eesel gratis con tus propios tickets.

Preguntas frecuentes

¿Qué es Cohere Embed 5?
Cohere Embed 5 es la familia de modelos de embeddings de Cohere, lanzada el 30 de septiembre de 2026. Convierte texto, imágenes, o texto e imágenes juntos, en vectores para búsqueda y RAG. Se ofrece en dos niveles, Embed 5 Pro (embed-v5.0-pro) y Embed 5 Fast (embed-v5.0-fast), ambos con una ventana de contexto de 128K tokens y más de 100 idiomas.
¿Cuánto cuesta Cohere Embed 5?
En la API de Cohere, Embed 5 Pro cuesta 0,12 $ por 1M de tokens de texto y Embed 5 Fast cuesta 0,08 $. La entrada de imágenes cuesta 0,40 $ por 1M de tokens de imagen en ambos. Las instancias dedicadas de Model Vault empiezan en 3,00 $ la hora (2.000 $ al mes). Para la lista de precios completa de Cohere, consulta este desglose de precios de Cohere.
¿Cuál es la diferencia entre Embed 5 Pro y Embed 5 Fast?
Pro es el modelo de mayor calidad, pensado para indexación sin conexión y búsqueda donde la calidad es crítica. Fast cuesta un tercio menos, tiene aproximadamente 2,4 veces el rendimiento y queda muy cerca de Pro en los benchmarks de Cohere. Comparten un mismo espacio de embeddings, así que puedes indexar documentos con Pro y ejecutar consultas en vivo con Fast sin reconstruir tu almacén de vectores.
¿Es Cohere Embed 5 mejor que los embeddings de OpenAI?
En los benchmarks propios de Cohere, sí, y por un margen amplio: ViDoRe V3 da 85,8 para Embed 5 Pro frente a 75,5 para text-embedding-3-large de OpenAI. La API de embeddings de OpenAI es más barata en el extremo pequeño (0,02 $ para 3-small), y las puntuaciones salen de una métrica que Cohere presentó el mismo día, así que prueba con tus propios datos antes de cambiar.
¿Necesito volver a generar los embeddings de mis datos para pasar de Embed 4 a Embed 5?
Cuenta con ello. Cohere dice que Pro y Fast comparten espacio entre sí, pero no afirma que los vectores de Embed 5 sean compatibles con los de Embed 4, así que lo seguro es asumir una reindexación completa. El tamaño de salida por defecto también pasó de 1536 a 2048 dimensiones, así que define output_dimension de forma explícita si el esquema de tu índice es fijo.
¿Está Cohere Embed 5 disponible en Amazon Bedrock?
No en el lanzamiento. Embed 5 está en la API de Cohere, Model Vault, Microsoft Foundry (en vista previa, precio aún sin publicar) y Amazon SageMaker. Bedrock sigue listando Embed 4 a 0,12 $ por 1M de tokens. Si estás comparando opciones de nube, el repaso de alternativas a Cohere cubre el panorama.
¿Puedo usar Cohere Embed 5 para la búsqueda en atención al cliente?
Sí, es una capa de recuperación sólida para un pipeline RAG de soporte, pero es solo una pieza: aún tienes que dividir en fragmentos, indexar, reordenar y generar las respuestas tú mismo. Si el objetivo es un agente de soporte que funcione y no un pipeline, eesel se conecta a tu centro de ayuda y a tus tickets pasados y se encarga de la recuperación por ti.

Share this article

Kira

Article by

Kira

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustración de dos personas revisando un panel de precios de Cohere Embed 5 con el logotipo de Cohere
Trending

Precios de Cohere Embed 5: lo que cuestan realmente Pro y Fast en 2026

Cohere Embed 5 cuesta $0,12 por 1M de tokens en Pro y $0,08 en Fast, con imágenes a $0,40. Aquí está la tabla completa, las cuentas de Model Vault y la factura de almacenamiento que nadie incluye.

Rama AdiRama AdiOct 1, 2026
Ilustración dibujada a mano de tres personas ante una puerta cerrada que eligen entre caminos sinuosos con una brújula, para una guía de alternativas a Gemini 4 Argon
Trending

Las 9 mejores alternativas a Gemini 4 Argon que puedes usar de verdad en 2026

Gemini 4 Argon todavía no está en la API. Estas 9 alternativas a Gemini 4 Argon sí lo están, con puntuaciones del mismo día, coste por tarea y una prueba práctica de quién se inventa respuestas.

Kurnia KharismaKurnia KharismaOct 1, 2026
Banner principal de precios de TypeSafe Jev en rosa y blanco roto, mostrando un coste bajo por millón de tokens
Trending

Precios de TypeSafe Jev (2026): 0,042 $ por millón de tokens, salida gratis

Los precios de TypeSafe Jev explicados: 0,042 $ por millón de tokens de entrada, salida gratis, sin niveles de plan todavía, y lo que realmente cuesta operar un modelo System One en producción.

Kurnia KharismaKurnia KharismaSep 22, 2026
Banner principal de TypeSafe Jev en rosa y blanco roto, que ilustra un modelo de decisiones tipadas rápido
Trending

Análisis de TypeSafe Jev: el modelo «System One» que le da a la IA las propiedades del código

Un análisis práctico de TypeSafe Jev: qué hace realmente el modelo System One, si las afirmaciones sobre velocidad, precio y que «no puede alucinar» se sostienen, y dónde encaja un modelo de decisiones tipadas en el trabajo real.

Rama AdiRama AdiSep 21, 2026
Ilustración dibujada a mano de tres personas esperando detrás de un cordón de terciopelo frente a una puerta cerrada y luminosa, para una guía sobre Gemini 4 Argon de Google
Trending

Gemini 4 Argon: benchmarks, precios y quién puede usarlo de verdad

Gemini 4 Argon es el nuevo modelo de frontera de Google, anunciado el 30 de septiembre de 2026 a $2/$10. Lidera en trabajo del conocimiento, se queda atrás en programación en terminal, y la mayoría de la gente todavía no puede usarlo.

KiraKiraOct 1, 2026
Ilustración del modelo de pesos abiertos Xiaomi MiMo V2.6
Trending

Xiaomi MiMo V2.6: especificaciones, benchmarks y cómo usar el modelo abierto

MiMo V2.6 de Xiaomi es una familia de modelos omnimodales de pesos abiertos, con un contexto de 1M de tokens y licencia MIT. Aquí están las especificaciones reales, los benchmarks y los precios de la API.

Rama AdiRama AdiSep 23, 2026
Ilustración de precios por token y pilas de costos para el modelo Claude Mythos 5.1
Trending

Precios de Claude Mythos 5.1: cada tarifa, el recorte de la lectura de caché y quién puede usarlo realmente

Un desglose completo de los precios de Claude Mythos 5.1: tarifas base, batch, escrituras de caché y la lectura de caché a 0,25 $ que es la verdadera noticia, además de por qué Mythos cuesta lo mismo que Fable 5.1.

Kurnia KharismaKurnia KharismaSep 8, 2026
Ilustración de un robot veloz programando en un portátil mientras una persona observa, representando a Gemini 3.8 Flash
Trending

Gemini 3.8 Flash: qué es, benchmarks honestos y mi análisis

Google lanzó Gemini 3.8 Flash el 2 de septiembre de 2026, tres semanas después de 3.7. Mismo precio, mejores puntuaciones y una línea en la letra pequeña que cambia la respuesta.

KiraKiraSep 3, 2026
Ilustración que compara los planes de modelo DeepSeek V4 Flash y V4 Pro
Trending

DeepSeek V4 Flash vs V4 Pro: ¿qué plan deberías usar?

El plan barato de DeepSeek ahora puntúa más alto que el caro en el ranking independiente. Aquí está exactamente dónde eso se cumple, y los dos sitios donde no.

Rama AdiRama AdiAug 3, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis