Alternativas a FLUX 3: 8 modelos que puedes comprar hoy
Kurnia Kharisma Agung Samiadjie
Katelin Teen
Última edición August 4, 2026

Por qué esto es una pregunta de compra
Dedico mi tiempo a analizar cómo la intención de búsqueda se traduce en una decisión de compra real, y "alternativas a FLUX 3" es uno de los ejemplos más claros que he visto este año. Nadie lo teclea porque piense que FLUX 3 es malo. Lo teclean porque leyeron el anuncio, fueron a buscar el endpoint y se encontraron con un formulario.
Aquí está la escalera de lanzamiento tal como la describió Black Forest Labs, y dónde está realmente cada peldaño.

Cuatro capacidades anunciadas, cero precios publicados. El vídeo está en acceso anticipado detrás de un formulario de solicitud. La predicción de acciones está limitada a socios seleccionados. La generación de imágenes se describió como algo que llegaría en las semanas siguientes. El backbone de pesos abiertos no tiene fecha alguna.
Eso no es una crítica a la investigación. Es un hecho de calendario, y si vas a lanzar algo este trimestre, es lo que decide la cuestión por ti. La misma distinción aparece cuando los equipos evalúan modelos de IA personalizados en general: la demo y el SKU son artefactos distintos, y solo uno de ellos tiene fecha de lanzamiento.
La lista corta, lado a lado
Cada precio de abajo viene de la propia tarifa del proveedor, comprobada el 4 de agosto de 2026. La columna de vídeo es un clip de diez segundos en 720p, porque esa es la especificación en las pruebas de preferencia publicadas de FLUX 3.
| Modelo | Mejor para | 10s a 720p | Audio nativo | Precio de imagen | Res. máx. de vídeo | Pesos abiertos | Cómo se compra | Precio publicado |
|---|---|---|---|---|---|---|---|---|
| Veo 3.1 Lite | Vídeo con audio nativo más barato | $0.50 | Sí | $0.067 (Nano Banana 2, 1K) | 1080p | No | API de Gemini, pago por uso | Sí |
| Sora 2 | Volumen en batch | $1.00 ($0.50 en batch) | Sí | $30/1M tokens de salida | 1080p (Pro) | No | API de OpenAI | Sí |
| Luma Ray 3.2 | Control por keyframes, HDR y EXR | $0.90 | No especificado | Uni-1.1, tarifa no publicada | 1080p | No | Por clip, sin compromiso | Sí |
| Kling 3.0 Omni | Edición con vídeo de entrada y audio | $1.12 | Sí | $0.0035/paquete de unidades | 4K | No | Unidades prepago, mínimo $700 | Sí |
| Grok Imagine 1.5 | Vídeo impulsado por audio | $1.40 | Entrada de audio | $0.02/img | 1080p | No | API de xAI | Sí |
| Seedance 2.0 | Estética cinematográfica, 4K | $1.50 | No especificado | No aplica | 4K | No | BytePlus ModelArk | Sí |
| Runway Gen-4.5 | Una API, varios modelos | Por créditos | Según el modelo | Gen-4 Image en créditos | 1080p | No | Planes de crédito desde $15/mes | Parcialmente |
| FLUX.2 [pro] | Quedarse en Black Forest Labs | Solo imágenes | No aplica | $0.03 el primer MP | No aplica | Sí (dev, klein) | Pago por uso | Sí |
| FLUX 3 | Nada todavía | No publicado | Sí | No publicado | No publicado | Anunciado, sin fecha | Formulario de solicitud | No |
De esa tabla saltan dos cosas. Primero, todo el campo tiene un número, excepto el modelo por el que has venido. Segundo, la diferencia entre el vídeo con audio nativo más barato y el más caro es de ocho veces, lo que significa que la elección es una decisión de presupuesto mucho antes de ser una decisión de gusto.

Lo que cuesta realmente un clip
Las tarifas por segundo son cómo cotizan los proveedores, y los totales por clip son cómo los lee finanzas. Elige una especificación y aparece el número real.
Coste de un clip generado
Precios de lista de los proveedores, comprobados el 4 de agosto de 2026. Elige la especificación que realmente vas a usar.
| Modelo | 5s a 720p | Audio |
|---|---|---|
| Veo 3.1 Lite | $0.25 | Nativo |
| Luma Ray 3.2 | $0.30 | No especificado |
| Sora 2 | $0.50 | Nativo |
| Veo 3.1 Fast | $0.50 | Nativo |
| Kling 3.0 Omni | $0.56 | Nativo |
| Grok Imagine 1.5 | $0.70 | Entrada de audio |
| Seedance 2.0 | $0.76 | No especificado |
| Veo 3.1 Standard | $2.00 | Nativo |
| FLUX 3 Video | No publicado | Nativo |
| Modelo | 10s a 720p | Audio |
|---|---|---|
| Veo 3.1 Lite | $0.50 | Nativo |
| Luma Ray 3.2 | $0.90 | No especificado |
| Sora 2 | $1.00 | Nativo |
| Veo 3.1 Fast | $1.00 | Nativo |
| Kling 3.0 Omni | $1.12 | Nativo |
| Grok Imagine 1.5 | $1.40 | Entrada de audio |
| Seedance 2.0 | $1.50 | No especificado |
| Veo 3.1 Standard | $4.00 | Nativo |
| FLUX 3 Video | No publicado | Nativo |
| Modelo | 5s a 1080p | Audio |
|---|---|---|
| Veo 3.1 Lite | $0.40 | Nativo |
| Veo 3.1 Fast | $0.60 | Nativo |
| Kling 3.0 Omni | $0.70 | Nativo |
| Luma Ray 3.2 | $1.20 | No especificado |
| Grok Imagine 1.5 | $1.25 | Entrada de audio |
| Seedance 2.0 | $1.87 | No especificado |
| Veo 3.1 Standard | $2.00 | Nativo |
| Sora 2 Pro | $3.50 | Nativo |
| FLUX 3 Video | No publicado | Nativo |
| Modelo | 10s a 1080p | Audio |
|---|---|---|
| Veo 3.1 Lite | $0.80 | Nativo |
| Veo 3.1 Fast | $1.20 | Nativo |
| Kling 3.0 Omni | $1.40 | Nativo |
| Grok Imagine 1.5 | $2.50 | Entrada de audio |
| Luma Ray 3.2 | $3.60 | No especificado |
| Seedance 2.0 | $3.70 | No especificado |
| Veo 3.1 Standard | $4.00 | Nativo |
| Sora 2 Pro | $7.00 | Nativo |
| FLUX 3 Video | No publicado | Nativo |
Las cifras de Luma Ray 3.2 son sus propios precios por clip para salida SDR, y el HDR las duplica. Las cifras de cinco segundos de Seedance 2.0 son los ejemplos publicados por BytePlus; las de diez segundos aplican la misma tarifa por segundo. Sora 2 no tiene nivel de 1080p, así que Sora 2 Pro lo sustituye. Todo lo demás es la tarifa por segundo del proveedor multiplicada por la duración.
Google Veo 3.1 y Nano Banana 2
Ideal para equipos que quieren vídeo con audio nativo a la tarifa publicada más baja.
Este es el caso incómodo para FLUX 3, porque Gemini Omni Flash es donde la propia prueba de preferencia del proveedor se sitúa en 52%. Una moneda al aire frente a la familia de modelos cuyo nivel de audio más barato corre a cinco centavos por segundo no es un lugar cómodo desde el que lanzarse.
La tarifa de Veo 3.1 tiene tres niveles, todos cotizados por segundo y todos con audio por defecto. Lite cuesta 0,05 $ en 720p y 0,08 $ en 1080p. Fast cuesta 0,10 $ y 0,12 $. Standard es plano en 0,40 $ para ambas resoluciones, y 0,60 $ en 4K.
El lado de imagen de la misma API se cobra por token y sale a 0,067 $ por una imagen de Nano Banana 2 en 1K. La variante Lite queda en 0,0336 $, y Nano Banana Pro en 0,134 $ para el mismo tamaño.
Dónde tiene límites. Veo 3.1 es un modelo en preview, algo que Google reconoce abiertamente que puede cambiar antes de estabilizarse, y que viene con límites de tasa más estrictos. No hay nivel gratuito para ninguna generación de Veo. La búsqueda con grounding se cobra por separado a 14 $ por cada 1.000 solicitudes tras la cuota mensual compartida.
Lo que cuesta. 0,50 $ por el clip de diez segundos en 720p en Lite, 4,00 $ en Standard. Esa diferencia interna de ocho veces es la decisión real dentro de la familia Veo, no la decisión entre Veo y cualquier otra cosa.
Veredicto. Si tu restricción es el precio por segundo útil, empieza aquí y deja de buscar. La reseña de Nano Banana 2 profundiza más en el lado de imagen.
OpenAI Sora 2
Ideal para trabajo de alto volumen que puede tolerar una cola de espera.
Sora 2 cuesta 0,10 $ por segundo en 720p, y este es el único lugar del sector donde se publica un descuento por batch: la misma generación baja a 0,05 $ por segundo en modo batch, empatando con Veo 3.1 Lite como el clip de diez segundos más barato del tablero. Sora 2 Pro añade resolución, a 0,30 $ por segundo en 720p, 0,50 $ en 1024p y 0,70 $ en 1080p.
Dónde tiene límites. El Sora 2 estándar tiene como tope 720p, así que cualquier trabajo en 1080p te obliga a pasar a Pro y aproximadamente triplica la tarifa. El modo batch cambia latencia por descuento, lo que lo descarta para cualquier cosa interactiva.
Lo que cuesta. 1,00 $ por el clip de diez segundos en 720p estándar, 0,50 $ en batch, 7,00 $ en Pro a 1080p.
Veredicto. La opción con mejor relación precio-rendimiento para trabajo de pipeline donde nada está esperando al render. Sora también tiene la superficie de integraciones más amplia del grupo, que es la razón por la que existen tantas páginas de integración con Sora 2.
Luma Ray 3.2 y Uni-1.1
Ideal para planos que necesitan dirección más que un solo prompt.
Luma se llevó la peor paliza en las evaluaciones de FLUX 3, con un 93% de los evaluadores prefiriendo FLUX 3. También es el único proveedor aquí que vende el control a nivel de fotograma como su rasgo estrella: Multi-Keyframe permite hasta 16 keyframes dentro de un mismo clip, video-to-video llega hasta 20 segundos, y el modelo incluye generación HDR nativa y exportación EXR de 16 bits para que la salida se pueda componer junto a planos de acción real.
Dónde tiene límites. Luma cobra por clip en lugar de por segundo, y la curva es pronunciada. Un clip de cinco segundos en 720p cuesta 0,30 $, pero diez segundos cuesta 0,90 $, así que la segunda mitad del clip cuesta el doble que la primera. El HDR duplica el precio, y el HDR con EXR lo triplica. El pago por uso conlleva límites de tasa y ningún SLA de latencia, y las tarifas de imagen de Uni-1.1 no están en la página pública en absoluto.
Lo que cuesta. 0,30 $ por cinco segundos en 720p, 0,90 $ por diez. En 1080p eso pasa a 1,20 $ y 3,60 $.
Veredicto. La mejor opción cuando necesitas dirigir un plano en lugar de dejarlo al azar, y la peor si tus clips son largos. La página de precios de Luma tiene la tabla completa, y el especial de alternativas a Luma cubre el resto.
Kling 3.0 Omni
Ideal para editar vídeo existente con audio en una sola pasada.
Kling ya ha superado la versión que Black Forest Labs usó en sus pruebas. La tabla de FLUX 3 cita a Kling v3 Pro con un 60%, mientras que la documentación actual de la API ofrece Kling 3.0, 3.0 Turbo y 3.0 Omni. Omni es el interesante, porque cobra el vídeo de entrada como un modo de primera clase en lugar de un añadido.
Dónde tiene límites. Este es el único proveedor del grupo con una barrera de entrada real. Se compran paquetes de unidades prepago, el paquete de vídeo más pequeño cuesta 700 $ por 5.000 unidades, y cada paquete tiene una validez de 180 días, sin arrastre ni extensión. La concurrencia está limitada a 20 en los paquetes estándar. No hay forma de gastar 5 $ para probarlo.
Lo que cuesta. Una unidad cuesta 0,14 $ de lista. Omni con audio nativo y sin vídeo de entrada son 0,8 unidades por segundo en 720p, es decir, 1,12 $ por diez segundos. Añadir vídeo de entrada sube a 0,9 unidades por segundo. El 4K son 3,0 unidades por segundo, o 0,42 $, en todos los modos.
Veredicto. Modelo potente, forma comercial incómoda para una primera prueba. Si el mínimo de 700 $ es el obstáculo, los precios de Kling tienen paquetes de imagen más pequeños a 350 $, y la página de reseñas de Kling cubre cómo se comporta en la práctica.
Runway Gen-4.5 y Aleph 2.0
Ideal para una sola integración que llega a varios modelos.
Runway perdió su enfrentamiento directo con FLUX 3 con un 77%, y responde a eso de la forma más práctica disponible: revende a la competencia. La lista de modelos de la API de Runway ahora sirve gen4.5, aleph2, seedance2 en tres tamaños y gpt-image-2 desde una sola superficie, y los planes de crédito incluyen imágenes de Nano Banana Pro. Una clave, cuatro laboratorios.
Dónde tiene límites. Runway es el único proveedor aquí que no publica una tarifa de API directa por segundo. Todo funciona por créditos, así que se valora por equivalencia: el plan de 15 $ son 625 créditos, que Runway indica que equivalen a 52 segundos de Gen-4.5, y el plan de 95 $ son 9.500 créditos, o 791 segundos. Los créditos se arrastran un mes en los planes intermedios y no se arrastran en absoluto en el plan de entrada. Las generaciones de Seedance a través de Runway tienen un tope de 15 segundos.
Lo que cuesta. 15 $/mes por 52 segundos de Gen-4.5, o 95 $/mes por 791 segundos. La tarifa efectiva por segundo mejora aproximadamente 2,4 veces entre esos dos planes, lo que convierte la elección de plan en la principal palanca de coste.
Veredicto. La opción pragmática si prefieres integrar una vez en lugar de cinco. Runway Gen-4.5 tiene el detalle del modelo, y los precios de Runway desglosan aún más las cuentas de créditos.
Seedance 2.0 en BytePlus
Ideal para una estética cinematográfica y una vía publicada a 4K.
Seedance es el segundo 52%, casi moneda al aire, en las evaluaciones de FLUX 3, y factura de una forma distinta a todo lo demás aquí. BytePlus cobra por token, donde el recuento de tokens es una función de la duración, las dimensiones de salida y la tasa de fotogramas. La tarifa por millón baja a medida que sube la resolución, de 7,00 $ en 720p a 4,00 $ en 4K, que es lo contrario de cualquier otra tarifa de este artículo. El clip sigue costando más en 4K, porque el recuento de tokens crece más rápido de lo que baja la tarifa.
Dónde tiene límites. La facturación por token es la más difícil de prever de cualquier proveedor aquí. Cuando la entrada incluye vídeo, se aplican límites de consumo mínimo de tokens, así que ediciones cortas pueden costar más de lo que sugiere la fórmula. BytePlus te remite a una calculadora en hoja de cálculo en lugar de a una tabla de tarifas, y el cargo real solo se cierra cuando la API devuelve su recuento de tokens.
Lo que cuesta. BytePlus publica ejemplos trabajados, que es la forma honesta de leerlo: un clip de cinco segundos en 720p cuesta 0,76 $, o 0,15 $ por segundo. Fast cuesta 0,60 $ y Mini 0,38 $ con la misma especificación. En 1080p, cinco segundos son 1,87 $. Añadir vídeo de entrada amplía un trabajo de diez segundos en 720p a un rango de 0,84 $ a 1,86 $ según la longitud de la entrada.
Veredicto. Estética excelente, con una sobrecarga real de previsión. Si quieres Seedance sin las cuentas de tokens, Runway lo revende por créditos.
Grok Imagine 1.5
Ideal para generar vídeo a partir de audio que ya tienes.
Grok Imagine perdió su enfrentamiento directo con un 69%, y tiene una capacidad que nadie más en esta tabla anuncia: la ficha de modelo de xAI lista grok-imagine-video-1.5 como texto, imagen y audio a vídeo. Todos los demás generan el audio. Este puede tomar el tuyo.
Dónde tiene límites. Es la opción por segundo en 720p más cara aquí, con 0,14 $, aproximadamente el triple de Veo 3.1 Lite para la misma resolución. La entrada de medios se cobra por separado a 0,01 $ por imagen. No hay nivel batch.
Lo que cuesta. 0,08 $ por segundo en 480p, 0,14 $ en 720p, 0,25 $ en 1080p. Las imágenes son la ganga de la gama a 0,02 $, o 0,05 $ en el modelo de calidad.
Veredicto. Merece la pena la prima solo si la generación impulsada por audio es el objetivo. Si no, la página de Grok Imagine cubre dónde encaja, y las imágenes a 0,02 $ son difíciles de superar.
FLUX.2, si quieres quedarte con Black Forest Labs
Ideal para enviar imágenes con el mismo proveedor mientras FLUX 3 despeja la pista.
La tarifa de FLUX.2 es totalmente pública y cotiza por megapíxel, donde 1 MP equivale a 1024x1024. [max] cuesta 0,07 $ por el primer megapíxel y 0,03 $ por cada adicional. [pro] cuesta 0,03 $ y 0,015 $. [klein] 9B cuesta 0,015 $ y 0,002 $, y [klein] 4B cuesta 0,014 $ y 0,001 $. [flex] cobra un plano de 0,05 $ por megapíxel sin mínimo por imagen. Las imágenes de referencia cuentan cada una como un megapíxel completo, y cualquier cosa por encima de 4 MP se redimensiona hacia abajo. La documentación sigue describiendo a FLUX.2 como la familia recomendada para todos los casos de uso.
Dónde tiene límites. Solo imágenes, así que sustituye a una de las cuatro capacidades anunciadas de FLUX 3 y a ninguna del vídeo. En adherencia al prompt también queda por detrás. Un profesional que gestiona un sitio de benchmarks puso números sobre ello:
"Flux.2 scored 5, Ideogram4 scored 8, and gpt-image-2 scored 12 out of 15."
Lo que cuesta. 0,03 $ por una sola imagen de 1024x1024 en [pro], o 0,014 $ en [klein] 4B, que es la imagen más barata de todo este repaso.
Veredicto. La decisión correcta si la continuidad con el proveedor importa más que ganar una prueba de adherencia al prompt. Si no es así, compara con GPT Image 2 y Midjourney antes de estandarizar, y revisa los precios de Midjourney o los precios de Ideogram para la vía de suscripción.
Lo que realmente dice la comunidad de pesos abiertos
FLUX 3 Dev es el peldaño que más le importaba a la mayoría de la gente en el hilo de lanzamiento, y es el que no tiene fecha. Eso deja el catálogo actual de pesos abiertos: FLUX.2 [dev] y [klein], más las familias Qwen y Z-Image. Los niveles de licencia que sí existen cubren solo [klein] y [dev], empezando con un plan Builder limitado a 10.000 imágenes al mes en un dominio.
Surgieron dos problemas repetidamente entre quienes los ejecutan localmente. El primero es la destilación:
"dev variants are usually cfg distilled which means that directly finetuning isn't as effective."
El segundo es el hardware y los términos de licencia, según el mismo operador que publicó la tabla de puntuaciones de arriba, sobre por qué el lanzamiento abierto anterior decepcionó. Sus dos razones fueron la VRAM y la velocidad frente a alternativas lanzadas al mismo tiempo, y una licencia que se sintió excesivamente restrictiva.
No es todo escepticismo. Un comentarista ejecuta FLUX.2 dev localmente en una sola RTX 5090 con un upsampler de prompts y lo prefiere sobre los modelos propietarios, que es el contrapeso honesto: un modelo que puedes ejecutar en tu propio hardware gana en ejes que un benchmark no mide. Si esa es tu vía, la edición de imágenes con Qwen es la comparación en vivo más cercana, y entrenar un modelo de IA cubre el lado del fine-tuning.
Cómo hacer tú mismo la comparativa
Aquí está la parte que más me importa, porque es el mismo error que veo cometer a los compradores con la IA de soporte. Una tasa de preferencia del proveedor se mide sobre los prompts del proveedor. "Hasta 93%" y "52%" vienen de la misma evaluación; el marketing cita el primer número y tus renders acabarán más cerca del segundo.

- Fija la especificación antes de tocar una API. Mismo prompt, misma duración, misma resolución, misma configuración de audio en todos los modelos. La mitad de las comparativas que veo por ahí juzgan un clip de 5 segundos en 720p contra uno de 10 segundos en 1080p.
- Usa tu propio material y tu propio brief. Los carretes de los proveedores son tomas seleccionadas. La lista de planos real de tu marca es donde los modelos realmente divergen.
- Calcula el precio del clip terminado, no del primero. Si un modelo barato necesita cuatro intentos y uno caro necesita solo uno, el modelo barato pierde. Este es el número que decide.
He visto exactamente esta disciplina decidir un trato en nuestro propio lado del negocio. Un cliente potencial hizo una evaluación metódica de 67 pruebas de nuestra IA. Las respuestas de conocimiento volvieron sólidas y visitaron la página de facturación tres veces, lo que es casi la señal de compra más fuerte que existe. Luego se marcharon, porque el widget de chat era lento y se quedaba atascado. Lo que mató el trato nunca estuvo en la tabla comparativa de funciones. Ninguna tabla de tasas de preferencia lo habría sacado a la luz, y tampoco lo habría hecho ninguna demo de proveedor. Solo sus propias 67 pruebas lo hicieron.
Ese es todo el argumento para hacer tu propia comparativa, y es por lo que no elegiría un modelo de vídeo a partir de la tabla de evaluación de un post de lanzamiento, incluido el mío. La misma lógica recorre cómo pensamos sobre las alucinaciones de la IA y los umbrales de confianza: el fallo que no has medido con tus propios datos es el que acaba en producción.
Para el mecanismo que todos estos comparten, los modelos de difusión explicados es la lectura de fondo. El repaso más amplio está en las mejores herramientas de IA generativa.
Si tu motivo para generar clips es el contenido y no el cine, el punto de entrada práctico es la automatización de blogs con IA, y el generador de guiones de vídeo con IA cubre el paso previo al render. Lo que ocurre después está en cómo añadir vídeos a los blogs.
Try eesel
Elegir un modelo de vídeo y elegir una IA de soporte resultan ser el mismo ejercicio: ambos parecen decididos por un benchmark y en realidad los decide lo que ocurre con tus propios datos. Esa es la parte que eesel se niega a saltarse.
eesel reproduce un agente de IA propuesto sobre tus tickets pasados reales antes de que responda a un solo cliente en vivo, así que ves la tasa de resolución real, los huecos reales y el coste real por ticket resuelto sobre tu propio volumen en lugar del set de demostración de un proveedor. Se conecta al helpdesk que ya usas, aprende de tu historial en lugar de una lista de escenarios guionizados, y te muestra el número antes de que te comprometas a él. La misma razón por la que el campo de arriba está ordenado por precio publicado y no por tasa de preferencia: los números que puedes comprobar ganan a los números que te enseñan.

Si ya te estás preguntando qué modelo pagar, ese es el instinto correcto. Hazte la misma pregunta sobre tu stack de soporte, y empieza por la simulación en lugar del cambio. Prueba eesel gratis.
El mismo enfoque recorre la IA generativa para atención al cliente y qué LLM encaja mejor con el soporte. Y para un lanzamiento que sí publicó su tarifa el primer día, los precios de DeepSeek V4 Flash son el caso contrario, junto a GPT-5.6.
Preguntas frecuentes
¿Cuáles son las mejores alternativas a FLUX 3 ahora mismo?
¿Por qué necesito una alternativa a FLUX 3?
¿Cuál es la alternativa más barata a FLUX 3 para vídeo?
¿Es FLUX.2 una buena alternativa a FLUX 3?
¿Cuánto cuesta una alternativa a FLUX 3 por clip?
¿Existen alternativas de pesos abiertos a FLUX 3?
¿Cómo debería probar las alternativas a FLUX 3 antes de decidirme?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








