
Lo que FLUX 3 realmente es

FLUX 1 y FLUX 2 hacían imágenes. FLUX 3 es un tipo de cosa distinta, y el nombre lo infravalora.
Se entrena conjuntamente en imagen, video y audio dentro de una sola arquitectura, construida sobre un enfoque que Black Forest Labs llama Self-Flow. El planteamiento de la empresa es que cada modalidad es una proyección con pérdida de una única realidad, así que aprenderlas todas juntas impone restricciones que un modelo de una sola modalidad nunca ve. La frase del post de anuncio que se me queda: "el sonido tiene que coincidir con el impacto, el movimiento tiene que obedecer a la masa."
Eso es una afirmación sobre representación, no sobre píxeles. Es también la misma afirmación detrás de Gemini Robotics 2, solo que abordada desde el otro extremo. DeepMind construyó un modelo de robot y le dio conocimiento del mundo. Black Forest Labs construyó un modelo de video y descubrió que el conocimiento del mundo ya estaba ahí dentro.
En concreto, en una sola generación, FLUX 3 hace:
- Texto a video e imagen a video, con audio, hasta 20 segundos.
- Video a video, llevando un personaje de un clip de referencia a una escena nueva.
- Keyframe a video para transiciones controladas.
- Diálogo multilingüe con voz sincronizada labialmente.
- Encadenamiento agéntico de clips en secuencias de múltiples planos.
- Síntesis y edición de imagen, con renderizado de texto multilingüe.

Para cualquiera que haya estado combinando Midjourney para las imágenes fijas, otra herramienta para los clips y una tercera para la voz en off, la consolidación es el argumento de venta. Un modelo, una factura, un lenguaje de prompts. El linaje de difusión del que viene nunca iba a detenerse en las imágenes fijas.
Esa presión ya se está notando en otros sitios. Todo flujo de trabajo de guion de video con IA que hoy termina en un archivo de texto es candidato para un modelo capaz de renderizar el clip y la voz en off a partir del mismo prompt.
El video es la parte difícil, y el reparto de cómputo lo demuestra

El detalle de ingeniería más útil de todo el lanzamiento es un desglose de costes, y está enterrado en el post complementario sobre robótica.
La predicción de video representa más del 95% del cómputo total de entrenamiento de FLUX 3. El audio es menos del 0.5% de los tokens en un video de 720p con sonido. Black Forest Labs llama al audio "la modalidad fácil", de baja dimensión y fuertemente acoplada a lo que el video ya muestra, así que una vez que el modelo ha aprendido video, adquiere la sincronización labial y los sonidos de impacto casi como efecto secundario.
Las acciones resultan tener la misma forma: una señal de baja dimensión, fuertemente acoplada a la observación visual. Ese es el argumento que sostiene todo el lanzamiento. Si lo aceptas, entonces un modelo de video es un modelo del mundo que resulta que produce píxeles, y el control de robots es solo otra cabeza decodificadora más.
Lo probaron de forma honesta, además. Añadir predicción de acciones a un entrenamiento en curso bajó las valoraciones humanas de texto a video e imagen a video hasta un 10%. Luego, tras 3.500 pasos, la calidad del video volvió a su nivel inicial, con la predicción de acciones ya encima. Una caída temporal, no un impuesto permanente. Hicieron una predicción falsable y publicaron el resultado, que es más de lo que la mayoría de los lanzamientos se molesta en hacer.
Las cifras que publicó Black Forest Labs

Son tasas de preferencia sobre clips de texto a video de 10 segundos, 720p, con audio. Léelas con la advertencia propia del proveedor: tanto el modelo como el arnés de evaluación aún estaban en desarrollo, y 50% significa que el voto se repartió por igual.
| Comparado con | Cuota que prefiere FLUX 3 | Lectura |
|---|---|---|
| Luma Ray 3.2 | 93% | Sin discusión |
| Runway Gen-4.5 | 77% | Claro |
| Grok Imagine Video | 69% | Claro |
| Kling v3 Pro | 60% | Real pero modesto |
| Happy Horse v1 | 59% | Real pero modesto |
| Happy Horse 1.1 | 57% | Marginal |
| Seedance 2.0 | 52% | Empate |
| Gemini Omni Flash | 52% | Empate |
La dispersión es lo que hace que esta tabla merezca leerse más que el titular. Frente a los dos modelos de video más fuertes actuales, FLUX 3 está en empate. Frente a Luma Ray 3.2 es una paliza. Un comunicado de prensa podría decir con verdad "preferido en hasta el 93% de las comparaciones" y no contarte casi nada, que es el mismo truco que juega una única cifra de deflexión combinada en mi propia industria.
Black Forest Labs merece crédito por publicar el extremo perdedor de su propio rango. En el lado de imagen todavía no hay cifras comparativas, solo muestras, y la empresa solo dice que el manejo de prompts complejos y el renderizado de texto mejoraron "significativamente" respecto a versiones anteriores de FLUX.

Si quieres una comparación equivalente sobre imágenes fijas hoy, GPT Image 2 frente a Midjourney es la comparación que realmente tiene ambos modelos disponibles.
Para edición en lugar de generación, Qwen Image Edit es el equivalente actual más cercano. En el extremo barato y rápido, Nano Banana 2 Lite es lo que la mayoría de los equipos usa en su lugar.
Lo que realmente puedes conseguir hoy

Aquí está la escalera, en el orden en que Black Forest Labs la publicó.

| Capacidad | Cómo conseguirla | Estado a 4 ago 2026 |
|---|---|---|
| FLUX 3 Video | API y acceso a pesos privados | Acceso anticipado, formulario de solicitud |
| FLUX-mimic y FLUX 3 Action | Socios de investigación y comerciales seleccionados | Cerrado, mimic robotics primero |
| FLUX 3 Image | API y acceso a pesos privados | "En las próximas semanas" |
| FLUX 3 Dev | Backbone multimodal de pesos abiertos | Anunciado, sin fecha |
Ahora la página de precios, que es donde aterriza la historia.

FLUX 3 no aparece en ella. Tres pestañas, ninguna de FLUX 3. La documentación va más allá y dice claramente que FLUX.2 "es nuestra familia de modelos recomendada para todos los casos de uso". Así que si necesitas lanzar algo este mes, las opciones reales son las que tienen tarifa publicada:
| Modelo | 1er MP | MP adicional | Imagen de referencia | Encaje |
|---|---|---|---|---|
| FLUX.2 [max] | $0.07 | $0.03 | $0.03/MP | Máxima fidelidad, hasta 4 MP |
| FLUX.2 [pro] | $0.03 | $0.015 | $0.015/MP | Equilibrio entre calidad y velocidad |
| FLUX.2 [flex] | $0.05 | $0.05 | $0.05/MP | Facturación pura por megapíxel |
| FLUX.2 [klein] 9B | $0.015 | $0.002 | $0.002/MP | Alto rendimiento, baja latencia |
| FLUX.2 [klein] 4B | $0.014 | $0.001 | $0.001/MP | El más barato por imagen |
La resolución se redondea hacia arriba al siguiente megapíxel, por separado para la salida y para cada imagen de referencia, y un megapíxel son 1024×1024. Cualquier cosa por encima de 4 MP se redimensiona hacia abajo. Lo que significa que el precio de etiqueta y tu factura real divergen rápido en cuanto empiezas a pasar referencias, así que aquí está la aritmética:
Dos referencias en un trabajo [pro] de 1080p meten un tercio de tu factura en las entradas. Ese es el tipo de detalle que solo aparece en el segundo mes, y es la misma lección que en cada tarifa de LLM que he costeado: el precio unitario del titular rara vez es la unidad que realmente compras.
La parte de robots no es una distracción

Que una empresa de generación de imágenes lance un modelo de robótica se lee como un giro. Black Forest Labs argumenta lo contrario. Si la creación de contenido y el control físico corren sobre el mismo modelo del mundo, la robótica es solo un segundo decodificador acoplado a un trabajo por el que ya habían pagado.
La evidencia es un decodificador de acciones ligero entrenado sobre características intermedias de la ruta de video de FLUX 3, construido junto con mimic robotics como FLUX-mimic. En una tarea de kitting de cuerpos blandos, con 20 pruebas autónomas cada una:
| Modelo | Éxito mediano |
|---|---|
| FLUX-mimic | 95% |
| Flow matching de tarea única | 70% |
| FLUX-mimic, backbone congelado | 65% |
| π0.5 | 55% |
| π0.5, backbone congelado | 0% |
La fila del backbone congelado es la que importa. Congela FLUX 3 por completo, entrena solo el decodificador, y aun así obtienes 65%. Haz lo mismo con la línea base π0.5 y obtienes cero. El conocimiento del mundo no solo está presente, es lo bastante legible como para leer acciones directamente de las características. Otras dos cifras lo respaldan: el backbone pasa de entrada a representación en menos de 80ms en una sola RTX 5090, y el bucle robótico completo de mimic reacciona en 101ms.
El despliegue es real, no una demo de laboratorio. Audi lo ha estado ejecutando en tareas de producción y logística que la automatización convencional nunca tocó, como sellos y cables.
"We have seen these robots solve complex soft-body manipulation work that would have been simply impossible with conventional robotics."
Christoph Schneider, Audi Production Lab, quoted in Black Forest Labs' announcement
La afirmación sobre eficiencia de muestras es la estratégicamente interesante. Black Forest Labs reporta que mejores representaciones redujeron a la mitad los pasos de entrenamiento necesarios para alcanzar una tasa de éxito dada, y cita la eficiencia de muestras de hasta 10x del paper mimic-video para modelos de video-acción. Si enseñar a un robot una nueva tarea deja de ser un proyecto de recolección de datos, cambia la economía de la automatización de fábricas. Eso es más importante que cualquier clip de 20 segundos, y es la misma tesis que DeepMind está probando desde el lado de la robótica.
Lo que dijo Hacker News
El hilo de lanzamiento llegó a 571 puntos y 133 comentarios, y la reacción se dividió con claridad. La audiencia técnica quiere una sola cosa, y no es la duración del video.
"Flux 2 Dev Klein has practically been the best you could use on most commercial hardware so I really hope Flux 3 has a comparable updated open-weights model to it. if not it'd be a great loss to most hobbyists."
Los pesos abiertos aparecieron comentario tras comentario, normalmente con la misma preocupación asociada: la línea de pesos abiertos se sitúa al final del plan de lanzamiento sin fecha. Varias personas señalaron la VRAM como el factor decisivo para saber si FLUX 3 Dev será usable en casa.
Los escépticos fueron más ruidosos de lo que merecía el lanzamiento, y una crítica sí dio en el blanco:
"Showed close to zero examples of people. Frivolous use of the term World Model. Claims 20 seconds of video, shows only jumpcuts."
Es una lectura justa de una página cuyas afirmaciones más fuertes son sobre personas y continuidad. La réplica también consiguió votos:
"It's incredible how negative and dismissive the comments in here are while here I am thinking the model actually looks impressively capable."
Las dos cosas pueden ser verdad a la vez. El resultado parece sólido, la presentación lo exagera, y la cosa en sí está detrás de un formulario. Personalmente me quedo con el desglose de cómputo y la gráfica del backbone congelado antes que con otro reel destacado cualquier día, y Black Forest Labs publicó ambos.
Qué significa esto si te dedicas a comprar IA

Yo no me dedico a generar video. Construyo agentes de IA que responden tickets de soporte, y FLUX 3 igual cambió cómo voy a leer los próximos tres lanzamientos en mi propia categoría.
Lee la escalera de acceso antes que el reel de demostración. Un lanzamiento tiene una lista de capacidades y una lista de disponibilidad, y rara vez son la misma lista. La página de FLUX 3 es inusualmente honesta al respecto, ya que publica la escalera ahí mismo. La mayoría de los proveedores de IA de soporte no lo hacen, por eso la pregunta útil siempre es "¿cuál de estas está en mi plan, hoy?" en lugar de "¿puede hacer esto?". Es la misma brecha que señalo al comparar un agente de IA con un chatbot: la demo muestra el techo, el plan muestra el suelo.
El rango vence al titular. "Preferido en hasta el 93% de las comparaciones" y "un empate frente a los dos mejores rivales" describen la misma tabla. Cuando un proveedor te da un solo número de calidad de IA, pide la distribución que hay detrás. Ese es todo el argumento a favor de las métricas por intención frente a una única cifra combinada de deflexión de nivel 1, y lo aplico también a mi propio producto. Es también por lo que los umbrales de confianza superan a una puntuación única de precisión.
Un backbone, muchos trabajos, esa es la tendencia real. FLUX 3 hace imagen, video, audio y acciones desde un solo modelo. En el lado del lenguaje, la misma consolidación explica por qué GPT-5.6 y DeepSeek V4 Flash ahora manejan trabajo que antes necesitaba tres modelos especializados. Claude Opus 4.6 está en la misma curva.
Comprar una herramienta con un solo modelo estrecho dentro es una decisión con vida más corta de lo que solía ser. Sea cual sea el que elijas, compáralo con controles de alucinación antes de dejarlo cerca de un cliente.
Los pesos abiertos son una bifurcación real en el camino. FLUX 3 Dev acabará permitiendo que los equipos autoalojen un backbone multimodal. Eso resulta atractivo justo hasta que asumes el fine-tuning, las GPU y la guardia de on-call. Un cliente nuestro que tenía todas las habilidades necesarias para construirlo internamente lo dijo sin rodeos.
"We could try to write our own LLM application but we didn't want to invest our time into that. We wanted something that we would not have to maintain."
Karel, GENERAL BYTES
Ese es el intercambio, dicho mejor de lo que yo podría. El trabajo de entrenamiento y de modelo personalizado es la parte que nadie muestra en la demo.
¿Quieres una IA que realmente responda tus tickets, no una lista de espera? eesel se conecta a tu helpdesk en pocos minutos, aprende de tus tickets pasados y tu centro de ayuda, y ejecuta una simulación sobre tu historial real para que veas la tasa de resolución antes que un cliente. Sin formulario, sin cola de acceso anticipado. Prueba eesel gratis.
Dónde está FLUX 3 ahora mismo
FLUX 3 es el lanzamiento de modelo más interesante del verano y el menos comprable. El caso técnico es fuerte: un backbone en cuatro modalidades, un desglose de cómputo publicado, un rango de preferencia honesto que incluye las derrotas, y un resultado de robótica con backbone congelado que sería difícil de fingir. El despliegue en Audi le da un suelo de realidad que la mayoría de los anuncios de IA física no tienen.
Lo que no tiene es un precio, un endpoint ni una fecha. FLUX.2 es lo que la propia Black Forest Labs recomienda para todos los casos de uso actuales, y a $0.014-$0.07 por el primer megapíxel es la versión con tarifa publicada. Si FLUX 3 está en tu hoja de ruta, solicita acceso anticipado, y mientras tanto planifica en torno a FLUX.2.
Si estás eligiendo herramientas generativas de forma más amplia, mi resumen de herramientas de IA generativa cubre lo que se puede comprar hoy. Para la mitad de escritura del mismo trabajo, empieza con modelo de IA para blogging.
En el lado del contenido, la automatización de blog con IA es donde estos modelos de imagen realmente se usan día a día. Un redactor de artículos con IA es la pieza que los invoca, y las herramientas de SEO con IA generativa es donde termina la salida.
Para el lado del soporte, la IA generativa para equipos de soporte es el mejor punto de partida. Si vas más atrás que eso, IA generativa para atención al cliente cubre la categoría, y qué LLM conviene al soporte entra en la elección del modelo en sí.
Sources
- FLUX 3 - Real World Models, Black Forest Labs, 24 July 2026
- FLUX 3 x mimic: The Next Generation of Video-Action Models, Black Forest Labs
- Self-Flow, Black Forest Labs research
- FLUX 3 model page, captured 4 August 2026
- Black Forest Labs pricing, captured 4 August 2026
- Black Forest Labs docs introduction, captured 4 August 2026
- Flux 3 launch discussion, Hacker News, 571 points
- Flux 3 x mimic discussion, Hacker News, 318 points
Preguntas frecuentes
¿Qué es FLUX 3?
¿Cuánto cuesta FLUX 3?
[max], $0.03 en [pro] y $0.014 en [klein] 4B. Quien presupuesta el gasto en IA por resultados y no por unidades encontrará más útil el marco de coste por resolución.¿Ya está disponible FLUX 3?
¿Es FLUX 3 mejor que Kling, Runway o Grok Imagine?
¿Tendrá FLUX 3 pesos abiertos?
¿Qué tiene que ver FLUX 3 con los robots?
¿Puedo usar FLUX 3 para imágenes de blog y contenido de soporte?
¿Qué deberían sacar los equipos de soporte del lanzamiento de FLUX 3?

Article by
Rama Adi Nugraha
Rama is a software engineer at eesel AI with two years of experience writing about B2B SaaS, AI tools, and customer support technology. Based in Bali, Indonesia, he brings a developer's perspective to product comparisons — cutting through marketing copy to what the integrations and APIs actually do.







