
¿Cómo se analiza un modelo que no puedes ejecutar?
Con honestidad, y dejando la metodología clara desde el principio. De lo contrario, el análisis de un modelo de acceso anticipado no es más que una reescritura del anuncio con adjetivos añadidos.
Esto es lo que pude comprobar. El anuncio de lanzamiento y su lista de capacidades. La tesis de FLUX-mimic y sus gráficos de tasa de éxito. La página de investigación de Self-Flow, que es donde realmente vive el método, publicada como preprint de arXiv 2603.06507. La página del modelo, y la página de precios, que resultó ser la más informativa de todas. Y dos hilos de Hacker News donde personas que ejecutan estos modelos en local reaccionaron en tiempo real. Cada uno de ellos está enlazado en su totalidad al final.
Esto es lo que no pude comprobar: una sola generación. No pasé ningún prompt por FLUX 3, y nadie que escribiera sobre él esta semana lo hizo tampoco, a menos que esté dentro del programa de acceso anticipado.

Esa captura de pantalla es toda la superficie del producto. Básicamente, un formulario de solicitud. Así que lo justo que queda por analizar es el rastro documental, y ese rastro resulta mejor de lo que el anuncio de lanzamiento me había hecho esperar.
La afirmación bajo revisión
FLUX 3 es un modelo fundacional multimodal que se entrena con imágenes, vídeo y audio dentro de una sola arquitectura, y ese mismo backbone también predice acciones de robots. Black Forest Labs lo plantea como aprender una representación del mundo en lugar de tres habilidades separadas. Cómo se sostienen los objetos entre sí, cómo se mueven las cosas, cómo suenan los eventos.

La versión concreta: vídeo con audio nativo de hasta 20 segundos en una sola generación, texto a vídeo, imagen a vídeo desde un fotograma inicial o una referencia visual, vídeo a vídeo que traslada un personaje a una nueva escena, fotograma clave a vídeo para transiciones controladas, diálogo multilingüe, y encadenamiento agéntico de clips en secuencias de varios planos. Cada salida trae el audio incorporado en lugar de doblado después.
Ese último detalle es el primero que probaría si tuviera acceso. Un sonido que encaja exactamente en el fotograma donde ocurre el impacto es un problema mucho más difícil que un sonido que simplemente suena sobre un clip, y es del tipo de cosas que o funcionan o se hacen evidentes de inmediato.
Vale la pena decirlo para quien esté planificando en torno a esto: un límite de 20 segundos con audio incorporado cambia lo que cuesta hacer un vídeo explicativo corto, pero no cambia la parte que realmente decide si el clip es bueno. Escribir el guion del vídeo sigue siendo el paso que la mayoría de los equipos se saltan.
El paper es mejor que el anuncio
Esta es la parte del análisis que no esperaba que terminara siendo lo más destacado. FLUX 3 se construye sobre Self-Flow, y es en la página de investigación, no en el anuncio, donde Black Forest Labs realmente muestra su trabajo.
El mecanismo se llama Dual-Timestep Scheduling, y es una variante de la configuración estándar de eliminación de ruido sobre la que se construye cualquier modelo de difusión. Dada una entrada limpia, el método toma dos pasos temporales y una máscara aleatoria, luego añade ruido a cada token según el paso temporal que le corresponde, de modo que distintas partes de la misma entrada llegan a distintos niveles de corrupción. La vista del profesor recibe el nivel de ruido más bajo, lo que crea una asimetría de información deliberada, y el alumno se entrena para eliminar el ruido de la entrada y reconstruir las características del profesor al mismo tiempo. El objetivo de toda esa maquinaria es que el modelo aprenda representaciones sólidas sin un modelo profesor externo acoplado.

Vale la pena explicar por qué esto importa a un comprador y no solo a un investigador. La vía habitual hacia la calidad semántica en un modelo generativo es alinearlo con algún modelo de visión preentrenado por separado. Eso funciona bien, y también te deja manteniendo dos modelos cuyos objetivos no coinciden del todo. La afirmación de Self-Flow es que la representación puede surgir del propio entrenamiento generativo. Cualquiera que haya sopesado construir sobre un codificador preentrenado frente a entrenar algo de extremo a extremo reconocerá esta disyuntiva, y mis notas sobre modelos de IA personalizados y cómo entrenar un modelo de IA cubren la misma bifurcación desde el lado aplicado.
Las ablaciones también son reales. La comparación de imagen ejecuta un backbone de 625M de parámetros sobre 20M de imágenes frente a flow matching estándar, REPA con DINOv2, REPA con SigLIP2 y SRA. Para la ejecución multimodal conjunta se usa un único backbone FLUX.2 de 4B de parámetros entrenado con 200M de imágenes y 6M de vídeos, a lo largo de 100 mil pasos de ajuste fino de alta resolución. Cifras lo bastante específicas como para discutirlas, que ya es más de lo que suele dar la mayoría de los lanzamientos de modelos.
El resultado de escalado es la afirmación más prometedora de cara al futuro de todo el lanzamiento:

A medida que el tamaño del modelo sube de 290M a 420M, a 625M y a 1B de parámetros, la brecha entre Self-Flow y REPA se amplía en lugar de cerrarse, mientras REPA muestra rendimientos decrecientes. Un método que mejora relativamente con la escala vale mucho más que un método que gana en un tamaño concreto.
Ahora la advertencia del revisor, que es real. Esos experimentos llegan solo hasta 4B de parámetros con 200M de imágenes. FLUX 3 en sí se describe como significativamente escalado a partir de esa configuración. Es decir, el paper valida el método, no el modelo publicado. Evidencia sólida de que la arquitectura es sólida, entonces, y ninguna evidencia en absoluto sobre lo que hay detrás del formulario de solicitud.
Las cifras de vídeo, leídas tal como se escribieron
Aquí está el conjunto completo de preferencias del anuncio de lanzamiento, medido sobre clips de texto a vídeo de 10 segundos a 720p con audio.
| Comparado con | FLUX 3 preferido en | Lectura |
|---|---|---|
| Luma Ray 3.2 | 93% | Victoria clara |
| Runway Gen-4.5 | 77% | Victoria clara |
| Grok Imagine Video | 69% | Victoria |
| Kling v3 Pro | 60% | Victoria ajustada |
| Happy Horse v1 | 59% | Victoria ajustada |
| Happy Horse 1.1 | 57% | Victoria ajustada |
| Seedance 2.0 | 52% | Moneda al aire |
| Gemini Omni Flash | 52% | Moneda al aire |

Hay dos cosas que merecen reconocimiento aquí. Black Forest Labs publicó las derrotas justo al lado de las victorias, y dejó en negrita la advertencia en su propia página: el modelo y el sistema de evaluación que lo rodea siguen en desarrollo, así que los resultados son preliminares y se espera que mejoren.
Hay dos cosas que merecen escrutinio. El conjunto de comparación fue elegido por el proveedor, con prompts escritos por el proveedor, y Kling ya ha avanzado más allá del v3 Pro que se evaluó, hacia la familia 3.0. Y el resumen honesto de esta tabla es "competitivo con la frontera actual", no "por delante de ella", porque los dos competidores más cercanos terminaron en una moneda al aire.
Nada de eso hace que la tabla sea inútil. La convierte en una métrica de rendimiento realizada por el proveedor, que es una categoría de evidencia real con un sesgo conocido, y se lee como se lee cualquier cifra autoinformada: confía en la forma, descuenta la magnitud y ve a buscar las derrotas. Black Forest Labs al menos imprimió las derrotas.
Si quieres esos ocho modelos con precios en lugar de clasificados, eso es exactamente lo que hace mi desglose de alternativas a FLUX 3, y el análisis completo del lanzamiento cubre la lista de capacidades con más profundidad de la que necesita un análisis.
Las evaluaciones de imagen se hicieron con un modelo que aún se estaba entrenando
El anuncio de lanzamiento lo dice sin rodeos y casi nadie lo citó: las mejoras de imagen provienen de evaluaciones preliminares realizadas durante el midtraining. Las muestras sí se ven sólidas, especialmente en tipografía y en la representación de texto multilingüe, que resulta ser justo donde las versiones anteriores de FLUX tenían problemas visibles.

Vale la pena contrastarlo con dónde se sitúa realmente la generación actual. Un operador que dirige un sitio de benchmark de adherencia a prompts complejos puntuó a FLUX.2 con 5 sobre 15, a Ideogram 4 con 8 y a GPT Image 2 con 12:
"I run a fairly high-traffic site for generative image models focusing on complex prompt adherence. Flux.2 doesn't score anywhere near SOTA proprietary models."
Esa es la brecha que FLUX 3 Image tiene que cerrar, y es amplia. Otro comentarista expresó la frustración de forma más directa:
"I have a feeling open-weight models ought to be outperforming proprietary ones by now, but that still hasn't happened."
Para trabajo con imágenes que puedas entregar este mes, la comparación que yo haría es FLUX.2 frente a Nano Banana 2, su variante Lite y GPT Image 2.
Si eliges por coste en lugar de por calidad, la comparación entre tres modelos de imagen es la página que mantengo abierta. La edición local es otra habilidad distinta, y la edición de imágenes de Qwen es contra lo que la compararía.
Esta es también la mitad de FLUX 3 que más importa a los equipos de contenido, ya que una ilustración es la parte de una publicación que la mayoría de la gente ya está generando. Si ese es tu caso de uso, el pipeline importa más que el modelo: la automatización de blogs y la redacción de artículos con imágenes cubren cómo encajan ambas cosas, y la tarifa de Midjourney es la base de coste con la que mido.
La sección de robótica es la mejor evidencia del lanzamiento
Si solo lees una parte del material de FLUX 3, lee el anuncio de mimic. Ahí es donde una afirmación sobre representaciones se pone a prueba contra la realidad física, y la realidad física es mucho más difícil de manipular que una encuesta de preferencias.
Black Forest Labs y mimic robotics construyeron FLUX-mimic colgando un decodificador de acciones ligero de la ruta de vídeo de FLUX 3, y Audi lo ha estado probando en trabajo de manipulación de objetos blandos en producción. En una tarea de kitting de objetos blandos con 20 pruebas autónomas, el éxito mediano fue del 95% para FLUX-mimic frente al 55% de la línea base pi-0.5.

La cifra a la que realmente recurriría en un debate es la de la condición de control. Con el backbone congelado, FLUX-mimic aún alcanzó el 65%, mientras que un pi-0.5 congelado alcanzó el 0%. Congelar el backbone elimina el ajuste fino de la ecuación, así que lo que queda es la calidad de la representación que el modelo de vídeo ya llevaba. Esa es toda la tesis del lanzamiento, puesta a prueba correctamente, con un resultado que habría sido embarazoso de haber salido al revés. Publicarlo de todos modos es lo más creíble de todo este lanzamiento.
Tampoco es un dato aislado en el campo. Gemini Robotics 2 hace una apuesta estructuralmente similar desde el lado de la robótica en lugar del de la generación, lo cual es una señal razonablemente buena de que la idea subyacente no es solo el planteamiento de un laboratorio.
La página de Self-Flow añade después una segunda capa de la misma historia, esta vez desde la simulación. Ajustando finamente las ejecuciones multimodales ponderadas por vídeo con 675M de parámetros y evaluando la predicción de acciones en el simulador SIMPLER, Self-Flow superó al flow matching normal en todas las tareas al principio del entrenamiento, en los 30 mil pasos, donde el flow matching falló por completo en las tareas Open y Place. Para los 100 mil pasos, las tareas de un solo objeto ya habían convergido, mientras que Self-Flow conservaba su ventaja en las tareas de varios objetos y secuenciales. El patrón se mantiene constante en todo momento: el beneficio aparece en las tareas compositivas difíciles y no en las fáciles.
Un lector del hilo captó el detalle que más me convenció, que no es en absoluto una tasa de éxito.
"The video at around 3.30min, where the robot arm took 3 attempts to reseat the window trim, was quite unnerving - I have not seen such resolving before."
Volver a intentarlo tras un fallo sin que se lo pidan es una capacidad distinta a acertar a la primera, y es la que realmente importa cuando un sistema funciona sin supervisión. Me importa esto por la misma razón que me importa en la automatización de soporte. Un sistema que sabe que falló puede transferir el caso; uno que no lo sabe simplemente registra una respuesta equivocada con confianza y sigue adelante. Esa es la tesis detrás de la transferencia de agentes de IA y de cómo prevenir las alucinaciones de IA.
Otro comentarista resumió la apuesta de arquitectura en una sola frase mejor de lo que lo hizo el anuncio de lanzamiento:
"Upshot: a well trained multimodal video generation model has a world representation model trained inside it."
La auditoría de evidencia
Seis afirmaciones, calificadas según lo realmente publicado y no según lo demostrado. Abre cada una.
Un solo modelo para imagen, vídeo, audio y acción
Mejor vídeo que la competencia
Un salto significativo en calidad de imagen
El backbone se transfiere al control de robots
El método escala
Se puede usar
Dónde el análisis se queda sin camino
Todo análisis tiene que responder eventualmente a "entonces, ¿debería comprarlo?", y este es el punto en el que tengo que detenerme.

La página de precios tiene pestañas para FLUX.2, FLUX Tools y FLUX.1. FLUX 3 no está en ella. La hoja de ruta de lanzamiento avanza primero con vídeo y audio a través de APIs y acceso a pesos privados, luego con predicción de acciones a través de socios seleccionados empezando por mimic robotics, después con síntesis de imagen, y finalmente con acceso a pesos abiertos del backbone multimodal como FLUX 3 Dev. Solo ha arrancado el primer peldaño, y el peldaño de pesos abiertos no tiene fecha alguna asociada.
Las cifras reales más cercanas son las tarifas de FLUX.2, y vale la pena conocerlas porque probablemente marcan la forma de lo que FLUX 3 acabará cobrando:
| Modelo FLUX.2 | Primer megapíxel | Megapíxel adicional | Imagen de referencia por MP |
|---|---|---|---|
[max] | $0.07 | $0.03 | $0.03 |
[pro] | $0.03 | $0.015 | $0.015 |
[flex] | $0.05 plano | $0.05 plano | $0.05 plano |
[klein] 9B | $0.015 | $0.002 | $0.002 |
[klein] 4B | $0.014 | $0.001 | $0.001 |
Aquí un megapíxel significa una salida de 1024x1024. La facturación redondea hacia arriba por separado para la salida y luego de nuevo para cada imagen de referencia, y todo lo que supere 4 MP se reduce de tamaño. El detalle que suele pillar a la gente es esa línea de imagen de referencia, ya que un flujo de edición con tres referencias cuesta bastante más de lo que sugiere la tarifa anunciada.

Lo que dicen quienes de verdad ejecutan estos modelos
El hilo de lanzamiento llegó a 571 puntos con 133 comentarios, el hilo de mimic a 318. Y la reacción más interesante ahí no tenía nada que ver con la calidad. Era sobre para quién es FLUX ahora.
"Given that Martin Scorsese is now an 'advisor', I suspect BFL will continue to position itself as the research lab for filmmakers."
Esa lectura encaja mejor con la evidencia que la alternativa. Un modelo con precios pensados para pipelines de VFX es un producto distinto de un modelo con precios pensados para generación masiva de contenido, y el material de lanzamiento se inclina hacia lo primero. Si tu plan era volumen barato, es en el nivel [klein] de FLUX.2 donde vive ese volumen barato, no aquí.
Es algo útil de aclarar pronto, porque decide si FLUX 3 encaja en tu presupuesto siquiera. Un equipo que produce un vídeo destacado por trimestre y un equipo que produce cuarenta clips sociales por semana quieren cosas opuestas de un proveedor, y solo uno de esos equipos debería estar pendiente de este lanzamiento. El lado de SEO de ese pipeline suele acabar siendo la limitación real, más que el coste de renderizado.
Lo que me llevo de esto si te dedicas a comprar IA
No voy a fingir que un modelo de vídeo es un helpdesk. Lo que sí se transfiere es la disciplina de análisis, y esa parte se transfiere exactamente igual.
El patrón de este lanzamiento es el mismo patrón que veo en la mayoría de los discursos de venta de IA desde el otro lado de la mesa: lo impresionante y lo comprable son dos cosas distintas, y el marketing no te las separa. Black Forest Labs fue más honesta que la mayoría, y aun así hizo falta leer la página de precios para descubrir que el producto no está a la venta. Los proveedores de IA generativa para atención al cliente rara vez son así de transparentes.
La versión específica de esto que cuesta dinero a los equipos de soporte es la confianza. Un comprador en una llamada de ventas de eesel describió el modo de fallo mejor de lo que yo podría hacerlo.
"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."
un responsable de CX que gestiona 7K tickets al mes, de una llamada de ventas de eesel
Ese es el mismo instinto que preocuparse por la cifra de backbone congelado en lugar de por el vídeo destacado. Lo que se quiere saber es el comportamiento en el límite, no el mejor caso. Por eso fijar umbrales de confianza es la primera decisión de configuración que explico a cualquiera, antes que cualquier cosa sobre tono o cobertura, y por eso los agentes de IA frente a los chatbots tradicionales dependen exactamente de esta propiedad.

Analizar un modelo de IA que no puedes ejecutar es frustrante. Analizar un agente de IA antes de comprometerte con él no debería serlo. Eso es lo único que le pediría a cualquier proveedor de este espacio, eesel incluido: muéstrame mis propios números antes de que firme nada. Con eesel apuntas a tu helpdesk, repite tus tickets históricos, y lo que obtienes de vuelta es la tasa de resolución sobre tu propio backlog en lugar de una puntuación de preferencia sacada de los prompts de otra persona. Cada acción queda registrada en un log de actividad que puedes auditar línea por línea. Gratis para probar, y toma minutos en lugar de un formulario de solicitud. Prueba eesel
Si quieres la versión más profunda de ese argumento, la contención en tier-1 con IA cubre qué se automatiza realmente, y la IA generativa para equipos de soporte cubre el despliegue.
El veredicto
| Dimensión | Calificación | Por qué |
|---|---|---|
| Calidad de la investigación | A | Bases de comparación reales, ablaciones reales, derrotas publicadas |
| Evidencia de robótica | A | Un control de backbone congelado que nadie tenía por qué publicar |
| Rendimiento de vídeo | C | Competitivo con la frontera, no por delante de ella |
| Rendimiento de imagen | C menos | Muestras del midtraining, sin cifras comparativas |
| Transparencia | B más | Advertencias declaradas, aunque la realidad del acceso queda enterrada |
| Disponibilidad | F | Sin precio, sin API, sin pesos, sin fechas |
FLUX 3 es el lanzamiento de modelo mejor documentado que he leído este año y, a la vez, uno de los menos útiles. Si construyes robots o trabajas en un pipeline de VFX, deberías apuntarte a la lista de acceso anticipado, porque ese resultado de backbone congelado dice que la representación es real. Si necesitas entregar imágenes o clips este trimestre, deberías usar algo con tarifas publicadas y volver a comprobar cuando haya precio. Y si estás aquí porque evaluar proveedores de IA es literalmente tu trabajo, lo que vale la pena robarle a este lanzamiento no es el modelo en sí. Es el hábito de publicar la condición de control.
Para lo que puedes comprar hoy en su lugar, mi resumen de alternativas a FLUX 3 pone precio a ocho de ellas sobre el mismo clip de diez segundos, y las mejores herramientas de IA generativa cubre el campo más amplio.
Si estás eligiendo modelos de texto en la misma pasada, las tres opciones de bajo coste con las que hago benchmark son DeepSeek V4 Flash, Gemini 3.5 Flash-Lite y Qwen 3.7 Flash.
En el extremo de frontera están GPT-5.6 y Claude Opus 4.6, y qué LLM conviene para soporte cubre la lectura específica de soporte sobre todos ellos.
Sources
- FLUX 3 launch announcement, Black Forest Labs
- FLUX 3 x mimic, the video-action thesis
- Self-Flow research page, arXiv preprint 2603.06507
- FLUX 3 model page
- Black Forest Labs pricing
- FLUX.2 overview docs
- Launch thread, Hacker News, 571 points
- mimic thread, Hacker News, 318 points
Preguntas frecuentes
¿Vale la pena FLUX 3 según este análisis?
¿Qué tan buena es la calidad de vídeo de FLUX 3?
¿Qué es Self-Flow y por qué importa en un análisis de FLUX 3?
¿Puedo usar FLUX 3 para imágenes ya?
¿Cuánto costará FLUX 3?
[max], 0,03 $ en [pro], 0,015 $ en [klein] de 9B y 0,014 $ en [klein] de 4B, donde un megapíxel equivale a una salida de 1024x1024 y cada imagen de referencia se redondea por separado. Si presupuestas por resultado en lugar de por unidad, el coste por resolución es el marco más adecuado.¿Es creíble la afirmación de FLUX 3 sobre robótica?
¿Deberían los equipos de contenido esperar a FLUX 3?
¿Cuál es la mayor debilidad del lanzamiento de FLUX 3?

Article by
Alicia Kirana Utomo
Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.








