Análisis de FLUX 3: evidencia sólida, nada que comprar todavía

Alicia Kirana Utomo
Escrito por

Alicia Kirana Utomo

Katelin Teen
Revisado por

Katelin Teen

Última edición August 4, 2026

Verificado por expertos
Ilustración de dos revisores sopesando paneles de imágenes generadas en una balanza, representando un análisis de FLUX 3

¿Cómo se analiza un modelo que no puedes ejecutar?

Con honestidad, y dejando la metodología clara desde el principio. De lo contrario, el análisis de un modelo de acceso anticipado no es más que una reescritura del anuncio con adjetivos añadidos.

Esto es lo que pude comprobar. El anuncio de lanzamiento y su lista de capacidades. La tesis de FLUX-mimic y sus gráficos de tasa de éxito. La página de investigación de Self-Flow, que es donde realmente vive el método, publicada como preprint de arXiv 2603.06507. La página del modelo, y la página de precios, que resultó ser la más informativa de todas. Y dos hilos de Hacker News donde personas que ejecutan estos modelos en local reaccionaron en tiempo real. Cada uno de ellos está enlazado en su totalidad al final.

Esto es lo que no pude comprobar: una sola generación. No pasé ningún prompt por FLUX 3, y nadie que escribiera sobre él esta semana lo hizo tampoco, a menos que esté dentro del programa de acceso anticipado.

La página del modelo FLUX 3 mostrando una etiqueta de Coming Soon y un botón de Request early access, capturada el 4 de agosto de 2026 de Black Forest Labs
La página del modelo FLUX 3 mostrando una etiqueta de Coming Soon y un botón de Request early access, capturada el 4 de agosto de 2026 de Black Forest Labs

Esa captura de pantalla es toda la superficie del producto. Básicamente, un formulario de solicitud. Así que lo justo que queda por analizar es el rastro documental, y ese rastro resulta mejor de lo que el anuncio de lanzamiento me había hecho esperar.

La afirmación bajo revisión

FLUX 3 es un modelo fundacional multimodal que se entrena con imágenes, vídeo y audio dentro de una sola arquitectura, y ese mismo backbone también predice acciones de robots. Black Forest Labs lo plantea como aprender una representación del mundo en lugar de tres habilidades separadas. Cómo se sostienen los objetos entre sí, cómo se mueven las cosas, cómo suenan los eventos.

La descripción general de capacidades de FLUX 3 mostrando un modelo que abarca imagen, vídeo, audio y acción, según lo publicado por Black Forest Labs
La descripción general de capacidades de FLUX 3 mostrando un modelo que abarca imagen, vídeo, audio y acción, según lo publicado por Black Forest Labs

La versión concreta: vídeo con audio nativo de hasta 20 segundos en una sola generación, texto a vídeo, imagen a vídeo desde un fotograma inicial o una referencia visual, vídeo a vídeo que traslada un personaje a una nueva escena, fotograma clave a vídeo para transiciones controladas, diálogo multilingüe, y encadenamiento agéntico de clips en secuencias de varios planos. Cada salida trae el audio incorporado en lugar de doblado después.

Ese último detalle es el primero que probaría si tuviera acceso. Un sonido que encaja exactamente en el fotograma donde ocurre el impacto es un problema mucho más difícil que un sonido que simplemente suena sobre un clip, y es del tipo de cosas que o funcionan o se hacen evidentes de inmediato.

Vale la pena decirlo para quien esté planificando en torno a esto: un límite de 20 segundos con audio incorporado cambia lo que cuesta hacer un vídeo explicativo corto, pero no cambia la parte que realmente decide si el clip es bueno. Escribir el guion del vídeo sigue siendo el paso que la mayoría de los equipos se saltan.

El paper es mejor que el anuncio

Esta es la parte del análisis que no esperaba que terminara siendo lo más destacado. FLUX 3 se construye sobre Self-Flow, y es en la página de investigación, no en el anuncio, donde Black Forest Labs realmente muestra su trabajo.

El mecanismo se llama Dual-Timestep Scheduling, y es una variante de la configuración estándar de eliminación de ruido sobre la que se construye cualquier modelo de difusión. Dada una entrada limpia, el método toma dos pasos temporales y una máscara aleatoria, luego añade ruido a cada token según el paso temporal que le corresponde, de modo que distintas partes de la misma entrada llegan a distintos niveles de corrupción. La vista del profesor recibe el nivel de ruido más bajo, lo que crea una asimetría de información deliberada, y el alumno se entrena para eliminar el ruido de la entrada y reconstruir las características del profesor al mismo tiempo. El objetivo de toda esa maquinaria es que el modelo aprenda representaciones sólidas sin un modelo profesor externo acoplado.

Diagrama del Dual-Timestep Scheduling: una entrada limpia se convierte en una cuadrícula con ruido desigual por token, creando asimetría de información, lo que entrena representación y generación juntas sin un modelo profesor externo
Diagrama del Dual-Timestep Scheduling: una entrada limpia se convierte en una cuadrícula con ruido desigual por token, creando asimetría de información, lo que entrena representación y generación juntas sin un modelo profesor externo

Vale la pena explicar por qué esto importa a un comprador y no solo a un investigador. La vía habitual hacia la calidad semántica en un modelo generativo es alinearlo con algún modelo de visión preentrenado por separado. Eso funciona bien, y también te deja manteniendo dos modelos cuyos objetivos no coinciden del todo. La afirmación de Self-Flow es que la representación puede surgir del propio entrenamiento generativo. Cualquiera que haya sopesado construir sobre un codificador preentrenado frente a entrenar algo de extremo a extremo reconocerá esta disyuntiva, y mis notas sobre modelos de IA personalizados y cómo entrenar un modelo de IA cubren la misma bifurcación desde el lado aplicado.

Las ablaciones también son reales. La comparación de imagen ejecuta un backbone de 625M de parámetros sobre 20M de imágenes frente a flow matching estándar, REPA con DINOv2, REPA con SigLIP2 y SRA. Para la ejecución multimodal conjunta se usa un único backbone FLUX.2 de 4B de parámetros entrenado con 200M de imágenes y 6M de vídeos, a lo largo de 100 mil pasos de ajuste fino de alta resolución. Cifras lo bastante específicas como para discutirlas, que ya es más de lo que suele dar la mayoría de los lanzamientos de modelos.

El resultado de escalado es la afirmación más prometedora de cara al futuro de todo el lanzamiento:

Gráfico que muestra la brecha de calidad entre Self-Flow y REPA ampliándose a medida que el backbone crece de 290M a 1B de parámetros, mientras REPA se estanca
Gráfico que muestra la brecha de calidad entre Self-Flow y REPA ampliándose a medida que el backbone crece de 290M a 1B de parámetros, mientras REPA se estanca

A medida que el tamaño del modelo sube de 290M a 420M, a 625M y a 1B de parámetros, la brecha entre Self-Flow y REPA se amplía en lugar de cerrarse, mientras REPA muestra rendimientos decrecientes. Un método que mejora relativamente con la escala vale mucho más que un método que gana en un tamaño concreto.

Ahora la advertencia del revisor, que es real. Esos experimentos llegan solo hasta 4B de parámetros con 200M de imágenes. FLUX 3 en sí se describe como significativamente escalado a partir de esa configuración. Es decir, el paper valida el método, no el modelo publicado. Evidencia sólida de que la arquitectura es sólida, entonces, y ninguna evidencia en absoluto sobre lo que hay detrás del formulario de solicitud.

Las cifras de vídeo, leídas tal como se escribieron

Aquí está el conjunto completo de preferencias del anuncio de lanzamiento, medido sobre clips de texto a vídeo de 10 segundos a 720p con audio.

Comparado conFLUX 3 preferido enLectura
Luma Ray 3.293%Victoria clara
Runway Gen-4.577%Victoria clara
Grok Imagine Video69%Victoria
Kling v3 Pro60%Victoria ajustada
Happy Horse v159%Victoria ajustada
Happy Horse 1.157%Victoria ajustada
Seedance 2.052%Moneda al aire
Gemini Omni Flash52%Moneda al aire
Gráfico de con qué frecuencia los evaluadores humanos prefirieron FLUX 3 frente a modelos de vídeo rivales, desde el 52% frente a Gemini Omni Flash hasta el 93% frente a Luma Ray 3.2, según Black Forest Labs
Gráfico de con qué frecuencia los evaluadores humanos prefirieron FLUX 3 frente a modelos de vídeo rivales, desde el 52% frente a Gemini Omni Flash hasta el 93% frente a Luma Ray 3.2, según Black Forest Labs

Hay dos cosas que merecen reconocimiento aquí. Black Forest Labs publicó las derrotas justo al lado de las victorias, y dejó en negrita la advertencia en su propia página: el modelo y el sistema de evaluación que lo rodea siguen en desarrollo, así que los resultados son preliminares y se espera que mejoren.

Hay dos cosas que merecen escrutinio. El conjunto de comparación fue elegido por el proveedor, con prompts escritos por el proveedor, y Kling ya ha avanzado más allá del v3 Pro que se evaluó, hacia la familia 3.0. Y el resumen honesto de esta tabla es "competitivo con la frontera actual", no "por delante de ella", porque los dos competidores más cercanos terminaron en una moneda al aire.

Nada de eso hace que la tabla sea inútil. La convierte en una métrica de rendimiento realizada por el proveedor, que es una categoría de evidencia real con un sesgo conocido, y se lee como se lee cualquier cifra autoinformada: confía en la forma, descuenta la magnitud y ve a buscar las derrotas. Black Forest Labs al menos imprimió las derrotas.

Si quieres esos ocho modelos con precios en lugar de clasificados, eso es exactamente lo que hace mi desglose de alternativas a FLUX 3, y el análisis completo del lanzamiento cubre la lista de capacidades con más profundidad de la que necesita un análisis.

Las evaluaciones de imagen se hicieron con un modelo que aún se estaba entrenando

El anuncio de lanzamiento lo dice sin rodeos y casi nadie lo citó: las mejoras de imagen provienen de evaluaciones preliminares realizadas durante el midtraining. Las muestras sí se ven sólidas, especialmente en tipografía y en la representación de texto multilingüe, que resulta ser justo donde las versiones anteriores de FLUX tenían problemas visibles.

Cuadrícula de muestras de imagen de FLUX 3 en estilos ilustrativo, fotográfico y tipográfico, según lo publicado por Black Forest Labs
Cuadrícula de muestras de imagen de FLUX 3 en estilos ilustrativo, fotográfico y tipográfico, según lo publicado por Black Forest Labs

Vale la pena contrastarlo con dónde se sitúa realmente la generación actual. Un operador que dirige un sitio de benchmark de adherencia a prompts complejos puntuó a FLUX.2 con 5 sobre 15, a Ideogram 4 con 8 y a GPT Image 2 con 12:

Hacker News

"I run a fairly high-traffic site for generative image models focusing on complex prompt adherence. Flux.2 doesn't score anywhere near SOTA proprietary models."

Esa es la brecha que FLUX 3 Image tiene que cerrar, y es amplia. Otro comentarista expresó la frustración de forma más directa:

Hacker News

"I have a feeling open-weight models ought to be outperforming proprietary ones by now, but that still hasn't happened."

Para trabajo con imágenes que puedas entregar este mes, la comparación que yo haría es FLUX.2 frente a Nano Banana 2, su variante Lite y GPT Image 2.

Si eliges por coste en lugar de por calidad, la comparación entre tres modelos de imagen es la página que mantengo abierta. La edición local es otra habilidad distinta, y la edición de imágenes de Qwen es contra lo que la compararía.

Esta es también la mitad de FLUX 3 que más importa a los equipos de contenido, ya que una ilustración es la parte de una publicación que la mayoría de la gente ya está generando. Si ese es tu caso de uso, el pipeline importa más que el modelo: la automatización de blogs y la redacción de artículos con imágenes cubren cómo encajan ambas cosas, y la tarifa de Midjourney es la base de coste con la que mido.

La sección de robótica es la mejor evidencia del lanzamiento

Si solo lees una parte del material de FLUX 3, lee el anuncio de mimic. Ahí es donde una afirmación sobre representaciones se pone a prueba contra la realidad física, y la realidad física es mucho más difícil de manipular que una encuesta de preferencias.

Black Forest Labs y mimic robotics construyeron FLUX-mimic colgando un decodificador de acciones ligero de la ruta de vídeo de FLUX 3, y Audi lo ha estado probando en trabajo de manipulación de objetos blandos en producción. En una tarea de kitting de objetos blandos con 20 pruebas autónomas, el éxito mediano fue del 95% para FLUX-mimic frente al 55% de la línea base pi-0.5.

Gráfico de tasas de éxito autónomo en una tarea de kitting de objetos blandos, con FLUX-mimic en una mediana del 95% frente al 55% de la línea base pi-0.5, según Black Forest Labs
Gráfico de tasas de éxito autónomo en una tarea de kitting de objetos blandos, con FLUX-mimic en una mediana del 95% frente al 55% de la línea base pi-0.5, según Black Forest Labs

La cifra a la que realmente recurriría en un debate es la de la condición de control. Con el backbone congelado, FLUX-mimic aún alcanzó el 65%, mientras que un pi-0.5 congelado alcanzó el 0%. Congelar el backbone elimina el ajuste fino de la ecuación, así que lo que queda es la calidad de la representación que el modelo de vídeo ya llevaba. Esa es toda la tesis del lanzamiento, puesta a prueba correctamente, con un resultado que habría sido embarazoso de haber salido al revés. Publicarlo de todos modos es lo más creíble de todo este lanzamiento.

Tampoco es un dato aislado en el campo. Gemini Robotics 2 hace una apuesta estructuralmente similar desde el lado de la robótica en lugar del de la generación, lo cual es una señal razonablemente buena de que la idea subyacente no es solo el planteamiento de un laboratorio.

La página de Self-Flow añade después una segunda capa de la misma historia, esta vez desde la simulación. Ajustando finamente las ejecuciones multimodales ponderadas por vídeo con 675M de parámetros y evaluando la predicción de acciones en el simulador SIMPLER, Self-Flow superó al flow matching normal en todas las tareas al principio del entrenamiento, en los 30 mil pasos, donde el flow matching falló por completo en las tareas Open y Place. Para los 100 mil pasos, las tareas de un solo objeto ya habían convergido, mientras que Self-Flow conservaba su ventaja en las tareas de varios objetos y secuenciales. El patrón se mantiene constante en todo momento: el beneficio aparece en las tareas compositivas difíciles y no en las fáciles.

Un lector del hilo captó el detalle que más me convenció, que no es en absoluto una tasa de éxito.

Hacker News

"The video at around 3.30min, where the robot arm took 3 attempts to reseat the window trim, was quite unnerving - I have not seen such resolving before."

Volver a intentarlo tras un fallo sin que se lo pidan es una capacidad distinta a acertar a la primera, y es la que realmente importa cuando un sistema funciona sin supervisión. Me importa esto por la misma razón que me importa en la automatización de soporte. Un sistema que sabe que falló puede transferir el caso; uno que no lo sabe simplemente registra una respuesta equivocada con confianza y sigue adelante. Esa es la tesis detrás de la transferencia de agentes de IA y de cómo prevenir las alucinaciones de IA.

Otro comentarista resumió la apuesta de arquitectura en una sola frase mejor de lo que lo hizo el anuncio de lanzamiento:

Hacker News

"Upshot: a well trained multimodal video generation model has a world representation model trained inside it."

La auditoría de evidencia

Seis afirmaciones, calificadas según lo realmente publicado y no según lo demostrado. Abre cada una.

Auditoría de evidencia de FLUX 3
Cada calificación se basa en lo que Black Forest Labs había publicado a 4 de agosto de 2026. Toca una afirmación para ver la prueba.
Un solo modelo para imagen, vídeo, audio y acción
Publicado: Una ejecución conjunta de 4B de parámetros sobre 200M de imágenes y 6M de vídeos, más un decodificador de acciones sobre el mismo backbone, más el control de backbone congelado.
Calificación: A. Demostrado arquitectónicamente, a escala de investigación.
Mejor vídeo que la competencia
Publicado: Tasas de preferencia realizadas por el proveedor sobre prompts del proveedor, del 93% al 52%, marcadas como preliminares en un modelo aún en desarrollo.
Calificación: C. Competitivo con la frontera, no por delante de ella.
Un salto significativo en calidad de imagen
Publicado: Cuadrículas de muestras y una mejora declarada en prompts complejos y renderizado de texto, a partir de evaluaciones realizadas durante el midtraining.
Calificación: C menos. Muestras prometedoras, ninguna cifra comparativa en absoluto.
El backbone se transfiere al control de robots
Publicado: 95% frente a 55% de éxito mediano en 20 pruebas, 65% frente a 0% con el backbone congelado, un tiempo de paso del backbone inferior a 80ms y un despliegue con Audi nombrado.
Calificación: A. El resultado más sólido y mejor controlado de todo el lanzamiento.
El método escala
Publicado: Una brecha creciente frente a REPA a lo largo de backbones de 290M, 420M, 625M y 1B de parámetros, con REPA estancándose.
Calificación: A menos. Curva real, bases de comparación reales, pero se detiene muy por debajo del tamaño del propio FLUX 3.
Se puede usar
Publicado: Un formulario de solicitud, una hoja de ruta de lanzamiento en prosa y una página de precios sin fila de FLUX 3.
Calificación: F. No es una vía de compra. Este es el que decide tu trimestre.

Dónde el análisis se queda sin camino

Todo análisis tiene que responder eventualmente a "entonces, ¿debería comprarlo?", y este es el punto en el que tengo que detenerme.

La página de precios de Black Forest Labs mostrando pestañas para FLUX.2, FLUX Tools y FLUX.1 solamente, sin fila de FLUX 3, según Black Forest Labs
La página de precios de Black Forest Labs mostrando pestañas para FLUX.2, FLUX Tools y FLUX.1 solamente, sin fila de FLUX 3, según Black Forest Labs

La página de precios tiene pestañas para FLUX.2, FLUX Tools y FLUX.1. FLUX 3 no está en ella. La hoja de ruta de lanzamiento avanza primero con vídeo y audio a través de APIs y acceso a pesos privados, luego con predicción de acciones a través de socios seleccionados empezando por mimic robotics, después con síntesis de imagen, y finalmente con acceso a pesos abiertos del backbone multimodal como FLUX 3 Dev. Solo ha arrancado el primer peldaño, y el peldaño de pesos abiertos no tiene fecha alguna asociada.

Las cifras reales más cercanas son las tarifas de FLUX.2, y vale la pena conocerlas porque probablemente marcan la forma de lo que FLUX 3 acabará cobrando:

Modelo FLUX.2Primer megapíxelMegapíxel adicionalImagen de referencia por MP
[max]$0.07$0.03$0.03
[pro]$0.03$0.015$0.015
[flex]$0.05 plano$0.05 plano$0.05 plano
[klein] 9B$0.015$0.002$0.002
[klein] 4B$0.014$0.001$0.001

Aquí un megapíxel significa una salida de 1024x1024. La facturación redondea hacia arriba por separado para la salida y luego de nuevo para cada imagen de referencia, y todo lo que supere 4 MP se reduce de tamaño. El detalle que suele pillar a la gente es esa línea de imagen de referencia, ya que un flujo de edición con tres referencias cuesta bastante más de lo que sugiere la tarifa anunciada.

Tarjeta de puntuación de la reseña dividida entre lo demostrado, incluyendo el reparto de cómputo publicado y el resultado de backbone congelado, frente a lo comprable, donde precio, API y pesos abiertos están todos ausentes
Tarjeta de puntuación de la reseña dividida entre lo demostrado, incluyendo el reparto de cómputo publicado y el resultado de backbone congelado, frente a lo comprable, donde precio, API y pesos abiertos están todos ausentes

Lo que dicen quienes de verdad ejecutan estos modelos

El hilo de lanzamiento llegó a 571 puntos con 133 comentarios, el hilo de mimic a 318. Y la reacción más interesante ahí no tenía nada que ver con la calidad. Era sobre para quién es FLUX ahora.

Hacker News

"Given that Martin Scorsese is now an 'advisor', I suspect BFL will continue to position itself as the research lab for filmmakers."

Esa lectura encaja mejor con la evidencia que la alternativa. Un modelo con precios pensados para pipelines de VFX es un producto distinto de un modelo con precios pensados para generación masiva de contenido, y el material de lanzamiento se inclina hacia lo primero. Si tu plan era volumen barato, es en el nivel [klein] de FLUX.2 donde vive ese volumen barato, no aquí.

Es algo útil de aclarar pronto, porque decide si FLUX 3 encaja en tu presupuesto siquiera. Un equipo que produce un vídeo destacado por trimestre y un equipo que produce cuarenta clips sociales por semana quieren cosas opuestas de un proveedor, y solo uno de esos equipos debería estar pendiente de este lanzamiento. El lado de SEO de ese pipeline suele acabar siendo la limitación real, más que el coste de renderizado.

Lo que me llevo de esto si te dedicas a comprar IA

No voy a fingir que un modelo de vídeo es un helpdesk. Lo que sí se transfiere es la disciplina de análisis, y esa parte se transfiere exactamente igual.

El patrón de este lanzamiento es el mismo patrón que veo en la mayoría de los discursos de venta de IA desde el otro lado de la mesa: lo impresionante y lo comprable son dos cosas distintas, y el marketing no te las separa. Black Forest Labs fue más honesta que la mayoría, y aun así hizo falta leer la página de precios para descubrir que el producto no está a la venta. Los proveedores de IA generativa para atención al cliente rara vez son así de transparentes.

La versión específica de esto que cuesta dinero a los equipos de soporte es la confianza. Un comprador en una llamada de ventas de eesel describió el modo de fallo mejor de lo que yo podría hacerlo.

"The AI will never be able to answer 100% of the questions, but if it tries and just answers 'sorry I don't know this,' I cannot go and check all my 7,000 tickets to see if the AI actually made a good answer. I need an AI who is only handling the tickets that it's confident to handle and all the other ones, leave them alone."

un responsable de CX que gestiona 7K tickets al mes, de una llamada de ventas de eesel

Ese es el mismo instinto que preocuparse por la cifra de backbone congelado en lugar de por el vídeo destacado. Lo que se quiere saber es el comportamiento en el límite, no el mejor caso. Por eso fijar umbrales de confianza es la primera decisión de configuración que explico a cualquiera, antes que cualquier cosa sobre tono o cobertura, y por eso los agentes de IA frente a los chatbots tradicionales dependen exactamente de esta propiedad.

La vista de actividad de eesel mostrando cada acción de IA realizada en las conversaciones de helpdesk conectadas, cada una con su propio estado de resolución
La vista de actividad de eesel mostrando cada acción de IA realizada en las conversaciones de helpdesk conectadas, cada una con su propio estado de resolución

Analizar un modelo de IA que no puedes ejecutar es frustrante. Analizar un agente de IA antes de comprometerte con él no debería serlo. Eso es lo único que le pediría a cualquier proveedor de este espacio, eesel incluido: muéstrame mis propios números antes de que firme nada. Con eesel apuntas a tu helpdesk, repite tus tickets históricos, y lo que obtienes de vuelta es la tasa de resolución sobre tu propio backlog en lugar de una puntuación de preferencia sacada de los prompts de otra persona. Cada acción queda registrada en un log de actividad que puedes auditar línea por línea. Gratis para probar, y toma minutos en lugar de un formulario de solicitud. Prueba eesel

Si quieres la versión más profunda de ese argumento, la contención en tier-1 con IA cubre qué se automatiza realmente, y la IA generativa para equipos de soporte cubre el despliegue.

El veredicto

DimensiónCalificaciónPor qué
Calidad de la investigaciónABases de comparación reales, ablaciones reales, derrotas publicadas
Evidencia de robóticaAUn control de backbone congelado que nadie tenía por qué publicar
Rendimiento de vídeoCCompetitivo con la frontera, no por delante de ella
Rendimiento de imagenC menosMuestras del midtraining, sin cifras comparativas
TransparenciaB másAdvertencias declaradas, aunque la realidad del acceso queda enterrada
DisponibilidadFSin precio, sin API, sin pesos, sin fechas

FLUX 3 es el lanzamiento de modelo mejor documentado que he leído este año y, a la vez, uno de los menos útiles. Si construyes robots o trabajas en un pipeline de VFX, deberías apuntarte a la lista de acceso anticipado, porque ese resultado de backbone congelado dice que la representación es real. Si necesitas entregar imágenes o clips este trimestre, deberías usar algo con tarifas publicadas y volver a comprobar cuando haya precio. Y si estás aquí porque evaluar proveedores de IA es literalmente tu trabajo, lo que vale la pena robarle a este lanzamiento no es el modelo en sí. Es el hábito de publicar la condición de control.

Para lo que puedes comprar hoy en su lugar, mi resumen de alternativas a FLUX 3 pone precio a ocho de ellas sobre el mismo clip de diez segundos, y las mejores herramientas de IA generativa cubre el campo más amplio.

Si estás eligiendo modelos de texto en la misma pasada, las tres opciones de bajo coste con las que hago benchmark son DeepSeek V4 Flash, Gemini 3.5 Flash-Lite y Qwen 3.7 Flash.

En el extremo de frontera están GPT-5.6 y Claude Opus 4.6, y qué LLM conviene para soporte cubre la lectura específica de soporte sobre todos ellos.

Sources

Preguntas frecuentes

¿Vale la pena FLUX 3 según este análisis?
Todavía no hay nada que valga la pena. A 4 de agosto de 2026, FLUX 3 no tiene precio publicado, ni API de autoservicio ni pesos abiertos, y la página del modelo sigue mostrando "Coming Soon" detrás de un formulario de solicitud. Lo que este análisis de FLUX 3 sí puede decirte es que la investigación subyacente está documentada de forma inusualmente completa, y que las cifras del anuncio de lanzamiento son preliminares según reconoce la propia Black Forest Labs. Si necesitas resultados este trimestre, mi resumen de alternativas a FLUX 3 compara el precio de ocho modelos que sí puedes comprar.
¿Qué tan buena es la calidad de vídeo de FLUX 3?
En las primeras evaluaciones propias de Black Forest Labs sobre clips de 10 segundos a 720p con audio, los evaluadores humanos prefirieron FLUX 3 frente a Luma Ray 3.2 en el 93% de las comparaciones y frente a Runway Gen-4.5 en el 77%, pero solo en el 52% frente a Seedance 2.0 y Gemini Omni Flash. Ese 52% es una moneda al aire. Black Forest Labs afirma abiertamente que tanto el modelo como el sistema de evaluación siguen en desarrollo, la misma cautela que aplico a cualquier métrica de rendimiento de IA que un proveedor publica sobre sí mismo.
¿Qué es Self-Flow y por qué importa en un análisis de FLUX 3?
Self-Flow es el método de entrenamiento sobre el que se construye FLUX 3, publicado en el sitio de investigación de Black Forest Labs como preprint. Utiliza Dual-Timestep Scheduling, que añade ruido a distintos niveles a los tokens de una misma entrada para obligar al modelo a inferir lo que falta, y aprende representación y generación a la vez sin un modelo profesor externo. Importa porque es la parte más verificable del lanzamiento: bases de comparación reales, recuentos de parámetros reales, ablaciones reales. Mi explicación sobre los modelos de difusión cubre la familia a la que pertenece.
¿Puedo usar FLUX 3 para imágenes ya?
No. Se describió que FLUX 3 Image llegaría "en las próximas semanas" y no aparece en la página de precios. La propia documentación de Black Forest Labs sigue señalando a FLUX.2 como la familia recomendada para todos los usos, así que FLUX.2 es la respuesta práctica para trabajo con imágenes hoy. Pruebas independientes de adherencia a prompts sitúan a FLUX.2 muy por detrás de GPT Image 2, algo que vale la pena saber antes de adoptarlo como estándar. Compáralo primero con Nano Banana 2 y con la generación de imágenes de OpenAI.
¿Cuánto costará FLUX 3?
Se desconoce. La fila de precios de FLUX 3 sencillamente no existe. Las únicas cifras reales de Black Forest Labs son las tarifas de FLUX.2: 0,07 $ por el primer megapíxel en [max], 0,03 $ en [pro], 0,015 $ en [klein] de 9B y 0,014 $ en [klein] de 4B, donde un megapíxel equivale a una salida de 1024x1024 y cada imagen de referencia se redondea por separado. Si presupuestas por resultado en lugar de por unidad, el coste por resolución es el marco más adecuado.
¿Es creíble la afirmación de FLUX 3 sobre robótica?
Es la evidencia más sólida de todo el lanzamiento. En una tarea de kitting de objetos blandos con 20 pruebas autónomas, FLUX-mimic alcanzó una tasa de éxito mediana del 95% frente al 55% de la línea base pi-0.5. La cifra que de verdad citaría es la del par con la red congelada: FLUX-mimic aún logró un 65% con su backbone congelado, mientras que pi-0.5 obtuvo un 0%. Esa es una afirmación sobre la representación en sí, no sobre el ajuste fino. Coincide con lo que Gemini Robotics 2 hace desde el lado contrario.
¿Deberían los equipos de contenido esperar a FLUX 3?
No si tienes trabajo saliendo ahora mismo. La señal sobre la que sí vale la pena planificar es que un solo modelo terminará cubriendo una ilustración, un vídeo explicativo corto y su locución, en lugar de tres proveedores y tres facturas. Hasta que tenga precio, construye tu flujo de trabajo sobre modelos que sí tengan tarifas publicadas. Así es como abordaría cualquier decisión sobre un redactor de blogs con IA con imágenes, y el mejor modelo de IA para blogging cubre la mitad del texto.
¿Cuál es la mayor debilidad del lanzamiento de FLUX 3?
La brecha entre lo que se demuestra y lo que se puede comprar, y el hecho de que las evaluaciones de imagen se realizaran durante el midtraining. Ninguna de las dos cosas es deshonesta, y Black Forest Labs señala ambas, pero un lector que solo mire el vídeo promocional por encima no notaría ninguna de las dos. Esa brecha tiene la misma forma que la mayoría de los discursos de venta de IA para soporte, y por eso pongo a prueba el software de servicio al cliente agéntico contra el historial real antes de que toque a un cliente, y realizo pruebas adversariales antes del lanzamiento, no después.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Ilustración de un modelo que genera paneles de imagen, vídeo y audio, en representación de FLUX 3 de Black Forest Labs
Trending

FLUX 3: lo que Black Forest Labs realmente lanzó

FLUX 3 es un solo modelo para imagen, video, audio y acciones de robots. Tampoco tiene API, ni precio, ni pesos abiertos todavía. Esto es lo que puedes y no puedes conseguir.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración que compara un núcleo de modelo pequeño y ordenado con otro mucho mayor y enmarañado, para un análisis de Inkling-Small
Trending

Análisis de Inkling-Small: un cuarto del tamaño, y casi igual de listo

Un análisis práctico de Inkling-Small: supera a su propio modelo padre de 975B en programación con un cuarto del tamaño y un cuarto del precio, y luego se desploma en factualidad. Esto es lo que ese intercambio realmente te cuesta.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Ilustración de Inkling, el modelo de IA de pesos abiertos de Thinking Machines Lab analizado en este artículo
Trending

Análisis de Inkling: ¿vale la pena el modelo abierto de Thinking Machines?

Un análisis honesto de Inkling: en qué es realmente bueno el primer modelo de pesos abiertos de Thinking Machines Lab, dónde fallan el precio y los benchmarks, y quién debería usarlo realmente.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 20, 2026
Banner principal del análisis de PromptQL con el logo de PromptQL sobre un fondo índigo
Trending

Análisis de PromptQL (2026): el agente de datos de Hasura, puesto a prueba

Un análisis práctico de PromptQL: cómo el agente de datos de Hasura separa la planificación de la ejecución, cuánto cuesta y si su promesa de fiabilidad se sostiene.

Alicia Kirana UtomoAlicia Kirana UtomoJul 10, 2026
Ilustración de Google NotebookLM convirtiendo documentos en un breve resumen en video vertical
Trending

NotebookLM Resúmenes en Video cortos: el formato de 60 segundos explicado

Los nuevos Short Video Overviews de NotebookLM convierten tus fuentes en un clip vertical de 60 segundos. Esto es lo que hace el formato, cómo está construido y dónde se queda corto.

Alicia Kirana UtomoAlicia Kirana UtomoJul 11, 2026
Ilustración de un modelo de control de robots humanoides, que representa a Gemini Robotics 2
Trending

Gemini Robotics 2: lo que muestran las cifras de DeepMind

Gemini Robotics 2 lanza tres modelos y una tabla de éxito por tarea en la que la mayoría de las puntuaciones no llega al 80%. Esa tabla es lo más útil de todo el lanzamiento.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026
Una mesa de trabajo de desarrollador donde un modelo de IA termina una tarea con limpieza y se atasca en la siguiente, en el color azul de marca de Meta
Trending

Meta Muse Spark 1.1 a examen: un techo alto y un suelo bajo

Muse Spark 1.1 es el modelo más rápido del tablero y uno de los peores en tareas agénticas. Un análisis de en qué trabajos esos tokens baratos realmente sobreviven.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 5, 2026
Ilustración de un chip de modelo compacto que enruta un token por dos rutas de expertos iluminadas entre muchas apagadas, para una explicación de Inkling-Small
Trending

Inkling-Small explicado: un modelo de 276B con 12B activos

Qué es realmente Inkling-Small: un MoE de pesos abiertos de 276B/12B de Thinking Machines, la ventana de contexto en la que la documentación y los proveedores no coinciden, lo que realmente cuesta un millón de tokens y dónde encaja en una pila de soporte.

Rama Adi NugrahaRama Adi NugrahaAug 4, 2026
Ilustración de un analista comparando paneles de generación de imagen y vídeo, en representación de las alternativas a FLUX 3
Alternatives

Alternativas a FLUX 3: 8 modelos que puedes comprar hoy

FLUX 3 no tiene precio ni API todavía. Aquí tienes 8 modelos de imagen y vídeo con tarifas publicadas, valorados sobre el mismo clip que Black Forest Labs usó en sus pruebas.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieAug 4, 2026

Listo para contratar tu companero de IA?

Configuracion en minutos. Sin tarjeta de credito requerida.

Comienza gratis