Nº 012 Edición

·04· Herramientas

FLUX 3 entrena imagen, video, audio y movimiento de robots en el mismo modelo

Black Forest Labs lanzó FLUX 3: un solo set de pesos para imagen, video con audio y robótica. Canva y Picsart ya lo prueban; el acceso sigue restringido.

· Redacción EC
    Para
  • Diseñadores
  • Estudios de diseño
  • Direcciones creativas
  • PM y Founders

Lo nuevo

El modelo que ya genera imágenes dentro de Photoshop acaba de aprender a mover robots. Black Forest Labs presentó FLUX 3 el 23 de julio: un mismo set de pesos entrenado en simultáneo sobre imagen, video y audio, extendido además a predecir acciones físicas (Black Forest Labs).

Se despliega en cuatro piezas: FLUX 3 Video (video con audio sincronizado nativo), FLUX 3 Image (edición precisa con consistencia de producto y material a través del movimiento), FLUX 3 Action (predicción de acciones para robótica) y FLUX 3 Dev. La empresa —fundada en 2024, con sedes en Friburgo y San Francisco, 100 personas, valuación de US$3.250 millones y más de US$450 millones levantados— ya tiene a Canva, Picsart, Krea, Magnific (ex Freepik) y Burda probándolo.

El acceso, por ahora, es lo más restringido del anuncio: Video y Action están en early access seleccionado, Image llega “en las próximas semanas” y las versiones open-weight, más adelante en 2026. No hay precio anunciado para ningún nivel.

Por qué importa

La tesis de Black Forest Labs es que las categorías que la industria trata por separado —generación de imagen, video, world models, simulación, robótica— son expresiones de la misma capacidad. “No se le puede hacer trampa a la realidad. Un modelo que solo aprende imágenes solo puede generar imágenes. Pero el mundo no está hecho de cuadros congelados. Se mueve, suena, cambia y responde”, argumentó Robin Rombach, cofundador y CEO (Black Forest Labs).

Para un equipo creativo la promesa concreta está en la consistencia, no en la robótica. Un modelo que aprendió física, causalidad y sonido junto con la imagen debería sostener el mismo producto, el mismo material y la misma luz a lo largo de un plano en movimiento — que es exactamente donde el video generativo se sigue cayendo y donde muere la mayoría de los pilotos de packaging y producto. Si eso se cumple, la unidad de trabajo pasa del frame a la escena.

Conviene sostener el “si”. FLUX 3 Video “lidera en evaluaciones tempranas contra modelos frontera de video” — evaluaciones tempranas, del propio fabricante, sobre un producto que la empresa describe como todavía en desarrollo. Lo mismo vimos en las 72 horas de anuncios alrededor de Google I/O: el anuncio llega meses antes que el acceso, y el benchmark llega antes que la verificación independiente.

Un detalle que cambia la escala del asunto: FLUX-mimic, el modelo de video-acción construido sobre FLUX 3 junto a mimic robotics, ya está en pruebas y despliegue en líneas de producción de Audi. Christoph Schneider, del Audi Production Lab, describe robots resolviendo manipulación de cuerpos blandos “que habría sido simplemente imposible con robótica convencional”. La misma familia de modelos que corre por debajo de las funciones generativas de Photoshop está moviendo piezas en una fábrica alemana. Para un estudio eso todavía no cambia nada operativo, pero sí cambia con quién compite por cómputo, por roadmap y por atención de producto.

Movimientos

  1. Anotá tu caso de consistencia antes de pedir acceso. El diferencial declarado es mantener producto y material iguales a lo largo del movimiento. Elegí una pieza real donde eso te falló —un packshot que rota, una textura que respira— y tenela lista como test. Sin caso, el early access es una demo más.
  2. Revisá si ya lo estás usando sin saberlo. FLUX corre por debajo de funciones generativas en Photoshop y Picsart, y Canva está entre quienes prueban FLUX 3. Mapear qué modelo hay detrás de cada herramienta de tu stack es un ejercicio de una hora que cambia cómo negociás licencias.
  3. No muevas presupuesto hasta que haya precio y evaluación independiente. Hoy hay dos de cuatro niveles en acceso restringido, cero precios públicos y benchmarks del propio fabricante. Anotate en la lista de espera y dejá el pipeline donde está hasta que aparezca alguna de las tres cosas.

Qué seguir mirando

Hoy hay dos de cuatro niveles abiertos, ningún precio público y ninguna evaluación externa. Lo demás son preguntas:

  • ¿Las evaluaciones independientes confirman el liderazgo en video que la empresa declara?
  • ¿La versión open-weight de fin de 2026 llega con capacidad real o recortada frente a los niveles cerrados?
  • ¿Qué implica para licenciamiento y derechos que el mismo modelo genere una campaña y opere un brazo robótico en una fábrica?