Black Forest Labs presentó FLUX 3, un modelo de inteligencia artificial que combina imágenes, video y audio para generar contenido y anticipar acciones robóticas desde una sola arquitectura.

La compañía lo describe como su primer sistema FLUX capaz de hacer predicciones de video, audio y acciones a partir de un mismo conjunto de pesos.

Un modelo que busca unir varias formas de información

La propuesta parte de una idea central: ninguna modalidad ofrece por sí sola una descripción completa del mundo. Las imágenes muestran la estructura espacial en un instante, mientras el video añade el tiempo y revela dinámicas físicas.

El audio suma otra capa, porque permite relacionar eventos mecánicos con sonidos. En ese enfoque, un golpe no solo aparece como una imagen, sino también como movimiento y como señal acústica vinculada al impacto.

Según la empresa, entrenar varias modalidades al mismo tiempo permite que se condicionen entre sí durante el aprendizaje. El objetivo es que el sonido coincida con el impacto y que el movimiento respete la masa.

Video con audio nativo y predicción de acciones robóticas

FLUX 3 Video puede generar clips de hasta 20 segundos en una sola generación, con audio nativo. El sistema admite texto a video, imagen a video y video a video a partir de un clip de referencia.

También ofrece generación basada en cuadros clave para controlar transiciones específicas, además de continuación generativa de video y audio a partir de materiales de entrada.

La compañía destaca diálogos multilingües, encadenamiento agéntico de clips en secuencias de múltiples tomas, generación de tipografía con diseños animados y mejor desempeño en expresiones faciales humanas.

El mismo backbone impulsa FLUX-mimic, una política robótica que funciona en menos de 80 milisegundos en una tarjeta gráfica RTX 5090.

Preferencias humanas y acceso restringido

La empresa publicó resultados preliminares basados en preferencias humanas. La evaluación utilizó clips de texto a video de 10 segundos, con resolución de 720p y audio.

FLUX 3 fue elegido frente a Luma Ray 3.2 en el 93% de las comparaciones y obtuvo una preferencia del 77% frente a Runway Gen-4.5.

Contra Grok Imagine Video, la cifra alcanzó hasta el 69%. También registró 60% frente a Kling v3 Pro, 59% frente a Happy Horse v1 y 57% frente a Happy Horse 1.1.

La ventaja fue más estrecha frente a Seedance 2.0 y Gemini Omni Flash, con un 52% en esas comparaciones.

El acceso al modelo permanece restringido: Video y Acción están disponibles en acceso anticipado, Imágenes se incorporará después y los pesos abiertos llegarán al final.