# FLUX 3 integra video, audio y robótica en un solo modelo

> Black Forest Labs presentó FLUX 3, un sistema de IA que combina imagen, video y audio, y también apunta a acciones robóticas. Su versión de video genera clips de hasta 20 segundos.

Por Deivimar Gutiérrez Soto · 29 de julio de 2026 · Tecnología

![File:Flux Pen.jpg](https://panorama.onl/app/uploads/379b5672780795f1.webp)

Claves

- FLUX 3 reúne imágenes, video y audio dentro de una misma arquitectura.

- FLUX 3 Video puede generar clips de hasta 20 segundos con audio nativo.

- FLUX-mimic opera en menos de 80 milisegundos en una RTX 5090.

Black Forest Labs presentó FLUX 3, un modelo de inteligencia artificial que combina imágenes, video y audio para generar contenido y anticipar acciones robóticas desde una sola arquitectura.

La compañía lo describe como su primer sistema FLUX capaz de hacer predicciones de video, audio y acciones a partir de un mismo conjunto de pesos.

## Un modelo que busca unir varias formas de información

La propuesta parte de una idea central: ninguna modalidad ofrece por sí sola una descripción completa del mundo. Las imágenes muestran la estructura espacial en un instante, mientras el video añade el tiempo y revela dinámicas físicas.

El audio suma otra capa, porque permite relacionar eventos mecánicos con sonidos. En ese enfoque, un golpe no solo aparece como una imagen, sino también como movimiento y como señal acústica vinculada al impacto.

Según la empresa, entrenar varias modalidades al mismo tiempo permite que se condicionen entre sí durante el aprendizaje. El objetivo es que el sonido coincida con el impacto y que el movimiento respete la masa.

## Video con audio nativo y predicción de acciones robóticas

FLUX 3 Video puede generar clips de hasta 20 segundos en una sola generación, con audio nativo. El sistema admite texto a video, imagen a video y video a video a partir de un clip de referencia.

También ofrece generación basada en cuadros clave para controlar transiciones específicas, además de continuación generativa de video y audio a partir de materiales de entrada.

La compañía destaca diálogos multilingües, encadenamiento agéntico de clips en secuencias de múltiples tomas, generación de tipografía con diseños animados y mejor desempeño en expresiones faciales humanas.

El mismo backbone impulsa FLUX-mimic, una política robótica que funciona en menos de 80 milisegundos en una tarjeta gráfica RTX 5090.

20 segundos duración máxima de los clips que genera FLUX 3 Video en una sola generación

## Preferencias humanas y acceso restringido

La empresa publicó resultados preliminares basados en preferencias humanas. La evaluación utilizó clips de texto a video de 10 segundos, con resolución de 720p y audio.

FLUX 3 fue elegido frente a Luma Ray 3.2 en el 93% de las comparaciones y obtuvo una preferencia del 77% frente a Runway Gen-4.5.

Contra Grok Imagine Video, la cifra alcanzó hasta el 69%. También registró 60% frente a Kling v3 Pro, 59% frente a Happy Horse v1 y 57% frente a Happy Horse 1.1.

La ventaja fue más estrecha frente a Seedance 2.0 y Gemini Omni Flash, con un 52% en esas comparaciones.

El acceso al modelo permanece restringido: Video y Acción están disponibles en acceso anticipado, Imágenes se incorporará después y los pesos abiertos llegarán al final.

Costo de entrenamiento

La predicción de video consume más del 95% de la computación utilizada durante el entrenamiento de FLUX 3, mientras que el audio representa menos del 0,5% de los tokens empleados.

---

**Fuente:** https://panorama.onl/tecnologia/flux-3-integra-video-audio-y-robotica-en-un-solo-modelo-20260729-0116.html
Publicado por Panorama Online — contenido de libre lectura; se permite citar con atribución y enlace a la URL original.
