LTX-2.5: Pesos abiertos para video con audio
video-generationopen-weightsltx-2-5
Los pesos abiertos en video vuelven a ser interesantes
LTX-2.5 importa no porque “otro modelo más genera clips”, sino porque Lightricks ha lanzado un modelo de video/mundo de pesos abiertos con generación sincronizada de video y audio. En la tarjeta del modelo de Lightricks en Hugging Face se describe como un modelo para ejecución local y fine-tuning, con entradas de texto, imagen y video. La documentación de LTX añade un punto clave: el audio y el video se generan sincrónicamente en una sola pasada.
A fecha del 12 de agosto de 2026, esto parece un lanzamiento competitivo, no solo un tráiler bonito. Según la documentación de LTX, la generación admite hasta 20 segundos por ejecución, modos 1080p, 1440p, 4K y retrato de hasta 1080×1920. Las frecuencias tampoco son de juguete: 24, 25, 48 o 50 FPS.
La documentación de ComfyUI menciona aparte 4K HDR nativo hasta 50 FPS y un flujo RAW para pipelines de acabado. Este es el lenguaje de quienes piensan no solo en el prompt, sino en lo que viene después de la generación: edición, color, entrega en un proceso de video real.
Arquitectónicamente, la sustancia no está en la resolución. LTX describe a LTX-2.5 como un modelo de mundo multimodal sobre un transformer de difusión asimétrico de doble flujo con atención cruzada bidireccional. Internamente presume de un codificador de texto personalizado Gemma 4 12B, potenciador de prompts, multishot nativo y un decodificador de video basado en difusión en lugar del anterior decodificador VAE.
Hay un matiz: el repositorio en Hugging Face figura como restringido (gated), pero el modelo en sí se describe como de pesos abiertos. Así que no es exactamente “descarga y olvídate sin preguntas”, pero para un desarrollador sigue siendo un tipo de acceso distinto al de un generador de video cerrado solo disponible a través de la interfaz de otro.
Qué cambia esto para los desarrolladores
El cambio principal es simple: los modelos de video empiezan a salir del modo de magia-demo y a entrar en el de material de ingeniería. Si los pesos están disponibles para ejecución local y fine-tuning, se puede desmontar el modelo, construir pipelines, adaptarlo a un dominio y no esperar a que aparezca el endpoint necesario en una API cerrada.
El multishot nativo tampoco es cosmético. Para los videos, no se trata de una sola escena bonita, sino de la coherencia entre planos, la duración, el audio y la controlabilidad. La predicción automática de la duración suena como un detalle menor, pero son precisamente esos detalles los que deciden si el modelo vivirá en un pipeline de producción o seguirá siendo un juguete de prompts.
Yo miraría primero no los ejemplos bonitos, sino la estabilidad de los personajes, los cortes de montaje, la deriva de los objetos y hasta qué punto el audio está realmente sincronizado y no solo “suena algo por ahí”. En video todo se rompe de forma más llamativa que en las imágenes.
Las comparaciones con Sora y Veo aún son resbaladizas
La conclusión honesta: en la tarjeta del modelo de Lightricks y en la documentación de LTX no hay una tabla fiable cara a cara contra Sora, Runway Gen-4 y Veo 3. Hacer un ranking de ganadores con eso sería forzado.
Por eso veo LTX-2.5 no como una bandera de victoria, sino como una señal incómoda para los actores cerrados. Si los modos anunciados se confirman en pipelines reales, la competencia pasará de “quién tiene el tráiler más bonito” a “el modelo de quién se puede realmente integrar, reentrenar y controlar”.
Y ahí sí que se pone interesante: no un solo video en un escaparate, sino la posibilidad de trastear con la propia máquina que lo crea.