3 хв читання

LTX-2.5: відкриті ваги для відео з аудіо

video-generationopen-weightsltx-2-5

Lightricks випустила LTX-2.5 — open-weights відео/світ-модель, що генерує синхронне відео та аудіо з тексту, зображень та відео. За документацією, підтримуються ролики до 20 секунд, режими до 4K HDR та 50 FPS, що робить модель цікавою для локальних пайплайнів та донавчання.

Відкриті ваги у відео знову стали цікавими

LTX-2.5 важливий не тим, що «ще одна модель генерує ролики», а тим, що Lightricks виклала open-weights відео/world-модель із синхронною генерацією відео та аудіо. У картці моделі Lightricks на Hugging Face вона описана як модель для локального запуску та fine-tuning, із входами з тексту, зображень та відео. Документація LTX додає ключовий момент: аудіо та відео генеруються синхронно за один прохід.

На 12 серпня 2026 року це виглядає як конкурентний реліз, а не просто красивий тизер. За документацією LTX, генерація підтримує до 20 секунд за один захід, режими 1080p, 1440p, 4K та портрет до 1080×1920. Частоти також не іграшкові: 24, 25, 48 або 50 FPS.

Документація ComfyUI окремо згадує native 4K HDR до 50 FPS та RAW workflow для finishing-пайплайнів. Це вже мова людей, які думають не лише про промпт, а й про те, що буде після генерації: монтаж, колір, доставка в реальний відеопроцес.

Архітектурно найбільше м’ясо не в роздільній здатності. LTX описує LTX-2.5 як multimodal world model на asymmetric dual-stream diffusion transformer із bidirectional cross-attention. Всередині заявлено custom Gemma 4 12B text encoder, prompt enhancer, native multishot та diffusion-based video decoder замість попереднього VAE-декодингу.

Є нюанс: репозиторій на Hugging Face вказано як gated, але сама модель описана як open weights. Тобто це не повністю «завантажив без питань і забув», але для розробника це все одно інший клас доступу, ніж закритий відеогенератор лише через чужий інтерфейс.

Що це змінює для розробників

Головна зміна проста: відео-моделі починають виходити з режиму демо-магії в режим інженерного матеріалу. Якщо ваги доступні для локального запуску та донавчання, можна розбирати модель, будувати пайплайни, налаштовувати домен і не чекати, поки в закритому API з’явиться потрібна ручка.

Нативний multishot також не косметика. Для роликів важлива не одна красива сцена, а зв’язність між планами, тривалість, звук і керованість. Авто-передбачення duration звучить як маленька деталь, але саме такі деталі вирішують, чи житиме модель у production-пайплайні, чи залишиться іграшкою для промптів.

Я б передусім дивився не на красиві приклади, а на стабільність персонажів, монтажні склейки, дрейф об’єктів і на те, наскільки звук справді синхронний, а не просто «щось грає поруч». У відео все ламається помітніше, ніж у картинках.

Порівняння з Sora та Veo поки слизькі

Чесний висновок такий: у картці моделі Lightricks та документації LTX немає надійної таблиці head-to-head проти Sora, Runway Gen-4 та Veo 3. Робити з цього рейтинг переможців було б натяжкою.

Тому я сприймаю LTX-2.5 не як переможний прапор, а як неприємний сигнал для закритих гравців. Якщо заявлені режими підтвердяться в реальних пайплайнах, конкуренція зміститься з «у кого красивіший тизер» у «чию модель реально можна вбудувати, донавчити та контролювати».

І ось це вже спека: не один ролик у вітрині, а можливість копирсатися в самій машині, яка його створює.

Раніше ми розбирали закриту бету Seedance 2.0 від ByteDance та її виробничі ризики. Це додає контексту тому, як Lightricks зі своєю LTX-2.5 вривається у гонку відеогенерації.