LTX-2.5: открытые веса для видео с аудио
video-generationopen-weightsltx-2-5
Открытые веса в видео снова стали интересными
LTX-2.5 важен не тем, что «ещё одна модель рисует ролики», а тем, что Lightricks выложила open-weights видео/world-модель с синхронной генерацией видео и аудио. В карточке модели Lightricks на Hugging Face она описана как модель для локального запуска и fine-tuning, с входами из текста, изображения и видео. Документация LTX добавляет ключевой момент: аудио и видео генерируются синхронно за один проход.
На 12 августа 2026 это выглядит как конкурентный релиз, а не просто красивый тизер. По документации LTX, генерация поддерживает до 20 секунд за один заход, режимы 1080p, 1440p, 4K и портрет до 1080×1920. Частоты тоже не игрушечные: 24, 25, 48 или 50 FPS.
ComfyUI-документация отдельно говорит про native 4K HDR до 50 FPS и RAW workflow для finishing-пайплайнов. Это уже язык людей, которые думают не только о промпте, но и о том, что будет после генерации: монтаж, цвет, доставка в реальный видеопроцесс.
Архитектурно самое мясо не в разрешении. LTX описывает LTX-2.5 как multimodal world model на asymmetric dual-stream diffusion transformer с bidirectional cross-attention. Внутри заявлены custom Gemma 4 12B text encoder, prompt enhancer, native multishot и diffusion-based video decoder вместо прежнего VAE-декодинга.
Есть нюанс: репозиторий на Hugging Face указан как gated, но сама модель описана как open weights. То есть это не полностью «скачал без вопросов и забыл», но для разработчика это всё равно другой класс доступа, чем закрытый видеогенератор только через чужой интерфейс.
Что это меняет для разработчиков
Главное изменение простое: видео-модели начинают выходить из режима демо-магии в режим инженерного материала. Если веса доступны для локального запуска и дообучения, можно разбирать модель, строить пайплайны, настраивать домен и не ждать, пока в закрытом API появится нужная ручка.
Нативный multishot тоже не косметика. Для роликов важна не одна красивая сцена, а связность между планами, длительность, звук и управляемость. Авто-предсказание duration звучит как маленькая деталь, но именно такие детали решают, будет ли модель жить в production-пайплайне или останется игрушкой для промптов.
Я бы первым делом смотрел не на красивые примеры, а на стабильность персонажей, монтажные склейки, дрейф объектов и то, насколько звук реально синхронен, а не просто «что-то играет рядом». В видео всё ломается заметнее, чем в картинках.
Сравнения с Sora и Veo пока скользкие
Честный вывод такой: в карточке модели Lightricks и документации LTX нет надёжной таблицы head-to-head против Sora, Runway Gen-4 и Veo 3. Делать из этого рейтинг победителей было бы натяжкой.
Поэтому я воспринимаю LTX-2.5 не как победный флаг, а как неприятный сигнал для закрытых игроков. Если заявленные режимы подтвердятся в реальных пайплайнах, конкуренция сместится из «у кого красивее тизер» в «у кого модель реально можно встроить, доучить и контролировать».
И вот это уже жара: не один ролик в витрине, а возможность ковырять саму машину, которая его делает.