3 мин чтения

LTX-2.5: открытые веса для видео с аудио

video-generationopen-weightsltx-2-5

Lightricks выпустила LTX-2.5, open-weights видео/world-модель для генерации синхронных видео и аудио из текста, изображений и видео. На момент релиза в документации заявлены до 20 секунд, режимы до 4K HDR и до 50 FPS, что делает модель заметной для локальных пайплайнов и fine-tuning.

Открытые веса в видео снова стали интересными

LTX-2.5 важен не тем, что «ещё одна модель рисует ролики», а тем, что Lightricks выложила open-weights видео/world-модель с синхронной генерацией видео и аудио. В карточке модели Lightricks на Hugging Face она описана как модель для локального запуска и fine-tuning, с входами из текста, изображения и видео. Документация LTX добавляет ключевой момент: аудио и видео генерируются синхронно за один проход.

На 12 августа 2026 это выглядит как конкурентный релиз, а не просто красивый тизер. По документации LTX, генерация поддерживает до 20 секунд за один заход, режимы 1080p, 1440p, 4K и портрет до 1080×1920. Частоты тоже не игрушечные: 24, 25, 48 или 50 FPS.

ComfyUI-документация отдельно говорит про native 4K HDR до 50 FPS и RAW workflow для finishing-пайплайнов. Это уже язык людей, которые думают не только о промпте, но и о том, что будет после генерации: монтаж, цвет, доставка в реальный видеопроцесс.

Архитектурно самое мясо не в разрешении. LTX описывает LTX-2.5 как multimodal world model на asymmetric dual-stream diffusion transformer с bidirectional cross-attention. Внутри заявлены custom Gemma 4 12B text encoder, prompt enhancer, native multishot и diffusion-based video decoder вместо прежнего VAE-декодинга.

Есть нюанс: репозиторий на Hugging Face указан как gated, но сама модель описана как open weights. То есть это не полностью «скачал без вопросов и забыл», но для разработчика это всё равно другой класс доступа, чем закрытый видеогенератор только через чужой интерфейс.

Что это меняет для разработчиков

Главное изменение простое: видео-модели начинают выходить из режима демо-магии в режим инженерного материала. Если веса доступны для локального запуска и дообучения, можно разбирать модель, строить пайплайны, настраивать домен и не ждать, пока в закрытом API появится нужная ручка.

Нативный multishot тоже не косметика. Для роликов важна не одна красивая сцена, а связность между планами, длительность, звук и управляемость. Авто-предсказание duration звучит как маленькая деталь, но именно такие детали решают, будет ли модель жить в production-пайплайне или останется игрушкой для промптов.

Я бы первым делом смотрел не на красивые примеры, а на стабильность персонажей, монтажные склейки, дрейф объектов и то, насколько звук реально синхронен, а не просто «что-то играет рядом». В видео всё ломается заметнее, чем в картинках.

Сравнения с Sora и Veo пока скользкие

Честный вывод такой: в карточке модели Lightricks и документации LTX нет надёжной таблицы head-to-head против Sora, Runway Gen-4 и Veo 3. Делать из этого рейтинг победителей было бы натяжкой.

Поэтому я воспринимаю LTX-2.5 не как победный флаг, а как неприятный сигнал для закрытых игроков. Если заявленные режимы подтвердятся в реальных пайплайнах, конкуренция сместится из «у кого красивее тизер» в «у кого модель реально можно встроить, доучить и контролировать».

И вот это уже жара: не один ролик в витрине, а возможность ковырять саму машину, которая его делает.

Ранее мы разбирали закрытую бету Seedance 2.0 от ByteDance и её производственные риски. Это добавляет контекст к тому, как Lightricks со своей LTX-2.5 врывается в гонку видео-генерации.