Laya классифицирует текст примерно за 33 мс
Layaклассификация текстаBERT-модели
Что именно сделала Laya
Меня здесь цепляет простая вещь: Laya не пытается писать текст, она принимает решение. Авторы Laya в README репозитория описывают её как открытую неавторегрессионную модель System 1, которая за один прямой проход отвечает на типизированный вопрос по тексту, письму, тикету или JSON. За первые два дня проект собрал 8 000 звёзд на GitHub, и такой интерес хорошо отражает спрос на узкие быстрые модели.
На момент публикации были представлены два контрольных пункта. Английская версия построена на ModernBERT-large, содержит 421 млн параметров и поддерживает контекст до 512 токенов. Многоязычная использует mmBERT-base с 322 млн параметров, контекстом до 1024 токенов и заявленной поддержкой более 100 языков.
Главная цифра из README и карточек моделей Laya: многоязычный вариант обрабатывает один вопрос за 32,8 мс на T4 GPU. Для десяти вопросов указано 72,3 мс, для пятидесяти 337 мс. При пакетной обработке получается примерно 7,2 мс на вопрос, поэтому архитектура особенно интересна там, где запросы можно собирать в короткие батчи.
Технически ставка сделана на двунаправленный BERT-подобный энкодер и отдельную решающую голову. Вместо свободного текста модель возвращает типизированный результат и вероятность. Это убирает разбор сгенерированной строки из критического пути и сокращает пространство для галлюцинаций: ответ выбирается из заданной схемы, а не сочиняется заново.
Где компактная модель меняет расклад
Для классификации, guardrails, маршрутизации и разбора входящих сообщений генеративная модель часто просто избыточна. Laya показывает более прямой путь: один проход, ограниченный формат ответа и предсказуемая вычислительная схема. Это не эффектная демонстрация рассуждений, зато именно такой компонент удобно ставить перед более тяжёлой системой.
Мой первый вопрос был бы не о средней задержке, а о переносимости результатов. Опубликованные измерения получены на T4 GPU, поэтому цифру 32,8 мс нельзя автоматически обещать на любом периферийном устройстве. Отдельно я бы проверял калибровку вероятностей, поведение на сдвиге данных и цену ошибок в сценариях эскалации.
Здесь нет магии и почти нет хайпа: узкая модель выигрывает потому, что решает узкую задачу. Самое интересное теперь не скорость сама по себе, а то, насколько хорошо Laya удержит качество за пределами официального тестового распределения.