2 хв читання

Laya класифікує текст приблизно за 33 мс

Layaклассификация текстаBERT-модели

Laya — це відкрита неавторегресійна модель для класифікації тексту й типізованих рішень. Автори заявляють затримку 32,8 мс на одне питання на GPU T4, а в пакетному режимі — близько 7,2 мс на питання. Це показує, чому компактні BERT-моделі залишаються важливими поруч із генеративними системами.

Що саме створила Laya

Мене тут чіпляє проста річ: Laya не намагається писати текст, вона ухвалює рішення. У README репозиторію автори описують її як відкриту неавторегресійну модель System 1, яка за один прямий прохід відповідає на типізоване питання щодо тексту, листа, тікета або JSON. За перші два дні проєкт зібрав 8 000 зірок на GitHub, і така увага добре відображає попит на вузькі швидкі моделі.

На момент публікації було представлено два чекпоїнти. Англійська версія побудована на ModernBERT-large, містить 421 млн параметрів і підтримує контекст до 512 токенів. Багатомовна версія використовує mmBERT-base з 322 млн параметрів, контекстом до 1 024 токенів і заявленою підтримкою понад 100 мов.

Ключова цифра з README та карток моделей Laya: багатомовний варіант обробляє одне питання за 32,8 мс на GPU T4. Для десяти питань вказано 72,3 мс, для п’ятдесяти — 337 мс. За пакетної обробки виходить приблизно 7,2 мс на питання, тому архітектура особливо цікава там, де запити можна збирати в короткі пакети.

Технічно ставка зроблена на двонапрямний BERT-подібний енкодер і окрему голову ухвалення рішень. Замість вільного тексту модель повертає типізований результат і ймовірність. Це прибирає розбір згенерованого рядка з критичного шляху та звужує простір для галюцинацій: відповідь обирається із заданої схеми, а не складається наново.

Де компактна модель змінює розклад

Для класифікації, guardrails, маршрутизації та розбору вхідних повідомлень генеративна модель часто просто надлишкова. Laya пропонує пряміший шлях: один прохід, обмежений формат відповіді та передбачувана обчислювальна схема. Це не ефектна демонстрація міркувань, зате саме такий компонент зручно ставити перед важчою системою.

Моє перше питання було б не про середню затримку, а про переносимість результатів. Опубліковані вимірювання отримано на GPU T4, тому цифру 32,8 мс не можна автоматично обіцяти на будь-якому периферійному пристрої. Окремо я б перевіряв калібрування ймовірностей, поведінку за зсуву даних і вартість помилок у сценаріях ескалації.

Тут немає магії й майже немає хайпу: вузька модель виграє, бо розв’язує вузьке завдання. Найцікавіше тепер не сама швидкість, а те, наскільки добре Laya збереже якість поза межами офіційного тестового розподілу.

Раніше ми розглядали Rust LocalGPT — компактного локального асистента для практичного розгортання з постійною пам’яттю та HTTP API. Його орієнтація на легкий самостійно розгорнутий ШІ дає корисний контекст для швидкого підходу Laya до класифікації тексту з 0,4 млрд параметрів.