PrismML и нелатинские языки: доказательств пока мало
PrismMLмногоязычные моделинелатинские алфавиты
Что на самом деле подтверждено
Я бы пока не называл проблему нелатинских языков решенной. На 19 сентября 2026 года страница загрузок моделей PrismML указывает вариант Bonsai/ternary g128 для текстового и мультимодального инференса, однако сама эта формулировка ничего не говорит о качестве отдельных языков или систем письма.
Больше конкретики дает карточка старой системы Prism NMT на Hugging Face. В ней заявлена поддержка 39 языков, среди которых есть арабский, бенгальский, китайский, греческий, иврит, японский, казахский, русский и украинский. Но наличие языка в списке поддержки еще не означает одинаковую точность, устойчивость и качество генерации.
Самый полезный сигнал находится в репозитории сравнения PrismML-Bonsai-vs-Qwen3.5. Для персидского языка показатель уменьшается с 79,8% до 66,7%, а затем до 45,2% по мере перехода к более компактным вариантам. Авторы сравнения называют персидский наиболее чувствительной к битности возможностью, и вот тут стало интересно: компрессия бьет не только по общей метрике, но и по конкретной языковой способности.
Релизные материалы Ternary Bonsai сообщают об улучшениях на широком наборе тестов и меньшем падении относительно полноточных моделей. Однако отдельной разбивки по нелатинским письменностям в доступных данных нет. Жалоба пользователя на слабую работу предыдущей версии вне английского выглядит правдоподобным сигналом, но остается наблюдением, а не контролируемым сравнением.
Почему список языков здесь ничего не гарантирует
Главный вывод простой: многоязычная поддержка и стабильная многоязычная модель не одно и то же. Особенно когда сильное сжатие непропорционально ухудшает отдельный язык, как показывает результат для персидского.
Для русских, украинских, арабских и азиатских сценариев я бы первым делом смотрел не на средний итоговый балл, а на тесты по каждому письму. Нужны одинаковые задания для английского и нелатинских языков, сравнение полноточной и сжатых конфигураций, а также проверка токенизации, смешанного текста и сохранения формата ответа.
Пока таких данных нет, нельзя уверенно сказать, исправили ли новые варианты слабость предыдущей версии. Заявленные 39 языков показывают ширину охвата, а падение до 45,2% напоминает о цене этой ширины. Настоящий вопрос теперь не в том, поддерживается ли язык, а в том, что остается от этой поддержки после компрессии.