2 мин чтения

PrismML и нелатинские языки: доказательств пока мало

PrismMLмногоязычные моделинелатинские алфавиты

Публичные материалы PrismML подтверждают поддержку 39 языков, включая системы письма без латиницы, но не доказывают стабильность качества. Самый явный сигнал дает персидский тест: у сжатых вариантов показатель падает с 79,8% до 66,7%, а затем до 45,2%. Это показывает чувствительность многоязычных возможностей к компрессии.

Что на самом деле подтверждено

Я бы пока не называл проблему нелатинских языков решенной. На 19 сентября 2026 года страница загрузок моделей PrismML указывает вариант Bonsai/ternary g128 для текстового и мультимодального инференса, однако сама эта формулировка ничего не говорит о качестве отдельных языков или систем письма.

Больше конкретики дает карточка старой системы Prism NMT на Hugging Face. В ней заявлена поддержка 39 языков, среди которых есть арабский, бенгальский, китайский, греческий, иврит, японский, казахский, русский и украинский. Но наличие языка в списке поддержки еще не означает одинаковую точность, устойчивость и качество генерации.

Самый полезный сигнал находится в репозитории сравнения PrismML-Bonsai-vs-Qwen3.5. Для персидского языка показатель уменьшается с 79,8% до 66,7%, а затем до 45,2% по мере перехода к более компактным вариантам. Авторы сравнения называют персидский наиболее чувствительной к битности возможностью, и вот тут стало интересно: компрессия бьет не только по общей метрике, но и по конкретной языковой способности.

Релизные материалы Ternary Bonsai сообщают об улучшениях на широком наборе тестов и меньшем падении относительно полноточных моделей. Однако отдельной разбивки по нелатинским письменностям в доступных данных нет. Жалоба пользователя на слабую работу предыдущей версии вне английского выглядит правдоподобным сигналом, но остается наблюдением, а не контролируемым сравнением.

Почему список языков здесь ничего не гарантирует

Главный вывод простой: многоязычная поддержка и стабильная многоязычная модель не одно и то же. Особенно когда сильное сжатие непропорционально ухудшает отдельный язык, как показывает результат для персидского.

Для русских, украинских, арабских и азиатских сценариев я бы первым делом смотрел не на средний итоговый балл, а на тесты по каждому письму. Нужны одинаковые задания для английского и нелатинских языков, сравнение полноточной и сжатых конфигураций, а также проверка токенизации, смешанного текста и сохранения формата ответа.

Пока таких данных нет, нельзя уверенно сказать, исправили ли новые варианты слабость предыдущей версии. Заявленные 39 языков показывают ширину охвата, а падение до 45,2% напоминает о цене этой ширины. Настоящий вопрос теперь не в том, поддерживается ли язык, а в том, что остается от этой поддержки после компрессии.

Мы ранее разбирали, как Unicode-гомоглифы и похожие нелатинские символы могут вводить ИИ-агентов в заблуждение. Этот аспект особенно важен при анализе ограничений PrismML в работе с многоязычным вводом.