2 хв читання

PrismML і нелатинські мови: доказів поки замало

PrismMLмногоязычные моделинелатинские алфавиты

Публічні матеріали PrismML підтверджують підтримку 39 мов, зокрема нелатинських систем письма, але не доводять стабільну якість. Найчіткіший сигнал дає перський тест: у стиснених варіантах показник падає з 79,8% до 66,7%, а потім до 45,2%. Отже, багатомовні можливості досі чутливі до стискання.

Що насправді підтверджено

Я б поки не називав проблему нелатинських мов вирішеною. Станом на 19 вересня 2026 року сторінка завантажень моделей PrismML вказує варіант Bonsai/ternary g128 для текстового та мультимодального інференсу, однак це формулювання нічого не говорить про якість окремих мов чи систем письма.

Більше конкретики дає картка старої системи Prism NMT на Hugging Face. У ній заявлено підтримку 39 мов, серед яких арабська, бенгальська, китайська, грецька, іврит, японська, казахська, російська та українська. Але наявність мови у списку підтримки ще не означає однакову точність, стабільність і якість генерації.

Найкорисніший сигнал міститься в репозиторії порівняння PrismML-Bonsai-vs-Qwen3.5. Для перської мови показник зменшується з 79,8% до 66,7%, а потім до 45,2% у міру переходу до компактніших варіантів. Автори порівняння називають перську можливістю, найбільш чутливою до бітності, і саме тут проблема стає цікавою: стискання б'є не лише по загальній метриці, а й по конкретній мовній здатності.

Матеріали релізу Ternary Bonsai повідомляють про поліпшення на широкому наборі тестів і менше падіння порівняно з повноточними моделями. Однак у доступних даних немає окремого розподілу за нелатинськими писемностями. Скарга користувача на слабку роботу попередньої версії поза англійською виглядає правдоподібним сигналом, але залишається спостереженням, а не контрольованим порівнянням.

Чому список мов тут нічого не гарантує

Головний висновок простий: багатомовна підтримка та стабільна багатомовна модель — не те саме. Особливо коли сильне стискання непропорційно погіршує окрему мову, як показує результат для перської.

Для російських, українських, арабських і азійських сценаріїв я б насамперед дивився не на середній підсумковий бал, а на тести для кожної писемності. Потрібні однакові завдання для англійської та нелатинських мов, порівняння повноточної і стиснених конфігурацій, а також перевірка токенізації, змішаного тексту та збереження формату відповіді.

Доки таких даних немає, не можна впевнено сказати, чи виправили нові варіанти слабкість попередньої версії. Заявлені 39 мов показують ширину охоплення, а падіння до 45,2% нагадує про ціну цієї ширини. Справжнє питання тепер не в тому, чи підтримується мова, а в тому, що лишається від цієї підтримки після стискання.

Раніше ми розглядали, як Unicode-гомогліфи та схожі нелатинські символи можуть вводити ШІ-агентів в оману. Цей аспект особливо важливий під час аналізу обмежень PrismML у роботі з багатомовним введенням.