Не про «розумність», а про те, чи бачить модель картинку
Найважливіше тут просте: Moonshot AI випустила PerceptionBench як діагностичний бенчмарк не для загального мультимодального IQ, а саме для атомарного візуального сприйняття. У блозі Kimi про PerceptionBench це сформульовано досить чесно: завдання в тому, щоб перевірити, чи може модель відповісти по зображенню безпосередньо, без опори на мовні шаблони, зовнішні знання та гарне міркування поверх помилки сприйняття.
І ось це, на мій погляд, правильний удар по болючому місцю. Дуже багато мультимодальних тестів змішують усе одразу: зір, міркування, пам'ять, здогадку за контекстом. А потім модель отримує пристойний підсумковий бал, хоча на базовому рівні могла просто не помітити об'єкт, переплутати атрибут або домалювати неіснуючу деталь.
В описі PerceptionBench розбивка йде на 10 атомарних здібностей: visual relations, counting, attributes, depth and 3D understanding, localization, comparison, fine-grained recognition, context integration, OCR і hallucination detection. Це вже не «модель добре розуміє картинки», а спроба розкласти збій по поличках: де саме ламається пайплайн сприйняття.
Ще один конкретний сигнал із анонсу: у бенчмарку близько 3000 перевірених прикладів, а загальна точність протестованих моделей, за даними Moonshot AI, залишається нижче 60%. Якщо ця постановка акуратна, то висновок неприємний, але корисний: стеля у багатьох систем зараз упирається не в складне міркування, а в досить приземлені помилки першого візуального проходу.
Чому це змінює розмову про мультимоделі
Так, це схоже на спробу підняти стандарт оцінки, і це хороший хід. Коли бенчмарк цілиться саме в perception, стає важче ховати слабкий зір моделі за сильним текстовим декодером.
Для інженерів користь дуже практична. Якщо модель валиться на localization, OCR або hallucination detection, це вже не абстрактне «вона гірша за конкурентів», а більш зрозумілий сигнал, що перевіряти першим у продукті: витяг тексту, координати об'єктів, візуальні порівняння, сцени зі схожими сутностями.
Але я б тримав у голові й інший бік. Будь-який benchmark, особливо випущений самою лабораторією, майже неминуче стане вітриною її власної оптики на проблему і, можливо, сильних сторін її моделей. Тож тут цікавий не тільки сам PerceptionBench, а й те, чи почнуть по ньому системно звітувати інші гравці. Якщо так, у мультимодального ринку з'явиться рідкісна корисна річ: тест, який хоча б намагається вимірювати зір, а не гарно замасковану здогадку.