2 хв читання

Choice / Score прискорює класифікацію, але це не AGI

Choice / Scoreклассификация текстадистилляция LLM

Choice / Score замінює вільну генерацію прямим оцінюванням заздалегідь визначених відповідей. У задачах із закритим набором класів це прибирає авторегресійне декодування та може прискорити інференс у 20–200 разів. Підхід корисний для класифікації, але не для завдань, де потрібно створити новий текст.

Що насправді робить Choice / Score

Я б одразу прибрав із цієї історії розмови про AGI: перед нами не універсальний інтелект, а розумне обмеження простору відповідей. Choice / Score не генерує текст у вільній формі. Модель отримує заздалегідь задані варіанти та повертає оцінку або ймовірність для кожного з них.

У посібнику Google з класифікації тексту описано той самий базовий формат: на виході маємо набір оцінок класів, які після нормалізації утворюють розподіл імовірностей. Замість послідовного створення токенів система кодує вхід і виконує невеликий крок оцінювання міток. Тому прискорення тут виглядає не магією, а прямим наслідком архітектури.

Обговорюваний діапазон становить 20–200 разів порівняно зі звичайними моделями генерації тексту. Такий розрив можливий, бо генератор багаторазово запускає декодер, обираючи наступний токен, тоді як класифікатору зазвичай достатньо одного проходу та обчислення оцінок для короткого списку варіантів. Що довшою була б вільна відповідь, то помітнішою є різниця.

  • Класифікація та визначення наміру добре вкладаються в закритий набір міток.
  • Маршрутизація та модерація отримують меншу затримку без зайвого тексту.
  • Імовірності можна використати для порогів і обробки невпевнених випадків.
  • Нову відповідь, якої немає серед варіантів, модель створити не зможе.

Порівняння з Google TabFM доречне лише на рівні принципу. TabFM працює з табличними даними, тоді як Choice / Score приймає текст, але обидва підходи замінюють універсальну генерацію структурованим передбаченням. Це радше родичі за інженерною логікою, а не одна архітектура.

Де економія реальна, а де починається маркетинг

Для закритих завдань це справді може бути кращою заміною великої LLM, але не новим класом інтелекту. Компактну модель можна навчити на м’яких мітках, розподілах або ранжуванні, отриманих від великої мовної моделі, а потім виконувати інференс дешевше та швидше.

Я б насамперед перевіряв не привабливий множник прискорення, а якість на рідкісних класах, калібрування ймовірностей і поведінку на входах поза навчальним розподілом. Без відкритої моделі, методики порівняння та однакових умов діапазон 20–200 разів не можна вважати універсальним результатом.

Головне обмеження закладене в самій ідеї: система настільки добра, наскільки добре заздалегідь визначені варіанти. Choice / Score прибирає дорогу генерацію там, де вона й не була потрібна, але гучне позиціонування перетворює акуратний класифікатор на обіцянку того, чим він технічно не є.

Раніше ми розповідали, як вимірювати надійність LLM-as-a-Judge за допомогою метрик IRT. Ця система оцінювання доповнює моделі Choice / Score, роблячи порівняння моделей послідовнішими та вимірюваними.