2 мин чтения

Choice / Score ускоряет классификацию, но это не AGI

Choice / Scoreклассификация текстадистилляция LLM

Choice / Score заменяет свободную генерацию прямой оценкой заранее заданных ответов. Для задач с закрытым набором классов это убирает авторегрессионный декодинг и может дать ускорение в 20–200 раз. Выигрыш полезен для классификации, но не для задач, где требуется новый текст.

Что на самом деле делает Choice / Score

Я бы сразу убрал из этой истории разговоры про AGI: перед нами не универсальный интеллект, а разумное ограничение пространства ответов. Choice / Score не генерирует текст в свободной форме. Модель получает заранее заданные варианты и возвращает оценку или вероятность для каждого из них.

В руководстве Google по классификации текста описан тот же базовый формат: на выходе получается набор оценок классов, которые после нормализации образуют распределение вероятностей. Вместо последовательного создания токенов система кодирует вход и выполняет небольшой шаг оценки меток. И вот тут ускорение выглядит не магией, а прямым следствием архитектуры.

Обсуждаемый диапазон составляет 20–200 раз относительно обычных моделей генерации текста. Такой разрыв возможен, потому что генератор многократно запускает декодер, выбирая очередной токен, а классификатору обычно достаточно одного прохода и вычисления оценок для короткого списка вариантов. Чем длиннее был бы свободный ответ, тем заметнее разница.

  • Классификация и определение намерения хорошо укладываются в закрытый набор меток.
  • Маршрутизация и модерация получают меньшую задержку без лишнего текста.
  • Вероятности можно использовать для порогов и обработки неуверенных случаев.
  • Новый ответ, которого нет среди вариантов, модель создать не сможет.

Сравнение с Google TabFM здесь уместно только на уровне принципа. TabFM работает с табличными данными, тогда как Choice / Score принимает текст, но оба подхода заменяют универсальную генерацию структурированным предсказанием. Это скорее родственники по инженерной логике, чем одна архитектура.

Где экономия реальна, а где начинается маркетинг

Для закрытых задач это действительно может быть лучшей заменой большой LLM, но не новым классом интеллекта. Компактную модель можно обучить на мягких метках, распределениях или ранжировании, полученных от крупной языковой модели, а затем выполнять инференс дешевле и быстрее.

Я бы первым делом проверял не красивый множитель ускорения, а качество на редких классах, калибровку вероятностей и поведение при входе вне обучающего распределения. Без открытой модели, методики сравнения и одинаковых условий диапазон 20–200 раз нельзя воспринимать как универсальный результат.

Главное ограничение встроено в саму идею: система хороша ровно настолько, насколько хорошо заранее определены варианты. Choice / Score убирает дорогую генерацию там, где она и не была нужна, но громкое позиционирование превращает аккуратный классификатор в обещание того, чем он технически не является.

Ранее мы разбирали, как измерять надёжность LLM-as-a-Judge с помощью метрик IRT. Эта схема оценки дополняет модели Choice / Score, делая сравнения моделей более последовательными и измеримыми.