3 min de lectura

Choice / Score acelera la clasificación, pero no es AGI

Choice / Scoreклассификация текстадистилляция LLM

Choice / Score sustituye la generación libre por la puntuación directa de respuestas predefinidas. En tareas con clases cerradas, elimina la decodificación autorregresiva y puede acelerar la inferencia entre 20 y 200 veces. Es útil para clasificar, pero no sirve cuando hace falta redactar una respuesta nueva.

Qué hace realmente Choice / Score

Yo eliminaría desde el principio las conversaciones sobre AGI: no estamos ante inteligencia general, sino ante una limitación razonable del espacio de respuestas. Choice / Score no genera texto libremente. El modelo recibe opciones definidas de antemano y devuelve una puntuación o probabilidad para cada una.

La guía de Google sobre clasificación de texto describe el mismo formato básico: la salida es un conjunto de puntuaciones de clase que, tras normalizarse, forman una distribución de probabilidades. En lugar de crear tokens secuencialmente, el sistema codifica la entrada y realiza un pequeño paso de evaluación de etiquetas. Por eso la aceleración no es magia, sino una consecuencia directa de la arquitectura.

El rango comentado es de 20 a 200 veces frente a los modelos habituales de generación de texto. Esta diferencia es posible porque un generador ejecuta repetidamente el decodificador para elegir el siguiente token, mientras que un clasificador suele necesitar una sola pasada y el cálculo de puntuaciones para una lista breve de opciones. Cuanto más larga hubiera sido la respuesta libre, más se nota la diferencia.

  • La clasificación y la detección de intención encajan bien en un conjunto cerrado de etiquetas.
  • El enrutamiento y la moderación reducen la latencia sin producir texto innecesario.
  • Las probabilidades permiten usar umbrales y tratar los casos inciertos.
  • El modelo no puede crear una respuesta nueva que no figure entre las opciones.

La comparación con Google TabFM solo es válida a nivel de principio. TabFM trabaja con datos tabulares, mientras que Choice / Score recibe texto, pero ambos sustituyen la generación universal por una predicción estructurada. Son parientes por su lógica de ingeniería, no una misma arquitectura.

Dónde el ahorro es real y dónde empieza el marketing

En tareas cerradas, esto puede ser una alternativa realmente mejor a una LLM grande, pero no una nueva clase de inteligencia. Es posible entrenar un modelo compacto con etiquetas blandas, distribuciones o rankings producidos por un modelo lingüístico grande y ejecutar después la inferencia de forma más barata y rápida.

Yo comprobaría primero no el atractivo multiplicador de velocidad, sino la calidad en las clases raras, la calibración de probabilidades y el comportamiento ante entradas fuera de la distribución de entrenamiento. Sin un modelo abierto, una metodología de comparación y condiciones idénticas, el rango de 20 a 200 veces no debe tomarse como un resultado universal.

La limitación principal está incorporada en la propia idea: el sistema es tan bueno como las opciones definidas previamente. Choice / Score elimina la generación costosa donde nunca hizo falta, pero un posicionamiento exagerado puede convertir un clasificador cuidadoso en la promesa de algo que técnicamente no es.

Anteriormente explicamos cómo medir la fiabilidad de LLM-as-a-Judge con métricas IRT. Ese marco de evaluación complementa los modelos choice-score al hacer las comparaciones entre modelos más coherentes y medibles.