3 min de lectura

FreeToken acelera las LLM locales frente a Ollama

FreeTokenлокальные LLMMoE-инференс

FreeToken acelera la inferencia local de modelos MoE al asignar expertos de forma dinámica entre CPU y GPU y reutilizar estado semántico entre turnos del agente. En la comparación publicada frente a Ollama, el proyecto informa una decodificación 3–4× más rápida y un prefill 6–30× más veloz.

Qué acelera exactamente FreeToken

Lo que me llamó la atención fueron las mejoras declaradas de 3–4× en velocidad de decode y de 6–30× en prefill frente a Ollama. El equipo de FlashML presenta estos resultados en el artículo de FreeToken, arXiv 2608.16157, y en la documentación del proyecto. Son benchmarks publicados por el proyecto en el momento de su publicación, no una prueba independiente mía: la ganancia concreta depende del modelo, el hardware y el tipo de carga.

La idea principal de FreeToken no es otro kernel rápido. El sistema trata CPU, GPU y memoria RAM como una única plataforma elástica para inferir grandes modelos MoE que no caben por completo en la VRAM. Durante la ejecución mide el ancho de banda de la conexión CPU–GPU a través de PCIe y también la velocidad de procesamiento de la CPU.

Después, el runtime decide qué conviene hacer con cada experto: mantenerlo en la caché de la GPU o ejecutarlo directamente en la CPU. La partición estática pierde aquí porque el coste de transferir datos y de calcular varía mucho entre un portátil, un equipo de escritorio y una estación de trabajo. Esto ya parece una optimización de sistemas, no una cifra atractiva obtenida en una única ejecución afortunada.

La segunda palanca es el almacenamiento en caché consciente de la semántica entre turnos del agente. Cuando las solicitudes están relacionadas y cambian gradualmente, FreeToken reutiliza estado útil, mantiene activos a los expertos más demandados y reduce el procesamiento repetido del prompt. Por eso la mejora en prefill es mucho mayor que en la generación secuencial de tokens.

El resumen del proyecto también declara una decodificación 1,5–2,3× más rápida que los mejores sistemas edge comparados en una RTX 5090. Un escenario ilustrativo ejecuta un modelo de 35B parámetros con una GPU de portátil de 8 GB de memoria.

Por qué cambia la inferencia local

FreeToken parece menos una aceleración cosmética y más un intento de corregir la arquitectura básica del stack local de serving. Las máquinas con VRAM limitada pero suficiente RAM, así como los flujos de agentes con largas secuencias de solicitudes relacionadas, son las que más deberían beneficiarse.

Yo revisaría primero el arranque en frío, la latencia de cola, la presión sobre la RAM y el comportamiento de la caché tras un cambio brusco de tema. La reutilización semántica funciona muy bien cuando hay repetición real; en solicitudes inconexas, su aportación será inevitablemente menor. Del mismo modo, el equilibrio entre CPU y GPU puede quedar limitado por un enlace PCIe concreto o por un procesador débil.

Desde el punto de vista de ingeniería, la idea es sólida: medir primero la máquina real y después planificar la ejecución, en lugar de imponer el mismo esquema a todos. La cuestión abierta ya no es si FreeToken es más rápido en las pruebas publicadas, sino cuán estable resulta esa ventaja entre modelos, hardware y sesiones reales de agentes.

Ya analizamos cómo la infraestructura de computación confidencial puede transformar los costes de inferencia de LLM y las concesiones en privacidad. FreeToken añade el componente de rendimiento al mejorar el rendimiento de decodificación mediante la adaptación al ancho de banda entre CPU y GPU.