Find XO: KVBoost: Reducción de la latencia del primer token de LLM de 5 a 48 veces mediante reutilización de caché KV, funciona sin GPU (pythongiant.github.io)
Idioma del texto: coreano Ver en el idioma original
Resumen / Leer la fuente ↗
- KVBoost de código abierto apareció en Hacker News.
- Divide la entrada en fragmentos, les asigna un hash y, cuando el mismo fragmento vuelve a aparecer, reutiliza directamente la caché KV.
- Reduce el tiempo hasta el primer token entre 5 y 48 veces y funciona sobre generate() de HuggingFace, por lo que no es necesario cambiar la infraestructura.
- Antes de implementarlo, debemos revisar cuánto se repite realmente el mismo contexto en nuestras solicitudes para que las cifras tengan sentido.