StartupXO
Buscar
Español

Find XO: KVBoost: Reducción de la latencia del primer token de LLM de 5 a 48 veces mediante reutilización de caché KV, funciona sin GPU (pythongiant.github.io)

1 voto mrlatte Conversar

Idioma del texto: coreano Ver en el idioma original

Resumen / Leer la fuente ↗

- KVBoost de código abierto apareció en Hacker News. - Divide la entrada en fragmentos, les asigna un hash y, cuando el mismo fragmento vuelve a aparecer, reutiliza directamente la caché KV. - Reduce el tiempo hasta el primer token entre 5 y 48 veces y funciona sobre generate() de HuggingFace, por lo que no es necesario cambiar la infraestructura. - Antes de implementarlo, debemos revisar cuánto se repite realmente el mismo contexto en nuestras solicitudes para que las cifras tengan sentido.

Inicia sesión para comentar

Atajos de teclado

Elige una publicación con las flechas arriba y abajo y pulsa Enter.

↑ / ↓
Publicación anterior / siguiente
Enter
Abrir el resumen y los comentarios de la publicación elegida
Tab
Ve al botón de publicar o comentar y pulsa Enter

Escribe con normalidad en los campos de texto. Tab y Enter siempre están disponibles.