KV cache
Aussi appelé : Key-Value cache (cache attention) · cache KV · KV-caching · attention caching
En bref
Le KV cache est une optimisation technique stockant les vecteurs Key et Value des tokens précédents pour accélérer l'inférence des modèles de langage en évitant des recalculs redondants.
📖 Définition
💬 En termes simples
C'est garder ouverts les chapitres déjà lus d'un livre au lieu de les rouvrir à chaque fois qu'on tourne une page.
🎯 Exemple concret
Une équipe IT de Boucherville héberge un Llama 3 70B local – en activant le PagedAttention pour optimiser le KV cache, elle passe de 8 utilisateurs simultanés à 32 sur le même serveur, économisant 12 000 $/mois.
💡 Le saviez-vous ?
En 2026, plus de 60 % de la mémoire GPU d'un déploiement LLM en production est typiquement consacrée au KV cache – l'optimiser est devenu un domaine de recherche actif (vLLM, FlashAttention, MLA).
❓ Questions fréquentes
Quelle est la différence entre le KV cache et la mémoire vive standard ?
Quand devriez-vous optimiser la gestion de votre KV cache ?
Quelles sont les limites actuelles du KV cache ?
📚 Sources
- Efficient Memory Management for LLM Serving with PagedAttention (Kwon et al., 2023)
- NVIDIA Documentation - KV Cache Optimization (NVIDIA, 2024)
📰 Dans l'actualité
- Qwen3.8-Flash-Next : le vrai prix pour tourner sur 24 Go (il y a 2 semaines)
- Deepseek dévoile des modèles d'IA performants et abordables (il y a 4 mois)
- Gemma 4 : Le modèle multimodal open source de Google DeepMind (il y a 5 mois)