Latence (latency)
En bref
La latence est le délai entre une demande et le début de la réponse ; en IA, le temps avant le premier mot (TTFT) détermine surtout l'impression de réactivité.
📖 Définition
💬 En termes simples
C'est le temps entre le moment où tu passes commande au restaurant et celui où le serveur dépose la première assiette : peu importe la vitesse à laquelle les plats suivants arrivent ensuite (le débit), c'est ce premier délai d'attente qui détermine si le service te semble réactif.
🎯 Exemple concret
Tu cliques sur « Envoyer » dans un clavardage IA ; selon le modèle, le réseau et la charge des serveurs, les premiers mots apparaissent après quelques centaines de millisecondes à plusieurs secondes. Ce délai initial avant le premier mot, c'est la latence (le TTFT).
💡 Le saviez-vous ?
Dans un clavardage IA, c'est le « temps jusqu'au premier mot » (TTFT) qui crée l'impression de réactivité, bien plus que la vitesse des mots suivants : un assistant qui commence à répondre vite « paraît » plus rapide, même s'il génère ensuite au même rythme qu'un autre.
❓ Questions fréquentes
Quelle différence entre latence et débit (throughput) ?
Qu'est-ce qui augmente la latence d'une IA ?
📰 Dans l'actualité
- Pipecat dévoile PhoneLLM Alpha 1, un modèle ouvert pour agents vocaux dérivé de Nemotron (il y a 2 semaines)
- AWS absorbe DuckLabs sans toucher à la licence MIT de DuckDB (il y a 2 semaines)
- Wi-Fi 8 : la fiabilité plutôt que la vitesse, finalisation attendue en 2028 (il y a 3 semaines)
- Base44 lance son modèle d'IA pour le codage (il y a 2 mois)
- IA générative : la course à la vitesse d'OpenAI, Google et Anthropic (il y a 2 mois)