Transformer
Aussi appelé : architecture Transformer · Transformers · réseau de neurones Transformer · modèle Transformer
En bref
Le Transformer est une architecture de réseau de neurones basée sur le mécanisme d'attention, permettant de traiter des données séquentielles en parallèle pour capturer les relations contextuelles globales dans un texte.
📖 Définition
💬 En termes simples
C'est une machine capable de lire une phrase entière d'un coup et de comprendre les relations entre tous les mots simultanément.
🎯 Exemple concret
Comprendre que le mot « avocat » désigne le fruit ou le métier selon les autres mots de la phrase.
💡 Le saviez-vous ?
C'est l'architecture révolutionnaire (le « T » de GPT) inventée par Google en 2017 qui a tout changé.
❓ Questions fréquentes
Pourquoi l'architecture Transformer a-t-elle révolutionné l'IA ?
Quel est le rôle du mécanisme d'attention dans cette architecture ?
Quelles sont les limites techniques des Transformers ?
📚 Sources
- Google Research - Attention Is All You Need (Ashish Vaswani et al., 2017)
- Wikipedia - Transformer (machine learning model) (Wikipedia, 2024)
📰 Dans l'actualité
- Profiling de l'algorithme d'attention dans PyTorch (il y a 2 mois)
- Transformers backend pour vLLM : performances natives optimisées (il y a 2 mois)
- NVIDIA NeMo AutoModel booste le fine-tuning des modèles MoE (il y a 2 mois)
- Google perd ses talents IA clés et 270 milliards en bourse (il y a 2 mois)
- Perspectives divergentes sur l'IA : LeCun, Hassabis et Vinyals (il y a 3 mois)