La vitesse d'inférence d'une IA
Mis à jour le 13 septembre 2026
L'inférence, c'est le moment où l'IA écrit sa réponse, token après token. Cette vitesse varie énormément : de 5 à 150 tokens par seconde. Regardez la différence en direct 👇
Sommaire
La course des vitesses (démo) 1. Les deux temps cachés 2. Les ordres de grandeur 3. Mesurez chez vous 4. Ce que ça change au cabinet 5. À retenir
La course des vitesses (démo) 1. Les deux temps cachés 2. Les ordres de grandeur 3. Mesurez chez vous 4. Ce que ça change au cabinet 5. À retenir
La course des vitesses
Le même texte est généré simultanément à quatre vitesses différentes. Choisissez la longueur du document, puis lancez :
Temps écoulé : 0,0 s
⏱️ Estimation : de — (le plus rapide) à — (le plus lent).
Repère : un humain lit environ 200 mots/minute, soit ≈ 5 tokens/seconde. Un modèle local sur processeur écrit donc à la vitesse à laquelle vous lisez… un modèle de pointe va 25 fois plus vite.
1. Les deux temps cachés derrière « la vitesse »
- Le délai de première réponse (TTFT) : le temps avant que le premier mot apparaisse. Il dépend surtout de la longueur de votre question (tout le contexte doit être « lu »).
- Le débit (tokens/seconde) : la vitesse d'écriture de la réponse — c'est ce que vous ressentez quand le texte défile.
Analogie : le TTFT, c'est le temps qu'un collaborateur met à ouvrir le dossier et à le lire ; le débit, c'est sa vitesse de frappe. Un dossier volumineux allonge le premier, un modèle puissant améliore le second.
2. Les ordres de grandeur (2026)
| Situation | Débit observé | Temps pour une page A4 (≈ 1 200 tokens) |
|---|---|---|
| Modèle 7-8B quantifié, processeur (portable, hors ligne) | 3 – 10 tokens/s | 2 à 7 minutes |
| Modèle 7-8B sur GPU grand public | 40 – 90 tokens/s | 13 à 30 secondes |
| Grand modèle (70B) sur serveur GPU | 15 – 40 tokens/s | 30 à 80 secondes |
| API d'un modèle de pointe | 50 – 150 tokens/s | 8 à 24 secondes |
| Modèles « raisonneurs » (réflexion longue) | 10 – 40 tokens/s visibles | Plus long : la réflexion consomme des tokens avant la réponse |
Ordres de grandeur indicatifs : la vitesse réelle varie selon la quantification, la longueur du contexte, la charge du serveur et le modèle exact.
3. Mesurez chez vous (5 minutes)
- Demandez à l'IA le même texte à chaque test : par exemple « rédige 300 mots sur le lettrage ».
- Chronométrez deux temps : apparition du premier mot (TTFT) et fin de la réponse.
- Calculez le débit : nombre de tokens produits ÷ durée. Exemple : 300 mots ≈ 510 tokens générés en 20 s → ≈ 25 tokens/s.
- Refaites le test avec un long contexte (10 pages) : vous verrez le TTFT s'allonger nettement.
Le bon critère n'est pas le « meilleur » modèle, mais le couple qualité suffisante / temps et coût acceptables pour la tâche concernée.
4. Ce que ça change au cabinet
- Tâches interactives (rédiger un email, reformuler, contrôler un texte) : privilégiez un débit élevé — au-delà de ~30 tokens/s, la réponse est plus rapide que votre lecture.
- Traitements en masse (200 factures, qualification d'écritures) : le débit importe moins que le coût par token. Lancez ces travaux en traitement par lots, éventuellement la nuit.
- Petits modèles locaux : parfaits pour les tâches répétitives et confidentielles ; à 5-10 tokens/s, on les réserve aux traitements automatiques plutôt qu'au dialogue.
- Modèles raisonneurs : meilleurs sur les problèmes complexes (analyse de contrat, calculs) mais « écrivent beaucoup » : plus lents et plus coûteux.
5. À retenir
1. L'inférence génère token après token ; la vitesse se mesure en tokens/seconde.
2. Deux temps à distinguer : le délai de première réponse (lié à la taille du contexte) et le débit (lié au modèle et au matériel).
3. Un modèle local sur processeur écrit à la vitesse de votre lecture ; une API de pointe va 20 à 25 fois plus vite.
4. Pour un travail de masse, le coût par token et la qualité priment sur la vitesse.
2. Deux temps à distinguer : le délai de première réponse (lié à la taille du contexte) et le débit (lié au modèle et au matériel).
3. Un modèle local sur processeur écrit à la vitesse de votre lecture ; une API de pointe va 20 à 25 fois plus vite.
4. Pour un travail de masse, le coût par token et la qualité priment sur la vitesse.
À lire aussi : la fenêtre de contexte d'une IA, expliquée avec 100, 500 et 2 000 tokens.
Pour aller plus loin : « L'IA dans la profession comptable » (Éditions Gualino) et tous les outils gratuits.
📬 Une newsletter par mois sur l'automatisation
Méthodes, modèles prêts à l'emploi et outils pour gagner du temps au cabinet. Inscription en bas de page.
FH
Fabrice Heuvrard
Expert-comptable, créateur de Truc de Comptable
Auteur de « L'IA dans la profession comptable » (Éditions Gualino) — réussir la mutation du cabinet à l'ère des agents IA et de l'AI Act.
En savoir plus sur l'auteur et ses outils →