Aller au contenu

La vitesse d'inférence d'une IA

Mis à jour le 13 septembre 2026

L'inférence, c'est le moment où l'IA écrit sa réponse, token après token. Cette vitesse varie énormément : de 5 à 150 tokens par seconde. Regardez la différence en direct 👇

La course des vitesses

Le même texte est généré simultanément à quatre vitesses différentes. Choisissez la longueur du document, puis lancez :

Temps écoulé : 0,0 s

⏱️ Estimation : de (le plus rapide) à (le plus lent).

Repère : un humain lit environ 200 mots/minute, soit ≈ 5 tokens/seconde. Un modèle local sur processeur écrit donc à la vitesse à laquelle vous lisez… un modèle de pointe va 25 fois plus vite.

1. Les deux temps cachés derrière « la vitesse »

Analogie : le TTFT, c'est le temps qu'un collaborateur met à ouvrir le dossier et à le lire ; le débit, c'est sa vitesse de frappe. Un dossier volumineux allonge le premier, un modèle puissant améliore le second.

2. Les ordres de grandeur (2026)

SituationDébit observéTemps pour une page A4 (≈ 1 200 tokens)
Modèle 7-8B quantifié, processeur (portable, hors ligne)3 – 10 tokens/s2 à 7 minutes
Modèle 7-8B sur GPU grand public40 – 90 tokens/s13 à 30 secondes
Grand modèle (70B) sur serveur GPU15 – 40 tokens/s30 à 80 secondes
API d'un modèle de pointe50 – 150 tokens/s8 à 24 secondes
Modèles « raisonneurs » (réflexion longue)10 – 40 tokens/s visiblesPlus long : la réflexion consomme des tokens avant la réponse

Ordres de grandeur indicatifs : la vitesse réelle varie selon la quantification, la longueur du contexte, la charge du serveur et le modèle exact.

3. Mesurez chez vous (5 minutes)

  1. Demandez à l'IA le même texte à chaque test : par exemple « rédige 300 mots sur le lettrage ».
  2. Chronométrez deux temps : apparition du premier mot (TTFT) et fin de la réponse.
  3. Calculez le débit : nombre de tokens produits ÷ durée. Exemple : 300 mots ≈ 510 tokens générés en 20 s → ≈ 25 tokens/s.
  4. Refaites le test avec un long contexte (10 pages) : vous verrez le TTFT s'allonger nettement.
Le bon critère n'est pas le « meilleur » modèle, mais le couple qualité suffisante / temps et coût acceptables pour la tâche concernée.

4. Ce que ça change au cabinet

5. À retenir

1. L'inférence génère token après token ; la vitesse se mesure en tokens/seconde.
2. Deux temps à distinguer : le délai de première réponse (lié à la taille du contexte) et le débit (lié au modèle et au matériel).
3. Un modèle local sur processeur écrit à la vitesse de votre lecture ; une API de pointe va 20 à 25 fois plus vite.
4. Pour un travail de masse, le coût par token et la qualité priment sur la vitesse.

À lire aussi : la fenêtre de contexte d'une IA, expliquée avec 100, 500 et 2 000 tokens.

Pour aller plus loin : « L'IA dans la profession comptable » (Éditions Gualino) et tous les outils gratuits.

📬 Une newsletter par mois sur l'automatisation
Méthodes, modèles prêts à l'emploi et outils pour gagner du temps au cabinet. Inscription en bas de page.
Je m'inscris
FH
Fabrice Heuvrard
Expert-comptable, créateur de Truc de Comptable
Auteur de « L'IA dans la profession comptable » (Éditions Gualino) — réussir la mutation du cabinet à l'ère des agents IA et de l'AI Act. En savoir plus sur l'auteur et ses outils →