Deloitte.
Strategy & Business Design
Keynote · 30 minutes · Dirigeants de PME et d'ETI

L'économie du token

Ce que coûte l'intelligence à l'unité, et ce que sa chute de prix change pour une entreprise française en 2026.

Julien MaldonatoPartner, Deloitte France
Strategy & Business Design, Financial Services
Septembre 2026Données Epoch AI, août-septembre 2026
Together makes progress
Deloitte.
Strategy & Business Design
1 · L'unité

Le token, un morceau de mot que l'on paie à l'unité

Un modèle de langage lit et écrit par fragments de texte, les tokens. En français, un mot en vaut environ 1,4 ; une page dense en compte près de 600 ; un contrat de trente pages, autour de 18 000.

Chaque échange se paie deux fois : les tokens lus (l'entrée, votre question, vos documents) et les tokens écrits (la sortie, la réponse). La sortie coûte en général quatre à cinq fois plus cher que l'entrée.

Tapez un e-mail de votre journée dans le compteur. Son prix de lecture tient en quelques centièmes de centime.
0
tokens environ
Modèle économique
lecture + réponse équivalente
Modèle standard
lecture + réponse équivalente
Modèle frontière
lecture + réponse équivalente
Estimation : 1 mot français ≈ 1,4 token. Tarifs indicatifs septembre 2026, par million de tokens : économique 0,15 $ entrée / 0,60 $ sortie ; standard 3 $ / 15 $ ; frontière 15 $ / 75 $. Change 1 $ = 0,90 €.02
Deloitte.
Strategy & Business Design
2 · Le cadre

Trois chiffres pour situer 2026

Taille
105Md$
Chiffre d'affaires annualisé cumulé d'OpenAI et d'Anthropic en août 2026, contre 30 Md$ en janvier. Le monde paie près de dix milliards par mois pour utiliser ces modèles.
Déflation
÷200
Prix du million de tokens pour atteindre une capacité de niveau GPT-4 : 37,50 $ en mars 2023, 0,18 $ en février 2025. Selon la tâche, la baisse annuelle va de 9× à 900×.
Mécanique
+49%/an
Performance obtenue par dollar dépensé en puces IA, en moyenne sur 2023-2025. Elle double tous les 1,7 an, par sauts à chaque génération de puces.
Sources : Epoch AI, « An update on AI's most important number » (27 août 2026) ; « LLM inference prices have fallen rapidly but unequally across tasks » ; « Performance per dollar of AI chips » (13 août 2026).03
Deloitte.
Strategy & Business Design
3 · La chute

La déflation la plus rapide jamais mesurée sur un bien industriel

Loi de Moore1965-2015

Le coût du transistor divisé par deux tous les deux ans, soit environ −30 % par an.

Photovoltaïque1980-2020

Le prix du watt crête en baisse d'environ 20 % par an, la référence des courbes d'apprentissage.

Token à capacité constante2022-2025

Divisé par 9 à 900 chaque année selon la tâche, médiane autour de 50. Sur les modèles récents, autour de 200.

Epoch précise que les baisses les plus fortes datent de la dernière année observée et pourraient ne pas se maintenir à ce rythme.

Source : Epoch AI, « LLM inference prices have fallen rapidly but unequally across tasks », prix les plus bas observés pour atteindre le score MMLU de GPT-4 (86) et de GPT-3.5 (64,8). Moore et photovoltaïque : ordres de grandeur usuels.04
Deloitte.
Strategy & Business Design
4 · Les causes

Trois moteurs empilés, aucun ne ralentit

Le silicium

La performance par dollar des puces achetées progresse de 49 % par an. Presque plate jusqu'à mi-2024, elle a doublé quand la génération Blackwell est devenue majoritaire dans les achats.

Le logiciel

Distillation, quantification, architectures plus sobres : les analyses attribuent l'essentiel de la baisse au logiciel, avec un gain d'efficacité algorithmique de l'ordre de 3× par an, en plus du matériel.

La concurrence

Un modèle ouvert publié à Hangzhou ou à Paris réaligne les prix du marché en quelques semaines. La capacité d'hier devient un produit de commodité.

Source : Epoch AI, AI Chip Sales Hub, « The performance per dollar of AI chips purchased each quarter has grown by an average of 49% per year » (13 août 2026). Indice construit à partir des écarts annuels publiés (+23 % en 2024, +91 % en 2025). Efficacité algorithmique : littérature académique 2025.05
Deloitte.
Strategy & Business Design
5 · Le paradoxe

Les prix s'effondrent et la dépense mondiale explose

William Jevons l'avait observé sur le charbon en 1865 : quand une ressource devient moins chère, on en consomme tellement plus que la dépense totale augmente. Le token suit la même loi, pour trois raisons.

1

Chaque palier de prix ouvre des usages qui n'étaient pas rentables au palier précédent.

2

Les modèles qui raisonnent consomment dix à cent fois plus de tokens par tâche que les modèles qui répondent.

3

Les agents enchaînent des dizaines d'appels là où un utilisateur posait une question.

Source : Epoch AI, « An update on AI's most important number » (27 août 2026). Chiffres d'affaires annualisés ; les deux sociétés n'appliquent pas les mêmes conventions comptables sur les ventes via clouds tiers.06
Deloitte.
Strategy & Business Design
6 · Deux marchés

Sous un même mot, deux économies très différentes

La frontière

Les meilleurs modèles gagnent environ 14 points par an sur l'indice de capacités d'Epoch depuis les modèles de raisonnement. Prix élevé, accès parfois rationné, différenciation réelle sur les tâches complexes.

La commodité

La capacité de l'an dernier, dix fois moins chère, servie par une dizaine de fournisseurs dont des européens. Interchangeable, négociable, hébergeable.

Pour une PME ou une ETI, l'essentiel des usages vit dans le second marché. Le premier se réserve aux décisions dont la qualité justifie le prix.
Source : Epoch AI, « The ECI frontier has advanced by 14 points per year since the introduction of reasoning models » (1er septembre 2026) ; Epoch Capabilities Index. Schéma illustratif.07
Deloitte.
Strategy & Business Design
7 · La facture

Anatomie d'une facture de tokens

Entrée

Tout ce que le modèle lit : la question, les documents, et l'historique complet relu à chaque tour de conversation.

Sortie

Ce qu'il écrit. Quatre à cinq fois plus cher à l'unité que l'entrée.

Raisonnement

Des tokens invisibles, facturés comme de la sortie. Ils peuvent multiplier la note par dix sur une tâche complexe.

Cache

Une base documentaire relue à chaque appel se facture une fois si elle est mise en cache : l'entrée répétée est divisée par dix.

Exemple illustratif : assistant de service client, 2 000 tokens par échange (1 500 lus, 300 écrits, historique inclus), 10 000 échanges par mois, soit 20 millions de tokens. Ratios entrée/sortie et cache : grilles tarifaires publiques 2026.08
Deloitte.
Strategy & Business Design
8 · Votre facture

Votre facture de tokens, en ordre de grandeur

1 000unités par mois

Facture mensuelle de tokens
Coût par unité traitée
tokens seuls, hors vérification humaine et hors intégration
Même tâche par une personne
Hypothèses modifiables. Tarifs indicatifs par million de tokens : économique 0,15 $ / 0,60 $ ; standard 3 $ / 15 $ ; frontière 15 $ / 75 $ (entrée / sortie). Temps humains par unité : 8, 60, 90 et 30 minutes. Les tokens de raisonnement sont comptés dans la sortie.09
Deloitte.
Strategy & Business Design
9 · Dans l'entreprise

L'usage est déjà là, il n'apparaît dans aucun compte

1 sur 5
salariés américains dit confier à l'IA un travail qu'il aurait donné à un collègue ou à un prestataire.
Majorité
des usages professionnels passent par des comptes gratuits, hors cadre de l'employeur. Exception : les métiers techniques et scientifiques, où 67 % utilisent un outil fourni par l'entreprise.
Le coût marginal

Une tâche cognitive routinière se rapproche du coût de l'électricité qui la produit. Ce qui coûtait du temps humain coûte des centimes.

La frontière faire, acheter, déléguer

Des prestations que l'on externalisait redeviennent internes, et des tâches internes s'achètent à l'unité.

Le modèle de dépense

De la licence par siège à la consommation à l'usage. La facture suit désormais l'activité, comme l'énergie.

Sources : Epoch AI / Ipsos, « AI at work: how AI is changing everyday job tasks » (6 août 2026, 1 106 salariés américains) ; « Most AI use at work happens on free plans, except in science and tech » (14 août 2026).10
Deloitte.
Strategy & Business Design
10 · Piloter

Piloter les tokens comme on pilote l'énergie

L'indicateur qui remonte au comité de direction : le coût par décision.
Routage

Petit modèle par défaut, grand modèle sur exception. Le levier principal : facture divisée par 5 à 20.

Cache

La base documentaire est lue une fois, pas à chaque appel. Entrée répétée divisée par 10.

Contexte

Trois pages pertinentes plutôt que trente. Le tri en amont coûte moins que la lecture.

Mesure

Tokens par unité d'œuvre : par dossier, par devis, par client. C'est ce qui rend les modèles et les équipes comparables.

Graphique illustratif : facture mensuelle de l'exemple précédent (20 M tokens en modèle frontière) après application successive des leviers. Facteurs de réduction issus des pratiques FinOps observées en 2026.11
Deloitte.
Strategy & Business Design
11 · La valeur

La valeur se déplace vers ce qui ne se déflate pas

Un actif dont le prix est divisé par dix chaque année n'est plus un avantage : tout le monde y accède au même tarif. Ce qui reste rare se trouve autour du token, pas dedans.

Dans l'histoire des techniques, quand l'énergie devient bon marché, l'avantage revient à qui organise les flux qu'elle rend possibles, jamais à qui la brûle. Le token est la nouvelle énergie ; l'organisation est la nouvelle rareté.

Les données

Propres, structurées, à jour. Le modèle ne vaut que ce qu'il lit, et ce qu'il lit vous appartient.

Les processus

Explicites et décrits. Une tâche que personne ne sait décrire ne peut pas être confiée à un agent.

La preuve

Qui a décidé, sur quelle base, avec quelle responsabilité. Ce que demanderont un client, un auditeur ou un juge.

La relation

La confiance d'un client ou d'un partenaire ne se génère pas au million de tokens.

Point de vue Deloitte Strategy & Business Design, « l'économie de la preuve ».12
Deloitte.
Strategy & Business Design
12 · Agir

Une feuille de route en quatre temps

Jours 1 à 30

Mesurer

Inventorier les usages réels, y compris les comptes gratuits. Estimer le volume de tokens consommé et les données qui circulent. Nommer un responsable.

Jours 30 à 60

Choisir

Retenir trois cas d'usage dans le marché de la commodité, à fort volume et faible risque. Lancer un pilote compté en tokens par unité d'œuvre.

Jours 60 à 90

Cadrer

Charte de données, choix de fournisseurs dont au moins un européen, routage et cache prévus dès la conception. Vérification humaine décrite et comptée.

Ensuite, chaque trimestre

Piloter

Coût par décision au comité de direction. Revue trimestrielle des prix : ils baissent, un contrat de janvier se renégocie en avril.

Cadre proposé par Deloitte Strategy & Business Design ; à adapter à la taille et au secteur.13
Deloitte.
Strategy & Business Design
13 · Vigilance

Quatre points de vigilance

La dépendance

Deux fournisseurs américains concentrent le marché de la frontière et en fixent les conditions. Un second fournisseur, européen si possible, sur la commodité.

La sécurité

En juillet 2026, environ 2 500 failles critiques ont été divulguées, cinq fois le record antérieur, depuis que des modèles de classe Mythos savent les trouver. La même capacité sert l'attaque et la défense.

Les données

Ce qui part vers un compte gratuit sort de l'entreprise. Hébergement, contrat et charte d'usage avant le déploiement, pas après.

La qualité

Un token bon marché produit aussi des erreurs bon marché. La vérification humaine devient plus précieuse, pas moins, et elle se compte dans le coût.

Source sécurité : Epoch AI, « Disclosed CVEs: July reached 5× the pre-Mythos record » (31 juillet 2026).14
Deloitte.
Strategy & Business Design
À retenir

Le token est le kilowattheure de la décision.

Personne ne demande plus si l'électricité vaut la peine. La question d'un dirigeant en 2026 porte sur le coût par décision, les données qui l'alimentent et les preuves qui la portent.

Together makes progress15
Deloitte.
Strategy & Business Design
Annexe

Sources et notes de méthode

  • Epoch AI, « An update on AI's most important number », Gradient Updates, 27 août 2026. Chiffres d'affaires annualisés OpenAI et Anthropic : 2,1 Md$ (janv. 2024), 6,5 Md$ (janv. 2025), 30 Md$ (janv. 2026), 105 Md$ (août 2026). Marché total de l'IA générative : environ 175 à 200 Md$ (Exponential View, juin 2026).
  • Epoch AI, « LLM inference prices have fallen rapidly but unequally across tasks », Data Insight. Prix les plus bas pour atteindre un score fixé sur six tests ; baisses annuelles de 9× à 900×, médiane environ 50×, environ 200× sur les modèles depuis 2024.
  • Epoch AI, « The performance per dollar of AI chips purchased each quarter has grown by an average of 49% per year », 13 août 2026. Intervalle de confiance à 90 % : 36 % à 66 % par an ; achats 2024 +23 % par rapport à 2023, achats 2025 +91 % par rapport à 2024.
  • Epoch AI, « The ECI frontier has advanced by 14 points per year since the introduction of reasoning models », 1er septembre 2026.
  • Epoch AI / Ipsos, « AI at work: how AI is changing everyday job tasks », 6 août 2026 (1 106 salariés américains) ; « Most AI use at work happens on free plans, except in science and tech », 14 août 2026.
  • Epoch AI, « Disclosed CVEs: July reached 5× the pre-Mythos record », 31 juillet 2026.
  • Epoch AI, « The Nvidia-sized hole in US GDP statistics », 24 août 2026 : la croissance américaine serait sous-estimée d'environ 0,3 point, écart pouvant atteindre 2 points en 2028.
  • Tarifs de tokens : ordres de grandeur construits à partir des grilles publiques des principaux fournisseurs en septembre 2026, arrondis par niveau. À actualiser avant chaque présentation ; les prix baissent.
  • Calculateur : hypothèses de tokens par unité et de temps humain fournies à titre illustratif ; le coût humain chargé et le change sont modifiables en séance. Les résultats sont des ordres de grandeur, pas des devis.
  • Comparaisons historiques (loi de Moore, photovoltaïque) : ordres de grandeur usuels de la littérature sur les courbes d'apprentissage.
Les travaux d'Epoch AI sont publiés sous licence Creative Commons BY 4.0.16
Notes du présentateur

Navigation

espace diapositive suivante
diapositive précédente
N notes du présentateur
F plein écran
19 aller à la diapositive
? cette aide

Sur tablette : balayer vers la gauche ou la droite.