Ce que coûte l'intelligence à l'unité, et ce que sa chute de prix change pour une entreprise française en 2026.
Un modèle de langage lit et écrit par fragments de texte, les tokens. En français, un mot en vaut environ 1,4 ; une page dense en compte près de 600 ; un contrat de trente pages, autour de 18 000.
Chaque échange se paie deux fois : les tokens lus (l'entrée, votre question, vos documents) et les tokens écrits (la sortie, la réponse). La sortie coûte en général quatre à cinq fois plus cher que l'entrée.
Le coût du transistor divisé par deux tous les deux ans, soit environ −30 % par an.
Le prix du watt crête en baisse d'environ 20 % par an, la référence des courbes d'apprentissage.
Divisé par 9 à 900 chaque année selon la tâche, médiane autour de 50. Sur les modèles récents, autour de 200.
Epoch précise que les baisses les plus fortes datent de la dernière année observée et pourraient ne pas se maintenir à ce rythme.
La performance par dollar des puces achetées progresse de 49 % par an. Presque plate jusqu'à mi-2024, elle a doublé quand la génération Blackwell est devenue majoritaire dans les achats.
Distillation, quantification, architectures plus sobres : les analyses attribuent l'essentiel de la baisse au logiciel, avec un gain d'efficacité algorithmique de l'ordre de 3× par an, en plus du matériel.
Un modèle ouvert publié à Hangzhou ou à Paris réaligne les prix du marché en quelques semaines. La capacité d'hier devient un produit de commodité.
William Jevons l'avait observé sur le charbon en 1865 : quand une ressource devient moins chère, on en consomme tellement plus que la dépense totale augmente. Le token suit la même loi, pour trois raisons.
Chaque palier de prix ouvre des usages qui n'étaient pas rentables au palier précédent.
Les modèles qui raisonnent consomment dix à cent fois plus de tokens par tâche que les modèles qui répondent.
Les agents enchaînent des dizaines d'appels là où un utilisateur posait une question.
Les meilleurs modèles gagnent environ 14 points par an sur l'indice de capacités d'Epoch depuis les modèles de raisonnement. Prix élevé, accès parfois rationné, différenciation réelle sur les tâches complexes.
La capacité de l'an dernier, dix fois moins chère, servie par une dizaine de fournisseurs dont des européens. Interchangeable, négociable, hébergeable.
Tout ce que le modèle lit : la question, les documents, et l'historique complet relu à chaque tour de conversation.
Ce qu'il écrit. Quatre à cinq fois plus cher à l'unité que l'entrée.
Des tokens invisibles, facturés comme de la sortie. Ils peuvent multiplier la note par dix sur une tâche complexe.
Une base documentaire relue à chaque appel se facture une fois si elle est mise en cache : l'entrée répétée est divisée par dix.
Une tâche cognitive routinière se rapproche du coût de l'électricité qui la produit. Ce qui coûtait du temps humain coûte des centimes.
Des prestations que l'on externalisait redeviennent internes, et des tâches internes s'achètent à l'unité.
De la licence par siège à la consommation à l'usage. La facture suit désormais l'activité, comme l'énergie.
Petit modèle par défaut, grand modèle sur exception. Le levier principal : facture divisée par 5 à 20.
La base documentaire est lue une fois, pas à chaque appel. Entrée répétée divisée par 10.
Trois pages pertinentes plutôt que trente. Le tri en amont coûte moins que la lecture.
Tokens par unité d'œuvre : par dossier, par devis, par client. C'est ce qui rend les modèles et les équipes comparables.
Un actif dont le prix est divisé par dix chaque année n'est plus un avantage : tout le monde y accède au même tarif. Ce qui reste rare se trouve autour du token, pas dedans.
Dans l'histoire des techniques, quand l'énergie devient bon marché, l'avantage revient à qui organise les flux qu'elle rend possibles, jamais à qui la brûle. Le token est la nouvelle énergie ; l'organisation est la nouvelle rareté.
Propres, structurées, à jour. Le modèle ne vaut que ce qu'il lit, et ce qu'il lit vous appartient.
Explicites et décrits. Une tâche que personne ne sait décrire ne peut pas être confiée à un agent.
Qui a décidé, sur quelle base, avec quelle responsabilité. Ce que demanderont un client, un auditeur ou un juge.
La confiance d'un client ou d'un partenaire ne se génère pas au million de tokens.
Inventorier les usages réels, y compris les comptes gratuits. Estimer le volume de tokens consommé et les données qui circulent. Nommer un responsable.
Retenir trois cas d'usage dans le marché de la commodité, à fort volume et faible risque. Lancer un pilote compté en tokens par unité d'œuvre.
Charte de données, choix de fournisseurs dont au moins un européen, routage et cache prévus dès la conception. Vérification humaine décrite et comptée.
Coût par décision au comité de direction. Revue trimestrielle des prix : ils baissent, un contrat de janvier se renégocie en avril.
Deux fournisseurs américains concentrent le marché de la frontière et en fixent les conditions. Un second fournisseur, européen si possible, sur la commodité.
En juillet 2026, environ 2 500 failles critiques ont été divulguées, cinq fois le record antérieur, depuis que des modèles de classe Mythos savent les trouver. La même capacité sert l'attaque et la défense.
Ce qui part vers un compte gratuit sort de l'entreprise. Hébergement, contrat et charte d'usage avant le déploiement, pas après.
Un token bon marché produit aussi des erreurs bon marché. La vérification humaine devient plus précieuse, pas moins, et elle se compte dans le coût.
Personne ne demande plus si l'électricité vaut la peine. La question d'un dirigeant en 2026 porte sur le coût par décision, les données qui l'alimentent et les preuves qui la portent.
→espace diapositive suivante
← diapositive précédente
N notes du présentateur
F plein écran
1…9 aller à la diapositive
? cette aide
Sur tablette : balayer vers la gauche ou la droite.