Fondamentaux IA · Formats & tokens

Le même document, trois poids très différents pour l'IA

Un rapport de 10 pages — texte + tableaux de chiffres — enregistré en .docx, en .pdf ou en .md (Markdown) ne « pèse » pas du tout la même chose aux yeux d'un modèle d'IA. Et chaque token compte : en contexte occupé, et en euros.

Étape 1 — Le document témoin

Un seul et même contenu

Pour comparer honnêtement, on part d'un contenu strictement identique : un rapport d'activité trimestriel.

Pages
10
Mots de texte
3 000
Tableaux
3
Lignes de chiffres
60
Étape 2 — La pesée

Poids du fichier vs poids en tokens

Le poids sur disque (Ko) n'est pas ce qui coûte à l'IA. Ce qui compte, c'est le nombre de tokens que le modèle doit lire pour accéder à l'information. Basculez entre les deux mesures :

Markdown.md — texte pur structuré
PDF.pdf — mise en page figée
DOCX.docx — XML Word (décompressé)

Étape 3 — La preuve par l'exemple

Ce que voit réellement l'IA

Voici la même ligne de tableau — « Janvier · CA 128 k€ · Marge 34,2 % » — telle qu'elle existe dans chaque format. Le surlignage terracotta = l'information utile. Le gris = le bruit de structure.


      
Ratio signal / bruit :
Étape 4 — L'impact à l'échelle, selon l'éditeur et le modèle

Et sur 1, 10, 100 documents — chez quel éditeur ?

Choisissez l'éditeur LLM et le modèle, puis faites glisser le curseur. Le tarif d'entrée (input) et la fenêtre de contexte changent selon le modèle — le format de vos documents, lui, pèse toujours autant.

5 rapport(s) de 10 pages
Tarif d'entrée :
Fenêtre de contexte :

Markdown

Coût d'entrée
Fenêtre de contexte

PDF (texte extrait + bruit)

Coût d'entrée
Fenêtre de contexte

DOCX (XML brut)

Coût d'entrée
Fenêtre de contexte

C'est le facteur d'économie du Markdown face au XML Word brut — même information, tokens et économisés sur ce volume, avec .

Comparatif inter-modèles sur ce même envoi

Le même volume de documents, chez chaque éditeur. Deux leçons : le tarif varie de ×1 à ×100 selon le modèle… mais quel que soit le modèle, le Markdown divise la facture et libère le contexte. Optimiser le format est un gain indépendant du choix d'éditeur.

Modèle Tarif entrée Contexte Coût Markdown Coût DOCX brut Contexte utilisé (DOCX)

À retenir

  • Le format n'est pas neutre : même contenu, jusqu'à ×9 de tokens entre Markdown et XML Word brut.
  • Tokens = argent + place : chaque token superflu coûte en facturation et remplit la fenêtre de contexte au détriment du raisonnement.
  • Markdown = le format natif de l'IA : structure lisible (titres, tableaux), zéro bruit de mise en page — le meilleur ratio signal/bruit.
  • Réflexe pratique : avant d'envoyer un document volumineux à une IA, convertissez-le ou extrayez l'essentiel en Markdown / texte structuré.
  • Le choix du modèle multiplie l'enjeu : de 0,20 $ à 5 $ le million de tokens selon l'éditeur — mais alléger le format fait gagner sur tous les modèles. Format d'abord, modèle ensuite.
  • Attention au tokenizer : chaque éditeur découpe le texte différemment (jusqu'à ±30 % de tokens pour un même document) — comparez toujours à volume mesuré, pas estimé.

« Lundi matin : quel document envoyez-vous régulièrement à l'IA, et sous quel format pourriez-vous l'alléger dès demain ? »