Comment une IA « lit » votre phrase : tokens & vecteurs
Elle ne voit pas des mots. Elle voit des morceaux, puis des nombres. Voici les deux premières secondes de sa « lecture ».
Dans l'épisode précédent, on a vu qu'une IA prédit le mot suivant. Mais avant de prédire, il faut lire. Et sa façon de lire n'a rien à voir avec la vôtre. Deux étapes, deux surprises.
Étape 1 — elle découpe en « tokens »
La première chose qu'une IA fait de votre texte : elle le coupe en petits morceaux appelés tokens. Et attention à l'idée reçue : un token n'est pas un mot, ni une syllabe. C'est un morceau statistiquement pratique — parfois un mot entier, parfois un bout.
Découper en morceaux, ça permet à l'IA de gérer n'importe quel mot — même un mot inventé, même une faute de frappe — en le recomposant à partir de bouts qu'elle connaît. C'est malin, et c'est pour ça qu'« un token = un mot » est faux.
Étape 2 — elle transforme les tokens en nombres
Une machine ne calcule pas sur des lettres. Elle calcule sur des nombres. Donc chaque token est traduit en une longue liste de nombres : un vecteur. Ce vecteur, c'est une sorte de « coordonnées GPS du sens ».
La magie est là : dans cet espace de nombres, les tokens de sens proche se retrouvent proches. « roi » et « reine » sont voisins. « Paris » et « Lyon » aussi. L'IA ne « comprend » pas les mots — elle mesure des distances entre des points. C'est ça, un embedding.
Une IA ne lit pas des mots. Elle manipule des points dans un espace de nombres — et calcule qui est proche de qui.
Pourquoi ça compte pour vous
Ces deux étapes, invisibles, expliquent des choses très concrètes :
- Pourquoi l'IA compte mal les lettres d'un mot (« combien de r dans “carrosse” ? ») : elle ne voit pas les lettres, elle voit des tokens.
- Pourquoi elle a une limite de contexte mesurée en tokens, pas en mots : au-delà, elle « oublie » le début.
- Pourquoi certaines langues ou certains textes coûtent plus cher : plus de tokens = plus de calcul.
Rien de sorcier une fois qu'on a vu la mécanique. Et c'est déjà de quoi ne plus se faire surprendre.
La suite arrive : comment l'IA relie ces tokens entre eux pour saisir le contexte (le fameux « mécanisme d'attention »).
En attendant, l'IA juridique que je bâtis : DAIRIA IA · Tous les épisodes : le Journal.
Vulgarisation personnelle, à titre pédagogique. Contenu original ; ne reproduit aucun document tiers. © Sofiane Coly — sofianecoly.com