← Journal Sofiane Coly
Comprendre l'IA · 2/5

Comment une IA « lit » votre phrase : tokens & vecteurs

Elle ne voit pas des mots. Elle voit des morceaux, puis des nombres. Voici les deux premières secondes de sa « lecture ».

11 juillet 2026 · 5 min de lecture · Épisode 2 de la série « Comprendre l'IA »

Dans l'épisode précédent, on a vu qu'une IA prédit le mot suivant. Mais avant de prédire, il faut lire. Et sa façon de lire n'a rien à voir avec la vôtre. Deux étapes, deux surprises.

Étape 1 — elle découpe en « tokens »

La première chose qu'une IA fait de votre texte : elle le coupe en petits morceaux appelés tokens. Et attention à l'idée reçue : un token n'est pas un mot, ni une syllabe. C'est un morceau statistiquement pratique — parfois un mot entier, parfois un bout.

Découper en morceaux, ça permet à l'IA de gérer n'importe quel mot — même un mot inventé, même une faute de frappe — en le recomposant à partir de bouts qu'elle connaît. C'est malin, et c'est pour ça qu'« un token = un mot » est faux.

Étape 2 — elle transforme les tokens en nombres

Une machine ne calcule pas sur des lettres. Elle calcule sur des nombres. Donc chaque token est traduit en une longue liste de nombres : un vecteur. Ce vecteur, c'est une sorte de « coordonnées GPS du sens ».

La magie est là : dans cet espace de nombres, les tokens de sens proche se retrouvent proches. « roi » et « reine » sont voisins. « Paris » et « Lyon » aussi. L'IA ne « comprend » pas les mots — elle mesure des distances entre des points. C'est ça, un embedding.

Une IA ne lit pas des mots. Elle manipule des points dans un espace de nombres — et calcule qui est proche de qui.

Pourquoi ça compte pour vous

Ces deux étapes, invisibles, expliquent des choses très concrètes :

Rien de sorcier une fois qu'on a vu la mécanique. Et c'est déjà de quoi ne plus se faire surprendre.

La suite arrive : comment l'IA relie ces tokens entre eux pour saisir le contexte (le fameux « mécanisme d'attention »).

En attendant, l'IA juridique que je bâtis : DAIRIA IA · Tous les épisodes : le Journal.

Vulgarisation personnelle, à titre pédagogique. Contenu original ; ne reproduit aucun document tiers. © Sofiane Coly — sofianecoly.com