Définition
Une représentation vectorielle convertit un contenu en une liste de nombres positionnés de telle façon que les sens voisins se retrouvent proches. C’est ce qui permet à une recherche d’associer « annuler mon abonnement » à un document intitulé « Résiliation de service » sans qu’ils partagent le moindre mot.
Ce qu’est une représentation vectorielle, sans les mathématiques
La recherche par mots-clés apparie des caractères. Demandez-lui « annuler mon abonnement » et elle ratera une page de politique intitulée « Résiliation de service », puisque les deux ne partagent aucun mot. Pour un humain, c’est la même chose ; pour un système d’appariement textuel, ce sont deux sujets sans rapport.
La représentation vectorielle règle cela en convertissant le contenu en coordonnées. Chaque fragment de texte devient une longue liste de nombres, disposés de sorte que ce qui veut dire des choses semblables se retrouve à proximité. « Annuler mon abonnement » et « Résiliation de service » atterrissent côte à côte. « Résiliation d’emploi » atterrit ailleurs, malgré le mot partagé.
Une fois le sens doté de coordonnées, le comparer devient une opération arithmétique. C’est le mécanisme sous la recherche sémantique, le RAG, la déduplication, le regroupement et la recommandation.
Recherche sémantique et par mots-clés échouent différemment
| Recherche par mots-clés | Recherche sémantique | |
|---|---|---|
| Apparie | Des termes exacts | Du sens |
| Gère la reformulation | Non | Oui |
| Gère numéros de pièce, codes, noms | Avec précision | De façon peu fiable |
| Explique pourquoi un résultat a matché | Facilement | Mal |
| Coût | Faible | Plus élevé |
Aucune ne l’emporte franchement. La recherche sémantique trouve la reformulation, puis renvoie avec assurance la pièce SKU-4471 quand vous demandiez SKU-4417, parce que ces deux références sont quasi identiques dans l’espace du sens et totalement différentes à l’entrepôt. La recherche par mots-clés ne commet jamais cette erreur et ne trouve jamais la reformulation.
Les systèmes qui tiennent en production exécutent généralement les deux et combinent les résultats, une approche appelée recherche hybride, parce que la plupart des vraies requêtes contiennent à la fois un concept et un identifiant.
Ce qu’il faut savoir avant de construire
La taille des fragments détermine la qualité. Le contenu est découpé avant d’être vectorisé. Trop gros, et une représentation tente de porter quatre idées sans rapport et n’en porte aucune correctement. Trop petit, et le passage perd le contexte qui lui donnait son sens. Découper selon la structure réelle du document vaut mieux que découper tous les N caractères.
Les représentations sont propres à un modèle. On ne peut pas comparer les vecteurs d’un modèle à ceux d’un autre. Changer de modèle de vectorisation oblige à tout revectoriser, ce qui représente un coût de migration réel sur un grand corpus.
Elles encodent le sens, pas la vérité. Deux affirmations contradictoires sur le même sujet se retrouvent voisines, puisqu’elles parlent de la même chose. La récupération renverra volontiers la politique périmée à côté de la version courante. La curation n’est pas facultative.
L’approche Automathing
Nous considérons le découpage et la structure documentaire comme le travail à plus fort effet de levier dans tout système de récupération, bien avant le choix du modèle de vectorisation. La recherche hybride est notre défaut plutôt qu’une optimisation, puisque les requêtes d’affaires mêlent presque toujours concepts et identifiants. Et nous planifions la revectorisation dès le départ, car les modèles se remplacent et un corpus qu’on ne peut pas reconstruire est un corpus qui finira bloqué.
Foire aux questions
Quelle différence entre une représentation vectorielle et une base de données vectorielle ?
La représentation est l’encodage ; la base de données vectorielle est l’endroit où ces encodages sont stockés et interrogés. On génère les représentations avec un modèle et on les range là où l’on peut retrouver rapidement les plus proches. Les petites collections n’exigent pas de base dédiée du tout.
Les représentations comprennent-elles notre terminologie interne ?
Seulement ce qu’elles peuvent déduire du contexte. Les modèles généralistes apprennent sur du texte large : un nom de code interne ou un usage inhabituel d’un mot courant peut donc se retrouver au mauvais endroit. Les correctifs habituels : inclure du contexte environnant dans chaque fragment, tenir une liste de synonymes, et associer recherche sémantique et recherche par mots-clés pour que les termes internes exacts continuent d’être trouvés.
Les représentations vectorielles posent-elles un enjeu de confidentialité ?
Traitez-les comme des copies dérivées du contenu source. Une représentation n’est pas lisible par un humain, mais ce n’est pas une anonymisation : un contenu approximatif peut être reconstitué à partir des vecteurs, et le texte récupérable se trouve généralement à côté de toute façon. Appliquez-leur les mêmes contrôles d’accès et règles de conservation qu’aux documents eux-mêmes.
Combien coûtent les représentations vectorielles ?
Les générer est peu coûteux comparé à l’inférence d’un modèle, et l’essentiel du coût vient du premier passage sur votre corpus. Le coût courant provient des documents nouveaux ou modifiés, plus la vectorisation des requêtes. La dépense qui surprend est la revectorisation complète après un changement de modèle, raison pour laquelle ce choix mérite une réflexion unique plutôt que répétée.
