Catégories
Synthèse

Comment un LLM construit-il une preuve ?

Quand ChatGPT associe spontanément une marque à « prix bas », « qualité » ou « durabilité », il est tentant d’interpréter cette réponse comme une validation. Le raisonnement est séduisant : si le modèle le dit, c’est qu’il doit bien avoir trouvé quelque chose quelque part.

Le problème est dans le « quelque part »

Un LLM apprend d’abord des régularités dans les textes des sources (extrêmement variées) utilisés lors de son entraînement. Une association fréquemment rencontrée peut donc devenir suffisamment stable pour réapparaître dans une réponse. Cette stabilité ne constitue pas une preuve. Elle indique au mieux que l’association est bien installée dans la représentation du modèle.

Plusieurs techniques permettent d’ailleurs d’examiner cette stabilité. SelfCheckGPT compare plusieurs réponses produites par un même modèle : lorsqu’elles divergent fortement sur un fait, le risque d’hallucination augmente. Les travaux publiés dans Nature sur l’entropie sémantique suivent une logique proche en mesurant l’incertitude à partir de réponses ayant des significations différentes. Ces méthodes détectent une incertitude. Elles ne démontrent pas qu’une affirmation stable est vraie. Une erreur largement présente dans les données peut aussi être répétée avec beaucoup de constance.

La nature du problème change lorsque le LLM utilise des sources externes : recherche Web, RAG, bases documentaires ou données structurées. L’affirmation peut alors être confrontée à un document identifiable.

De l’association à la preuve

On passe de « le modèle associe cette marque à ce concept » à « quelles informations permettent de soutenir cette association ? ».

FActScore formalise assez bien cette logique : une réponse est découpée en faits atomiques, puis chacun est confronté à une source de connaissance. La preuve devient moins une qualité globale de la réponse qu’une relation entre une affirmation précise et les éléments qui permettent de l’étayer.

Cela ne règle pourtant pas le problème. RAGTruth a étudié près de 18 000 réponses produites avec des systèmes RAG et montre que ces modèles peuvent encore générer des affirmations non supportées, voire contradictoires avec les documents récupérés. Fournir des sources n’oblige donc pas le modèle à les utiliser correctement.

Le problème devient particulièrement visible avec les produits. Dans mon article « Comment les LLMs analysent-ils les données produits ? », l’exemple du Kärcher K3 montre plusieurs niveaux. Une caractéristique donnée par le fabricant peut être recoupée chez plusieurs distributeurs. Une divergence sur la longueur d’un flexible demande une vérification supplémentaire. Un prix, pour être créddible, doit être associé à une date, un vendeur et une variante. Une moyenne d’avis clients ne permet pas, seule, de prouver la performance d’un produit.

La répétition compte donc moins que la nature du faisceau de preuves : origine de l’information, indépendance et croisement des sources, précision de l’affirmation, cohérence entre les données et possibilité de les rattacher au bon produit ou à la bonne entité.

Cette distinction rejoint le Brand Concept Scoring, dans lequel j’utilise les LLM pour identifier les concepts associés à une marque, établir un diagnostic puis chercher des pistes d’optimisation portant notamment sur les contenus, les preuves et les usages. Le modèle peut faire apparaître une association marque-concept ; le travail GEO consiste ensuite à comprendre sur quoi cette association peut réellement s’appuyer et surtout : comment la développer.

L'ancrage d'une marque
L’ancrage d’une marque

Affirmer n’est plus suffisant

Une marque peut répéter qu’elle est « responsable », « innovante » ou « fiable ». Ces qualificatifs peuvent être cohérents avec son discours, repris sur plusieurs pages et apparaître régulièrement dans les contenus qui parlent d’elle. Cela ne suffit pourtant pas à les rendre vérifiables. Pour un LLM, le concept gagne en solidité lorsqu’il peut être relié à des éléments factuels : une caractéristique produit, un service effectivement proposé, une politique de retour, une durée de garantie, une certification identifiable, une donnée mesurable, un usage documenté ou une source indépendante.

La différence tient au niveau d’ancrage. Marque « fiable » reste une appréciation générale. Une garantie de cinq ans, un taux de panne mesuré ou plusieurs tests indépendants documentant la tenue du produit fournissent des éléments plus faciles à rattacher à cette idée. « Responsable » est tout aussi large tant qu’il ne renvoie pas à des pratiques observables : composition des produits, réparabilité, politique de reprise, origine des matériaux ou données environnementales publiées. Le concept n’est pas automatiquement prouvé par ces éléments, mais il devient au moins examinable.

Cela change aussi la manière de penser la répétition. Répéter le même adjectif sur dix pages renforce surtout la présence du signal. Multiplier des éléments cohérents, issus de sources et de formats différents, renforce sa possibilité de vérification. Pour le GEO, la distinction est importante : une marque ne cherche pas seulement à être associée à un concept, mais à rendre cette association suffisamment concrète pour qu’un système puisse la retrouver, la recouper et l’étayer. Ce qui le conduira à l’utiliser pour répondre à ses utilisateurs.

Il faut ancrer les concepts

Pour le GEO, la différence est assez importante. Il ne s’agit plus seulement de rendre une association marque-concept visible ou fréquente. Il faut aussi lui donner des points d’ancrage que les systèmes peuvent retrouver, attribuer, recouper et utiliser.