J’ai déjà abordé le sujet des sources des infos produits utilisés par les LLM. Voyons plus précisément le sujet des marques.
Quand on cherche ce qu’un LLM peut savoir de Leroy Merlin, le premier réflexe consiste à regarder leroymerlin.fr. C’est logique, mais très incomplet. Une marque laisse des traces dans beaucoup d’autres endroits : articles de presse, avis clients, offres d’emploi, publications de salariés, décisions administratives, applications mobiles, campagnes publicitaires, sites concurrents ou documents d’urbanisme.
Pour un LLM, cette dispersion change la nature du problème. La représentation d’une marque peut être construite à partir de dizaines de catégories de sources qui n’ont ni le même auteur, ni le même objectif, ni le même niveau de fraîcheur.
Il faut cependant distinguer deux mécanismes assez différents :
- ce qu’un assistant comme ChatGPT peut rechercher aujourd’hui
- ce qui a éventuellement contribué à l’entraînement de son modèle (et qui n’est peut être plus accessible)
Une marque produit beaucoup plus d’informations que son site officiel
Avec un outil de recherche Web, un assistant peut aujourd’hui retrouver des informations publiques provenant de nombreuses sources. Le site de Leroy Merlin renseigne sur les produits, les prix ou les services. Le site d’ADEO apporte des informations corporate. La presse documente une acquisition, une ouverture ou une évolution stratégique. Une offre d’emploi donne des indications sur les compétences recherchées. Les avis clients exposent d’autres signaux : problèmes de livraison, perception du service ou défauts d’une application.
Même une information apparemment secondaire peut devenir utile lorsqu’elle est croisée avec d’autres. Les conditions générales de la Marketplace de Leroy Merlin indiquent par exemple que des marchands tiers peuvent lister et vendre leurs produits sur leroymerlin.fr. Ce document permet donc de comprendre une partie du modèle commercial, pas seulement les conditions d’utilisation du site.
| Catégorie | Sources / exemples | Exemple d’information que le LLM peut récupérer |
|---|---|---|
| Sources officielles | leroymerlin.fr, pages institutionnelles, communiqués, catalogues, contenus éditoriaux | Prix d’un produit, modalités de livraison, services proposés, caractéristiques d’une gamme |
| Groupe ADEO | site ADEO, rapports, communiqués, actualités corporate | Effectifs, implantations, engagements environnementaux, organisation du groupe |
| Presse économique | Les Échos, La Tribune, Challenges, Le Figaro, Le Monde, Reuters… | Résultats financiers, investissements, acquisitions, nominations ou évolution de la stratégie |
| Presse retail / e-commerce | LSA, Republik Retail, Journal du Net, EcommerceMag, RetailDetail… | Ouverture de magasins, évolution d’un concept, stratégie marketplace ou omnicanale |
| Presse marketing / publicité | Stratégies, CB News, Influencia, Campaign, The Drum… | Nouvelle campagne publicitaire, agence choisie, repositionnement de marque |
| Presse locale | La Voix du Nord, Ouest-France, Le Parisien, presse régionale | Ouverture ou rénovation d’un magasin, emploi local, conflits ou projets immobiliers |
| Sites des concurrents | Castorama, Brico Dépôt, ManoMano, Mr.Bricolage, Bricomarché… | Prix concurrents, services proposés, assortiment, promesses commerciales |
| Avis publics | Google Reviews et plateformes d’avis publiques | Motifs récurrents de satisfaction ou d’insatisfaction : attente, SAV, disponibilité des produits |
| Forums et communautés | Reddit, forums bricolage et construction | Retours d’expérience sur un produit, comparaison entre enseignes, problèmes rencontrés |
| Réseaux sociaux publics | LinkedIn, YouTube, Instagram, Facebook, TikTok, Pinterest… | Communications de la marque, réactions publiques, publications de dirigeants ou salariés |
| Vidéo / influence | YouTube, tests produits, interviews, conférences | Démonstration d’un produit, avis d’un créateur, interview d’un responsable de l’entreprise |
| Offres d’emploi | Leroy Merlin, ADEO, LinkedIn Jobs, Indeed, Welcome to the Jungle… | Métiers recrutés, technologies utilisées, compétences recherchées, localisation des recrutements |
| App stores | Apple App Store, Google Play | Note de l’application, fonctionnalités, historique des mises à jour, critiques d’utilisateurs |
| Publicité publique | Meta Ad Library, Google Ads Transparency Center, TikTok Creative Center | Créations publicitaires diffusées, messages promotionnels, formats et périodes de campagne |
| Archives web | Internet Archive / Wayback Machine | Ancienne page d’accueil, ancienne offre commerciale, évolution d’un service ou d’un discours |
| Tendances de recherche | Google Trends et données publiques de recherche | Évolution relative de l’intérêt pour Leroy Merlin ou comparaison avec un concurrent |
| SEO visible publiquement | Google, Bing, pages indexées, snippets | Pages positionnées sur une requête, contenus mis en avant, structure éditoriale visible |
| Données techniques publiques | PageSpeed Insights, technologies détectables, informations exposées publiquement | Performance d’une page, technologies Web détectées, problèmes techniques visibles |
| Données juridiques publiques | INPI, BODACC, registre des entreprises, Pappers… | Dirigeants déclarés, créations de sociétés, modifications statutaires, comptes lorsqu’ils sont publiés |
| Données publiques / statistiques | INSEE, data.gouv.fr, Eurostat, ADEME, ministères | Taille d’un marché, données démographiques locales, statistiques sur le logement ou la rénovation |
| Décisions réglementaires | CNIL, Autorité de la concurrence, DGCCRF, Commission européenne, jurisprudence | Sanction, décision administrative, litige ou engagement demandé à l’entreprise |
| Propriété intellectuelle | INPI, EUIPO, WIPO, Espacenet, Google Patents | Dépôt d’une marque, titulaire, date de dépôt, brevet ou dessin protégé |
| Recherche académique | Google Scholar, HAL, Cairn, theses.fr, publications universitaires | Étude citant Leroy Merlin, analyse du secteur du bricolage ou cas de management |
| Documents publics locaux | collectivités, préfectures, urbanisme, CDAC, enquêtes publiques | Projet d’extension, autorisation commerciale, implantation ou modification d’un magasin |
| Conférences / interviews | podcasts, webinars, conférences, interviews de dirigeants | Explication publique d’une stratégie, d’un projet numérique ou d’un choix organisationnel |
La disponibilité reste conditionnelle. Une information peut être publique sans être techniquement récupérable : paywall, authentification, interdiction d’exploration ou problème d’indexation peuvent limiter l’accès. Dans sa FAQ destinée aux éditeurs et développeurs, OpenAI précise par exemple que les éditeurs peuvent autoriser ou bloquer OAI-SearchBot, le robot utilisé pour découvrir des contenus susceptibles d’apparaître dans les résultats de recherche de ChatGPT.
Il faut également séparer ces sources des données privées. CRM, analytics, NPS, tickets de support, études internes ou bases commerciales ne sont pas spontanément accessibles. Un LLM peut les analyser si l’entreprise les lui fournit ou les rend accessibles via un outil connecté. Cela ne les transforme pas en informations publiques.
L’entraînement ne fournit pas un historique des sources
La deuxième confusion concerne les données d’entraînement. Dans sa documentation sur le développement de ChatGPT et de ses modèles de fondation, OpenAI distingue trois sources principales :
- les données accessibles publiquement sur Internet
- les données obtenues via des partenaires tiers
- les données fournies ou générées par les utilisateurs, les personnes chargées de l’entraînement des modèles et les chercheurs
La documentation du Help Center d’OpenAI consacrée au processus de développement des modèles précise que ces informations peuvent intervenir à différentes étapes, notamment lors de la préparation des données, du pré-entraînement et du post-entraînement.

Pour les données issues du Web public, OpenAI indique utiliser des informations « librement et publiquement accessibles » et ne pas chercher intentionnellement à collecter des contenus connus pour être derrière un paywall ou provenant du dark web. L’entreprise indique également appliquer des filtres avant l’entraînement. OpenAI détaille ces principes sur cette page.
Cela ne permet pas de conclure qu’une page particulière de Leroy Merlin, un article de LSA ou un commentaire Reddit précis a servi à entraîner un modèle. OpenAI ne fournit pas un inventaire permettant cette traçabilité document par document. Il faut donc rester au niveau des catégories de sources susceptibles d’avoir contribué à l’entraînement, et non attribuer une connaissance du modèle à une URL précise.
Le fonctionnement du modèle ajoute une autre distinction. OpenAI explique que ses modèles ne conservent pas simplement une copie des phrases, images ou sons traités pendant l’entraînement. Celui-ci ajuste les paramètres du modèle ; la génération utilise ensuite ces paramètres appris pour produire une réponse. L’explication d’OpenAI sur le fonctionnement de l’entraînement est disponible ici.
La marque est ce qu’elle publie, mais aussi ce que les autres publient sur elle
Pour une marque, la conséquence est assez concrète. Travailler sa visibilité auprès des LLM ne peut pas se limiter à « optimiser son site pour l’IA ». Les informations susceptibles d’être retrouvées sont distribuées entre
- les contenus contrôlés par l’entreprise
- ceux qu’elle influence partiellement
- ceux qu’elle ne contrôle pratiquement pas
C’est à partir de ces sources que le modèle associe l’entité marque à d’autres entités (cf. Le Brand Concept Scoring) qui servent à rédiger les réponses aux questions des utilisateurs.
Le sujet existait déjà avec les réseaux sociaux. La nouveauté est que les infos sont beaucoup plus complètes et synthétisées à la volée en fonction de la question de l’utilisateur. Ceci les rend mobilisables instantanément.
Un catalogue produit, un avis Google, une annonce de recrutement et une décision de la CNIL parlent tous de la même entreprise. Ils n’en racontent simplement pas la même histoire.
L’empreinte informationnelle d’une marque est donc beaucoup plus large que son patrimoine éditorial. Et les LLM ont précisément la capacité de relier ces traces dispersées.