Aller au contenu principal

    Blogue

    Votre site est-il lisible par ChatGPT ? Ce qu'on a corrigé sur le nôtre

    · Solutions SafeHive Inc.

    Vos clients posent de plus en plus leurs questions à ChatGPT, Gemini ou Perplexity avant de chercher sur Google. Pour répondre, ces outils envoient des robots lire les sites. La plupart de ces robots n'exécutent pas le JavaScript : ils lisent le HTML tel que le serveur le livre, et rien d'autre.

    Nous avons donc passé notre propre site à la grille qu'on applique aux clients. Premier résultat : 59 sur 100. Voici ce qu'on a trouvé, ce qu'on a corrigé, et ce qui reste hors de portée du code.

    Problème n° 1 : une page presque vide pour les robots

    Notre site est une application React. Pour un navigateur, tout va bien : le JavaScript construit la page. Pour un robot qui ne l'exécute pas, le HTML livré contenait 124 mots, toujours les mêmes sur les dix pages du site, en français même sur les pages anglaises.

    Le correctif : générer le HTML complet de chaque page au moment de la construction du site. L'accueil livre maintenant 1 163 mots lisibles sans JavaScript, et chaque page anglaise livre son texte en anglais. Rien ne change pour le visiteur ; tout change pour le robot.

    Problème n° 2 : des adresses officielles qui redirigeaient

    Chaque page déclarait une adresse canonique du type /capacites, mais l'hébergeur répondait par une redirection vers /capacites/. Un moteur qui suit l'adresse officielle tombe donc sur une redirection : c'est un signal contradictoire.

    Le correctif : publier chaque page à l'adresse exacte qu'elle déclare, sans barre oblique finale. Le sitemap est maintenant produit à partir de la même liste de pages, il ne peut plus diverger.

    Problème n° 3 : des pages qui n'existent pas répondaient « tout va bien »

    Une adresse inventée répondait avec le code 200 et le contenu de l'accueil. Pour un moteur, c'est du contenu en double à l'infini. Même un fichier absent, comme llms.txt, renvoyait l'accueil.

    Le correctif : une vraie page 404, marquée pour ne pas être indexée, et des redirections permanentes pour les anciennes adresses encore liées ailleurs.

    Problème n° 4 : une carte d'identité incomplète

    Les données structurées (le bloc JSON-LD que les moteurs et les IA lisent en premier) nommaient l'entreprise, mais sans adresse ni téléphone. Nous les avons complétées : nom légal, NEQ, adresse de correspondance, téléphone, logo, territoire desservi.

    Robots d'IA : faut-il les bloquer ?

    Il faut distinguer deux familles. Les robots de recherche (OAI-SearchBot et ChatGPT-User d'OpenAI, PerplexityBot, Claude-SearchBot) lisent votre site au moment où quelqu'un pose une question : les bloquer, c'est disparaître des réponses. Les robots d'entraînement (GPTBot, Google-Extended, CCBot, ClaudeBot) servent à entraîner les modèles : les bloquer est un choix légitime, au prix d'une présence plus faible dans la mémoire des modèles.

    Vérifiez aussi votre pare-feu. Certains hébergeurs offrent une option qui bloque les robots d'IA en un clic ; activée par défaut ou par mégarde, elle rend un site invisible sans que personne ne s'en aperçoive. Notre choix : tout ouvert.

    llms.txt : utile, pas magique

    Le fichier llms.txt est un standard proposé pour résumer un site à l'intention des modèles de langage. Peu de robots le lisent encore. Le nôtre existait, mais sous le mauvais nom (llm.txt) : il ne servait à rien. Corrigé. Ça prend dix minutes, ça ne remplace rien de ce qui précède.

    Ce que le code ne règle pas

    Interrogé de mémoire, Gemini ne connaissait pas SafeHive. Aucun correctif technique n'y change quoi que ce soit. Ce qui fait entrer un nom dans la mémoire des IA, ce sont les mentions ailleurs sur le Web : registres, annuaires, associations, médias, partenaires. Le site doit être lisible ; la réputation, elle, se construit hors du site.

    La liste de vérification

    • Le HTML livré contient le texte de la page, sans JavaScript.
    • robots.txt laisse passer les robots de recherche des IA.
    • Le pare-feu ne bloque pas ces robots.
    • Chaque page publie à son adresse canonique exacte, sans redirection.
    • Une adresse inconnue répond 404, pas 200.
    • Le JSON-LD décrit l'entreprise : nom, adresse, téléphone, territoire.
    • Titre et description disent quoi, où et pour qui.
    • Un sitemap à jour, déclaré dans robots.txt.

    Vous voulez qu'on regarde votre site ou votre projet avec la même grille ? Écrivez-nous à contact@safehive.ca.