Être en ligne et être indexé sont deux choses différentes. Dans la quasi-totalité des cas que nous ouvrons, l'invisibilité ne vient pas d'un manque de contenu : elle vient d'un blocage technique que personne n'a regardé. Voici les sept causes, et pour chacune le test que vous faites vous-même en moins d'une minute.
Taper site:votresite.fr dans Google est le réflexe de tout le monde. Ce n'est pas un diagnostic : la commande donne un aperçu approximatif, avec un décompte instable qui varie d'une heure à l'autre et qui n'affiche pas tout. Elle vous dit « il se passe quelque chose », jamais « voilà pourquoi ».
Le seul instrument sérieux est gratuit : la Search Console de Google, son rapport d'indexation des pages et son outil d'inspection d'URL. L'inspection prend une adresse et vous répond, en clair : indexée ou non, et le motif exact. Si vous n'avez pas encore vérifié la propriété de votre domaine, faites-le avant de lire la suite — sans elle, vous diagnostiquez à l'aveugle.
C'est la cause n°1 et la plus humiliante : pendant la refonte, le prestataire ajoute une instruction qui interdit l'indexation, pour éviter que Google ne voie le chantier. Puis le site est mis en ligne, et personne ne retire l'instruction. Le site est parfait, public, rapide — et formellement interdit d'indexation.
Cette instruction existe sous deux formes strictement équivalentes pour Google : une balise <meta name="robots" content="noindex"> dans l'en-tête de la page, ou un en-tête HTTP X-Robots-Tag: noindex renvoyé par le serveur. La seconde est la plus vicieuse : elle est invisible dans le code source de la page.
noindex (Ctrl+F). Recommencez sur deux pages profondes. Pour la version en en-tête HTTP, ouvrez l'inspection d'URL de la Search Console : elle indique explicitement quand l'indexation est bloquée par un noindex, quelle que soit sa forme.Le fichier robots.txt, à la racine de votre domaine, dit aux robots ce qu'ils ont le droit d'explorer. Un Disallow: / sous User-agent: * ferme tout le site. C'est le réglage normal d'un site de préproduction — et une catastrophe silencieuse s'il part en production.
Il y a un piège supplémentaire, contre-intuitif : robots.txt et noindex ne se cumulent pas, ils s'annulent. Si votre robots.txt interdit l'accès à une page, le robot ne peut pas la charger, donc il ne voit jamais le noindex qu'elle contient — et l'adresse peut rester listée. Pour désindexer, il faut au contraire laisser lire la page pour que l'instruction soit vue.
votresite.fr/robots.txt dans votre navigateur. Cherchez Disallow: / seul sur sa ligne. Puis descendez : cherchez GPTBot, ClaudeBot, Google-Extended, PerplexityBot. Un Disallow: / sous l'un de ces noms vous retire des moteurs génératifs.La balise <link rel="canonical"> sert à dire « parmi ces pages qui se ressemblent, voici la version de référence ». Bien utilisée, elle regroupe la valeur. Mal utilisée, elle efface vos pages une par une.
Les deux accidents classiques : un gabarit qui copie la même canonique partout — et donc déclare que toutes vos pages sont en réalité la page d'accueil ; et une canonique restée pointée vers l'ancien domaine ou vers l'adresse de préproduction après une migration. Dans les deux cas, Google vous obéit : il indexe la cible et abandonne le reste.
canonical. Chaque page doit désigner sa propre adresse, en version finale : bon domaine, bon protocole https, avec ou sans www mais toujours le même choix. Si les trois pages affichent la même adresse, vous avez trouvé.Le sitemap.xml est la liste que vous soumettez à Google. Il doit contenir uniquement des adresses finales qui répondent en 200. Trois défauts très fréquents le rendent contre-productif : des adresses qui partent en redirection, des adresses mortes, et des pages en noindex listées comme si elles étaient publiques. Un plan de site truffé de fausses pistes cesse d'être un outil de découverte : le moteur s'y fie de moins en moins.
votresite.fr/sitemap.xml, prenez cinq adresses au hasard et collez-les dans un onglet. Chacune doit s'afficher directement, sans rebond d'adresse dans la barre du navigateur et sans page d'erreur. Vérifiez aussi l'inverse : vos pages importantes sont-elles bien dans la liste ?Une page à laquelle aucun lien interne ne mène est une page orpheline. Elle peut être parfaite, sourcée, rapide : elle vit dans un cul-de-sac. Les moteurs découvrent et hiérarchisent par les liens ; une page que rien ne recommande depuis votre propre site envoie un signal clair — même vous ne la jugez pas utile.
C'est aussi la cause la plus fréquente du statut « Découverte, actuellement non indexée » : l'adresse est connue par le plan de site, mais rien ne justifie de dépenser du budget d'exploration pour elle.
Google exécute le JavaScript, mais en deux temps : il récupère d'abord le HTML, puis met la page dans une file d'attente pour le rendu. Ce qui n'apparaît qu'après exécution dépend donc entièrement de la réussite de cette seconde étape. Un script bloqué, une ressource interdite dans le robots.txt, une erreur silencieuse — et il ne reste qu'une coquille vide.
Le cas le plus courant chez les PME n'est même pas le site entier : ce sont les éléments décisifs injectés par un script tiers — la liste des produits, les avis clients, le contenu d'un onglet, le texte chargé au défilement.
C'est la cause la plus désagréable, parce qu'elle n'est pas technique. Le statut « Explorée, actuellement non indexée » signifie que le robot est venu, a lu, et a décidé de ne pas garder. En 2026, les moteurs indexent de moins en moins par défaut : ils arbitrent.
Les motifs habituels : contenu trop proche d'une autre de vos pages, texte générique qu'on trouve identique ailleurs, page de service dupliquée par ville avec seul le nom de la ville qui change, ou site trop jeune et trop peu cité pour mériter un budget d'exploration.
Alors vous n'avez plus un problème d'indexation mais de classement, et ce sont deux chantiers différents. Deux repères pour ne pas se tromper de combat :
Une fois le socle sain, la question devient : combien produire, à quel rythme, et pour quel budget. Nous avons posé les chiffres du marché dans Combien coûte le SEO pour une PME en 2026, et la vue d'ensemble Google + moteurs IA dans notre guide Être trouvé sur Google et sur ChatGPT en 2026.
| Cause | Où regarder | Signe qui accuse |
|---|---|---|
| 1. noindex | Code source + inspection d'URL | Le mot noindex, ou un blocage annoncé par la Search Console |
| 2. robots.txt | /robots.txt | Disallow: / seul sur sa ligne |
| 3. Canonique | Code source de 3 pages | La même adresse déclarée partout |
| 4. Plan de site | /sitemap.xml | Adresses qui rebondissent ou qui n'existent plus |
| 5. Page orpheline | Navigation à la souris | Injoignable en 3 clics depuis l'accueil |
| 6. JavaScript | Code source | Votre texte visible absent du HTML |
| 7. Valeur perçue | Rapport d'indexation | « Explorée, actuellement non indexée » |
site: suffit-elle à savoir si je suis indexé ?Non. Elle donne un aperçu approximatif et un décompte instable. Utilisez le rapport d'indexation des pages et l'inspection d'URL de la Search Console : eux vous donnent le motif.
Aucun délai n'est garanti. De quelques heures à plusieurs semaines. Demander l'indexation dans la Search Console accélère parfois la découverte, jamais la décision.
Souvent oui, mais avec la bonne méthode : mettez-les en noindex sans les bloquer dans le robots.txt, sinon l'instruction ne sera jamais lue.
Non pour ces sept vérifications : elles se font seul, gratuitement, en un quart d'heure. Un prestataire se justifie ensuite, pour produire du contenu régulier — mais payer du contenu sur un site que les moteurs ne peuvent pas lire, c'est jeter le budget.
Sources (consultées le 19/08/2026) : Google Search Central — Bloquer l'indexation avec noindex · Google Search Central — Introduction au robots.txt · Google Search Central — Spécifier une URL canonique · Google Search Central — Corriger les problèmes de canonisation · Google Search Central — Principes de base du SEO JavaScript · Search Console — Rapport d'indexation des pages (statuts « Découverte » et « Explorée, actuellement non indexée ») · web.dev — Core Web Vitals : seuils LCP 2,5 s, INP 200 ms, CLS 0,1.