Modèle de pagination et de navigation à facettes
Modèle gratuit pour contrôler la façon dont les moteurs de recherche explorent et indexent les séries paginées et la navigation à facettes, afin que les bonnes URL se positionnent.
Les séries paginées et les filtres à facettes peuvent engendrer des milliers d'URL quasi dupliquées ou pauvres qui épuisent le budget de crawl et enterrent vos meilleurs contenus. Ce modèle vous offre un système reproductible pour cartographier ces URL, décider quoi indexer ou bloquer, et appliquer les bonnes règles de canonical, de robots et de maillage interne. Utilisez-le pour concentrer les robots sur les pages à valeur tout en garantissant que les éléments plus profonds restent découvrables.
6 variantes prêtes à l'emploi
Cartographiez vos URL paginées et à facettes
Inventoriez chaque modèle d'URL paginée et filtrée avant de changer quoi que ce soit, pour que les décisions reposent sur des données réelles.
Constituez un inventaire complet des URL
Vous ne pouvez pas contrôler le crawl et l'indexation tant que vous ne savez pas exactement ce qui existe. Commencez par répertorier chaque série paginée (listes de catégories, archives de blog, résultats de recherche) et chaque paramètre à facettes (couleur, taille, prix, marque, tri, affichage).
- Source : crawl complet avec [Nom de l'outil de crawl] & logs serveur de [Source des fichiers de logs]
- Modèle de pagination : [/category/?page=N or /category/page/N/]
- Paramètres de facettes : [?color=, ?size=, ?sort=]
- Profondeur de combinaison : [une facette vs. plusieurs facettes empilées]
Pour chaque modèle, notez le canonical actuel, le robots meta et si l'URL figure dans le sitemap XML. Signalez toute URL à la fois canonicalisée ailleurs et interdite dans le robots.txt : c'est un conflit à corriger plus tard.
Étiquetez chaque modèle comme Indexer, Explorer seulement ou Bloquer. Cet inventaire devient la source unique de vérité pour le reste du modèle.
Bonnes pratiques de pagination
Rendez les pages composantes d'une série explorables et autocanoniques, afin que les éléments plus profonds soient découverts et indexés.
Traitez chaque page comme sa propre URL
Google a abandonné rel=next/prev et ne l'utilise plus comme signal d'indexation, ne comptez donc pas dessus. Faites plutôt en sorte que chaque page de la série tienne debout par elle-même.
- Autocanonique : la page 2 se canonicalise vers elle-même ([/category/?page=2]), jamais vers la page 1.
- Liens explorables : utilisez de vraies balises anchor avec href pour les pages suivante, précédente et numérotées, pas des boutons, ni le défilement infini seul, ni des gestionnaires uniquement en JavaScript.
- URL stables : chaque page renvoie un 200 et affiche un ensemble cohérent d'éléments.
- Vérifiez que les liens de pagination sont dans le HTML rendu.
- Assurez-vous que la page 2 et suivantes sont indexables (pas de noindex généralisé).
- Gardez des titres et meta descriptions distincts ou complétez-les avec le numéro de page.
L'objectif est la découverte : les robots suivent les liens de pagination pour atteindre les produits ou articles au fond de la série. N'évitez une page « tout afficher » que si elle se charge trop lentement pour être pratique.
Facettes : indexer ou bloquer
Décidez quelles combinaisons filtrées méritent d'être indexées et lesquelles bloquer pour protéger le budget de crawl.
Indexez la valeur, bloquez le bruit
La navigation à facettes peut générer des combinaisons quasi infinies. Seul un petit sous-ensemble mérite l'indexation : celles avec une réelle demande de recherche et un stock unique et utile.
Indexez celles-ci :
- Les facettes uniques très demandées que les internautes recherchent ([chaussures de running rouges], [vestes imperméables]).
- Les combinaisons avec un volume de mots-clés clair et assez de produits pour être utiles.
Bloquez ou mettez en noindex celles-ci :
- Les paramètres de tri et d'affichage ([?sort=price, ?view=grid]) qui ne font que réordonner les mêmes éléments.
- Les empilements de plusieurs facettes ([couleur + taille + prix + marque]) qui créent des pages pauvres et qui se recoupent.
- Les identifiants de session, les paramètres de suivi et les ensembles de résultats vides.
Validez la demande par une recherche de mots-clés avant de promouvoir une facette au rang d'indexable. Dans le doute, gardez-la hors de l'index : les pages filtrées pauvres diluent la pertinence et gaspillent la capacité de crawl qui devrait atteindre vos pages génératrices de revenus.
Contrôler le crawl
Utilisez les règles robots, la gestion des paramètres et les liens internes pour orienter les robots vers les URL qui comptent.
Orientez le crawl délibérément
Le contrôle du crawl est une question d'accent : envoyez les robots vers les URL à valeur et loin de la prolifération de paramètres à faible valeur.
- robots.txt : interdisez les chemins de paramètres sans valeur ([/*?sort=], [/*?sessionid=]) dont vous n'avez pas besoin qu'ils soient rendus. Rappelez-vous qu'une URL interdite ne peut toujours pas être explorée pour lire son canonical ou sa balise noindex.
- Liens internes : pointez de façon visible vers les facettes indexables et les pages paginées ; évitez de lier vers les combinaisons que vous voulez ignorer. Le maillage interne est votre signal de crawl le plus fort.
- nofollow : envisagez-le sur les liens de filtre que vous n'indexez ni ne voulez explorer, même si c'est un indice plus faible et non contraignant.
- Identifiez quels paramètres apportent de la valeur et lesquels ne font que rebrasser.
- Bloquez à la source les paramètres qui gaspillent le crawl.
- Gardez un chemin propre et peu profond vers chaque page que vous voulez indexer.
N'interdisez jamais une URL dans le robots.txt si vous avez aussi besoin que Google lise un canonical ou un noindex dessus : les pages bloquées gardent leurs signaux contradictoires invisibles.
Règles de canonical et d'indexation pour les facettes
Appliquez une logique cohérente de canonical et de noindex aux pages filtrées sans créer de signaux contradictoires.
Faites concorder les signaux
Les directives de canonical et d'indexation doivent pointer dans la même direction. Des signaux mélangés déroutent les robots et gaspillent le budget que vous cherchez à économiser.
- Facette indexable : autocanonique vers sa propre URL propre ([/shoes/red/] se canonicalise vers [/shoes/red/]), incluez-la dans le sitemap et liez-la en interne.
- Variante dupliquée : si une version de tri ou de paramètre affiche les mêmes éléments qu'une page propre, canonicalisez la variante vers cette URL propre.
- Combinaison pauvre : appliquez noindex, follow pour qu'elle reste hors de l'index tout en transmettant le jus de lien plus loin.
Évitez ces conflits :
- Ne combinez pas canonical et noindex sur la même URL : ils se contredisent.
- Ne canonicalisez pas une page que vous bloquez aussi dans le robots.txt.
- Ne pointez pas un canonical vers une cible en noindex ou redirigée.
Une URL, une instruction claire. Auditez les chevauchements pour que chaque facette ait exactement une décision d'indexation cohérente.
QA et suivi
Vérifiez que les directives sont rendues correctement et suivez la couverture d'index dans le temps pour détecter tôt les régressions.
Testez, puis continuez de surveiller
La configuration n'est correcte que si les robots la voient réellement dans la sortie rendue. Faites une QA avant le lancement, puis surveillez en continu.
Vérifications avant lancement :
- Inspectez le HTML rendu (pas seulement le code source) pour vérifier les bonnes balises canonical et robots sur un échantillon d'URL paginées et à facettes.
- Confirmez que les liens de pagination sont de vrais anchors explorables et que la page 2 et suivantes sont indexables.
- Utilisez l'inspection d'URL dans [Search Console / outils Bing] pour confirmer que le canonical choisi correspond à votre intention.
- Vérifiez que le robots.txt ne bloque pas d'URL portant des balises canonical ou noindex.
Suivi continu :
- Suivez chaque mois la couverture d'index et les rapports « exclue par noindex » / doublons.
- Surveillez les logs serveur pour repérer le gaspillage de crawl sur les paramètres bloqués.
- Recrawlez après toute modification de modèle ou de filtre.
Planifiez une revue récurrente selon une [cadence, ex. trimestrielle] pour que de nouvelles facettes ou des changements de pagination ne cassent jamais discrètement vos règles de crawl et d'indexation.
Comment utiliser ce modèle
- Crawlez votre site et extrayez les logs serveur pour constituer un inventaire complet de chaque URL de série paginée et de paramètre à facettes.
- Étiquetez chaque modèle d'URL comme Indexer, Explorer seulement ou Bloquer selon la demande de recherche, l'unicité et la profondeur de stock.
- Rendez les pages paginées autocanoniques avec de vrais liens anchor explorables, et ne comptez pas sur le rel=next/prev abandonné.
- Choisissez quelles facettes uniques et combinaisons très demandées indexer ; réservez l'indexation aux pages ayant une réelle demande de mots-clés.
- Appliquez l'autocanonique aux facettes indexables, canonicalisez les variantes dupliquées vers leur URL propre, et mettez en noindex,follow les combinaisons pauvres.
- Interdisez dans le robots.txt les paramètres qui gaspillent le crawl (tri, affichage, session, suivi), mais ne bloquez jamais d'URL portant des balises canonical ou noindex.
- Renforcez les liens internes vers les URL que vous voulez indexer et supprimez les liens vers les combinaisons que vous voulez ignorer.
- Faites la QA du HTML rendu, validez les canonicals dans la Search Console, puis surveillez la couverture d'index et les logs de crawl selon un calendrier récurrent.
Conseils pro
- Vérifiez que les signaux concordent : ne mettez jamais canonical et noindex sur la même URL, et ne canonicalisez jamais une page que vous bloquez aussi dans le robots.txt.
- Validez la demande d'une facette par une recherche de mots-clés avant d'indexer une combinaison ; dans le doute, gardez les pages filtrées pauvres hors de l'index.
- Utilisez de vrais anchors <a href> pour la pagination afin que les robots puissent les suivre ; le JavaScript seul ou le défilement infini seul peut masquer les éléments plus profonds.
- Auditez le HTML rendu, pas seulement le code source, car les canonicals et balises robots injectés par JavaScript peuvent différer de la réponse brute.
Questions fréquentes
Dois-je encore utiliser rel=next/prev pour la pagination ?
Non. Google a abandonné rel=next/prev et ne l'utilise plus pour l'indexation. Concentrez-vous plutôt sur des liens anchor explorables et des pages autocanoniques, afin que chaque page de la série puisse être découverte et indexée par elle-même.
La page 2 doit-elle se canonicaliser vers la page 1 ?
Non. La page 2 et suivantes doivent être autocanoniques vers leur propre URL. Les canonicaliser vers la page 1 indique aux moteurs de recherche que les pages plus profondes sont des doublons, ce qui peut empêcher la découverte de produits ou d'articles listés uniquement sur des pages ultérieures.
Quelles pages à facettes dois-je laisser Google indexer ?
Seulement les facettes avec une réelle demande de recherche et un stock utile et unique, comme un seul filtre populaire du type vestes imperméables. Bloquez ou mettez en noindex les paramètres de tri/affichage et les empilements de plusieurs facettes qui créent des pages pauvres et qui se recoupent, avec peu de valeur ajoutée.
Dois-je bloquer les URL à facettes dans le robots.txt ou utiliser noindex ?
Cela dépend de l'intention. Utilisez noindex,follow lorsque vous voulez qu'une page reste hors de l'index tout en étant explorée pour que le jus de lien circule. N'utilisez le disallow du robots.txt que pour les paramètres que vous n'avez jamais besoin de faire explorer, et ne bloquez jamais une URL qui porte aussi un canonical ou un noindex que vous devez faire lire.
Puis-je utiliser canonical et noindex ensemble sur une page filtrée ?
Non, ils envoient des instructions contradictoires. Le canonical dit de consolider vers une autre URL, tandis que le noindex dit de retirer entièrement celle-ci. Choisissez-en un : autocanonique ou canonical vers une page propre s'il s'agit d'un doublon, ou noindex,follow si la page est simplement pauvre.
Comment garder découvrables les éléments des pages profondes ?
Assurez-vous que chaque page paginée renvoie un 200, reste indexable et expose de vrais liens anchor explorables vers la page suivante et les pages numérotées dans le HTML rendu. Cela permet aux robots de parcourir toute la série et d'atteindre les éléments listés uniquement sur des pages plus profondes.