Шаблон пагинации и фасетной навигации
Бесплатный шаблон для управления тем, как поисковые системы сканируют и индексируют серии с пагинацией и фасетную навигацию, чтобы в выдаче ранжировались нужные URL.
Серии с пагинацией и фасетные фильтры могут породить тысячи почти одинаковых или малосодержательных URL, которые истощают краулинговый бюджет и прячут ваш лучший контент. Этот шаблон даёт вам воспроизводимую систему, чтобы составить карту таких URL, решить, что индексировать, а что блокировать, и применить правильные правила canonical, robots и внутренней перелинковки. Используйте его, чтобы сосредоточить краулеров на ценных страницах и при этом сохранить доступность более глубоких элементов.
6 готовых вариантов
Составьте карту URL с пагинацией и фасетами
Проведите инвентаризацию каждого шаблона URL с пагинацией и фильтрами, прежде чем что-либо менять, чтобы решения опирались на реальные данные.
Постройте полный инвентарь URL
Вы не сможете управлять сканированием и индексацией, пока точно не узнаете, что вообще существует. Начните с каталогизации каждой серии с пагинацией (листинги категорий, архивы блога, результаты поиска) и каждого фасетного параметра (цвет, размер, цена, бренд, сортировка, вид).
- Источник: полный краул в [Название инструмента для сканирования] и серверные логи из [Источник лог-файлов]
- Шаблон пагинации: [/category/?page=N or /category/page/N/]
- Параметры фасетов: [?color=, ?size=, ?sort=]
- Глубина комбинаций: [один фасет против наслоения нескольких]
Для каждого шаблона запишите текущий canonical, robots meta и находится ли URL в XML-карте сайта. Отметьте любой URL, который одновременно канонизирован на другую страницу и запрещён в robots.txt: это конфликт, который нужно исправить позже.
Пометьте каждый шаблон как Индексировать, Только сканировать или Блокировать. Этот инвентарь становится единственным источником истины для остальной части шаблона.
Лучшие практики пагинации
Сделайте страницы-компоненты серии доступными для сканирования и самоканоническими, чтобы более глубокие элементы находились и индексировались.
Относитесь к каждой странице как к отдельному URL
Google прекратил поддержку rel=next/prev и больше не использует его как сигнал для индексации, поэтому не полагайтесь на него. Вместо этого сделайте так, чтобы каждая страница серии была самодостаточной.
- Самоканоничность: страница 2 канонизируется сама на себя ([/category/?page=2]), а не обратно на страницу 1.
- Сканируемые ссылки: используйте настоящие теги anchor с href для следующей, предыдущей и пронумерованных страниц, а не кнопки, только бесконечную прокрутку или обработчики исключительно на JavaScript.
- Стабильные URL: каждая страница возвращает 200 и показывает согласованный набор элементов.
- Убедитесь, что ссылки пагинации есть в готовом HTML.
- Обеспечьте индексируемость страницы 2 и далее (без сплошного noindex).
- Делайте заголовки и meta-описания разными или добавляйте к ним номер страницы.
Цель — обнаружение: краулеры идут по ссылкам пагинации, чтобы добраться до товаров или статей в глубине серии. Избегайте страницы «показать всё» только тогда, когда она загружается слишком медленно, чтобы быть практичной.
Фасеты: индексировать или блокировать
Решите, какие комбинации фильтров заслуживают индексации, а какие следует заблокировать, чтобы сохранить краулинговый бюджет.
Индексируйте ценное, блокируйте шум
Фасетная навигация может генерировать почти бесконечное число комбинаций. Лишь небольшая часть заслуживает индексации: те, что имеют реальный поисковый спрос и уникальный, полезный ассортимент.
Индексируйте эти:
- Отдельные востребованные фасеты, которые ищут пользователи ([красные беговые кроссовки], [водонепроницаемые куртки]).
- Комбинации с чётким объёмом запросов и достаточным количеством товаров, чтобы быть полезными.
Блокируйте или применяйте noindex к этим:
- Параметры сортировки и вида ([?sort=price, ?view=grid]), которые лишь переупорядочивают те же элементы.
- Наслоения нескольких фасетов ([цвет + размер + цена + бренд]), создающие малосодержательные, пересекающиеся страницы.
- Идентификаторы сессий, параметры отслеживания и пустые наборы результатов.
Проверьте спрос с помощью исследования ключевых слов, прежде чем повышать любой фасет до индексируемого. Если сомневаетесь, держите его вне индекса: малосодержательные отфильтрованные страницы размывают релевантность и растрачивают краулинговую ёмкость, которая должна доходить до страниц, приносящих деньги.
Управление сканированием
Используйте правила robots, обработку параметров и внутренние ссылки, чтобы направить краулеров к важным URL.
Направляйте сканирование осознанно
Управление сканированием — это про акценты: направляйте краулеров к ценным URL и подальше от малоценного разрастания параметров.
- robots.txt: запрещайте бесполезные пути с параметрами ([/*?sort=], [/*?sessionid=]), рендер которых вам не нужен. Помните: запрещённый URL всё равно нельзя просканировать, чтобы прочитать его canonical или тег noindex.
- Внутренние ссылки: заметно ссылайтесь на индексируемые фасеты и страницы с пагинацией; избегайте ссылок на комбинации, которые хотите игнорировать. Внутренняя перелинковка — ваш самый сильный сигнал для сканирования.
- nofollow: рассмотрите его для ссылок на фильтры, которые вы не индексируете и не хотите сканировать, хотя это более слабая, необязательная подсказка.
- Определите, какие параметры добавляют ценность, а какие лишь перетасовывают.
- Блокируйте параметры, растрачивающие сканирование, у источника.
- Сохраняйте чистый, неглубокий путь к каждой странице, которую хотите индексировать.
Никогда не запрещайте URL в robots.txt, если вам также нужно, чтобы Google прочитал его canonical или noindex: заблокированные страницы оставляют свои конфликтующие сигналы невидимыми.
Правила canonical и индексации для фасетов
Применяйте согласованную логику canonical и noindex к отфильтрованным страницам, не создавая противоречивых сигналов.
Сделайте сигналы согласованными
Директивы canonical и индексации должны указывать в одном направлении. Смешанные сигналы запутывают краулеров и растрачивают бюджет, который вы пытаетесь сохранить.
- Индексируемый фасет: самоканонический на собственный чистый URL ([/shoes/red/] канонизируется на [/shoes/red/]), включите его в карту сайта и ссылайтесь на него внутренне.
- Дублирующийся вариант: если версия с сортировкой или параметром показывает те же элементы, что и чистая страница, канонизируйте вариант на этот чистый URL.
- Малосодержательная комбинация: примените noindex, follow, чтобы она оставалась вне индекса, но всё равно передавала вес ссылок дальше.
Избегайте этих конфликтов:
- Не сочетайте canonical и noindex на одном URL: они противоречат друг другу.
- Не канонизируйте страницу, которую также блокируете в robots.txt.
- Не направляйте canonical на цель с noindex или на перенаправленную цель.
Один URL — одна чёткая инструкция. Проверяйте пересечения, чтобы у каждого фасета было ровно одно согласованное решение по индексации.
Контроль качества и мониторинг
Убедитесь, что директивы правильно рендерятся, и отслеживайте покрытие индексом со временем, чтобы рано выявлять регрессии.
Протестируйте, а затем продолжайте наблюдать
Настройка верна только тогда, когда краулеры действительно видят её в готовом выводе. Проведите контроль качества перед запуском, а затем мониторьте непрерывно.
Проверки перед запуском:
- Проверьте готовый HTML (а не только исходный код) на наличие правильных тегов canonical и robots на выборочных URL с пагинацией и фасетами.
- Убедитесь, что ссылки пагинации являются настоящими сканируемыми anchor-ссылками, а страница 2 и далее индексируется.
- Воспользуйтесь инспекцией URL в [Search Console / инструменты Bing], чтобы подтвердить, что выбранный canonical соответствует вашему намерению.
- Проверьте, что robots.txt не блокирует URL, несущие теги canonical или noindex.
Постоянный мониторинг:
- Ежемесячно отслеживайте покрытие индексом и отчёты об исключении через noindex / дубликаты.
- Следите за серверными логами на предмет растраты сканирования на заблокированных параметрах.
- Пересканируйте сайт после изменений шаблона или фильтров.
Установите регулярный пересмотр с [периодичность, напр. ежеквартально], чтобы новые фасеты или изменения пагинации никогда тихо не ломали ваши правила сканирования и индексации.
Как использовать этот шаблон
- Просканируйте свой сайт и соберите серверные логи, чтобы составить полный инвентарь каждого URL с серией пагинации и фасетным параметром.
- Пометьте каждый шаблон URL как Индексировать, Только сканировать или Блокировать на основе поискового спроса, уникальности и глубины ассортимента.
- Сделайте страницы с пагинацией самоканоническими с настоящими сканируемыми anchor-ссылками и не полагайтесь на устаревший rel=next/prev.
- Выберите, какие отдельные фасеты и востребованные комбинации индексировать; оставьте индексацию для страниц с реальным спросом по ключевым словам.
- Примените самоканоничность к индексируемым фасетам, канонизируйте дублирующиеся варианты на их чистый URL, а к малосодержательным комбинациям — noindex,follow.
- Запретите в robots.txt параметры, растрачивающие сканирование (сортировка, вид, сессия, отслеживание), но никогда не блокируйте URL, несущие теги canonical или noindex.
- Усильте внутренние ссылки на URL, которые хотите индексировать, и уберите ссылки на комбинации, которые хотите игнорировать.
- Проверьте готовый HTML, подтвердите canonical в Search Console, а затем регулярно мониторьте покрытие индексом и логи сканирования.
Советы
- Проверяйте согласованность сигналов: никогда не ставьте canonical и noindex на один URL и никогда не канонизируйте страницу, которую также блокируете в robots.txt.
- Проверяйте спрос на фасеты через исследование ключевых слов, прежде чем индексировать комбинацию; если не уверены, держите малосодержательные отфильтрованные страницы вне индекса.
- Используйте настоящие anchor-ссылки <a href> для пагинации, чтобы краулеры могли по ним переходить; только JavaScript или сама бесконечная прокрутка могут прятать более глубокие элементы.
- Проверяйте готовый HTML, а не только исходный код, поскольку теги canonical и robots, внедрённые через JavaScript, могут отличаться от сырого ответа.
Частые вопросы
Стоит ли по-прежнему использовать rel=next/prev для пагинации?
Нет. Google прекратил поддержку rel=next/prev и больше не использует его для индексации. Вместо этого сосредоточьтесь на сканируемых anchor-ссылках и самоканонических страницах, чтобы каждую страницу серии можно было найти и проиндексировать отдельно.
Должна ли страница 2 канонизироваться обратно на страницу 1?
Нет. Страница 2 и далее должны быть самоканоническими на собственный URL. Канонизация их на страницу 1 сообщает поисковым системам, что более глубокие страницы являются дубликатами, а это может помешать обнаружению товаров или статей, которые есть только на более поздних страницах.
Какие фасетные страницы стоит разрешить Google индексировать?
Только фасеты с реальным поисковым спросом и полезным, уникальным ассортиментом, например отдельный популярный фильтр вроде водонепроницаемых курток. Блокируйте или применяйте noindex к параметрам сортировки/вида и наслоениям нескольких фасетов, создающим малосодержательные, пересекающиеся страницы с малой добавленной ценностью.
Блокировать фасетные URL в robots.txt или использовать noindex?
Это зависит от намерения. Используйте noindex,follow, когда хотите держать страницу вне индекса, но всё же сканируемой, чтобы вес ссылок перетекал. Используйте запрет в robots.txt только для параметров, которые никогда не нужно сканировать, и никогда не блокируйте URL, который также несёт canonical или noindex, который нужно прочитать.
Можно ли использовать canonical и noindex вместе на отфильтрованной странице?
Нет, они посылают противоречивые инструкции. Canonical говорит объединить с другим URL, а noindex говорит полностью убрать эту страницу. Выберите одно: самоканоничность или canonical на чистую страницу, если это дубликат, либо noindex,follow, если страница просто малосодержательна.
Как сохранить доступность глубоких элементов с пагинацией?
Убедитесь, что каждая страница с пагинацией возвращает 200, остаётся индексируемой и содержит настоящие сканируемые anchor-ссылки на следующую и пронумерованные страницы в готовом HTML. Это позволяет краулерам пройти всю серию и добраться до элементов, которые есть только на более глубоких страницах.