Шаблон анализа краулингового бюджета и лог-файлов

Бесплатный шаблон анализа краулингового бюджета и лог-файлов: узнайте, как Googlebot сканирует ваш сайт, и быстро устраните бесполезное сканирование.

У поисковых систем ограниченные ресурсы для сканирования любого сайта, поэтому бесполезное сканирование означает, что ваши важные страницы обнаруживаются и обновляются медленнее. Этот шаблон проведёт вас через выгрузку серверных логов, анализ реального поведения Googlebot, поиск бесполезного сканирования и повышение эффективности. Используйте его, чтобы каждое сканирование приносило пользу на крупных сайтах или сайтах с большим числом дубликатов.

6 готовых вариантов

Нужно ли это вам вообще

Определите, действительно ли краулинговый бюджет — проблема, стоящая вашего времени, прежде чем погружаться в логи.

Важен ли краулинговый бюджет для вас?

Краулинговый бюджет — это количество URL-адресов, которые поисковая система готова и способна просканировать на вашем сайте за определённый период. Для большинства малых и средних сайтов это не проблема, которую стоит решать. Google обычно без труда сканирует несколько тысяч URL-адресов.

Краулинговый бюджет должен вас волновать в первую очередь, если вы управляете крупным сайтом (сотни тысяч URL-адресов или более), сайтом, который генерирует много малоценных или дублирующихся URL-адресов, либо таким, где новые и обновлённые страницы долго попадают в индекс.

Тревожные сигналы, оправдывающие эту работу

  • Фасетная навигация или фильтры, создающие бесконечные комбинации URL-адресов
  • Важные страницы не проиндексированы даже спустя недели после публикации
  • Search Console показывает много URL-адресов со статусом "Обнаружено – в настоящее время не проиндексировано"
  • Серверные логи переполнены обращениями ботов к параметрам, сортировке или пагинации

[URL сайта]: запишите здесь приблизительное общее количество URL-адресов: [Всего URL]. Если оно небольшое и страницы индексируются быстро, пропустите остальное и сосредоточьтесь на другом.

Получите и подготовьте лог-файлы

Соберите сырые серверные логи доступа и очистите их до вида, который действительно можно анализировать.

Где найти ваши логи

Серверные логи доступа — самая надёжная запись того, как боты и пользователи реально обращаются к вашему сайту. Попросите у своего хостинг-провайдера, команды devops или CDN сырые логи доступа как минимум за несколько недель, а лучше за полный месяц, чтобы охватить обычные циклы сканирования.

Распространённые источники: ваш веб-сервер (Apache, Nginx), ваш CDN (например, Cloudflare или Fastly) и любой балансировщик нагрузки перед ними. Выгрузите данные из [Источник логов] за период [Диапазон дат].

Подготовьте данные

  1. Объедините логи со всех серверов, чтобы не пропустить запросы, обслуженные разными машинами.
  2. Убедитесь, что каждая строка содержит отметку времени, запрашиваемый URL, код статуса, user agent и IP-адрес.
  3. Проверьте Googlebot, выполнив обратный DNS-запрос по IP, а затем прямой запрос. Не доверяйте только строке user agent, поскольку её легко подделать.
  4. Отфильтруйте до проверенных ботов поисковых систем, прежде чем делать выводы о поведении сканирования.

Храните очищенный набор данных в месте, пригодном для повторного использования, чтобы в следующем квартале повторить тот же анализ.

Проанализируйте паттерны сканирования

Поймите, что именно сканирует Googlebot, как часто и на какие коды статуса он натыкается.

На что смотреть в первую очередь

Выделив проверенные запросы Googlebot, составьте картину реального поведения сканирования, а не гадайте. Сосредоточьтесь на объёме, частоте и кодах ответа: именно они показывают, куда уходит усилие сканирования.

Ключевые вопросы, на которые нужно ответить

  • Какие URL-адреса сканируются чаще всего? Сравните самые сканируемые URL-адреса с вашими важнейшими страницами. Расхождения — это сигнал.
  • Как часто сканируются ключевые страницы? Страницы, приносящие доход, должны посещаться регулярно; редко сканируемые важные URL-адреса устаревают.
  • Какие коды статуса видит Googlebot? Здоровый сайт — это преимущественно 200-е. Следите за всплесками 404, редиректов 301/302 и серверных ошибок 5xx.
  • Какие разделы доминируют? Сгруппируйте обращения по каталогам, чтобы увидеть, не поглощает ли малоценный раздел активность сканирования.

Запишите свои выводы по [Самый сканируемый раздел] и зафиксируйте любой раздел, который сканируется чрезмерно относительно своей ценности: [Чрезмерно сканируемый путь].

Активное сканирование редиректов или ошибок — это бесполезное усилие, которое следует устранить на следующих шагах.

Найдите бесполезное сканирование

Выявите малоценные, дублирующиеся и битые URL-адреса, истощающие ресурсы сканирования.

Где утекает краулинговый бюджет

Бесполезное сканирование возникает, когда боты тратят время на URL-адреса, которые вообще не должны сканироваться. На крупных сайтах это может быть разницей между тем, обновляются ли важные страницы ежедневно или ежемесячно.

Распространённые источники потерь

  • Фасетные и параметрические URL-адреса: фильтры, сортировка и параметры отслеживания, умножающие одну страницу в тысячи вариантов.
  • Дублирующийся контент: та же страница, доступная по нескольким URL-адресам, со слешами в конце или заглавными/строчными буквами в пути.
  • Мягкие 404: пустые результаты, устаревшие объявления или неполноценные страницы, возвращающие 200, но не дающие никакой ценности.
  • Цепочки редиректов: URL-адреса, прыгающие через несколько переходов, прежде чем разрешиться.
  • Бесконечные пространства: календари, результаты поиска и идентификаторы сессий, генерирующие почти бесконечные URL-адреса.

По результатам анализа логов перечислите здесь худших нарушителей: [Паттерн потерь 1], [Паттерн потерь 2]. Оцените долю обращений Googlebot, уходящую на эти малоценные URL-адреса: это число — ваша возможность. Приоритизируйте исправления по тому, сколько активности сканирования потребляет каждый паттерн.

Повысьте эффективность сканирования

Предпримите конкретные действия, чтобы поисковые системы тратили усилия на страницы, которые важны.

Направьте краулеров к важному

Когда вы знаете, где живут потери, цель — консолидировать сигналы и направить ботов к ценным, каноническим URL-адресам.

  1. Усильте внутренние ссылки на важные страницы, чтобы их было легко обнаружить и чтобы они сигнализировали о своём приоритете.
  2. Держите XML-карты сайта чистыми: включайте только канонические, индексируемые URL-адреса и убирайте редиректы, ошибки и noindex-страницы.
  3. Используйте robots.txt продуманно, чтобы блокировать сканирование явно малоценных путей, таких как внутренний поиск и бесконечные параметрические пространства. Помните: блокировка сканирования — это не то же самое, что удаление из индекса.
  4. Обрабатывайте параметры каноническими тегами, указывающими на чистую версию, и не ссылайтесь на параметризованные URL-адреса внутри сайта.
  5. Исправляйте цепочки редиректов, направляя первый переход сразу на конечный пункт одним 301.
  6. Устраняйте мягкие 404, возвращая настоящий 404 или 410 либо улучшая страницу так, чтобы она заслуживала сканирования.

Запишите три главных действия: [Действие 1], [Действие 2], [Действие 3]. Внедряйте изменения постепенно, чтобы можно было измерить их эффект.

Отслеживайте через статистику сканирования

Следите за поведением сканирования во времени с помощью Search Console и регулярных проверок логов.

Замкните цикл

Эффективность сканирования — не разовый проект. После внесения изменений отслеживайте, реагируют ли поисковые системы так, как вы ожидаете.

За чем следить

  • Статистика сканирования Search Console: просматривайте общее число запросов на сканирование, среднее время ответа и разбивку по коду ответа, типу файла и цели (обнаружение против обновления).
  • Состояние хоста: следите за проблемами доступности, ведь медленный или ошибающийся сервер заставляет Google сканировать меньше.
  • Тренды кодов статуса: убедитесь, что после ваших исправлений число 404, редиректов и ошибок 5xx снижается.
  • Отчёты об индексировании: проверьте, переходят ли ранее застрявшие страницы в состояние проиндексированных.

Постройте рутину

Регулярно (ежемесячно или ежеквартально) повторно выгружайте серверные логи и сравнивайте с базовым уровнем. Запишите здесь дату проверки: [Дата следующей проверки] и ответственного: [Ответственный].

Если потери снова появятся, вы заметите это рано, а не после того, как важные страницы выпадут из индекса.

Как использовать этот шаблон

  1. Решите, стоит ли краулинговый бюджет вашего времени: он важен прежде всего для крупных сайтов (сотни тысяч URL-адресов) или сайтов с большим числом дубликатов и малоценных URL-адресов.
  2. Запросите сырые серверные логи доступа у своего хоста, CDN и балансировщиков нагрузки как минимум за несколько недель, а лучше за полный месяц.
  3. Очистите и объедините логи, а затем проверьте Googlebot через обратный и прямой DNS, чтобы анализировать реальное поведение ботов, а не поддельные user agent.
  4. Составьте карту паттернов сканирования: определите самые сканируемые URL-адреса и разделы, частоту сканирования ключевых страниц и коды статуса, которые получает Googlebot.
  5. Охотьтесь за бесполезным сканированием, таким как фасетные параметры, дублирующиеся URL-адреса, мягкие 404, цепочки редиректов и бесконечные пространства URL-адресов.
  6. Повысьте эффективность за счёт более сильных внутренних ссылок, чистых XML-карт сайта, продуманных правил robots.txt, канонических тегов и однопереходных 301.
  7. Откройте статистику сканирования в Search Console, чтобы подтвердить, что запросы на сканирование, время ответа и тренды кодов статуса движутся в правильном направлении.
  8. Установите регулярный график повторной выгрузки логов и просмотра статистики сканирования, чтобы потери не возвращались постепенно.

Советы

  • Краулинговый бюджет — реальная забота преимущественно для крупных сайтов или сайтов с большим числом дубликатов; если ваш сайт небольшой и страницы индексируются быстро, направьте усилия в другое место.
  • Всегда проверяйте Googlebot через обратный, а затем прямой DNS, прежде чем доверять любому запросу, ведь строку user agent тривиально подделать.
  • Блокировка URL-адреса в robots.txt останавливает сканирование, но не удаляет её из индекса; используйте noindex или подходящие коды статуса, когда нужно убрать страницу.
  • Исправляйте цепочки редиректов, направляя исходный URL сразу на конечный пункт одним 301, чтобы боты не тратили переходы впустую.

Частые вопросы

Что такое краулинговый бюджет?

Краулинговый бюджет — это количество URL-адресов, которые поисковая система готова и способна просканировать на вашем сайте за период времени. Он определяется тем, какую нагрузку выдерживает ваш сервер и насколько поисковые системы нуждаются в вашем контенте.

Нужно ли малым сайтам беспокоиться о краулинговом бюджете?

Обычно нет. Если на вашем сайте несколько тысяч URL-адресов и новые страницы индексируются быстро, краулинговый бюджет редко становится узким местом. Он приобретает значение на крупных сайтах или сайтах, генерирующих много малоценных или дублирующихся URL-адресов.

Зачем использовать серверные лог-файлы вместо одних лишь инструментов сканирования?

Серверные логи показывают, что именно запрашивали поисковые системы, включая частоту, коды статуса и то, какие именно URL-адреса они посетили. Инструменты сканирования имитируют сканирование, но логи — это истинная правда о реальном поведении ботов на вашем сайте.

Как проверить, что запрос действительно от Googlebot?

Выполните обратный DNS-запрос по IP-адресу, отправившему запрос, чтобы подтвердить, что он разрешается в домен Google, а затем выполните прямой DNS-запрос по этому имени, чтобы подтвердить, что оно указывает обратно на тот же IP-адрес. Никогда не доверяйте только строке user agent, поскольку её можно подделать.

Каковы самые распространённые источники бесполезного сканирования?

Фасетная навигация и параметры URL-адресов, дублирующиеся URL-адреса, мягкие 404, цепочки редиректов и бесконечные пространства, такие как календари или результаты внутреннего поиска. Они могут потреблять большую долю активности сканирования на крупных сайтах.

Где посмотреть статистику сканирования в Search Console?

Search Console включает отчёт «Статистика сканирования», показывающий общее число запросов на сканирование, среднее время ответа и разбивки по коду ответа, типу файла, типу Googlebot и цели. Используйте его вместе с анализом логов, чтобы отслеживать тренды во времени.