Шаблон анализа краулингового бюджета и лог-файлов
Бесплатный шаблон анализа краулингового бюджета и лог-файлов: узнайте, как Googlebot сканирует ваш сайт, и быстро устраните бесполезное сканирование.
У поисковых систем ограниченные ресурсы для сканирования любого сайта, поэтому бесполезное сканирование означает, что ваши важные страницы обнаруживаются и обновляются медленнее. Этот шаблон проведёт вас через выгрузку серверных логов, анализ реального поведения Googlebot, поиск бесполезного сканирования и повышение эффективности. Используйте его, чтобы каждое сканирование приносило пользу на крупных сайтах или сайтах с большим числом дубликатов.
6 готовых вариантов
Нужно ли это вам вообще
Определите, действительно ли краулинговый бюджет — проблема, стоящая вашего времени, прежде чем погружаться в логи.
Важен ли краулинговый бюджет для вас?
Краулинговый бюджет — это количество URL-адресов, которые поисковая система готова и способна просканировать на вашем сайте за определённый период. Для большинства малых и средних сайтов это не проблема, которую стоит решать. Google обычно без труда сканирует несколько тысяч URL-адресов.
Краулинговый бюджет должен вас волновать в первую очередь, если вы управляете крупным сайтом (сотни тысяч URL-адресов или более), сайтом, который генерирует много малоценных или дублирующихся URL-адресов, либо таким, где новые и обновлённые страницы долго попадают в индекс.
Тревожные сигналы, оправдывающие эту работу
- Фасетная навигация или фильтры, создающие бесконечные комбинации URL-адресов
- Важные страницы не проиндексированы даже спустя недели после публикации
- Search Console показывает много URL-адресов со статусом "Обнаружено – в настоящее время не проиндексировано"
- Серверные логи переполнены обращениями ботов к параметрам, сортировке или пагинации
[URL сайта]: запишите здесь приблизительное общее количество URL-адресов: [Всего URL]. Если оно небольшое и страницы индексируются быстро, пропустите остальное и сосредоточьтесь на другом.
Получите и подготовьте лог-файлы
Соберите сырые серверные логи доступа и очистите их до вида, который действительно можно анализировать.
Где найти ваши логи
Серверные логи доступа — самая надёжная запись того, как боты и пользователи реально обращаются к вашему сайту. Попросите у своего хостинг-провайдера, команды devops или CDN сырые логи доступа как минимум за несколько недель, а лучше за полный месяц, чтобы охватить обычные циклы сканирования.
Распространённые источники: ваш веб-сервер (Apache, Nginx), ваш CDN (например, Cloudflare или Fastly) и любой балансировщик нагрузки перед ними. Выгрузите данные из [Источник логов] за период [Диапазон дат].
Подготовьте данные
- Объедините логи со всех серверов, чтобы не пропустить запросы, обслуженные разными машинами.
- Убедитесь, что каждая строка содержит отметку времени, запрашиваемый URL, код статуса, user agent и IP-адрес.
- Проверьте Googlebot, выполнив обратный DNS-запрос по IP, а затем прямой запрос. Не доверяйте только строке user agent, поскольку её легко подделать.
- Отфильтруйте до проверенных ботов поисковых систем, прежде чем делать выводы о поведении сканирования.
Храните очищенный набор данных в месте, пригодном для повторного использования, чтобы в следующем квартале повторить тот же анализ.
Проанализируйте паттерны сканирования
Поймите, что именно сканирует Googlebot, как часто и на какие коды статуса он натыкается.
На что смотреть в первую очередь
Выделив проверенные запросы Googlebot, составьте картину реального поведения сканирования, а не гадайте. Сосредоточьтесь на объёме, частоте и кодах ответа: именно они показывают, куда уходит усилие сканирования.
Ключевые вопросы, на которые нужно ответить
- Какие URL-адреса сканируются чаще всего? Сравните самые сканируемые URL-адреса с вашими важнейшими страницами. Расхождения — это сигнал.
- Как часто сканируются ключевые страницы? Страницы, приносящие доход, должны посещаться регулярно; редко сканируемые важные URL-адреса устаревают.
- Какие коды статуса видит Googlebot? Здоровый сайт — это преимущественно 200-е. Следите за всплесками 404, редиректов 301/302 и серверных ошибок 5xx.
- Какие разделы доминируют? Сгруппируйте обращения по каталогам, чтобы увидеть, не поглощает ли малоценный раздел активность сканирования.
Запишите свои выводы по [Самый сканируемый раздел] и зафиксируйте любой раздел, который сканируется чрезмерно относительно своей ценности: [Чрезмерно сканируемый путь].
Активное сканирование редиректов или ошибок — это бесполезное усилие, которое следует устранить на следующих шагах.
Найдите бесполезное сканирование
Выявите малоценные, дублирующиеся и битые URL-адреса, истощающие ресурсы сканирования.
Где утекает краулинговый бюджет
Бесполезное сканирование возникает, когда боты тратят время на URL-адреса, которые вообще не должны сканироваться. На крупных сайтах это может быть разницей между тем, обновляются ли важные страницы ежедневно или ежемесячно.
Распространённые источники потерь
- Фасетные и параметрические URL-адреса: фильтры, сортировка и параметры отслеживания, умножающие одну страницу в тысячи вариантов.
- Дублирующийся контент: та же страница, доступная по нескольким URL-адресам, со слешами в конце или заглавными/строчными буквами в пути.
- Мягкие 404: пустые результаты, устаревшие объявления или неполноценные страницы, возвращающие 200, но не дающие никакой ценности.
- Цепочки редиректов: URL-адреса, прыгающие через несколько переходов, прежде чем разрешиться.
- Бесконечные пространства: календари, результаты поиска и идентификаторы сессий, генерирующие почти бесконечные URL-адреса.
По результатам анализа логов перечислите здесь худших нарушителей: [Паттерн потерь 1], [Паттерн потерь 2]. Оцените долю обращений Googlebot, уходящую на эти малоценные URL-адреса: это число — ваша возможность. Приоритизируйте исправления по тому, сколько активности сканирования потребляет каждый паттерн.
Повысьте эффективность сканирования
Предпримите конкретные действия, чтобы поисковые системы тратили усилия на страницы, которые важны.
Направьте краулеров к важному
Когда вы знаете, где живут потери, цель — консолидировать сигналы и направить ботов к ценным, каноническим URL-адресам.
- Усильте внутренние ссылки на важные страницы, чтобы их было легко обнаружить и чтобы они сигнализировали о своём приоритете.
- Держите XML-карты сайта чистыми: включайте только канонические, индексируемые URL-адреса и убирайте редиректы, ошибки и noindex-страницы.
- Используйте robots.txt продуманно, чтобы блокировать сканирование явно малоценных путей, таких как внутренний поиск и бесконечные параметрические пространства. Помните: блокировка сканирования — это не то же самое, что удаление из индекса.
- Обрабатывайте параметры каноническими тегами, указывающими на чистую версию, и не ссылайтесь на параметризованные URL-адреса внутри сайта.
- Исправляйте цепочки редиректов, направляя первый переход сразу на конечный пункт одним 301.
- Устраняйте мягкие 404, возвращая настоящий 404 или 410 либо улучшая страницу так, чтобы она заслуживала сканирования.
Запишите три главных действия: [Действие 1], [Действие 2], [Действие 3]. Внедряйте изменения постепенно, чтобы можно было измерить их эффект.
Отслеживайте через статистику сканирования
Следите за поведением сканирования во времени с помощью Search Console и регулярных проверок логов.
Замкните цикл
Эффективность сканирования — не разовый проект. После внесения изменений отслеживайте, реагируют ли поисковые системы так, как вы ожидаете.
За чем следить
- Статистика сканирования Search Console: просматривайте общее число запросов на сканирование, среднее время ответа и разбивку по коду ответа, типу файла и цели (обнаружение против обновления).
- Состояние хоста: следите за проблемами доступности, ведь медленный или ошибающийся сервер заставляет Google сканировать меньше.
- Тренды кодов статуса: убедитесь, что после ваших исправлений число 404, редиректов и ошибок 5xx снижается.
- Отчёты об индексировании: проверьте, переходят ли ранее застрявшие страницы в состояние проиндексированных.
Постройте рутину
Регулярно (ежемесячно или ежеквартально) повторно выгружайте серверные логи и сравнивайте с базовым уровнем. Запишите здесь дату проверки: [Дата следующей проверки] и ответственного: [Ответственный].
Если потери снова появятся, вы заметите это рано, а не после того, как важные страницы выпадут из индекса.
Как использовать этот шаблон
- Решите, стоит ли краулинговый бюджет вашего времени: он важен прежде всего для крупных сайтов (сотни тысяч URL-адресов) или сайтов с большим числом дубликатов и малоценных URL-адресов.
- Запросите сырые серверные логи доступа у своего хоста, CDN и балансировщиков нагрузки как минимум за несколько недель, а лучше за полный месяц.
- Очистите и объедините логи, а затем проверьте Googlebot через обратный и прямой DNS, чтобы анализировать реальное поведение ботов, а не поддельные user agent.
- Составьте карту паттернов сканирования: определите самые сканируемые URL-адреса и разделы, частоту сканирования ключевых страниц и коды статуса, которые получает Googlebot.
- Охотьтесь за бесполезным сканированием, таким как фасетные параметры, дублирующиеся URL-адреса, мягкие 404, цепочки редиректов и бесконечные пространства URL-адресов.
- Повысьте эффективность за счёт более сильных внутренних ссылок, чистых XML-карт сайта, продуманных правил robots.txt, канонических тегов и однопереходных 301.
- Откройте статистику сканирования в Search Console, чтобы подтвердить, что запросы на сканирование, время ответа и тренды кодов статуса движутся в правильном направлении.
- Установите регулярный график повторной выгрузки логов и просмотра статистики сканирования, чтобы потери не возвращались постепенно.
Советы
- Краулинговый бюджет — реальная забота преимущественно для крупных сайтов или сайтов с большим числом дубликатов; если ваш сайт небольшой и страницы индексируются быстро, направьте усилия в другое место.
- Всегда проверяйте Googlebot через обратный, а затем прямой DNS, прежде чем доверять любому запросу, ведь строку user agent тривиально подделать.
- Блокировка URL-адреса в robots.txt останавливает сканирование, но не удаляет её из индекса; используйте noindex или подходящие коды статуса, когда нужно убрать страницу.
- Исправляйте цепочки редиректов, направляя исходный URL сразу на конечный пункт одним 301, чтобы боты не тратили переходы впустую.
Частые вопросы
Что такое краулинговый бюджет?
Краулинговый бюджет — это количество URL-адресов, которые поисковая система готова и способна просканировать на вашем сайте за период времени. Он определяется тем, какую нагрузку выдерживает ваш сервер и насколько поисковые системы нуждаются в вашем контенте.
Нужно ли малым сайтам беспокоиться о краулинговом бюджете?
Обычно нет. Если на вашем сайте несколько тысяч URL-адресов и новые страницы индексируются быстро, краулинговый бюджет редко становится узким местом. Он приобретает значение на крупных сайтах или сайтах, генерирующих много малоценных или дублирующихся URL-адресов.
Зачем использовать серверные лог-файлы вместо одних лишь инструментов сканирования?
Серверные логи показывают, что именно запрашивали поисковые системы, включая частоту, коды статуса и то, какие именно URL-адреса они посетили. Инструменты сканирования имитируют сканирование, но логи — это истинная правда о реальном поведении ботов на вашем сайте.
Как проверить, что запрос действительно от Googlebot?
Выполните обратный DNS-запрос по IP-адресу, отправившему запрос, чтобы подтвердить, что он разрешается в домен Google, а затем выполните прямой DNS-запрос по этому имени, чтобы подтвердить, что оно указывает обратно на тот же IP-адрес. Никогда не доверяйте только строке user agent, поскольку её можно подделать.
Каковы самые распространённые источники бесполезного сканирования?
Фасетная навигация и параметры URL-адресов, дублирующиеся URL-адреса, мягкие 404, цепочки редиректов и бесконечные пространства, такие как календари или результаты внутреннего поиска. Они могут потреблять большую долю активности сканирования на крупных сайтах.
Где посмотреть статистику сканирования в Search Console?
Search Console включает отчёт «Статистика сканирования», показывающий общее число запросов на сканирование, среднее время ответа и разбивки по коду ответа, типу файла, типу Googlebot и цели. Используйте его вместе с анализом логов, чтобы отслеживать тренды во времени.