Шаблон аналізу краул-бюджету та лог-файлів
Безкоштовний шаблон аналізу краул-бюджету та лог-файлів: побачте, як Googlebot сканує ваш сайт, і швидко усуньте марне сканування.
Пошукові системи мають обмежені ресурси для сканування будь-якого сайту, тож марне сканування означає, що ваші важливі сторінки виявляються й оновлюються повільніше. Цей шаблон проведе вас через вивантаження серверних логів, аналіз реальної поведінки Googlebot, пошук марного сканування та підвищення ефективності. Використовуйте його, щоб кожне сканування було корисним на великих сайтах або сайтах із багатьма дублікатами.
6 готових варіантів
Чи взагалі це вам потрібно
Визначте, чи краул-бюджет справді є проблемою, вартою вашого часу, перш ніж занурюватися в логи.
Чи важливий краул-бюджет для вас?
Краул-бюджет — це кількість URL-адрес, які пошукова система готова й здатна просканувати на вашому сайті за певний період. Для більшості малих і середніх сайтів це не проблема, яку варто розв'язувати. Google зазвичай без зусиль сканує кілька тисяч URL-адрес.
Краул-бюджет має вас турбувати передусім тоді, коли ви керуєте великим сайтом (сотні тисяч URL-адрес або більше), сайтом, що генерує багато малоцінних чи дубльованих URL-адрес, або таким, де нові й оновлені сторінки довго потрапляють до індексу.
Тривожні сигнали, що виправдовують цю роботу
- Фасетна навігація або фільтри, що створюють нескінченні комбінації URL-адрес
- Важливі сторінки не проіндексовані навіть за тижні після публікації
- Search Console показує багато URL-адрес зі статусом "Виявлено – наразі не проіндексовано"
- Серверні логи переповнені зверненнями ботів до параметрів, сортування чи пагінації
[URL сайту]: запишіть тут приблизну загальну кількість URL-адрес: [Усього URL]. Якщо вона невелика й сторінки індексуються швидко, пропустіть решту й зосередьтеся на іншому.
Отримайте та підготуйте лог-файли
Зберіть сирі серверні логи доступу й очистіть їх до вигляду, який справді можна аналізувати.
Де знайти ваші логи
Серверні логи доступу — найнадійніший запис того, як боти й користувачі реально звертаються до вашого сайту. Попросіть у свого хостинг-провайдера, команди devops чи CDN сирі логи доступу принаймні за кілька тижнів, а найкраще за повний місяць, щоб охопити звичайні цикли сканування.
Поширені джерела: ваш вебсервер (Apache, Nginx), ваш CDN (наприклад, Cloudflare чи Fastly) і будь-який балансувальник навантаження перед ними. Вивантажте дані з [Джерело логів] за період [Діапазон дат].
Підготуйте дані
- Об'єднайте логи з усіх серверів, щоб не пропустити запити, які обслуговували різні машини.
- Переконайтеся, що кожен рядок містить позначку часу, запитувану URL-адресу, код статусу, user agent та IP-адресу.
- Перевірте Googlebot, зробивши зворотний DNS-запит за IP, а потім прямий запит. Не довіряйте лише рядку user agent, оскільки його легко підробити.
- Відфільтруйте до перевірених ботів пошукових систем, перш ніж робити висновки про поведінку сканування.
Зберігайте очищений набір даних у місці, придатному для повторного використання, щоб наступного кварталу повторити той самий аналіз.
Проаналізуйте патерни сканування
Зрозумійте, що саме сканує Googlebot, як часто й на які коди статусу натрапляє.
На що дивитися насамперед
Виокремивши перевірені запити Googlebot, сформуйте картину реальної поведінки сканування, а не здогадуйтеся. Зосередьтеся на обсязі, частоті й кодах відповіді: саме вони показують, куди йде зусилля сканування.
Ключові питання, на які треба відповісти
- Які URL-адреси скануються найчастіше? Порівняйте найбільш скановані URL-адреси з вашими найважливішими сторінками. Розбіжності — це сигнал.
- Як часто скануються ключові сторінки? Сторінки, що приносять дохід, мають відвідуватися регулярно; рідко скановані важливі URL-адреси застарівають.
- Які коди статусу бачить Googlebot? Здоровий сайт — це переважно 200-ті. Стежте за сплесками 404, редиректів 301/302 та серверних помилок 5xx.
- Які розділи домінують? Згрупуйте звернення за каталогами, щоб побачити, чи не поглинає малоцінний розділ активність сканування.
Занотуйте свої висновки щодо [Найбільш сканований розділ] і зафіксуйте будь-який розділ, що сканується надмірно відносно своєї цінності: [Надмірно сканований шлях].
Активне сканування редиректів чи помилок — це марне зусилля, яке слід усунути на наступних кроках.
Знайдіть марне сканування
Виявіть малоцінні, дубльовані та зламані URL-адреси, що виснажують ресурси сканування.
Де витікає краул-бюджет
Марне сканування виникає, коли боти витрачають час на URL-адреси, які взагалі не мали б скануватися. На великих сайтах це може бути різницею між тим, чи важливі сторінки оновлюються щодня чи щомісяця.
Поширені джерела марнування
- Фасетні та параметричні URL-адреси: фільтри, сортування й параметри відстеження, що множать одну сторінку на тисячі варіантів.
- Дубльований контент: та сама сторінка, доступна за кількома URL-адресами, зі слешами наприкінці чи великими/малими літерами в шляху.
- М'які 404: порожні результати, застарілі оголошення чи неповноцінні сторінки, що повертають 200, але не дають жодної цінності.
- Ланцюжки редиректів: URL-адреси, що стрибають через кілька переходів, перш ніж розв'язатися.
- Нескінченні простори: календарі, результати пошуку та ідентифікатори сесій, що генерують майже безкінечні URL-адреси.
За результатами аналізу логів перелічіть тут найгірших порушників: [Патерн марнування 1], [Патерн марнування 2]. Оцініть частку звернень Googlebot, що йде до цих малоцінних URL-адрес: це число — ваша можливість. Пріоритезуйте виправлення за обсягом активності сканування, який споживає кожен патерн.
Підвищте ефективність сканування
Виконайте конкретні дії, щоб пошукові системи витрачали зусилля на сторінки, які мають значення.
Спрямуйте краулерів до важливого
Коли ви знаєте, де живе марнування, мета — консолідувати сигнали й спрямувати ботів до цінних, канонічних URL-адрес.
- Посильте внутрішні посилання на важливі сторінки, щоб їх було легко виявити й щоб вони сигналізували про свій пріоритет.
- Тримайте XML-мапи сайту чистими: включайте лише канонічні, індексовані URL-адреси й прибирайте редиректи, помилки та noindex-сторінки.
- Використовуйте robots.txt виважено, щоб блокувати сканування явно малоцінних шляхів, як-от внутрішній пошук і нескінченні параметричні простори. Пам'ятайте: блокування сканування — це не те саме, що видалення з індексу.
- Обробляйте параметри канонічними тегами, що вказують на чисту версію, і не посилайтеся на параметризовані URL-адреси всередині сайту.
- Виправляйте ланцюжки редиректів, спрямовуючи перший перехід одразу на кінцевий пункт одним 301.
- Усувайте м'які 404, повертаючи справжній 404 чи 410 або покращуючи сторінку так, щоб вона заслуговувала на сканування.
Занотуйте три головні дії: [Дія 1], [Дія 2], [Дія 3]. Впроваджуйте зміни поступово, щоб можна було виміряти їхній ефект.
Відстежуйте через статистику сканування
Стежте за поведінкою сканування з часом за допомогою Search Console та регулярних перевірок логів.
Замкніть цикл
Ефективність сканування — не разовий проєкт. Після внесення змін відстежуйте, чи реагують пошукові системи так, як ви очікуєте.
За чим стежити
- Статистика сканування Search Console: переглядайте загальну кількість запитів на сканування, середній час відповіді та розподіл за кодом відповіді, типом файлу й метою (виявлення проти оновлення).
- Стан хоста: стежте за проблемами доступності, адже повільний чи помилковий сервер змушує Google сканувати менше.
- Тренди кодів статусу: переконайтеся, що після ваших виправлень кількість 404, редиректів і помилок 5xx зменшується.
- Звіти про індексування: перевірте, чи переходять раніше застряглі сторінки до стану проіндексованих.
Побудуйте рутину
Регулярно (щомісяця чи щокварталу) повторно вивантажуйте серверні логи й порівнюйте з базовим рівнем. Запишіть тут дату перегляду: [Дата наступного перегляду] та відповідального: [Відповідальний].
Якщо марнування знову з'явиться, ви помітите це рано, а не після того, як важливі сторінки випадуть з індексу.
Як використовувати цей шаблон
- Вирішіть, чи вартий краул-бюджет вашого часу: він важливий передусім для великих сайтів (сотні тисяч URL-адрес) або сайтів із великою кількістю дублікатів і малоцінних URL-адрес.
- Запросіть сирі серверні логи доступу у свого хосту, CDN і балансувальників навантаження принаймні за кілька тижнів, а найкраще за повний місяць.
- Очистіть і об'єднайте логи, а потім перевірте Googlebot через зворотний і прямий DNS, щоб аналізувати реальну поведінку ботів, а не підроблені user agent.
- Складіть карту патернів сканування: визначте найбільш скановані URL-адреси й розділи, частоту сканування ключових сторінок і коди статусу, які отримує Googlebot.
- Полюйте на марне сканування, як-от фасетні параметри, дубльовані URL-адреси, м'які 404, ланцюжки редиректів і нескінченні простори URL-адрес.
- Підвищте ефективність за рахунок сильніших внутрішніх посилань, чистих XML-мап сайту, виважених правил robots.txt, канонічних тегів і одноперехідних 301.
- Відкрийте статистику сканування в Search Console, щоб підтвердити, що запити на сканування, час відповіді й тренди кодів статусу рухаються в правильному напрямку.
- Встановіть регулярний графік повторного вивантаження логів і перегляду статистики сканування, щоб марнування не поверталося поступово.
Поради
- Краул-бюджет — реальна турбота переважно для великих сайтів або сайтів із багатьма дублікатами; якщо ваш сайт невеликий і сторінки індексуються швидко, спрямуйте зусилля в інше місце.
- Завжди перевіряйте Googlebot через зворотний, а потім прямий DNS, перш ніж довіряти будь-якому запиту, адже рядок user agent легко підробити.
- Блокування URL-адреси в robots.txt зупиняє сканування, але не видаляє її з індексу; використовуйте noindex або відповідні коди статусу, коли потрібно прибрати сторінку.
- Виправляйте ланцюжки редиректів, спрямовуючи вихідну URL-адресу одразу на кінцевий пункт одним 301, щоб боти не марнували переходи.
Поширені запитання
Що таке краул-бюджет?
Краул-бюджет — це кількість URL-адрес, які пошукова система готова й здатна просканувати на вашому сайті за певний період часу. Він визначається тим, яке навантаження витримує ваш сервер і наскільки пошукові системи потребують вашого контенту.
Чи потрібно малим сайтам турбуватися про краул-бюджет?
Зазвичай ні. Якщо на вашому сайті кілька тисяч URL-адрес і нові сторінки індексуються швидко, краул-бюджет рідко стає вузьким місцем. Він набуває значення на великих сайтах або сайтах, що генерують багато малоцінних чи дубльованих URL-адрес.
Навіщо використовувати серверні лог-файли замість самих лише інструментів сканування?
Серверні логи показують, що саме запитували пошукові системи, включно з частотою, кодами статусу й тим, які саме URL-адреси вони відвідали. Інструменти сканування імітують сканування, але логи — це справжня правда про реальну поведінку ботів на вашому сайті.
Як перевірити, що запит справді від Googlebot?
Зробіть зворотний DNS-запит за IP-адресою, що надіслала запит, аби підтвердити, що вона розв'язується в домен Google, а потім виконайте прямий DNS-запит за цим ім'ям, щоб підтвердити, що воно вказує назад на ту саму IP-адресу. Ніколи не довіряйте лише рядку user agent, оскільки його можна підробити.
Які найпоширеніші джерела марного сканування?
Фасетна навігація й параметри URL-адрес, дубльовані URL-адреси, м'які 404, ланцюжки редиректів і нескінченні простори, як-от календарі чи результати внутрішнього пошуку. Вони можуть споживати велику частку активності сканування на великих сайтах.
Де переглянути статистику сканування в Search Console?
Search Console містить звіт «Статистика сканування», що показує загальну кількість запитів на сканування, середній час відповіді та розподіл за кодом відповіді, типом файлу, типом Googlebot і метою. Використовуйте його разом з аналізом логів, щоб відстежувати тренди з часом.