Шаблон robots.txt і директив сканування
Готові до копіювання шаблони robots.txt для найпоширеніших конфігурацій сайтів, а також правила, які вбережуть вас від випадкового блокування Google.
Robots.txt — це перший файл, який запитує більшість пошукових роботів, і один хибний рядок може приховати весь ваш сайт від пошуку. Ці готові до копіювання шаблони охоплюють ситуації, з якими власники сайтів стикаються найчастіше, із простими поясненнями того, що робить кожна директива. Замініть значення у квадратних дужках на власні шляхи та домен, а потім перевірте файл, перш ніж викладати його.
6 готових варіантів
Стандартний робочий сайт
Звичайний робочий сайт, якому потрібне повне сканування плюс вказівник на карту сайту.
Використовуйте, коли: у вас справний робочий сайт і ви хочете, щоб пошукові системи вільно сканували все та швидко знаходили вашу карту сайту.
Директиви
- User-agent: *
- Disallow: (залиште значення порожнім, щоб дозволити все)
- Sitemap: [https://example.com/sitemap.xml]
Порожній Disallow означає, що нічого не заблоковано. Рядок Allow для цього не потрібен; дозвіл за замовчуванням — це стандартна поведінка.
Додаткова гігієна
- Disallow: [/wp-admin/] (заблокуйте реальний адміністративний шлях, якщо він у вас є)
- Allow: [/wp-admin/admin-ajax.php]
Примітка: robots.txt керує скануванням, а не індексуванням. Заблокована URL-адреса все одно може з'явитися в результатах, якщо на неї посилаються інші сторінки. Щоб не допустити сторінку до індексу, дозвольте сканування та додайте метатег noindex або захистіть її входом до системи. Розмістіть файл у корені домену: [https://example.com/robots.txt].
Тестовий, розробницький або передстартовий сайт
Непублічне середовище, яке потрібно повністю тримати поза пошуком.
Використовуйте, коли: сайт є тестовим сервером, копією для розробки або передстартовою збіркою, яку ніхто не повинен знаходити в пошуку.
Директиви
- User-agent: *
- Disallow: /
Один рядок Disallow: / наказує сумлінним роботам пропускати кожну URL-адресу на хості. Тут це зроблено навмисно, а всюди інде це небезпечно.
Критичне попередження: ніколи не допускайте, щоб цей рядок потрапив у продакшн. Найпоширеніша катастрофа з деіндексацією — це Disallow: /, скопійований із тестового середовища на робочий сайт під час розгортання.
Надійніший захист
- Robots.txt — це прохання, а не замок. Недобросовісні роботи його ігнорують.
- Додайте HTTP-автентифікацію (ім'я користувача та пароль), щоб середовище було справді приватним.
- Якщо ви додаєте загальносайтовий noindex як резерв, не блокуйте водночас сторінку через Disallow: /: заблокована сторінка ніколи не показує свій тег noindex.
Примітка: якщо тестову URL-адресу вже було проскановано, не покладайтеся на Disallow: /, щоб її видалити. Блокування URL-адреси також не дає Google побачити тег noindex. Тимчасово дозвольте сканування з noindex або скористайтеся інструментами видалення в Search Console.
Керування скануванням для інтернет-магазину
Магазин, якому потрібно відвести бюджет сканування від малоцінних URL-адрес.
Використовуйте, коли: магазин генерує безкінечні фасетні, параметричні та облікові URL-адреси, які марнують бюджет сканування та розмивають сигнали.
Типові блокування
- User-agent: *
- Disallow: [/cart]
- Disallow: [/checkout]
- Disallow: [/account/]
- Disallow: [/search] (результати внутрішнього пошуку по сайту)
- Disallow: [/*?*sort=] (параметр сортування будь-де в рядку запиту)
- Disallow: [/*?*filter=] (фасетні фільтри)
- Disallow: [/*.pdf$] (заблокувати будь-яку URL-адресу, що закінчується на .pdf: $ фіксує кінець)
Використовуйте *, щоб зіставити будь-яку послідовність, і $, щоб зафіксувати кінець URL-адреси. Шляхи чутливі до регістру, тож [/Search] і [/search] — це різні правила.
Обережно: блокуйте лише ті параметри, що створюють справжні дублі або порожні сторінки. Блокування параметра, який змінює основний вміст товару (або ваші канонічні URL-адреси), може приховати сторінки, які ви хочете просувати. Для дубльованого вмісту віддавайте перевагу канонічним тегам, а robots.txt залиште для марного сканування, якого ви ніколи не хочете допускати.
Дозволити пошукові системи, заблокувати скрапери
Впустити великі пошукові роботи, водночас відвертаючи агресивні чи небажані.
Використовуйте, коли: ви хочете, щоб Google, Bing та інші великі системи вільно сканували, але хочете стримати відомі скрапери та боти, що споживають багато трафіку.
Дозвольте потрібні системи
- User-agent: Googlebot
- Disallow: (порожньо)
- User-agent: Bingbot
- Disallow: (порожньо)
Стримайте конкретного робота
- User-agent: [BadBot]
- Disallow: /
Кожен блок User-agent зіставляється незалежно, і бот дотримується найконкретнішої групи, яка його називає. Залиште наприкінці групу User-agent: *, щоб неназвані боти теж отримали чіткі вказівки.
Щоб стримати сумлінні ШІ-роботи, назвіть і їх: наприклад, User-agent: GPTBot з Disallow: /. Це зупиняє лише тих роботів, які самі вирішують поважати robots.txt.
Перевірка реальністю: robots.txt — добровільний. Добропорядні системи його дотримуються; зловмисні скрапери та багато ШІ-роботів ігнорують його й навіть можуть використати, щоб знайти названі вами шляхи. Для справжнього примусу блокуйте за user-agent або IP на рівні сервера чи фаєрвола, або застосовуйте обмеження частоти запитів. Ставтеся до robots.txt як до вказівки, а не до захисту.
Оголошення карти сайту та кількох карт
Спрямувати роботів до однієї чи кількох карт сайту, зокрема до індексу карт.
Використовуйте, коли: ви хочете, щоб кожен робот виявляв ваші карти сайту, особливо для великого сайту, розбитого на кілька файлів.
Одна карта сайту
- Sitemap: [https://example.com/sitemap.xml]
Кілька карт сайту
- Sitemap: [https://example.com/sitemap-posts.xml]
- Sitemap: [https://example.com/sitemap-products.xml]
- Sitemap: [https://example.com/sitemap-images.xml]
Або один індекс карт сайту
- Sitemap: [https://example.com/sitemap_index.xml]
Правила, яких варто дотримуватися:
- Указуйте кожну карту сайту в окремому рядку. Кількість рядків Sitemap не обмежена, але кожен окремий файл карти обмежено 50 000 URL-адресами та 50 МБ у розпакованому вигляді: розбивайте більші сайти на кілька файлів або на індекс карт.
- Завжди використовуйте повну абсолютну URL-адресу з правильним протоколом (https) і хостом.
- Директива Sitemap не залежить від груп User-agent, тож розміщуйте її будь-де у файлі.
- Подавати карти сайту в Search Console та Bing Webmaster Tools усе одно рекомендовано як резерв.
Контрольний список перевірки перед публікацією
Виявіть помилки, що тихо деіндексують сайт, перш ніж викладати файл.
Використовуйте, коли: ви збираєтеся опублікувати або замінити файл robots.txt і хочете уникнути класичних, дорогих помилок.
Перевірте кожен пункт
- Переконайтеся, що файл знаходиться в корені: [https://example.com/robots.txt]. Файл у підпапці ігнорується.
- Упевніться, що не залишилося зайвого Disallow: / з тестового середовища.
- Перевірте регістр у кожному шляху; robots.txt чутливий до регістру.
- Переконайтеся, що папки з CSS, JS та зображеннями не заблоковані, щоб Google міг відтворювати сторінки.
- Підтвердіть, що кожен рядок Sitemap використовує повну https-адресу, яка повертає 200.
- Стежте за правилами Disallow:, ширшими, ніж задумано (кінцева коса риска має значення).
- Пам'ятайте, що robots.txt не деіндексує; поєднуйте блокування з noindex чи інструментами видалення там, де потрібно.
- Повторно тестуйте після будь-якого оновлення CMS чи плагіна, яке може перезаписати файл.
Фінальний тест: відкрийте [https://example.com/robots.txt] у браузері, щоб підтвердити, що він завантажується, а потім перевірте його інструментом тестування robots.txt до та після публікації.
Як використовувати цей шаблон
- Створіть простий текстовий файл із назвою точно robots.txt і розмістіть його в корені домену, щоб він відкривався за адресою https://yourdomain.com/robots.txt; файли в підпапках ігноруються.
- Визначте своє замовчування: залиште Disallow порожнім, щоб дозволити повне сканування, і додавайте рядки Disallow лише для шляхів, які ви справді хочете тримати поза скануванням.
- Групуйте правила під рядком User-agent; використовуйте User-agent: * для всіх ботів або назвіть конкретного бота, як-от Googlebot, щоб надати йому власну групу.
- Записуйте шляхи Disallow точно так, як вони з'являються у ваших URL-адресах, пам'ятаючи, що шляхи чутливі до регістру, а кінцева коса риска змінює те, що зіставляється.
- Використовуйте символи підстановки обережно: * зіставляє будь-яку послідовність символів, а $ фіксує кінець URL-адреси, що корисно для блокування параметрів або типів файлів.
- Додайте по одному рядку Sitemap на кожну карту сайту з повними абсолютними https-адресами або вкажіть один файл індексу карт для великих сайтів.
- Перевірте файл в інструменті тестування robots.txt і запросіть кілька важливих URL-адрес, щоб підтвердити, що вони й досі дозволені, перш ніж публікувати.
- Після запуску відстежуйте покриття в Search Console та звіт robots.txt на помилки сканування й перевіряйте файл повторно після будь-якого оновлення CMS, теми чи плагіна.
Поради
- Ніколи не викладайте Disallow: / на робочому сайті; цей єдиний рядок просить роботів пропускати кожну URL-адресу і є найпоширенішою причиною випадкової деіндексації.
- Robots.txt керує скануванням, а не індексуванням. Щоб видалити сторінку з результатів, дозвольте сканування та додайте тег noindex або захистіть її автентифікацією, а не покладайтеся на Disallow.
- Не блокуйте каталоги з CSS, JavaScript чи зображеннями; вони потрібні Google, щоб відтворювати й розуміти ваші сторінки, а їх блокування може зашкодити позиціям.
- Ставтеся до robots.txt як до публічного й дорадчого: його може прочитати будь-хто, добропорядні боти його дотримуються, а зловмисні роботи ігнорують, тож для справжнього захисту використовуйте засоби на боці сервера.
Поширені запитання
Чи видаляє Disallow сторінку з Google?
Ні. Disallow зупиняє сумлінних роботів від завантаження сторінки, але заборонена URL-адреса все одно може бути проіндексована, якщо на неї посилаються інші сторінки. Щоб тримати сторінку поза індексом, дозвольте сканування та додайте директиву noindex або захистіть її автентифікацією.
Де має розташовуватися файл robots.txt?
У корені кожного хоста, щоб він відкривався за адресою https://yourdomain.com/robots.txt. Файл robots.txt, розміщений у підпапці, ігнорується. Кожен субдомен і протокол обробляється окремо, тож версіям https, http та www може знадобитися власний файл.
Чи чутливий robots.txt до регістру?
Значення шляхів — так. Disallow: /Folder/ і Disallow: /folder/ зіставляють різні URL-адреси, тож копіюйте шляхи точно так, як вони з'являються на вашому сайті. Назви директив, як-от User-agent і Disallow, не чутливі до регістру, але важливо саме дотримання регістру ваших справжніх URL-адрес.
Яка різниця між Disallow і noindex?
Disallow керує скануванням: він просить ботів не завантажувати URL-адресу. Noindex керує індексуванням: він просить пошукові системи не показувати сторінку в результатах. Якщо ви заборонили сторінку через Disallow, Google не бачить її тег noindex, тож щоб деіндексувати сторінку, потрібно дозволити сканування й використати noindex.
Як заблокувати одного бота, але дозволити інших?
Надайте цьому боту власну групу, наприклад User-agent: BadBot, а далі Disallow: /, і залиште окрему групу User-agent: * для всіх решти. Кожен бот дотримується найконкретнішої групи, яка його називає, тож цільовий бот заблокований, а інші лишаються дозволеними.
Чи зупинить robots.txt скрапери та ШІ-роботів?
Лише тих, що самі вирішують йому підкорятися. Robots.txt добровільний, тож солідні пошукові системи його дотримуються, тоді як багато скраперів і ботів повністю його ігнорують. Для справжнього примусу блокуйте за user-agent або IP на рівні сервера чи фаєрвола, або додайте обмеження частоти запитів і автентифікацію.