Мы проверили 21 живую карту сайта на соответствие протоколу, и хуже всех дела оказались у тех, кто продаёт SEO-софт.
Чистыми вернулись только 8. У Ahrefs нет lastmod вообще, и у Semrush его тоже нет.
Карта сайта, это единственный файл на вашем сайте, который никто не перечитывает. Вы генерируете его один раз, он вечно проходит как валидный XML, и ни один инструмент не скажет вам, что он тихо перестал приносить пользу.
Поэтому 6 сентября 2026 года мы заново скачали 21 такой файл и прочитали, что внутри. Вот 7 уроков, и каждый из них относится и к вашему файлу тоже.
Считайте, что ваш файл сломан, пока не посмотрели
Мы запросили 21 карту сайта, ответили 19. Etsy отдал 404 по тому адресу, который сам объявляет в своём robots.txt, а GitHub отказал нам в запросе напрямую.
Ваш собственный файл может прямо сейчас делать то же самое, и вам об этом никто не сообщит.
Из этих 19 у 8 не нашлось вообще ничего плохого: Booking.com, Canva, eBay, Figma, Investopedia, Moz, Vercel и наш.
В остальных 11 есть что-то лишнее, что-то за пределами своей зоны или чего-то не хватает. И ничего из этого не является синтаксической ошибкой.
Каждый из этих файлов, это валидный XML, и любой валидатор пропустит его без единого замечания. Именно поэтому проблемы живут годами, и именно поэтому ваша тоже дожила.
Так что считайте свой файл сломанным, пока сами его не открыли и не прочитали. Ничто в вашем стеке не скажет вам обратного.
Сборка его генерирует, валидатор пропускает, а трекер позиций про него вообще не вспоминает. Если не посмотрите вы, не посмотрит никто.
Уберите поля, которые никто не читает
Самая частая находка и самая бессмысленная.
<changefreq> и <priority>, это рекомендательные поля в спецификации sitemaps.org, и в собственной документации Google сказано, что он игнорирует оба. 5 из 19 всё ещё отдают changefreq, и 4 всё ещё отдают priority.
Cloudflare отдаёт по 896 штук каждого. Shopify по 557. The Guardian отдаёт 424 значения changefreq. Zapier по 36 каждого. HubSpot отдаёт ровно по 1 каждого, и это почему-то самый странный результат во всём обзоре.
Файл Cloudflare несёт 1,800 элементов, которые не читает ни одна крупная поисковая система. Они не стоят ничего, кроме байтов.
Дело не в байтах. Дело в том, что файл сгенерировал несколько лет назад инструмент с такими настройками по умолчанию, и с тех пор его никто не открывал. У вашего генератора тоже были настройки по умолчанию, и вы их, скорее всего, тоже не выбирали.
Дайте каждому URL настоящий lastmod
Поле, которое действительно читают, чаще всего и отсутствует.
<lastmod> сообщает роботу, какие из ваших страниц изменились, чтобы он тратил бюджет обхода на них. У 6 из 19 его нет вовсе: Ahrefs, Semrush, Stripe, Notion, Healthline и Zapier.
Без него ничего не ломается. Робот просто не получает сигнала о том, что нового, и опирается на собственную догадку, а на большом сайте это значит, что ваши обновлённые страницы стоят в очереди за тысячами неизменившихся.
Посмотрите на состав этого списка: платёжный API, новостное издание, платформа автоматизации и 2 SEO-вендора. Размер и зрелость компании тут не предсказывают ничего.
Если хотите увидеть, что объявляет ваш файл, прежде чем чинить его, Генератор XML-карты сайта пройдёт по индексам и покажет, что получает робот.
Это бесплатно. Проблема с картой сайта проявляется как страницы, которые тихо выпадают из индекса, поэтому держите рядом историю позиций: и Semrush, и SE Ranking её хранят, и падение там видно за недели до того, как его кто-то заметит.
Делите на 2 совет, которому не следует сам советчик
Из 3 крупнейших SEO-компаний чистая карта сайта только у 1.
У Moz чисто. У Ahrefs нет lastmod. У Semrush нет lastmod и есть 7 URL, которые ведут на другой хост, не тот, где лежит сама карта: такие записи робот вправе проигнорировать, потому что карта сайта может говорить только за URL того хоста, на котором она живёт.
Себя мы в это сравнение включаем, поэтому: в индексе unmiss.com 7 записей, и он чистый. Файл маленький, хвастаться тут нечем.
Важно другое: его кто-то проверил. В этом вся разница между двумя половинами этой таблицы.
Попасть в верхнюю половину вы можете уже сегодня. Ничему из этого списка не нужен проект, бюджет или подрядчик. Нужен человек, который откроет файл.
11 из 19 проверенных нами карт сайта нарушают правила, и среди них несколько файлов компаний, которые продают SEO. Эти файлы никто не перечитывает. Мы перечитываем, вместе со всем остальным, во что не заглядывали с момента запуска.
- Полный технический аудит, прочитанный человеком
- Разработчики, которые чинят то, что нашёл аудит
- SEO и GEO, когда база приведена в порядок
- Первая консультация бесплатная
Откройте файл, не верьте статусу ответа
Самый странный результат обзора. wikihow.com/sitemap_index.xml отдаёт 200, валидный XML, правильный корневой элемент и 0 URL.
Пустой индекс карты сайта неотличим от здорового в любой автоматической проверке, которая останавливается на вопросе «распарсилось ли». Он отдаёт 200. Он проходит валидацию. Внутри ничего нет.
wikiHow, это сайт из сотен тысяч статей, который отлично ранжируется, так что бизнеса это его не лишает. Зато это хорошая иллюстрация того, что карта сайта может фактически отсутствовать, выглядя при этом полностью на месте, и что никто об этом не узнает, пока не пересчитает записи.
Так пересчитайте свои. Это одна строка в консоли, и она отделяет «у нас есть карта сайта» от «в нашей карте сайта есть наши страницы».
На статусной встрече эти 2 фразы звучат одинаково. На большинстве сайтов правдива только одна, и какая именно, вы не узнаете, пока не посмотрите.
Держите карту в пределах своей папки
Протокол ограничивает карту сайта теми URL, которые лежат на её собственном пути или ниже. Карта по адресу /sitemaps/news.xml может перечислять /sitemaps/… и ничего выше.
Новостная карта сайта The Guardian перечисляет 424 URL вне собственной директории: обычные адреса статей в корне сайта, отправленные из файла, у которого нет над ними полномочий.
На практике Google смотрит на это снисходительно, если карта объявлена в robots.txt, а у The Guardian она объявлена. Но это из тех вещей, которые работают ровно до того дня, когда робот решит применить правило, а выигрыша от нарушения спецификации нет никакого.
Поэтому положите карту сайта в корень или поднимите её так, чтобы она покрывала всё, что перечисляет. Это стоит вам одного редиректа и убирает целый класс молчаливых отказов.
Проверяйте её после каждого деплоя
Главная инструкция и причина, по которой этот обзор вообще появился.
Всё, что выше, невидимо для того, кому файл принадлежит. Ни ошибки, ни падения позиций, которое можно было бы на это списать, ни оповещения. Файл был правильным в момент генерации, а дальше уехал.
Так поставьте проверку в деплой. Скачайте карту сайта, посчитайте записи, сверьте число с ожидаемым и проверьте, что нужные вам поля на месте. У себя в сборке мы теперь так и делаем: в более ранней версии этой статьи пришлось признать, что не делаем, и что наш собственный файл не проходил проверку, которую мы гоняли по чужим.
Потом посмотрите, что робот с вашим файлом делает. Наш Аудит сайта помечает адреса из карты сайта, на которых стоит тег noindex, а это самая дорогая версия этой проблемы: вы одним движением просите проиндексировать страницу и сами же отказываете. У Canva такое живёт прямо сейчас.
Каждый файл в этом обзоре, это валидный XML. Проблемы в том, что файл говорит, а не в том, парсится ли он, и именно поэтому 11 из 19 годами ошибаются, и никто этого не замечает.
- Проходит по индексу вашей карты сайта и считает, что получает робот
- Работает в паре с проверкой аудита на noindex внутри карты сайта
- Бесплатно, без регистрации и без карты
Что мы не смогли измерить
А вот чего этот аудит не показывает. Пара инструментов, которые названы на этом сайте, наши партнёры: если вы купите по этим ссылкам, мы получим комиссию, а вы не заплатите ни цента больше.
Мы не измеряли никакого влияния на позиции. Ничто здесь не связывает отсутствующий lastmod с позицией, скоростью обхода или визитом. Это находки о соответствии протоколу, то есть файл говорит не то, что предписывает спецификация, а соответствие, это не то же самое, что последствия.
То, что Google игнорирует changefreq и priority, это опубликованная позиция самого Google, а не результат нашей проверки. Мы посчитали поля, но не можем увидеть, что с ними делает тот или иной робот.
Мы проверяли только верхнеуровневую карту сайта или её индекс, а не каждый дочерний файл. Чистый индекс может вести на сломанный дочерний файл, а 8 из наших 19, это индексы, так что «чисто» здесь значит, что чиста точка входа. Один только индекс Booking.com разворачивается в сотни тысяч файлов, и для этого обзора мы по ним не ходили.
2 карты сайта не удалось прочитать вообще. Etsy отдал 404 по тому адресу, который объявляет его собственный robots.txt, и это само по себе находка, которую мы не стали раскручивать.
GitHub вернул нашему user-agent 406, и это блокировка нас, а не дефект их файла.
Выборка, это 21 сайт, который выбрали мы, а не случайная выборка, и она смещена в сторону компаний, знакомых SEO-аудитории. Метод лежит в scripts/survey-sitemaps.mjs в нашем репозитории, а сырой вывод в evidence/surveys/.
Частые вопросы
У скольких карт сайта нашлись проблемы?
У 11 из 19, которые мы смогли прочитать, замер от 6 сентября 2026 года. Чистыми оказались 8: Booking.com, Canva, eBay, Figma, Investopedia, Moz, Vercel и seotools.pro. Каждый файл в обзоре, это валидный XML: проблемы в том, что они объявляют, а не в том, парсятся ли они.
Использует ли Google changefreq и priority?
Нет. В собственной документации Google сказано, что он игнорирует оба. 5 из 19 карт сайта всё ещё отдают changefreq, и 4 всё ещё отдают priority: Cloudflare выдаёт по 896 каждого, Shopify по 557, а HubSpot ровно по 1.
Важен ли lastmod?
Это то поле, которое робот действительно читает: оно говорит ему, какие страницы изменились, чтобы он взял их первыми. У 6 из 19 его нет вовсе: Ahrefs, Semrush, Stripe, Notion, Healthline и Zapier. Влияния его отсутствия на позиции мы не измеряли.
Может ли карта сайта перечислять URL из другой папки?
Протокол ограничивает карту сайта адресами на её собственном пути и ниже. Новостная карта The Guardian перечисляет 424 URL выше своей директории, а карта Semrush, 7 адресов вообще на другом хосте. На практике Google снисходителен, если файл объявлен в robots.txt, но выигрыша от нарушения спецификации нет.
Может ли карта сайта быть пустой и выглядеть нормально?
Да, и в этом обзоре такая есть. Индекс карты сайта wikihow.com отдаёт 200, парсится как валидный XML, имеет правильный корневой элемент и содержит 0 URL. Любая автоматическая проверка, которая останавливается на вопросе «распарсилось ли», его пропускает.
Какие есть ограничения по размеру карты сайта?
50K URL и 50 MB без сжатия на файл. Ни один из верхнеуровневых файлов в этом обзоре и близко к лимиту не подошёл, хотя товарные карты сайта IKEA, замеренные отдельно, доходят до 47.6 MB каждая из-за блоков hreflang внутри.
Чистые ли карты сайта у SEO-вендоров?
У одного из трёх крупнейших да. У Moz чисто, у Ahrefs нет lastmod, у Semrush нет lastmod плюс 7 URL на другом хосте. Наша чистая и содержит 7 записей, но это скорее маленький файл, чем достижение: разница в том, что его проверяют.
Как проверить свою карту сайта?
Скачайте её, посчитайте записи <loc> и сверьте число с ожидаемым, а затем проверьте, что lastmod на месте и что каждый URL лежит на собственном хосте и пути этой карты. Поставьте это в деплой, потому что больше вам никто не скажет, когда файл уедет.
Одна цифра, которую стоит запомнить
0.
Столько URL лежит в индексе карты сайта wikiHow на сайте из сотен тысяч статей, и столько же автоматических проверок им об этом скажет, потому что файл отдаёт 200 и парсится идеально.
Так устроена здесь каждая находка. Ничто в этом обзоре не сломано так, чтобы об этом хоть что-то сообщило. 1,800 игнорируемых полей Cloudflare, отсутствующий lastmod у Ahrefs, выходящие за пределы папки адреса The Guardian, записи Semrush на чужом хосте: всё это валидный XML, всё это молча, и всё это тянется годами.
Карта сайта, это последний файл, который кто-либо открывает, и первый, который перестаёт быть правдой. Наша была неправильной, пока мы не написали для неё проверку, а проверка заняла один вечер.
Идите и пересчитайте записи в своей. Если число вас удивит, это и есть находка.
Замеры от 6 сентября 2026 года. Мы скачали 21 верхнеуровневую карту сайта, находя адрес в robots.txt там, где сайт не использует привычный путь, и проверили число записей, наличие и формат lastmod, использование changefreq и priority, границы по хосту и пути, а также лимиты протокола в 50K URL и 50 MB. Ответили 19. Метод лежит в scripts/survey-sitemaps.mjs в нашем репозитории, а сырые результаты в evidence/surveys/, так что любую цифру отсюда можно перепроверить.