Техническое SEO без лишней теории
Meta robots, X-Robots-Tag и robots.txt часто путают, хотя они решают разные задачи. Один инструмент управляет индексацией HTML-страницы, второй работает через HTTP-заголовки, третий ограничивает сканирование.
Ошибка в этих настройках может убрать из поиска важные страницы, оставить в индексе служебные URL или закрыть роботу доступ к директиве noindex. Ниже - практическое руководство для владельца сайта, маркетолога и SEO-специалиста.
Для HTML-страниц: index, noindex, follow, nofollow, snippet-директивы.
Для HTTP-заголовков, PDF, изображений, видео и массовых правил на сервере.
Для ограничения обхода: какие URL робот может или не может сканировать.
Главная разница: сканирование и индексация - не одно и то же
Сканирование - это когда робот запрашивает URL и читает содержимое. Индексация - это когда поисковая система решает, можно ли хранить страницу в индексе и показывать её в выдаче.
robots.txt влияет на сканирование. Meta robots и X-Robots-Tag влияют на индексацию и показ в поиске. Поэтому нельзя считать, что Disallow в robots.txt надёжно удаляет страницу из выдачи.
robots.txt
Робот проверяет, можно ли сканировать URL.
Доступ к странице
Если доступ закрыт, meta robots и X-Robots-Tag могут быть не прочитаны.
Индексация
noindex, snippets и preview-директивы влияют на показ в выдаче.
Если URL запрещён в robots.txt, робот может не увидеть noindex в meta robots или X-Robots-Tag. Для удаления из индекса обычно нужно разрешить сканирование и дать роботу прочитать запрет индексации.
Что выбрать: meta robots, X-Robots-Tag или robots.txt
Выбор зависит не от привычки, а от задачи. Ниже - практическая таблица, которую можно использовать при аудите сайта.
| Задача | Лучший инструмент | Почему | Риск ошибки |
|---|---|---|---|
| Закрыть HTML-страницу от выдачи | meta robots noindex |
Директива находится в коде конкретной страницы. | Если URL закрыт в robots.txt, робот может не увидеть noindex. |
| Закрыть PDF, изображения или файлы | X-Robots-Tag |
У файлов нет HTML-блока head, поэтому директива задаётся в HTTP-заголовке. | Неверное серверное правило может закрыть весь тип файлов. |
| Снизить обход дублей и параметров | robots.txt |
Файл ограничивает сканирование шаблонов URL. | Disallow не является надёжным способом удалить страницу из индекса. |
| Ограничить сниппет, превью картинок или видео | max-snippet, max-image-preview, max-video-preview |
Директивы управляют представлением страницы в выдаче. | Слишком жёсткие ограничения могут ухудшить CTR. |
| Закрыть тестовый сайт | Пароль, basic auth, firewall | Такой способ надёжнее, чем надеяться только на noindex. | Забытый noindex после релиза может обрушить индексацию. |
Meta robots: что это и когда использовать
Meta robots - это тег внутри HTML-кода страницы. Его размещают в секции head, чтобы дать поисковым роботам инструкции по индексации, переходу по ссылкам и отображению сниппетов.
<meta name="robots" content="noindex,follow">
Такой вариант говорит: страницу не нужно показывать в поиске, но ссылки на ней можно учитывать при обходе. На практике это может применяться к служебным страницам, внутреннему поиску, фильтрам, временным акциям или страницам, которые не должны собирать поисковый трафик.
Что должно быть в норме
- На важных посадочных страницах нет случайного noindex.
- Директивы не противоречат robots.txt.
- В sitemap остаются только URL, которые действительно должны индексироваться.
Где часто ошибаются
- Ставят noindex на категорию или услугу после тестов.
- Путают nofollow с noindex.
- Закрывают страницу в robots.txt и ждут, что meta robots сработает.
Основные директивы meta robots и X-Robots-Tag
Не нужно использовать все директивы подряд. В большинстве SEO-задач достаточно понимать несколько ключевых команд.
| Директива | Что делает | Когда применять |
|---|---|---|
index |
Разрешает индексацию. | Обычно не требуется, потому что индексация разрешена по умолчанию. |
noindex |
Запрещает показ URL в поиске. | Служебные страницы, дубли, временные страницы, внутренний поиск. |
follow |
Разрешает роботу переходить по ссылкам. | Чаще всего оставляют по умолчанию. |
nofollow |
Просит не переходить по ссылкам на странице. | Использовать осторожно: можно ухудшить внутренний обход сайта. |
none |
Эквивалент noindex,nofollow. | Когда URL не должен быть в поиске и ссылки на нём не нужны для обхода. |
noarchive |
Запрещает показывать сохранённую копию. | Для страниц, где нежелательна устаревшая версия в кэше. |
nosnippet |
Запрещает текстовый сниппет. | Редко. Может снизить привлекательность результата в поиске. |
max-snippet |
Ограничивает длину сниппета. | Когда нужно контролировать объём текста в выдаче. |
max-image-preview |
Управляет размером превью изображения. | Для статей, карточек и страниц, где важна картинка в поиске. |
X-Robots-Tag: когда нужен HTTP-заголовок
X-Robots-Tag нужен, когда директиву удобнее или возможно задать только на уровне HTTP-ответа. Это особенно полезно для PDF-документов, изображений, видео, архивов, офисных файлов и массовых правил по расширениям.
Если на сайте есть коммерческие PDF, прайсы, инструкции, закрытые документы или файлы, которые не должны попадать в поиск, стоит проверить их индексацию отдельно. Подробнее смежную тему можно усилить материалом SEO для PDF-файлов.
Пример для Apache
<Files ~ "\.pdf$">
Header set X-Robots-Tag "noindex, nofollow"
</Files>
Пример для Nginx
location ~* \.pdf$ {
add_header X-Robots-Tag "noindex, nofollow";
}
Нельзя без проверки ставить X-Robots-Tag на все PDF, изображения или документы. Иногда именно эти файлы приносят трафик, ссылки, доверие и конверсию. Сначала проверьте, какие URL уже видны в поиске и дают переходы.
robots.txt: что он делает и чего не делает
Файл robots.txt находится в корне сайта и сообщает роботам, какие разделы можно сканировать, а какие нет. Он полезен для управления обходом технических разделов, параметров, корзины, личного кабинета, внутреннего поиска и дублей.
Но robots.txt не является полноценным инструментом запрета индексации. Если URL закрыт от сканирования, поисковая система может знать о нём по ссылкам и показывать в выдаче без нормального сниппета.
User-agent: *
Disallow: /cart/
Disallow: /search/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.ru/sitemap.xml
Для тонкой настройки полезно понимать и смежные директивы. Например, для управления частотой обхода Яндекса можно изучить материал про crawl-delay в robots.txt.
Как проверить meta robots, X-Robots-Tag и robots.txt
Проверка должна идти не только глазами в коде страницы. Иногда noindex приходит из плагина, темы, CDN, серверного правила, заголовка, staging-настройки или шаблона CMS.
Проверьте исходный код страницы
Откройте HTML и найдите meta name="robots". Убедитесь, что на важных страницах нет noindex или none.
Проверьте HTTP-заголовки
Используйте curl, DevTools, Screaming Frog, Netpeak Spider или расширение браузера. Ищите X-Robots-Tag.
Сравните с robots.txt
Если URL закрыт через Disallow, директивы индексации на самой странице могут не учитываться.
Проверьте Search Console и Яндекс.Вебмастер
Смотрите статус URL, причину исключения из индекса, дату последнего обхода и версию страницы, которую видел робот.
Быстрая проверка через curl
curl -I https://example.ru/page/
curl -I -A "Googlebot" https://example.ru/page/
curl -I https://example.ru/file.pdf
Примеры плохого и хорошего варианта
Плохой вариант
Страница услуги закрыта в robots.txt, но в HTML стоит noindex. Владелец сайта думает, что страница удалится из поиска, хотя робот может не увидеть meta robots.
robots.txt:
Disallow: /services/seo/
HTML:
<meta name="robots" content="noindex">
Хороший вариант
Для временного удаления URL разрешают обход, добавляют noindex, ждут переобхода и только потом решают, нужно ли ограничивать сканирование.
robots.txt:
Allow: /old-page/
HTML:
<meta name="robots" content="noindex,follow">
Частые ошибки, которые вредят SEO
Noindex после переноса сайта
На тестовом домене ставят noindex, а после релиза забывают снять. В итоге важные страницы не попадают в индекс.
Disallow вместо noindex
Страницу закрывают от обхода, но ждут удаления из выдачи. Это нестабильная логика, особенно если URL уже известен поиску.
Nofollow на важных разделах
Массовый nofollow может мешать роботу находить внутренние страницы, особенно на сайтах с глубокой структурой.
Слишком жёсткий nosnippet
Страница может остаться в поиске, но без нормального описания. Это иногда снижает кликабельность результата.
Случайный X-Robots-Tag
Директива может прийти из Nginx, Apache, CDN, PHP-кода или плагина. В HTML её не видно, поэтому её часто пропускают.
Неверная логика sitemap
Если URL должен индексироваться, он должен быть доступен, каноничен и логично присутствовать в sitemap. Если URL закрыт, не стоит держать его в карте сайта без причины.
Что спросить у SEO-подрядчика или разработчика
Эти вопросы помогут быстро понять, контролирует ли специалист техническую часть, а не просто «закрывает страницы по шаблону».
- Какие типы страниц должны индексироваться, а какие нет?
- Где именно стоит noindex: в HTML, HTTP-заголовке, плагине, теме, CDN или серверной конфигурации?
- Есть ли конфликт между robots.txt и meta robots?
- Какие страницы исключены из индекса и почему?
- Есть ли в sitemap страницы с noindex, редиректами, дублями или ошибками?
- Как будет проверяться результат после изменений?
- Что может сломаться после обновления CMS, темы, плагинов или серверной конфигурации?
Если специалист не может объяснить разницу между crawl, index, noindex, disallow, canonical и sitemap простыми словами, риск ошибочной настройки выше.
Честно: проблема индексации не всегда в robots
Если страница плохо индексируется или не даёт трафик, причина может быть не только в meta robots, X-Robots-Tag или robots.txt.
Иногда страница технически открыта, но у неё слабый контент, нет спроса, плохой оффер, дублирующая структура, нет внутренних ссылок, слабая коммерческая ценность или низкая скорость загрузки. В B2B и услугах дополнительно влияют цена, доверие, обработка заявок, сезонность и качество продаж.
Техническая причина
noindex, canonical на другой URL, редирект, 404, закрытие в robots.txt, X-Robots-Tag, серверная ошибка.
Контентная причина
Поверхностный текст, слабое покрытие интента, нет примеров, нет таблиц, нет ответов на реальные вопросы пользователя.
Коммерческая причина
Нет понятного предложения, условий, доказательств, ценового ориентира, контактов, гарантий по процессу и доверия.
Поэтому технический аудит лучше связывать с коммерческой структурой страницы. Для комплексной работы по таким задачам можно посмотреть услугу SEO-продвижение сайта.
Условный пример диагностики
Это не реальный кейс, а типовая ситуация для понимания логики проверки.
Типовая ситуация
Интернет-магазин жалуется: категории не появляются в поиске. В HTML noindex не найден. Но при проверке заголовков видно:
HTTP/2 200
X-Robots-Tag: noindex, nofollow
Причина может быть в серверном шаблоне или CDN-правиле, которое применилось шире, чем планировалось. После исправления важно отправить страницы на переобход и проверить статус в инструментах вебмастера.
Как действовать после обнаружения ошибки
Зафиксируйте текущую картину
Сохраните URL, статус-коды, meta robots, X-Robots-Tag, canonical, robots.txt и наличие URL в sitemap.
Определите намерение
Страница должна индексироваться, удаляться из поиска или просто не сканироваться слишком часто?
Исправьте только нужное правило
Не меняйте сразу robots.txt, sitemap, canonical и meta robots без понимания причин. Так можно создать новый конфликт.
Проверьте результат после переобхода
Индексация меняется не мгновенно. Проверяйте не только код страницы, но и то, что увидел поисковый робот.
Связь с другими SEO-настройками
Meta robots и X-Robots-Tag не работают в вакууме. Их нужно сопоставлять с canonical, sitemap, редиректами, внутренними ссылками, пагинацией и мобильной версией.
Например, если страница открыта для индексации, но указывает canonical на другой URL, поисковая система может выбрать другую каноническую страницу. Если страница есть в sitemap, но закрыта noindex, это сигнал о несогласованности. Смежный материал по теме - cross-domain canonical.
FAQ: частые вопросы
Можно ли закрыть страницу от индексации через robots.txt?
Надёжнее использовать noindex в meta robots или X-Robots-Tag. robots.txt ограничивает сканирование, но не гарантирует удаление URL из выдачи.
Что лучше: noindex или canonical?
noindex нужен, когда страницу не нужно показывать в поиске. canonical нужен, когда есть похожие URL и нужно указать предпочтительную версию. Это разные задачи.
Когда использовать X-Robots-Tag?
Когда нужно управлять индексацией файлов или массово задать правило на уровне сервера: PDF, изображения, видео, архивы, документы.
Нужно ли ставить index,follow на все страницы?
Обычно нет. Индексация и переход по ссылкам разрешены по умолчанию, если нет запрещающих директив и технических ограничений.
Почему страница с noindex всё ещё видна в поиске?
Возможные причины: робот ещё не переобошёл URL, страница закрыта в robots.txt и директива не прочитана, есть кэш, ошибка в шаблоне или поисковая система видит другую версию страницы.
Можно ли закрывать от индексации страницы с персональными данными?
Их лучше не публиковать открыто. Для чувствительных данных noindex недостаточен как мера безопасности: нужен контроль доступа, авторизация или ограничение на уровне сервера.
Не уверены, что сайт открыт для индексации правильно?
Начните не с переписывания robots.txt, а с проверки: какие URL должны быть в поиске, какие закрыты, где стоят noindex/X-Robots-Tag, нет ли конфликтов с sitemap, canonical и серверными заголовками.
Вывод
Meta robots, X-Robots-Tag и robots.txt - это не взаимозаменяемые инструменты. Meta robots подходит для HTML-страниц, X-Robots-Tag - для HTTP-заголовков и файлов, robots.txt - для управления сканированием.
Самая частая ошибка - закрыть URL от обхода и одновременно ждать, что поисковик прочитает запрет индексации. Чтобы не терять трафик, проверяйте директивы комплексно: HTML, HTTP-заголовки, robots.txt, sitemap, canonical и данные в инструментах вебмастера.
Управление обходом, индексированием и языковыми версиями проверяют по документации конкретного поисковика: директива или тег, не поддержанные системой, не дают ожидаемого эффекта.
- Google: robots meta tags and X-Robots-Tag
- Google: localized versions and hreflang
- Yandex Webmaster: robots.txt
7 августа 2026. Перед внедрением технических настроек сверяйте документацию источника и конфигурацию конкретного сайта.
