Robots.txt для мультиязычного сайта нужен не для того, чтобы “спрятать” страницы от поиска, а чтобы управлять обходом: какие технические разделы роботам не трогать, где находится sitemap и почему языковые версии нельзя случайно закрывать от сканирования.
Главный риск в многоязычности - не сам robots.txt, а конфликт между robots.txt, sitemap, hreflang, canonical, фильтрами, служебными URL и CMS. Один неверный запрет может оставить часть языковой версии без нормального обхода.
Короткий ответ для AEO и AI-выдачи
Для мультиязычного сайта robots.txt обычно размещают в корне домена: /robots.txt. Если языковые версии находятся в подпапках, например /ru/, /en/, /de/, один файл управляет обходом всех этих разделов.
Важные языковые страницы должны быть доступны для обхода, присутствовать в XML-карте сайта и иметь корректные связи hreflang. Закрывать стоит служебные зоны: админку, поиск по сайту, корзину, фильтры, параметры, технические папки и дубли, если они не нужны в поиске.
Как robots.txt работает на мультиязычном сайте
Robots.txt - это файл с правилами обхода для поисковых роботов. Он не заменяет meta robots, canonical, hreflang и sitemap. Его задача уже: сказать роботу, какие URL можно сканировать, а какие лучше не обходить.
На мультиязычном сайте эта логика сложнее, потому что один и тот же смысл может существовать в нескольких версиях: /ru/uslugi/, /en/services/, /de/leistungen/. Если закрыть одну версию, поисковик может хуже понять связь между языками.
что обходить
какие URL важны
какая версия для языка
правильная выдача
Что должно быть открыто, а что можно закрыть
| Зона сайта | Что делать | Почему это важно |
|---|---|---|
Языковые разделы /ru/, /en/, /de/ |
Оставить доступными для обхода | Робот должен увидеть контент и проверить связи между языковыми версиями. |
| Админка, личный кабинет, корзина, оформление заказа | Обычно закрыть через Disallow |
Эти страницы не дают поисковой ценности и могут создавать лишний обход. |
| Поиск по сайту и сортировки | Закрывать точечно | Внутренняя выдача и параметры часто плодят дубли и расходуют crawl budget. |
| CSS, JS и важные изображения интерфейса | Не закрывать без причины | Роботу нужен доступ к ресурсам, чтобы корректно оценить страницу и мобильную версию. |
| Sitemap | Указать абсолютным URL | Карта сайта помогает поисковикам быстрее найти важные страницы на всех языках. |
Базовый пример robots.txt для мультиязычного сайта
Ниже не универсальный “идеальный” файл, а безопасная заготовка. Перед публикацией её нужно адаптировать под CMS, структуру URL, фильтры, корзину, личный кабинет и фактическую карту сайта.
User-agent: *
Disallow: /wp-admin/
Disallow: /search/
Disallow: /*?s=
Disallow: /*?orderby=
Disallow: /*?sort=
Allow: /wp-admin/admin-ajax.php
Sitemap: https://example.ru/sitemap_index.xml
Не добавляйте Disallow: /en/, Disallow: /ru/ или похожие правила, если эти разделы должны ранжироваться. Для мультиязычного SEO это критическая ошибка.
Примеры для разных структур языковых версий
Языки в подпапках
example.ru/ru/, example.ru/en/. Один robots.txt лежит в корне домена. Правила должны учитывать все языковые папки.
Языки на поддоменах
ru.example.com, en.example.com. У каждого поддомена должен быть свой robots.txt, потому что правила действуют в пределах конкретного хоста.
Языки на разных доменах
example.ru, example.com. Для каждого домена нужен отдельный robots.txt, отдельная проверка sitemap и корректные hreflang-связи.
Robots.txt, sitemap и hreflang: где чаще всего ломается SEO
Для мультиязычного сайта важно не просто “открыть папки языков”, а согласовать три уровня: доступность URL, наличие URL в sitemap и наличие взаимных hreflang-ссылок между альтернативами.
Страница /en/service/ указана в hreflang, но закрыта в robots.txt. Робот не может нормально проверить альтернативу.
Все языковые версии отвечают 200, доступны для обхода, есть в sitemap и ссылаются друг на друга через hreflang.
Если вы разбираете не только robots.txt, но и запреты индексации, полезно отдельно посмотреть материал про Meta Robots, X-Robots-Tag и robots.txt: там проще понять разницу между “не сканировать” и “не индексировать”.
Директивы: что использовать осторожно
| Директива | Как применять | Риск ошибки |
|---|---|---|
Disallow |
Закрывать только ненужные для обхода зоны. | Можно случайно закрыть языковой каталог или коммерческие страницы. |
Allow |
Использовать для исключений внутри закрытого раздела. | Лишние Allow не исправят плохо продуманную структуру запретов. |
Sitemap |
Указывать полный адрес XML-карты сайта. | Если sitemap содержит закрытые URL, возникает конфликт сигналов. |
Clean-param |
Использовать для Яндекса, когда параметры не меняют смысл страницы. | Нельзя считать универсальной директивой для всех поисковиков. |
Host |
Лучше не использовать как основной способ выбора зеркала. | Для зеркал надёжнее 301-редирект, canonical и настройки в инструментах вебмастера. |
Как проверить robots.txt перед публикацией
Откройте https://домен/robots.txt и убедитесь, что файл отвечает 200 OK, а не 404, 403, редиректом или HTML-страницей.
Проверьте несколько важных URL: главную, коммерческие страницы, статьи, страницы каждого языка, sitemap и ресурсы CSS/JS.
Сравните robots.txt с sitemap: в карте сайта не должно быть URL, которые вы сами закрыли от обхода.
Проверьте файл в Google Search Console и Яндекс.Вебмастере. После правок наблюдайте за индексированием, ошибками обхода и логами сервера.
Если нагрузка идёт от роботов и вы думаете о задержках обхода, сначала изучите разбор директивы crawl-delay. В большинстве случаев проблема решается не задержкой, а чисткой дублей, параметров, ошибок сервера и слабого кеширования.
Красные флаги в настройке robots.txt
- Файл скопирован у конкурента без учёта вашей CMS, языков, фильтров и структуры URL.
- Закрыты папки
/ru/,/en/,/de/, хотя эти страницы должны ранжироваться. - В sitemap находятся URL, запрещённые через
Disallow. - Подрядчик говорит “закрыли от индексации через robots.txt”, хотя robots.txt управляет прежде всего обходом.
- Закрыты CSS/JS, из-за чего робот может хуже видеть мобильную версию и элементы страницы.
- Нет проверки после публикации: валидаторы, Вебмастер, Search Console, логи, страницы в индексе.
Что спросить у SEO-специалиста или разработчика
Честно: проблема может быть не только в robots.txt
Если мультиязычный сайт плохо индексируется или не приносит заявки, причина не всегда в robots.txt. Часто мешают слабая структура страниц, дубли из фильтров, неточные hreflang-связи, медленный сервер, плохой перевод, слабый оффер, неубедительные коммерческие блоки, цена, сезонность или обработка заявок.
Для бизнеса robots.txt - это не отдельная магическая настройка, а часть технической основы. Если страницы открыты, но на них нет доверия, ценности и понятного предложения, рост обхода не гарантирует рост заявок.
Когда задача шире технической индексации, логичнее смотреть SEO как систему: структура сайта, коммерческие факторы, контент, аналитика и конверсия. Для этого можно начать с SEO-продвижения сайта с понятным планом работ, а не с одиночной правки файла.
Что делать дальше: безопасный порядок действий
- Соберите структуру сайта: языковые папки, поддомены, домены, sitemap, CMS, фильтры, служебные разделы.
- Определите, какие страницы должны индексироваться, а какие нужны только пользователю или системе.
- Проверьте, не закрыты ли важные языковые URL, CSS, JS и изображения интерфейса.
- Сверьте robots.txt с sitemap и hreflang. Закрытый URL не должен быть важной альтернативной версией.
- Проверьте файл в инструментах вебмастера и посмотрите динамику обхода после публикации.
Если вы готовите сайт к AI-выдаче и хотите, чтобы поисковые системы лучше понимали структуру, дополнительно посмотрите материал про GEO-продвижение сайта: там важны чистые сущности, понятная архитектура и проверяемые сигналы.
Когда стоит обратить внимание на хостинг
Если robots.txt доступен, но сайт часто отдаёт 5xx, долго отвечает или падает при обходе, проблема может быть не в правилах, а в сервере, кешировании или ресурсах хостинга. В такой ситуации сначала смотрят логи, TTFB, кеш, PHP/SQL-нагрузку и ошибки.
Для небольших и средних проектов можно рассмотреть стабильный хостинг с нормальной поддержкой. Например, БЕГЕТ подойдёт как один из вариантов, если вам нужен понятный хостинг для WordPress и технических файлов сайта.
Если материал был полезен
Если статья помогла вам разобраться с robots.txt, sitemap или мультиязычной индексацией, можно оставить короткий отзыв о “Лукавченко Маркетинг” в Яндекс Картах. Это не обязательно, но такие отзывы помогают другим владельцам бизнеса быстрее понять, к кому можно обратиться за разбором SEO.
- Откройте карточку компании в Яндекс Картах.
- Нажмите “Оценить” или “Написать отзыв”.
- Коротко напишите, что именно было полезно: статья, консультация, аудит, объяснение ошибки.
Не уверены, что robots.txt не мешает SEO?
Начните с аккуратной проверки: какие страницы открыты, какие закрыты, где есть конфликт с sitemap и hreflang, не тратит ли сайт обход на дубли, фильтры и параметры. Это быстрее и безопаснее, чем править robots.txt наугад.
Управление обходом, индексированием и языковыми версиями проверяют по документации конкретного поисковика: директива или тег, не поддержанные системой, не дают ожидаемого эффекта.
- Google: robots meta tags and X-Robots-Tag
- Google: localized versions and hreflang
- Yandex Webmaster: robots.txt
7 августа 2026. Перед внедрением технических настроек сверяйте документацию источника и конфигурацию конкретного сайта.
