Файл robots.txt в SEO
robots.txt - текстовый файл
в корне сайта. Он говорит роботам,
какие адреса можно обходить.
Путь всегда такой:
https://example.com/robots.txt.
Файл управляет обходом, а не удалением из поиска. Закрытая в нем страница может остаться в индексе, если на нее ведут ссылки.
Пример 1
Самый частый случай - закрыть
админку. Всем роботам нельзя
заходить в /admin/:
User-agent: *
Disallow: /admin/
Пример 2
Закрывают служебные разделы: корзину, личный кабинет и внутренний поиск. Они не нужны в обходе:
User-agent: *
Disallow: /cart/
Disallow: /account/
Disallow: /search/
Пример 3
Пустой Disallow ничего
не закрывает. Так разрешают
обход всего сайта:
User-agent: *
Disallow:
Пример 4
Disallow: / закрывает весь
сайт. Так иногда оставляют
тестовый файл на боевом домене -
это опасная ошибка:
User-agent: *
Disallow: /
Пример 5
Раздел закрыт, но одна страница
внутри открыта. Более длинное
правило Allow важнее:
User-agent: *
Disallow: /admin/
Allow: /admin/login
Пример 6
В файле указывают адрес карты сайта. Робот быстрее найдет список страниц:
User-agent: *
Disallow: /admin/
Sitemap: https://example.com/sitemap.xml
Пример 7
Закрывают мусорные параметры: сортировку и UTM-метки. Робот не тратит обход на дубли:
User-agent: *
Disallow: /*?sort=
Disallow: /*?utm_
Пример 8
Для Яндекса директива
Clean-param говорит, какие
параметры не меняют страницу.
Адреса с метками не считают
дублями:
User-agent: *
Disallow: /admin/
Clean-param: utm_source&utm_medium&utm_campaign
Sitemap: https://example.com/sitemap.xml
Пример 9
Правила можно задать отдельно для конкретного робота. Здесь для Яндекса своя пауза и общая карта сайта:
User-agent: Yandex
Disallow: /admin/
Crawl-delay: 2
User-agent: *
Disallow: /admin/
Sitemap: https://example.com/sitemap.xml
Что делает robots.txt
и где он должен лежать?
Почему Disallow не удаляет
страницу из поиска?
Дан файл:
User-agent: *
Disallow: /
Что произойдет с сайтом?
Напишите robots.txt,
который закрывает /admin/,
/cart/ и указывает
карту сайта
https://example.com/sitemap.xml.