Почему GOOGLE индексирует заблокированные веб-страницы

Почему Google индексирует заблокированные веб-страницы

Почему Google индексирует заблокированные веб-страницы

Blog Article



Джон Мюллер из Google объяснил, почему Google индексирует ограниченные страницы, и почему отчеты Search Console, связанные с этим, можно безопасно не учитывать.

Джон Мюллер из Google ответил на вопрос о том, почему Google индексирует страницы, которые запрещены для выполнения обхода с помощью файла robots.txt, и по какой причине можно не учитывать соответствующие отчеты Search Console об этих обходах.

Трафик ботов к URL-адресам с параметрами запроса

Человек, задающий вопрос, задокументировал, что боты создают ссылки на несуществующие URL-адреса с параметрами запросов (?q=xyz) на страницы с мета-тегами noindex, которые также блокированы в robots.txt. Вопрос был вызван тем, что Google обходит эти ссылки на страницы, блокируется в robots.txt (не видя мета-тег noindex), а затем указывает об этом в Google Search Console как "Индексируется, хотя заблокировано robots.txt."

Человек спросил следующий вопрос:

"Но вот главный вопрос: почему Google индексирует страницы, когда он не может просмотреть содержимое? В чем тут выгода?"

Джон Мюллер из Google подтвердил, что если они не могут просканировать страницу, они не могут увидеть мета-тег noindex. Он также упомянул оператор site:search, посоветовав не учитывать результаты, потому что "средние" пользователи не наблюдают их.

Он написал:

"Да, вы правы: если мы не можем обойти страницу, мы не можем заметить noindex. Тем не менее, если мы не можем обходить страницы, для нас там мало что можно индексировать. Так что, хотя вы можете заметить некоторые из этих страниц с помощью целевого запроса site:, средний пользователь их не увидит, поэтому я бы не переживал. Noindex также функционирует (без запрета в robots.txt), это просто означает, что URL-адреса будут обходиться (и попадут в отчет Search Console как 'обойдены/не индексируются' — ни один из этих статусов не вызывает проблем для остальной части сайта). Важно, чтобы вы не делали их доступными для обхода и индексации."

Связанный: Google советует сайтам использовать файл robots.txt для блокировки URL-адресов действий.

Выводы:

1. Ответ Мюллера подтверждает недостатки использования оператора Site:search для диагностических целей. Одной из причин является то, что он не регламентирован с обычным поисковым индексом, это совсем отдельная особенность.

Джон Мюллер из Google прокомментировал оператор site search в 2021 году:

"Короткий ответ заключается в том, что запрос site: не предназначен для исчерпывающего отображения, а также для диагностических целей.

Запрос site: — это определенный вид поиска, который ограничивает результаты определенным веб-сайтом. Это, по сути, просто слово "site", двоеточие и затем домен веб-сайта.

Этот запрос сужает результаты специфическим веб-сайтом. Он не предназначен для того, чтобы быть исчерпывающей коллекцией всех страниц этого сайта."

Оператор site не отображает индекс поиска Google, что приводит к тому, что его ненадежным для осмысления того, какие страницы Google уже проиндексировал или нет. Как и другие операторы расширенного поиска Google, они ненадежны как инструменты для определения любых вопросов, связанных с тем, как Google ранжирует или индексирует контент.

2. Мета-тег noindex без работы robots.txt подходит для таких ситуаций, когда бот создает ссылки на отсутствующие страницы, которые идентифицируются Googlebot.

Мета-тег noindex на страницах, которые не запрещаются в robots.txt, позволяет Google просмотреть страницу и распознать директиву noindex, гарантируя, что страница не отобразится в поисковом индексе, что предпочтительно, если цель состоит в том, чтобы не позволить страницу в поисковый индекс Google.

3. URL-адреса с мета-тегом noindex внесут в Search Console запись "обойдены/не индексируются", что не приведет к негативного результата на остальную часть веб-сайта.

Эти записи в Search Console, в контексте страниц, которые специально заблокированы, лишь указывают на то, что Google обошел страницу, но не проиндексировал. По сути говоря, что это произошло, а не то, что (в этом данном контексте) есть что-то, что нужно поправить. Эта запись полезна для предупреждения издателей о страницах, которые непреднамеренно заблокированы мета-тегом noindex или по какой-либо другой причине, препятствующей индексации страницы. Тогда это стоит изучить.

Report this page