"Страница не в индексе" - формулировка, за которой может скрываться что угодно: от опечатки в robots.txt до архитектурной проблемы, которую разработчики закладывали еще на этапе проектирования сайта. Проблема в том, что большинство чек-листов по индексации ограничиваются очевидными пунктами - проверить robots.txt, отправить sitemap, посмотреть в Search Console. Этого хватает в половине случаев. Во второй половине сайт продолжает не индексироваться, а специалист ходит по кругу одних и тех же проверок.
Собрали десять причин, которые реже всего проверяют в первую очередь - хотя именно они чаще всего оказываются виновниками. Без их устранения любая раскрутка сайта упирается в потолок: сколько бы контента и ссылок ни было вложено, страницы, которых нет в индексе, не принесут ни трафика, ни позиций.
1. Canonical указывает не туда, куда нужно
Классическая ошибка - разработчики настроили canonical по шаблону, и все страницы категории ссылаются на одну и ту же "эталонную" страницу вместо себя самой. Формально это не ошибка индексации в чистом виде: поисковик видит страницу, но сознательно выбирает не индексировать ее, потому что canonical говорит "настоящая версия - вот эта, другая". Стоит проверить:
-
совпадает ли canonical с реальным URL страницы для всех типовых шаблонов - карточек товара, категорий, статей;
-
не указывают ли canonical на страницу пагинации или на главную по умолчанию;
-
как ведут себя фильтры и параметры URL - часто они массово канонизируются на одну страницу без параметров, из-за чего вариации с реальным трафиком выпадают из индекса.
2. Meta robots noindex остался после разработки
Часто страница блокируется тегом noindex, который поставили на этапе разработки или тестирования и забыли снять при переносе на боевой домен. Это особенно частая история для:
-
страниц, созданных через конструктор или CMS с шаблонами по умолчанию;
-
разделов, которые копировали с тестового поддомена без ревизии настроек;
-
страниц, добавленных через сторонние плагины, у которых noindex стоит по умолчанию.
Проверять нужно не только отдельные страницы, а весь шаблон раздела - иногда noindex стоит не в HTML, а прописан на уровне сервера через X-Robots-Tag в заголовках ответа, и в исходном коде страницы его просто не видно.
3. Страница технически недоступна для робота
Страница может открываться в браузере у живого пользователя и при этом быть недоступной для поискового робота - из-за разного поведения сервера в зависимости от user-agent. Стоит проверить:
-
не блокирует ли сервер запросы с user-agent Googlebot или YandexBot на уровне файрвола или CDN;
-
не возвращает ли сайт разный контент для робота и пользователя - это может расцениваться как клоакинг и приводить к исключению из индекса;
-
корректно ли настроена геозащита - иногда она блокирует IP-диапазоны поисковых роботов вместе с нежелательным трафиком;
-
нет ли капчи или проверки JavaScript, которая не пропускает робота дальше первого экрана.
4. Контент рендерится только через JavaScript
Google научился исполнять JavaScript, но делает это в два прохода - индексация JS-контента может занимать недели, а иногда не происходит вовсе. Яндекс работает с JS еще осторожнее. Проблемные сценарии:
-
ключевой контент подгружается динамически после клика или скролла и не попадает в исходный HTML;
-
важные ссылки реализованы через onClick вместо обычного тега a href;
-
SPA-приложение без серверного рендеринга (SSR) или пререндеринга для поисковых роботов;
-
метатеги и заголовки формируются на клиенте, из-за чего в исходном коде страницы title и description пустые.
Проверить, что реально видит робот, можно через инструмент "Просмотреть как Googlebot" в Search Console - если рендер сильно отличается от того, что видно пользователю, дело в JavaScript.
5. Внутренняя перелинковка не доводит до страницы
Робот находит новые страницы в основном по ссылкам с уже проиндексированных. Если на страницу не ведет ни одна внутренняя ссылка - она может годами оставаться сиротой, даже если формально есть в sitemap. Это часто происходит с:
-
страницами, которые появляются только в результатах внутреннего поиска или фильтров;
-
старыми материалами, на которые перестали ссылаться после редизайна меню;
-
страницами глубокого уровня вложенности - на четвертом-пятом клике от главной робот заходит редко и нерегулярно.
Наличие в sitemap не заменяет перелинковку - файл сообщает о существовании страницы, но не дает ей веса и приоритета для регулярного обхода.
6. Сайт превышает краулинговый бюджет
Для крупных сайтов - от нескольких десятков тысяч страниц - актуальна проблема, о которой редко думают на небольших проектах: у робота ограниченное количество запросов к домену за период. Если бюджет расходуется на бесполезные страницы, до важных робот просто не доходит:
-
бесконечная генерация страниц через фильтры и параметры URL создает миллионы технических дублей;
-
медленный ответ сервера снижает число страниц, которые робот успевает обойти за сессию;
-
страницы с ошибками 404 и 5xx, на которые продолжают вести старые ссылки, тратят часть бюджета впустую;
-
дубли с разными протоколами или www/без www при неправильных редиректах удваивают число URL для обхода.
7. Сайт слишком "молод" в глазах поисковика
Даже без технических ошибок новый домен или недавно перезапущенный сайт может индексироваться медленно просто потому, что у поисковика еще не накопилось доверия к ресурсу. Это не поломка, а нормальный процесс, который стоит учитывать в ожиданиях:
-
у нового домена нет истории обходов, и робот выделяет на него меньше ресурсов по умолчанию;
-
отсутствие внешних ссылок снижает приоритет сканирования - робот реже узнает о существовании новых страниц;
-
частая смена структуры URL на старте проекта заставляет поисковик каждый раз пересматривать приоритеты обхода заново.
Здесь помогает не паника, а системная работа: регулярная публикация, наращивание внешних сигналов и терпение - индексация молодого домена может занимать несколько месяцев даже при отсутствии ошибок.
8. Дублирующийся или низкокачественный контент
Поисковик не обязан индексировать все подряд - если контент страницы почти не отличается от уже проиндексированных или выглядит малоценным, робот может сознательно исключить ее из индекса. Типичные случаи:
-
карточки товаров с одинаковым описанием, отличающиеся только цветом или размером;
-
страницы городов и регионов, сгенерированные по шаблону с минимальными правками текста;
-
статьи, скопированные с других источников без переработки;
-
страницы-заглушки с парой предложений текста и без реальной пользы для пользователя.
Проверить масштаб проблемы можно через выборочный поиск фрагментов текста в кавычках - если один и тот же блок встречается на десятках страниц сайта, для поисковика это сигнал низкой уникальности раздела в целом.
9. Проблемы на уровне DNS и сертификата
Робот обращается к сайту так же, как любой клиент - через DNS и SSL-хендшейк, и любой сбой на этом уровне может периодически блокировать обход, даже если сайт визуально работает нормально:
-
нестабильный DNS-провайдер с редкими, но регулярными таймаутами при резолвинге домена;
-
истекающий или неправильно настроенный SSL-сертификат, из-за которого часть запросов падает с ошибкой;
-
смешанный контент - когда часть ресурсов страницы загружается по http вместо https, что может блокироваться браузером робота;
-
редиректы между http и https или между www и без www, зациклленные друг на друга.
Такие проблемы особенно коварны тем, что проявляются не постоянно, а спорадически - сайт может быть доступен в 95% случаев, но именно эти 5% сбоев накапливаются в логах робота и снижают частоту обхода.
10. Санкции и ручные меры, о которых не знают
Иногда причина банальна, но ее не проверяют в первую очередь: сайт уже находится под алгоритмическим фильтром или ручной санкцией, о которой владелец либо не знает, либо забыл. Стоит исключить:
-
наличие уведомлений о ручных мерах в Google Search Console и аналогичном разделе Яндекс Вебмастера;
-
резкое падение видимости, совпадающее по дате с известными обновлениями алгоритмов;
-
накопленный спамный ссылочный профиль, который мог спровоцировать пессимизацию;
-
смену владельца или последствия предыдущей команды, которая могла применять серые методы продвижения до текущей.
Проверка санкций логично идет последним пунктом, но по хорошему ее стоит делать одной из первых - если сайт под фильтром, все остальные технические доработки не дадут эффекта, пока не снята основная причина.
Как быстро продиагностировать ситуацию
Прежде чем разбирать каждую из десяти причин по отдельности, стоит пройти базовый порядок проверки, который сразу сужает круг подозреваемых:
-
Проверить статус конкретной страницы через инструмент проверки URL в Search Console и Яндекс Вебмастере.
-
Сверить, что видит робот, с тем, что видит пользователь - через рендеринг в тех же панелях вебмастеров.
-
Проверить robots.txt, meta robots и X-Robots-Tag в заголовках ответа сервера.
-
Убедиться, что canonical страницы указывает сама на себя, если это не осознанное решение.
-
Проверить наличие внутренних ссылок на страницу с других проиндексированных разделов.
-
Посмотреть уведомления о ручных мерах и санкциях в панелях вебмастеров.
-
Оценить уникальность контента страницы относительно остального сайта.
Вывод
Индексация - это не разовая настройка, а состояние, которое сайт может терять и восстанавливать на протяжении всей жизни проекта. Большинство проблем из этого списка не видны на поверхности и не ловятся стандартным чек-листом из трех пунктов - именно поэтому их упускают даже опытные специалисты, которые проверяют очевидное и останавливаются на этом. Системная диагностика по всем десяти направлениям занимает больше времени, чем беглый осмотр robots.txt, но именно она отличает раскрутку сайта, которая действительно решает проблему, от повторного набора одних и тех же поверхностных проверок.
