Статья опубликована, открывается по прямому адресу и содержит полезную информацию. Но из других разделов сайта на неё нельзя перейти. Такая страница оказывается изолированной: читатель практически не встречает её во время просмотра сайта.
Страницей-сиротой называют URL, на который нет внутренних ссылок с других страниц сайта. При проверке важно оговаривать границы: иногда отсутствие ссылок означает лишь то, что краулер не увидел часть сайта.
Для блога проблема особенно характерна после смены рубрик, удаления подборок и переноса материалов. Статья сохраняется в CMS, но исчезает из маршрутов, которыми пользуются посетители.
Почему одного обхода сайта недостаточно
Краулер, который начинает с главной страницы и переходит по ссылкам, может вообще не обнаружить изолированный URL. Поэтому искать сироты только среди найденных им страниц — неполная проверка.
Нужно сопоставить несколько списков:
- опубликованные URL из CMS;
- адреса из Sitemap;
- страницы, найденные обходом по внутренним ссылкам;
- доступные данные о посадочных страницах из поисковых инструментов и аналитики.
Адрес, который есть в CMS, но отсутствует в результатах обхода, становится кандидатом на проверку. Это ещё не доказательство: причиной могут быть ограничения обхода, авторизация или особенности загрузки ссылок.
Основы такого анализа разобраны в статье «Краулинг сайта с ВерстаСлов».
Sitemap помогает обнаружению, но не заменяет навигацию
Карта сайта сообщает поисковой системе об URL, которые владелец считает важными. Однако её наличие не гарантирует обход и индексацию каждой страницы. Документация Google о Sitemap.
Представьте библиотеку, где книга есть в каталоге, но отсутствует на доступных читателю полках. Запись о ней полезна, однако человеку всё ещё трудно её найти. Аналогично Sitemap не создаёт переход из обзорной статьи в подробную инструкцию.
Если карта сайта содержит старые адреса или ошибочные URL, сначала пригодится руководство по проверке Sitemap.
Как проверить найденного кандидата
Возьмём условный пример: в CMS есть 240 опубликованных статей, а обход обнаружил 218. Разницу из 22 адресов нельзя автоматически объявлять ошибкой.
Для каждого адреса выясните:
- Должна ли страница быть публичной?
- Открывается ли она без авторизации?
- Есть ли на неё ссылки из рубрик, пагинации и других материалов?
- Не ведут ли ссылки на старый адрес с перенаправлением?
- Не исключена ли нужная часть сайта настройками краулера?
Результат проверки — объяснение судьбы каждого URL. Часть материалов потребуется вернуть в навигацию. Часть окажется служебными страницами. Для устаревших публикаций понадобится отдельное редакционное решение.
Как восстановить полезные связи
Начните с материалов, после которых читателю естественно перейти к найденной странице.
Например, из руководства по кластеризации уместно сослаться на разбор каннибализации запросов. Из инструкции по публикации — на проверку индексации. Из обзора SEO-аудита — на поиск битых ссылок.
Анкор должен объяснять содержание перехода: «как проверить Sitemap», а не «здесь». Google рекомендует доступные для обхода ссылки и понятный текст ссылок; у каждой важной страницы должна быть ссылка хотя бы с одной другой страницы сайта. Универсального идеального количества ссылок нет. Рекомендации Google по ссылкам.
После изменений повторите обход. Проверьте, что ссылки ведут на нужные адреса, а новые материалы доступны из тематических разделов. Для регулярной проверки используйте краулинг сайта в ВерстаСлов.
Добавьте в процесс публикации простое правило: для каждой новой статьи находить подходящие старые материалы, из которых на неё стоит сослаться. Тогда перелинковка будет развиваться вместе с блогом.