-10%Переходите к нам от другого подрядчика — дадим скидку на первый этап работ

Аудит индексации большого каталога

Аудит индексации большого каталога на 1С-Битрикс: crawl budget, дубли умного фильтра, sitemap, канонические URL

У вас 40 тысяч товаров, а в поиске находится хорошо если треть. Новые карточки неделями не появляются в выдаче, зато в индекс лезут мусорные URL с параметрами фильтра, которых вы даже не создавали. Знакомо? На большом каталоге проблема почти никогда не в «мало контента» — контента как раз завались. Проблема в том, что поисковик тратит силы не на те страницы и до важных просто не доходит.

Эта статья — практический разбор аудита индексации большого каталога на 1С-Битрикс: как понять, что реально в индексе, где утекает crawl budget, что делать с дублями умного фильтра, sitemap, каноникалами и товарами «под заказ». Многое здесь упирается в качество данных из учётной системы, поэтому по ходу затронем автоматизацию на 1С — статусы наличия и структура каталога родом оттуда.

Коротко

  • На большом каталоге беда не в нехватке контента, а в том, что робот тратит crawl budget на дубли и мусор.
  • Главный пожиратель бюджета — комбинации умного фильтра; откройте ценные посадочные, остальное закройте.
  • Сравните число активных товаров с числом в индексе: разрыв и есть объём проблемы, которую вскрывает аудит.
  • Наведите порядок в sitemap, каноникалах и статусах товаров «под заказ» — и важные страницы начнут индексироваться быстрее.

Почему большой каталог теряет трафик

У небольшого сайта проблем с индексацией почти не бывает: страниц мало, робот обходит их все и часто. С каталогом на десятки тысяч URL всё иначе — включаются ограничения обхода, и сайт начинает «конкурировать сам с собой» за внимание поисковика. Если структура не управляется, робот тонет в дублях и до ценных карточек добирается редко.

Типичная картина большого магазина на 1С-Битрикс: тысячи реальных товаров, вокруг которых наросли сотни тысяч технических URL — сортировки, пагинация, комбинации фильтра, метки. Для поисковика это выглядит как гигантский сайт, почти сплошь состоящий из почти одинаковых страниц. Он снижает частоту обхода и приоритет, и в итоге даже хорошие карточки индексируются медленно. Аудит нужен, чтобы вернуть обход к тем страницам, которые приносят трафик.

Что такое crawl budget

Crawl budget — это условный лимит страниц, которые поисковый робот готов обойти на сайте за отрезок времени. Он складывается из того, как быстро отвечает сервер (сколько робот может запросить, не перегружая), и из того, насколько сайт «интересен» поисковику. На каталоге в десятки тысяч URL этот лимит становится дефицитным ресурсом.

Простая логика: если из отведённого бюджета робот половину тратит на мусорные URL фильтра, значит вторую половину он делит между всеми реальными карточками — и до части из них доходит редко. Освободите бюджет от мусора, и та же квота обхода сконцентрируется на важном: новые товары и изменения цен попадут в индекс быстрее. Именно поэтому борьба с дублями — это не «чистота ради чистоты», а прямое ускорение индексации.

Факторы продвижения → позиции в выдаче Структуралогика разделовКонтенттексты, карточкиСкоростьбыстрый сайтСсылкивес страницПозициирост в выдаче
Схема: позиции в выдаче складываются из структуры, контента, скорости и ссылочного веса. Слабое звено тянет вниз весь результат.

Сбор данных для аудита

Аудит начинается не с догадок, а с цифр. Нужно собрать три картины: что должно быть в индексе, что в нём реально есть и куда ходит робот.

  1. Инвентаризация каталога. Сколько активных товаров, категорий, посадочных страниц реально есть — по данным инфоблоков и торгового каталога.
  2. Состояние индекса. Панели веб-мастеров: сколько страниц в индексе, сколько исключено и по каким причинам.
  3. Реальный обход. Логи сервера — куда робот ходит на самом деле, сколько бюджета уходит на мусорные URL.
  4. Сканирование краулером. Прогон сайта desktop-краулером выявляет дубли, битые ссылки, цепочки редиректов, глубину вложенности.

Ключевая метрика аудита — разрыв между числом ценных страниц и числом реально проиндексированных. Если активных карточек 40 тысяч, а в индексе 12 тысяч, у вас потеряно две трети потенциального трафика — и это уже конкретная цель, а не абстрактное «надо улучшить SEO».

Дубли умного фильтра

Главный источник раздувания URL на каталоге 1С-Битрикс — компонент умного фильтра catalog.smart.filter. Он превращает каждую комбинацию параметров в отдельный адрес. Три-четыре свойства с несколькими значениями дают тысячи сочетаний, а на большом каталоге — миллионы. Без управления робот пытается обойти их все.

Правильная стратегия — разделить фильтрационные URL на три группы:

Группа комбинацийПримерЧто делать
Ценные посадочныеБренд + категория, «холодильники Bosch»Открыть для индексации, дать текст и title
Спросовые сочетанияКатегория + ключевой параметрОткрыть выборочно под реальный спрос
Мусорные комбинацииПять параметров вместе, «цвет+вес+...»Закрыть от индексации и обхода

Ценные комбинации оформляют как полноценные посадочные страницы с уникальным заголовком и описанием — они ловят низкочастотный спрос. Всё остальное закрывают: мусорные комбинации не должны съедать crawl budget. Как грамотно настроить сам фильтр под SEO, мы разбираем в отдельных материалах рубрики — здесь важен принцип: фильтр либо работает на индексацию, либо топит её.

Канонические URL и параметры

Вторая большая тема — дубли от служебных параметров: сортировка, пагинация, utm-метки, параметры отображения. Один и тот же список товаров доступен по десяткам адресов, и поисковик размывает сигналы между ними.

Важно помнить: canonical — рекомендация, а не жёсткий барьер. Поэтому мусорные параметры дополнительно закрывают на уровне обхода, а не полагаются на один каноникал. Связка «каноникал плюс управление обходом» и убирает основную массу дублей.

Sitemap для десятков тысяч страниц

Для большого каталога карта сайта — не формальность, а способ гарантированно сообщить роботу обо всех важных URL, включая те, до которых трудно дойти по ссылкам. Но плохо собранный sitemap скорее вредит.

В 1С-Битрикс sitemap генерируется штатными средствами, но на больших каталогах его почти всегда дорабатывают: под нужную структуру, исключение закрытых разделов и корректную частоту обновления. Иначе карта тянет в индекс то, что вы старательно закрывали.

Товары «под заказ» и снятые с продажи

Большой каталог постоянно дышит: позиции появляются, заканчиваются, снимаются с продажи. Если не управлять их URL, накапливаются битые ссылки и мягкие 404, которые робот продолжает обходить, тратя бюджет впустую.

  1. Определите политику. Что делать со страницей отсутствующего товара: оставить с пометкой и аналогами, склеить редиректом или отдать 404.
  2. Свяжите со статусом из 1С. Наличие и снятие с продажи приходят обменом — логика страницы должна опираться на эти данные, а не на ручную правку.
  3. Убирайте из sitemap выбывших. Снятые товары не должны оставаться в карте сайта как активные.
  4. Не плодите мягкие 404. Пустая карточка с кодом 200 хуже честного 404 или редиректа на аналог.
Ценные страницы не выбрасывайте зря. Если товар временно отсутствует, но у страницы есть трафик и ссылки, разумнее сохранить URL с пометкой «нет в наличии» и подборкой аналогов, чем удалять и терять накопленный вес.

Приоритеты обхода и внутренняя перелинковка

Даже при чистой структуре важно направить обход на приоритетные страницы. Здесь работает внутренняя перелинковка и логика вложенности.

Скорость — отдельный рычаг: чем быстрее отвечают страницы каталога, тем больше робот успевает обойти в рамках бюджета. Техническая сторона производительности и надёжной отдачи связана с инфраструктурой, о которой мы пишем в статье про хостинг и инфраструктуру BitrixVM.

Данные каталога из 1С и качество страниц

Индексация — это не только техника обхода, но и качество самих страниц, а оно во многом определяется данными из учётной системы. Пустые характеристики, отсутствующие описания, дубли названий приходят на сайт вместе с плохой выгрузкой.

Поэтому аудит индексации нередко упирается в порядок обмена с 1С: без стабильной, полной и структурированной выгрузки технические правки дают половинчатый результат. Как выстроить надёжную работу с данными на стороне сайта, мы разбирали в материале про D7 ORM в Битрикс, а вопросы качества интеграционного слоя — в статье про REST, вебхуки и безопасность.

Частые ошибки индексации

Чек-лист аудита

  1. Разрыв индекса измерен. Известно, сколько ценных страниц и сколько реально в индексе.
  2. Логи разобраны. Понятно, куда робот тратит бюджет и сколько уходит на мусор.
  3. Фильтр под контролем. Ценные комбинации открыты как посадочные, мусорные закрыты от индексации и обхода.
  4. Каноникалы проставлены. Сортировки, пагинация и метки не создают индексируемых дублей.
  5. Sitemap чистый. Только канонические, живые, открытые URL; разбит на файлы; обновляется.
  6. Статусы товаров настроены. Снятые и отсутствующие обрабатываются по политике, без мягких 404.
  7. Перелинковка направляет обход. Важные страницы близко к главной и хорошо связаны.
  8. Данные из 1С в порядке. Карточки заполнены, коды стабильны, структура логична.
  9. Мониторинг настроен. Ключевые метрики индексации отслеживаются регулярно.

Вывод

Аудит индексации большого каталога — это не про «дописать текстов», а про то, чтобы поисковик тратил силы на нужные страницы. На каталоге в десятки тысяч URL crawl budget становится дефицитом, и главная работа — убрать его пожирателей: дубли умного фильтра, мусорные параметры, мягкие 404 и кривой sitemap. Освободите бюджет — и та же квота обхода начнёт индексировать реальные карточки быстрее.

Но техника обхода работает только на хороших данных. Заполненные карточки, стабильные коды и логичная структура приходят из 1С, поэтому аудит индексации и порядок в обмене идут рука об руку. Измерьте разрыв между реальным каталогом и индексом, уберите мусор, наведите порядок в данных — и большой каталог начнёт приносить трафик, соразмерный своему объёму.

Частые вопросы

Что такое аудит индексации и зачем он большому каталогу?

Это проверка того, как поисковые системы находят, обходят и включают в индекс страницы вашего каталога. У магазина на тысячи и десятки тысяч товаров типична ситуация, когда часть карточек и категорий вообще не попадает в индекс, а вместо них поисковик тратит ресурс на дубли и мусорные URL. Аудит выявляет, какие страницы проиндексированы, какие нет и почему, и превращает это в план исправлений. Для большого каталога это прямой путь к росту трафика без создания нового контента.

Что такое crawl budget и почему он важен для больших сайтов?

Crawl budget — это условный объём страниц, который поисковый робот готов обойти на вашем сайте за период. На маленьком сайте он не ограничивает, но на каталоге в десятки тысяч URL становится узким местом: если робот тратит бюджет на дубли фильтра и мусорные параметры, до реальных карточек он может не дойти или доходить редко. Задача аудита — убрать пожирателей бюджета, чтобы обход концентрировался на важных страницах, а свежие товары и изменения цен попадали в индекс быстрее.

Почему умный фильтр создаёт проблемы с индексацией?

Компонент умного фильтра catalog.smart.filter генерирует комбинации параметров, и каждая комбинация — это отдельный URL. На большом каталоге таких сочетаний миллионы, и без управления поисковик пытается обойти их все, распыляя crawl budget и плодя тонкие, почти одинаковые страницы. Решение — осознанно открыть для индексации только ценные посадочные комбинации (например, бренд плюс категория), а остальные закрыть от индексации и обхода. Тогда фильтр работает на SEO, а не против него.

Как понять, какие страницы не проиндексированы?

Основной источник — панели веб-мастеров поисковых систем: там видно число страниц в индексе, исключённые URL и причины исключения. Дополнительно помогает сравнение: сколько всего активных товаров и категорий в каталоге против того, сколько реально в индексе. Разрыв между этими числами и есть объём проблемы. Логи сервера показывают, куда робот реально ходит, а сканирование сайта краулером выявляет дубли, битые ссылки и цепочки редиректов.

Нужен ли большому каталогу sitemap и каким он должен быть?

Да, карта сайта критична для больших каталогов: она помогает роботу узнать обо всех важных URL, особенно о тех, до которых трудно дойти по ссылкам. Для десятков тысяч страниц sitemap разбивают на несколько файлов и объединяют индексным. Важно, чтобы в карту попадали только канонические, отдающие код 200 и открытые для индексации страницы — иначе она вводит робота в заблуждение. В 1С-Битрикс карту можно генерировать штатно, но на больших каталогах её обычно дорабатывают под нужную структуру и частоту обновления.

Как канонические URL решают проблему дублей в каталоге?

Тег canonical указывает поисковику, какая версия страницы главная, когда одно и то же содержимое доступно по разным адресам — с параметрами сортировки, пагинации, utm-метками. Для каталога это способ сказать: «все эти вариации ведут к одной карточке или категории, индексируй её». Правильно проставленные каноникалы убирают размывание сигналов между дублями и экономят crawl budget. Но canonical — рекомендация, а не жёсткий запрет, поэтому мусорные параметры дополнительно закрывают на уровне обхода.

Как товары «под заказ» и снятые с продажи влияют на индексацию?

В большом каталоге постоянно появляются и исчезают позиции. Если снятый с продажи товар просто отдаёт пустую страницу или ошибку, а ссылки на него остаются, накапливаются битые URL и мягкие 404, которые робот продолжает обходить. Нужна политика: что делать со страницей отсутствующего товара — оставить с пометкой и рекомендациями, склеить с аналогом или корректно отдать 404. Статусы наличия приходят из 1С, поэтому логика должна опираться на данные обмена, а не на ручное ведение.

Как часто проводить аудит индексации большого каталога?

Базовый аудит делают при заметном расхождении индекса с реальным числом страниц или при падении трафика, а затем переходят к регулярному мониторингу. Для активно меняющегося каталога разумно отслеживать ключевые метрики — число страниц в индексе, исключённые URL, скорость попадания новых товаров — ежемесячно, а глубокий разбор проводить раз в квартал или после крупных изменений структуры. Индексация большого сайта — не разовая задача, а процесс, который держат под контролем.

Поделиться:

Большой каталог не индексируется как надо?

Проведём аудит индексации, наведём порядок в фильтре, каноникалах, sitemap и данных из 1С, чтобы важные страницы попадали в индекс. Рассчитаем работу по вашему каталогу.

Автоматизация на 1С

Игорь Воскресенский

Команда B2Bsite. С 2014 года разрабатываем интернет-магазины на 1С-Битрикс: техническое SEO больших каталогов, управление индексацией, обмен с 1С и производительность витрины.

← Все статьи блога