У вас 40 тысяч товаров, а в поиске находится хорошо если треть. Новые карточки неделями не появляются в выдаче, зато в индекс лезут мусорные URL с параметрами фильтра, которых вы даже не создавали. Знакомо? На большом каталоге проблема почти никогда не в «мало контента» — контента как раз завались. Проблема в том, что поисковик тратит силы не на те страницы и до важных просто не доходит.
Эта статья — практический разбор аудита индексации большого каталога на 1С-Битрикс: как понять, что реально в индексе, где утекает crawl budget, что делать с дублями умного фильтра, sitemap, каноникалами и товарами «под заказ». Многое здесь упирается в качество данных из учётной системы, поэтому по ходу затронем автоматизацию на 1С — статусы наличия и структура каталога родом оттуда.
Коротко
- На большом каталоге беда не в нехватке контента, а в том, что робот тратит crawl budget на дубли и мусор.
- Главный пожиратель бюджета — комбинации умного фильтра; откройте ценные посадочные, остальное закройте.
- Сравните число активных товаров с числом в индексе: разрыв и есть объём проблемы, которую вскрывает аудит.
- Наведите порядок в sitemap, каноникалах и статусах товаров «под заказ» — и важные страницы начнут индексироваться быстрее.
Почему большой каталог теряет трафик
У небольшого сайта проблем с индексацией почти не бывает: страниц мало, робот обходит их все и часто. С каталогом на десятки тысяч URL всё иначе — включаются ограничения обхода, и сайт начинает «конкурировать сам с собой» за внимание поисковика. Если структура не управляется, робот тонет в дублях и до ценных карточек добирается редко.
Типичная картина большого магазина на 1С-Битрикс: тысячи реальных товаров, вокруг которых наросли сотни тысяч технических URL — сортировки, пагинация, комбинации фильтра, метки. Для поисковика это выглядит как гигантский сайт, почти сплошь состоящий из почти одинаковых страниц. Он снижает частоту обхода и приоритет, и в итоге даже хорошие карточки индексируются медленно. Аудит нужен, чтобы вернуть обход к тем страницам, которые приносят трафик.
Что такое crawl budget
Crawl budget — это условный лимит страниц, которые поисковый робот готов обойти на сайте за отрезок времени. Он складывается из того, как быстро отвечает сервер (сколько робот может запросить, не перегружая), и из того, насколько сайт «интересен» поисковику. На каталоге в десятки тысяч URL этот лимит становится дефицитным ресурсом.
Простая логика: если из отведённого бюджета робот половину тратит на мусорные URL фильтра, значит вторую половину он делит между всеми реальными карточками — и до части из них доходит редко. Освободите бюджет от мусора, и та же квота обхода сконцентрируется на важном: новые товары и изменения цен попадут в индекс быстрее. Именно поэтому борьба с дублями — это не «чистота ради чистоты», а прямое ускорение индексации.
Сбор данных для аудита
Аудит начинается не с догадок, а с цифр. Нужно собрать три картины: что должно быть в индексе, что в нём реально есть и куда ходит робот.
- Инвентаризация каталога. Сколько активных товаров, категорий, посадочных страниц реально есть — по данным инфоблоков и торгового каталога.
- Состояние индекса. Панели веб-мастеров: сколько страниц в индексе, сколько исключено и по каким причинам.
- Реальный обход. Логи сервера — куда робот ходит на самом деле, сколько бюджета уходит на мусорные URL.
- Сканирование краулером. Прогон сайта desktop-краулером выявляет дубли, битые ссылки, цепочки редиректов, глубину вложенности.
Ключевая метрика аудита — разрыв между числом ценных страниц и числом реально проиндексированных. Если активных карточек 40 тысяч, а в индексе 12 тысяч, у вас потеряно две трети потенциального трафика — и это уже конкретная цель, а не абстрактное «надо улучшить SEO».
Дубли умного фильтра
Главный источник раздувания URL на каталоге 1С-Битрикс — компонент умного фильтра catalog.smart.filter. Он превращает каждую комбинацию параметров в отдельный адрес. Три-четыре свойства с несколькими значениями дают тысячи сочетаний, а на большом каталоге — миллионы. Без управления робот пытается обойти их все.
Правильная стратегия — разделить фильтрационные URL на три группы:
| Группа комбинаций | Пример | Что делать |
|---|---|---|
| Ценные посадочные | Бренд + категория, «холодильники Bosch» | Открыть для индексации, дать текст и title |
| Спросовые сочетания | Категория + ключевой параметр | Открыть выборочно под реальный спрос |
| Мусорные комбинации | Пять параметров вместе, «цвет+вес+...» | Закрыть от индексации и обхода |
Ценные комбинации оформляют как полноценные посадочные страницы с уникальным заголовком и описанием — они ловят низкочастотный спрос. Всё остальное закрывают: мусорные комбинации не должны съедать crawl budget. Как грамотно настроить сам фильтр под SEO, мы разбираем в отдельных материалах рубрики — здесь важен принцип: фильтр либо работает на индексацию, либо топит её.
Канонические URL и параметры
Вторая большая тема — дубли от служебных параметров: сортировка, пагинация, utm-метки, параметры отображения. Один и тот же список товаров доступен по десяткам адресов, и поисковик размывает сигналы между ними.
- Canonical на главную версию. Все вариации сортировки и отображения указывают каноникалом на базовый URL категории.
- Пагинация. Страницы 2, 3, N либо самоканоничны с уникальным содержимым, либо решаются продуманной схемой — но не должны плодить дубли первой страницы.
- Метки и параметры. utm и технические параметры не должны создавать индексируемые дубли — их закрывают от обхода.
- Единый регистр и слеши. Один URL — один вид: без разнобоя со слешем на конце и регистром.
Важно помнить: canonical — рекомендация, а не жёсткий барьер. Поэтому мусорные параметры дополнительно закрывают на уровне обхода, а не полагаются на один каноникал. Связка «каноникал плюс управление обходом» и убирает основную массу дублей.
Sitemap для десятков тысяч страниц
Для большого каталога карта сайта — не формальность, а способ гарантированно сообщить роботу обо всех важных URL, включая те, до которых трудно дойти по ссылкам. Но плохо собранный sitemap скорее вредит.
- Только канонические URL. В карту попадают лишь главные, открытые для индексации страницы, отдающие код 200 — без дублей и редиректов.
- Разбивка на файлы. Десятки тысяч URL делят на несколько sitemap и объединяют индексным файлом, соблюдая лимиты.
- Актуальность и частота. Карта обновляется при появлении и снятии товаров, отражает реальные даты изменения.
- Приоритеты. Разумно выделить ключевые категории и посадочные, а не заливать всё одной кучей.
В 1С-Битрикс sitemap генерируется штатными средствами, но на больших каталогах его почти всегда дорабатывают: под нужную структуру, исключение закрытых разделов и корректную частоту обновления. Иначе карта тянет в индекс то, что вы старательно закрывали.
Товары «под заказ» и снятые с продажи
Большой каталог постоянно дышит: позиции появляются, заканчиваются, снимаются с продажи. Если не управлять их URL, накапливаются битые ссылки и мягкие 404, которые робот продолжает обходить, тратя бюджет впустую.
- Определите политику. Что делать со страницей отсутствующего товара: оставить с пометкой и аналогами, склеить редиректом или отдать 404.
- Свяжите со статусом из 1С. Наличие и снятие с продажи приходят обменом — логика страницы должна опираться на эти данные, а не на ручную правку.
- Убирайте из sitemap выбывших. Снятые товары не должны оставаться в карте сайта как активные.
- Не плодите мягкие 404. Пустая карточка с кодом 200 хуже честного 404 или редиректа на аналог.
Приоритеты обхода и внутренняя перелинковка
Даже при чистой структуре важно направить обход на приоритетные страницы. Здесь работает внутренняя перелинковка и логика вложенности.
- Малая глубина до карточки. Чем меньше кликов от главной до товара, тем чаще робот до него доходит.
- Ссылки на важное. Ключевые категории и посадочные получают больше внутренних ссылок — из меню, подборок, блоков «популярное».
- Управление nofollow и обходом. Ссылки на мусорные фильтры и служебные страницы не должны звать робота внутрь.
- Скорость ответа. Быстрый сервер повышает допустимую скорость обхода — а значит, и объём проиндексированного.
Скорость — отдельный рычаг: чем быстрее отвечают страницы каталога, тем больше робот успевает обойти в рамках бюджета. Техническая сторона производительности и надёжной отдачи связана с инфраструктурой, о которой мы пишем в статье про хостинг и инфраструктуру BitrixVM.
Данные каталога из 1С и качество страниц
Индексация — это не только техника обхода, но и качество самих страниц, а оно во многом определяется данными из учётной системы. Пустые характеристики, отсутствующие описания, дубли названий приходят на сайт вместе с плохой выгрузкой.
- Заполненность карточек. Характеристики, свойства, описания из 1С делают страницу содержательной, а не «тонкой».
- Уникальность названий. Разные товары с одинаковыми именами создают неразличимые для поиска страницы.
- Стабильные коды и URL. Если при обмене «плавают» идентификаторы, меняются и адреса — накапливаются редиректы и дубли.
- Структура разделов. Логичное дерево категорий из 1С формирует понятную и обходимую структуру сайта.
Поэтому аудит индексации нередко упирается в порядок обмена с 1С: без стабильной, полной и структурированной выгрузки технические правки дают половинчатый результат. Как выстроить надёжную работу с данными на стороне сайта, мы разбирали в материале про D7 ORM в Битрикс, а вопросы качества интеграционного слоя — в статье про REST, вебхуки и безопасность.
Частые ошибки индексации
- Открытый умный фильтр. Все комбинации доступны роботу — миллионы мусорных URL пожирают crawl budget.
- Нет каноникалов. Сортировки, пагинация и метки плодят дубли, вес размывается.
- Кривой sitemap. В карте закрытые, редиректные или несуществующие URL — робот получает противоречивые сигналы.
- Мягкие 404. Снятые товары отдают код 200 с пустой страницей, робот их обходит впустую.
- Тонкие карточки. Пустые характеристики и описания из-за плохой выгрузки — страница не индексируется как ценная.
- Медленный сервер. Долгий ответ снижает скорость обхода и объём индексации.
- Аудит «один раз». Проверили и забыли, а каталог меняется — проблемы возвращаются.
Чек-лист аудита
- Разрыв индекса измерен. Известно, сколько ценных страниц и сколько реально в индексе.
- Логи разобраны. Понятно, куда робот тратит бюджет и сколько уходит на мусор.
- Фильтр под контролем. Ценные комбинации открыты как посадочные, мусорные закрыты от индексации и обхода.
- Каноникалы проставлены. Сортировки, пагинация и метки не создают индексируемых дублей.
- Sitemap чистый. Только канонические, живые, открытые URL; разбит на файлы; обновляется.
- Статусы товаров настроены. Снятые и отсутствующие обрабатываются по политике, без мягких 404.
- Перелинковка направляет обход. Важные страницы близко к главной и хорошо связаны.
- Данные из 1С в порядке. Карточки заполнены, коды стабильны, структура логична.
- Мониторинг настроен. Ключевые метрики индексации отслеживаются регулярно.
Вывод
Аудит индексации большого каталога — это не про «дописать текстов», а про то, чтобы поисковик тратил силы на нужные страницы. На каталоге в десятки тысяч URL crawl budget становится дефицитом, и главная работа — убрать его пожирателей: дубли умного фильтра, мусорные параметры, мягкие 404 и кривой sitemap. Освободите бюджет — и та же квота обхода начнёт индексировать реальные карточки быстрее.
Но техника обхода работает только на хороших данных. Заполненные карточки, стабильные коды и логичная структура приходят из 1С, поэтому аудит индексации и порядок в обмене идут рука об руку. Измерьте разрыв между реальным каталогом и индексом, уберите мусор, наведите порядок в данных — и большой каталог начнёт приносить трафик, соразмерный своему объёму.