Как собрать семантическое ядро и не заставить свои страницы конкурировать друг с другом
Разбор на живых данных: как по пересечению выдачи решить, где двум запросам нужна одна страница, а где две. 10 фраз, 45 пар, семь форм частотности и цитаты из справок Яндекса и Google.

Руководств по составлению семантического ядра написано столько, что ещё одно пошаговое перечисление сервисов никому не поможет. Проблема давно не в том, где взять запросы, — их отдаёт любой инструмент за пять минут. Проблема в решении, которое принимается после сбора: какие запросы отвечают на один и тот же вопрос, а какие требуют разных страниц. Ошибётесь здесь — и через полгода две ваши статьи будут отбирать показы друг у друга.
Мы взяли десять близких фраз из собственного семантического ядра, сняли по ним живую выдачу Яндекса и Google и семь форм частотности Вордстата, а потом сверили выводы со справками обеих поисковых систем. Ниже — что показали числа, где два поисковика ответили по-разному и какой порядок сбора выдерживает эту проверку.
Все замеры сделаны 17 августа 2026 года, Москва, lr=213 для Яндекса и локация Москвы для Google; источник — XMLRiver. Цитаты из справок проверены открытием страниц в тот же день.
Ядро отвечает не на вопрос «какие запросы», а на вопрос «сколько страниц»
Семантическое ядро принято описывать как список запросов, по которым сайт хочет находиться. Определение верное и бесполезное: список сам по себе ничего не решает. Семантическое ядро помогает не тем, что перечисляет фразы, а тем, что превращает их в решения. Работающее определение другое — это карта соответствия «группа запросов → одна страница». Всё остальное в ядре обслуживает эту карту: частотность подсказывает, стоит ли группа отдельной страницы, интент отсеивает чужих людей, конкурентность говорит о цене входа.
Из такой формулировки сразу следует, что семантическое ядро нельзя собрать один раз и отложить. Оно превращается в структуру сайта, а структура — в задачи редакции. Собирать семантическое ядро на две тысячи фраз и не расписывать, какая страница какую группу закрывает, — то же самое, что заказать кирпич без чертежа.
Отсюда и требование к результату: семантическое ядро нужно не для отчёта, а для того, чтобы у каждой будущей страницы был свой участок спроса. И здесь же прячется главная ошибка, ради которой написан этот материал. Когда запросов много, а времени мало, соблазн простой: под каждый заметный из них завести свою страницу. Кажется, что так покрытие полнее. На деле вы делаете две страницы, которые отвечают на один вопрос, и заставляете поисковую систему выбирать между ними — вместо того чтобы выбирать между вами и конкурентом.
Что происходит, когда две ваши страницы отвечают на один запрос
Об этом не нужно догадываться: обе поисковые системы описали механику в собственных справках. Формулировки стоит прочитать буквально, потому что они отвечают на вопрос точнее, чем большинство статей про каннибализацию.
Яндекс: группа дублей и прямое предупреждение о конкуренции
Справка Вебмастера говорит, что страницы с одинаковым или схожим содержимым робот может признать дублями, объединить в группу и показывать в выдаче только одну — «наиболее информативную и релевантную поисковым запросам». Обратите внимание на слово «схожим»: под правило попадают не только технические копии по разным адресам, но и два материала, написанные про одно и то же разными словами.
А в соседней статье справки идёт фрагмент, который в пересказах почти не встречается:
Также в некоторых случаях страницы могут не объединяться в группу и участвовать в поиске как разные документы. Таким образом конкурировать между собой. Это может оказать влияние на сайт в поиске.
То есть Яндекс прямо описывает ситуацию, которую в отрасли называют каннибализацией, — и делает это без термина, в разделе про дубли. Худший исход тут не «страницу склеили», а «страницы не склеили»: обе живут, обе тянут на себя сигналы, ни одна не выигрывает.
Рядом лежит второе следствие, о котором забывают. Атрибут rel="canonical" для Яндекса — рекомендация: «Робот игнорирует указания, если содержимое канонической страницы значительно отличается от содержимого неканонической». Разметкой проблему разных по смыслу страниц не закрыть, её можно закрыть только редакционно.
Есть и третий сценарий, самый частый для тех, кто плодит страницы под варианты одного запроса. У Яндекса есть отдельная справка про малоценные и маловостребованные страницы: «Алгоритм может не включать страницу в поиск, если у неё мало шансов оказаться востребованной пользователями. Так может произойти, например, если страница дублирует уже известные роботу страницы». Страница просто не попадает в поиск, и в Вебмастере у неё будет статус «малоценная или маловостребованная».
Google: кластер похожих страниц и выбор канонической
У Google та же механика, изложенная своими словами. В документации по нормализации URL сформулировано так: «Если на сайте несколько одинаковых страниц или страниц с похожим контентом, робот объединяет их в кластер». Дальше система выбирает ту, которую считает «наиболее полной и полезной для пользователей поиска», и делает её канонической. Ваше мнение учитывается, но не является решающим: «Даже если вы укажете каноническую страницу самостоятельно, мы по той или иной причине можем выбрать другую».
Смысл склейки Google формулирует через сигналы: канонический адрес нужен, «чтобы сгруппировать сигналы для похожих или одинаковых страниц» — объединить всё, что накопилось на разные адреса, включая внешние ссылки, и связать с одним URL. Пока страницы не склеены, сигналы живут порознь. Это и есть механика размывания, только описанная не блогерами, а документацией.
Отдельно стоит знать, где проходит граница дозволенного. В правилах в отношении спама раздел «Дорвеи» перечисляет среди примеров «практически одинаковые страницы, которые не имеют чёткой иерархии и, скорее, напоминают результаты поиска». Стратегия «страница на каждый вариант запроса» ведёт ровно туда — и это уже не про конкуренцию своих страниц между собой, а про риск получить санкции.
Чего в обеих справках нет — так это порога. Ни Яндекс, ни Google не публикуют, при какой степени похожести страницы считаются дублями. Снаружи виден только результат, а не правило. Поэтому решать приходится по косвенному признаку — и хорошая новость в том, что один надёжный признак существует.
Критерий, который можно проверить руками: пересечение выдачи

Признак такой: посмотрите, что поисковая система уже показывает по обоим запросам. Если по двум фразам в первой десятке стоят преимущественно одни и те же страницы, значит поисковик считает эти запросы одной задачей. Своей второй страницей вы вклиниваетесь не в новый интент, а в тот же самый.
Метод считается элементарно: снять первую десятку по обеим фразам и посчитать, сколько адресов совпало. Дальше нужен порог, и вот тут выясняется, что общей нормы нет — у каждого инструмента она своя, и разработчики честно называют её результатом опыта, а не расчёта.
Разработчик KeyAssort формулирует это прямо: «сила группировки — это минимальное количество общих URL для образования группы». По его инструкции опытным путём найдены такие минимальные значения: для жёсткой кластеризации 2 общих адреса, для промежуточной 3, для мягкой 4. В документации сервиса LowFruits порог задан долей: чтобы попасть в один кластер, запросы должны иметь не меньше 40 % общих адресов в первой десятке, то есть те же четыре из десяти.
Разброс объясняется тем, что порог и способ сравнения работают в паре. При жёсткой кластеризации общие адреса требуются у всех запросов группы с каждым, поэтому само число может быть меньше. При мягкой достаточно цепочки: А похож на Б, Б похож на В — все трое в одной группе, хотя А и В могут не пересекаться вовсе.
Мы в своих замерах берём границу строже принятой: пять общих адресов из десяти и больше означают одну страницу, два и меньше — разные, три-четыре попадают в серую зону, где решает человек. Причина простая: создание отдельной страницы обходится дорого и плохо обращается вспять, поэтому ошибаться в сторону лишней страницы хуже, чем в сторону одной. Это наша договорённость, а не свойство поисковой системы, и её видно в результатах: меняя порог, вы меняете архитектуру сайта.
Мы прогнали разбор на десяти фразах — вот что получилось

Для проверки мы взяли десять фраз из собственного семантического ядра: все про один предмет, все с непустым спросом. По ним снята живая выдача обеих систем — Яндекс lr=213 и Google по локации Москвы, первая десятка, десктоп, 17 августа 2026 года. Получилось 45 пар. Дальше только арифметика: сколько адресов совпало.
Где выдача говорит «одна страница», а где «две»
Первый результат ожидаемый: близкие по формулировке запросы действительно живут на одной странице. У «как собрать семантическое ядро» и «сбор семантического ядра» шесть общих адресов из десяти в обеих системах. Отдельной страницы вторая фраза не заслуживает — вы будете конкурировать сами с собой за один и тот же ТОП.
Второй результат менее очевиден и стоит того, чтобы его запомнить. Фразы «как собрать семантическое ядро» и «что такое семантическое ядро» отличаются одним оборотом, обе про один предмет — а общих адресов у них два из десяти в Яндексе и два в Google. Это разные задачи пользователя: в одном случае человеку нужна инструкция, в другом — определение. Две страницы здесь не роскошь, а необходимость, и материал, который пытается закрыть оба интента сразу, проигрывает специализированным.
Третий результат — про то, как легко ошибиться в обратную сторону. Запросы «кластеризация запросов» и «кластеризация семантического ядра» выглядят как два разных предмета, а в Яндексе у них восемь общих адресов из десяти: это одна страница, без вариантов. При этом с фразой «семантическое ядро» ни одна из них не пересекается вообще — ноль общих адресов в обеих системах. Слово в запросе то же самое, задача другая.
Такое распределение видно и на живых сайтах. У Unisender в нашем срезе три страницы делят этот раздел спроса, и границы проходят ровно там, где их провела бы матрица: руководство /ru/blog/kak-sostavit-semanticheskoe-yadro-sayta/ собирает запросы про сбор, статья глоссария про определение — запросы «что такое семантическое ядро» и «семантическое ядро сайта», а кластеризация вынесена в отдельную страницу глоссария. В Google все три ранжируются по своим группам, в Яндексе из них видны две. Мы не знаем, считали ли там пересечения или пришли к этому иначе; важно, что независимо посчитанная матрица дала ту же архитектуру.
Яндекс и Google расходятся в трети пар
А вот результат, ради которого стоило снимать обе системы. Из 45 пар вердикт совпал в 30. Если убрать 16 пар, где обе системы дали честный ноль и спорить не о чем, останется 29 содержательных пар — и в них согласие всего в 14 случаях, меньше половины.
Разница не косметическая. Возьмите «сбор семантического ядра» и «пример семантического ядра»: в Яндексе семь общих адресов — одна страница, в Google два — разные страницы. Или ту же пару про кластеризацию: восемь общих адресов в Яндексе против четырёх в Google.
Если посмотреть на это через порог, картина становится наглядной. При стандартном мягком пороге в четыре общих адреса Яндекс объединил бы 23 пары из 45, а Google — только 14. Один и тот же список фраз, один и тот же метод, а структура сайта получается разной.
Практический вывод неудобный, но честный: группировать нужно под ту систему, которая приносит вам трафик, и знать, что во второй разбивка будет другой. Усреднять две выдачи нельзя — получится структура, которая не подходит ни одной. Если приоритет ещё не выбран, это решение принимается до сбора ядра, а не после.
Отдельно про доверие к самим числам. Выдача снята один раз. Через неделю она будет другой — на сколько именно, мы не измеряли и утверждать не станем. Публичных исследований, где кто-то повторял такие замеры и считал устойчивость кластеров, мы не нашли: есть практические пороги, но нет работы с доверительными интервалами. Поэтому пересечение выдачи — это сильный аргумент, а не доказательство, и перед дорогими решениями замер стоит повторить.
Частотность: одно число вместо семи — главный источник лишних страниц

Вторая причина, по которой в семантическом ядре появляются лишние страницы, — привычка смотреть на одно число напротив фразы. Базовая частотность Вордстата считает все запросы, где встречаются ваши слова в любых формах, в любом порядке и с любыми добавками. Это оценка направления целиком, а не отдельной формулировки.
Что операторы делают на самом деле
Справка Вордстата перечисляет операторы -, !, +, " ", [], () и |. Три из них отвечают за точность, и путают их постоянно:
- `" "` фиксирует количество слов, а не порядок. В примере самой справки запрос
"купить автомобиль"показывается в том числе по «автомобиль купить». Кавычки убирают хвосты, но перестановку слов пропускают. - `[]` фиксирует порядок слов, при этом «учитываются все словоформы и стоп-слова». То есть скобки разрешают и добавки, и падежи, но требуют именно такой последовательности.
- `!` фиксирует форму слова — число, падеж, время.
Комбинации этих трёх операторов и дают семь рабочих форм частотности: от самой широкой W до самой строгой "[!W]", где зафиксировано всё сразу. Разница между крайними значениями показывает, насколько реальный спрос отличается от размера темы.
И полезная деталь, которой нет почти нигде: операторы работают не на всех вкладках. По ответам справки, «в Вордстате все операторы работают на вкладках Регионы и Топы запросов. На вкладке Динамика работает только оператор +». Если снимаете точную частотность на графике динамики, вы получаете число без операторов и не видите этого. Там же указаны периоды: «Регионы» показывают последние 30 дней, «Топы запросов» — последний месяц, «Динамика» — до двух лет помесячно, самая ранняя дата январь 2018 года.
Фраза с частотностью 239, которую не набирает никто
Теперь ради чего всё это. Вот два соседних ряда из нашего замера — Вордстат, регион 213, 17 августа 2026 года:
Базовая частотность одинаковая — 239 у обеих. Фразовая тоже совпала до единицы: 151 и 151, и теперь понятно почему — кавычки порядок не фиксируют, для них это одна и та же фраза. А как только порядок закрепляется скобками, вторая строка обнуляется. Такого запроса в этой последовательности люди не задают.
Инструмент, который отдаёт семантическое ядро с одной колонкой частотности, покажет вам две фразы с одинаковым спросом по 239. Дальше кто-то заведёт под каждую по странице — и получит вторую страницу под запрос, которого не существует, плюс конкуренцию с собственной первой.
Похожая ловушка у «составить семантическое ядро»: базовая частотность 25, а форма "W" — ноль. Отдельно эти три слова не набирают никогда, только с добавками вроде «как» или «сайта». Как самостоятельная посадочная фраза она не годится, как часть группы — вполне.
Заодно про стабильность самих чисел. Первую строку таблицы мы замеряли тремя днями раньше, 14 августа: тогда базовая частотность была 202, сейчас 239. Ничего не сломалось — просто Вордстат показывает скользящее окно, и число живёт своей жизнью. Поэтому в отчёте всегда стоит дата замера, а сравнивать имеет смысл замеры одного дня.
Порядок сбора семантического ядра

Создание семантического ядра складывается из шести шагов. Она не отменяет привычных шагов, но добавляет к ним две проверки, без которых карта «запрос → страница» получается на глаз.
Шаг 1. Маски
Начинается составление семантического ядра с коротких основ, от которых пойдёт расширение: сам продукт, его синонимы, профессиональный и бытовой варианты названия, задачи вместо названий. На этом шаге легко недобрать — люди ищут не только то слово, которым вы называете услугу внутри компании. Полезно сразу разметить маски по веткам аудитории: тот, кто выбирает подрядчика, и тот, кто делает сам, ищут разными словами, и смешивать их в одном материале потом будет нечем.
Шаг 2. Расширение
Маски раскрываются в фразы. Источников три, и они дают разное: подсказки самой поисковой системы, базы вроде Keys.so, где лежит снимок видимости конкурентов, и ваши собственные данные из Вебмастера и Search Console, если сайт уже живёт. Данные базы и живой Вордстат смешивать в одной колонке нельзя: первое — снимок неизвестной давности, второе — измерение на сегодня. Собирать семантику из одного источника рискованно: каждый показывает свой срез спроса.
Шаг 3. Чистка
Из расширения приходит мусор: чужие бренды, города, где вы не работаете, слова «бесплатно» и «своими руками» там, где вы продаёте услугу, вакансии и обучение. Отрицательные интенты правильнее не удалять, а помечать: через полгода понадобится вспомнить, почему фраза не в работе, и не собирать её заново.
Шаг 4. Частотность в семи формах
По оставшимся фразам снимаются все семь форм. Смотреть на широкую бессмысленно: она описывает направление целиком. Решение принимается по строгим формам — они показывают, сколько людей действительно набирают именно эту последовательность слов. Фразы с нулём в строгих формах остаются в ядре как часть группы, но собственной страницы не получают никогда.
Шаг 5. Группировка по выдаче
Дальше — то, ради чего писался материал. По приоритетным фразам снимается первая десятка выбранной системы, считается пересечение, применяется порог. Серую зону разбирает человек: открывает обе выдачи и смотрит, что за страницы там стоят и одну ли задачу они решают. Автоматика здесь помогает считать, но не решать. Именно на этом шаге сбор семантики перестаёт быть выгрузкой и становится проектированием.
Шаг 6. Карта «фраза → страница»
Итог сбора семантики — не список, а таблица: группа, её суммарный спрос по строгой форме, тип страницы, главная фраза для заголовка, статус. Дальше эта таблица становится контент-планом, и у каждой новой страницы появляется обязательная проверка: есть ли уже страница, чья группа пересекается с новой. Если есть — материал не пишется, а дописывается в существующий.
Где метод ломается
Честно про границы, потому что метод не универсален.
Новый спрос. Если по запросу выдача ещё не сформировалась — направление свежее, спроса мало, в первой десятке случайные страницы, — пересечение считать не по чему. Здесь решает понимание задачи пользователя, а не арифметика.
Коммерция против информации. Смешанная выдача, где рядом стоят каталоги и статьи, даёт пересечение, которое ничего не значит: вы физически не сделаете страницу, которая одновременно каталог и руководство. Такие пары надо разводить по типу страницы независимо от чисел.
Один замер — это один замер. Выдача меняется, и мы не измеряли, насколько сильно. Перед решением о крупной перестройке раздела имеет смысл повторить съём в другой день.
Порог — договорённость. Мы взяли пять из десяти и объяснили почему; кто-то возьмёт четыре и получит другую структуру. Важно не значение, а то, что оно зафиксировано, записано рядом с семантическим ядром и одинаково для всего проекта.
Если страницы уже конкурируют
Когда сайт живёт давно, проблема обычно уже есть. Порядок разбора такой.
Сначала нужно увидеть. Единственный надёжный источник здесь внутренний: в Вебмастере и Search Console видно, какие страницы показываются по одному запросу и как менялась картина. Снаружи заметен только симптом: по группе близких запросов у домена ранжируются разные страницы, а по части запросов не ранжируется ни одна. Причину симптом не доказывает; её подтверждает сопоставление с семантическим ядром и внутренней статистикой.
Дальше решается, что оставить. Если обе страницы про одну задачу, побеждает та, у которой больше накопленных сигналов и полнее содержание; вторая отдаёт уникальное содержание победителю и уходит редиректом. Если задачи всё-таки разные, а матрица пересечений это покажет, правильнее не склеивать, а развести: переписать заголовки и первые абзацы так, чтобы каждая страница отвечала на свой вопрос, и связать их ссылками.
Чего делать не стоит — рассчитывать, что rel="canonical" решит смысловую проблему. Мы уже цитировали справку Яндекса: указание игнорируется, если содержимое канонической страницы значительно отличается от неканонической. Разметка — инструмент для технических копий, а не для двух разных статей.
И последнее. Собрать семантику не значит получить трафик: сама по себе она не поднимает позиции и не заменяет качество материала. Делает она другое: убирает из работы решения, принятые на глаз, и не даёт оплатить производство страницы, которая будет мешать вашей же. В нашем случае эта же логика распространяется и на видимость в ответах нейросетей: языковая модель тоже выбирает один источник на вопрос, и разобранная тема с ясной структурой имеет больше шансов, чем три похожие статьи. Как это устроено со стороны инфраструктуры, мы разбирали в материале про llms.txt.
Если хотите, чтобы такой разбор кто-то делал за вас регулярно, вместе с производством и публикацией материалов, — это то, чем мы занимаемся.
Источники
- Яндекс Вебмастер — Дублирование страниц
- Яндекс Вебмастер — Канонический адрес страницы
- Яндекс Вебмастер — Малоценные или маловостребованные страницы
- Яндекс Вордстат — Операторы
- Яндекс Вордстат — Вопросы и ответы: где работают операторы
- Яндекс Вордстат — Гайд по интерфейсу: периоды данных
- Google Search Central — Что такое нормализация URL
- Google Search Central — Как указать канонический URL
- Google Search Central — Правила в отношении спама: дорвеи
- KeyAssort — инструкция: сила группировки по SERP
- LowFruits — как формируются кластеры: порог 40 %
Об авторе
Автор anyseo — о SEO-стратегии, контенте и измеримом росте
Алексей Крайнов пишет для anyseo о практической стороне поискового продвижения: как исследовать реальный спрос, превращать его в понятную структуру сайта и оценивать вклад контента в задачи бизнеса. В материалах делает акцент на проверяемых источниках, ясных приоритетах и решениях, которые можно повторить на реальном проекте.
Все статьи автора




