Анализ утечки Google
FilesMoney
24 мая 2024 года произошло немыслимое. Документация с описанием определённых алгоритмов ранжирования Google оказалась в паблике, что представляет собой значительное преимущество для всех, стремящихся увеличить поисковый трафик из Google. Этот материал окажется полезным как для опытных, так и начинающих сеошников.
Авторитетность сайта
Несмотря на предыдущие заявления Google о том, что параметр "Авторитетность сайта" не используется, на самом деле он применяется в их алгоритмах. Это подтверждает существование такого показателя, как траст домена, который, по наблюдениям, играет ключевую роль в успехе SEO-стратегий в течение последних 3-4 лет.
Поведенческие факторы
Google активно интегрирует поведенческие факторы в свои механизмы ранжирования. После изучения документации становится очевидным, что Google анализирует действия пользователей не только в поиске, но и в других своих сервисах, таких как Google Chrome, Google Карты, YouTube и прочих. Эти данные имеют важное значение для ранжирования сайтов. Некоторые ключевые поведенческие факторы, влияющие на ранжирование, включают:
- CTR (коэффициент кликабельности) сайта в поиске. Низкий CTR может отрицательно сказаться на ранжировании.
- Продолжительность взаимодействия с контентом сайта после клика (длинные клики). Время пребывания на сайте может различаться в зависимости от конкретной ниши, подчёркивая значение качества контента.
- Негативным фактором является быстрое возвращение пользователя обратно в поиск после посещения сайта, что может привести к понижению позиций в поисковой выдаче.
- Влияние кликов из поиска на ранжирование может варьироваться. Некоторые клики могут иметь большее значение, чем другие.
- В документации также упоминается специальный алгоритм защиты от клик-спама, который разделяет пользователей на доверенных, с активной историей в Google Chrome, и на недоверенных, у которых такой истории нет. Это делает более сложными манипуляции с поведенческими факторами.
Отдельное внимание в документации заслуживает алгоритм NevaBoost, который, судя по всему, играет значительную роль в определении ранжирования, предоставляя новые подходы к оценке пользовательского опыта и взаимодействия.
Внешние ссылки
Документ содержит обширную информацию о роли ссылок в ранжировании сайтов, подчеркивая их значимость как стабильный и эффективный сигнал для поисковых систем. Вот ключевые выводы из этой информации:
- Ссылки продолжают оставаться критически важным элементом для ранжирования сайтов, и данные указывают на то, что их роль не уменьшается. Это означает, что инвестиции в качественное ссылочное окружение остаются актуальными.
- Качество ссылок оценивается на основе доверия к главной странице сайта-донора. Следовательно, нет смысла наращивать большое количество низкокачественных ссылок с сайтов сомнительного содержания.
- Эффективность ссылки также зависит от кликов и трафика генерируемого сайтом-донором, что делает бесполезными дешёвые покупки ссылок с неактивных ресурсов.
- Google активно борется со ссылочным спамом, классифицируя анкоры на спамные и неспамные. Сайты с высоким процентом спамных анкоров в анкор-листе могут подвергнуться санкциям, хотя умеренное количество спамных ссылок ещё допускается.
- Поисковая система отслеживает скорость нарастания ссылочной массы и может наказать за слишком быстрое и массовое появление новых ссылок.
- Исключение сделано для новых сайтов, которые защищены от негативного воздействия большого числа первоначальных ссылок, предполагая, что это может быть результатом активных PR-кампаний.
- Ссылки с авторитетных СМИ по умолчанию считаются качественными.
- Для сайтов с высоким уровнем доверия даже спамные анкоры могут трактоваться как не спамные, что указывает на определённый дисбаланс в восприятии авторитетности ресурсов.
Таким образом, стратегия построения ссылок остаётся важной частью SEO, требующей внимания к качеству и источнику ссылок, а также к модерации их прироста.
Контент
Метатеги, включая заголовки и описания страниц, сохраняют свою значимость и не должны упускаться из виду. Согласно документу, Google применяет продвинутые технологии обработки естественного языка (NLP) для анализа тем и подтем текста, а также для оценки полноты покрытия статьей всех необходимых аспектов поискового запроса.
Поисковик также способен распознавать оригинальный контент в статье, включая уникальные мысли и мнения автора, отличая их от простого переписывания уже существующих текстов. К тому же, Google отслеживает время последнего обновления страницы и может определить, были ли внесены значимые изменения в контент или же была произведена лишь поверхностная корректировка даты обновления.
Что именно произошло
27 мая 2024 эксперт в области SEO Рэнд Фишкин рассказал, что сотрудники Google поделились с ним внутренней документацией, описывающей работу поискового алгоритма компании. Однако сам IT-гигант не намерен комментировать утечку.

Другой эксперт, Майк Кинг, опубликовал подробности утечки. По его мнению, кто-то из стажёров Google по ошибке автоматически опубликовал документацию на GitHub. Судя по истории коммитов, соответствующий код был добавлен в марте 2024 года.

Всего в документации описано более 14 тысяч атрибутов.
Фишкин утверждает, что источник передал ему 2,500 страниц документов в надежде, что сообщение об утечке поможет опровергнуть «ложь», которой поделились сотрудники Google о работе алгоритма. По его словам, в документах описывается поисковый API Google и разбирается, какая информация доступна сотрудникам.
Детали, которыми поделился Фишкин, носят технический характер. Утечка описывает, какие данные Google собирает с веб-страниц, сайтов и поисковых систем, и даёт косвенные подсказки экспертам по SEO о том, на чём делает акцент компания.
Так, в ней описывается, как и какие данные собирает и использует Google, какие сайты по деликатным темам ранжируются лучше, как Google обрабатывает небольшие веб-сайты и многое другое. По словам экспертов, некоторые из этих данных противоречат публичным заявлениям представителей Google. Они также отмечают, что алгоритм Google — это, по сути, серия микросервисов, в которых многие функции предварительно обрабатываются и становятся доступными во время выполнения для формирования результатов поиска.
Один из примеров Фишкина демонстрирует, используются ли вообще данные Google Chrome для ранжирования. Представители компании неоднократно заявляли, что они не учитывают такие данные. Однако Chrome упоминается в разделах, посвящённых отображению веб-сайтов в поиске.
Кроме того, там упоминается система NavBoost, которая подсчитывает клики, сегментирует данные по странам и устройствам, оценивает отдельно домены, поддомены и URL-адреса. Также может применяться модификатор Panda, который оценивает сайты на основе нескольких показателей, связанных с поведением пользователей. Этот модификатор можно применять на уровне домена, поддомена или подкаталога. Суть в том, что для лучшей выдачи нужно получать больше кликов, используя более широкий набор запросов.

Ещё один вопрос заключается в том, какую роль играет E-E-A-T в ранжировании. E-E-A-T (опыт, знания, авторитетность и надёжность) — показатель Google, используемый для оценки качества результатов. Представители компании ранее заявляли, что E-E-A-T не является фактором ранжирования. Однако в документах он есть. E-E-A-T позволяет понижать выдачу при ссылках на нерелевантный сайту контент и отсутствие привязки по геолокации.
Однако эксперты рассказали, как Google собирает данные об авторе со страницы и верифицирует его. В основном, это работает для новостных статей и научных публикаций. Не факт, что авторство играет роль в ранжировании, однако Google, по крайней мере, отслеживает этот атрибут. Представители компании ранее настаивали на том, что авторство не влияет на рейтинг. Атрибут «siteAuthority», очевидно, предназначен для ранжирования источников по авторитетности.

Кроме того, в работе алгоритма, похоже, используется функция Twiddlers для переранжирования. Она работает аналогично фильтрам и действиям в WordPress. Twiddlers может предлагать ограничения по категориям и даже убирать из поиска небольшие сайты.
При этом файловая система Google способна сохранять версии страниц с течением времени подобно Wayback Machine. Вероятно, при обработке данных рассматриваются только 20 последних версий страницы.
Наконец, Google подсчитывает количество токенов и соотношение общего количества слов в тексте к количеству уникальных токенов. Существует максимальное количество токенов, поэтому авторам следует размещать наиболее важный контент как можно выше. Длинные заголовки страниц не подходят для увеличения количества кликов, но они работают для повышения рейтинга.

Фишкин указывает на проблему, связанную с тем, что многие издатели контента никогда не сомневались в поисковой политике Google: «Исторически сложилось так, что некоторые из самых громких голосов поисковой индустрии и наиболее плодовитые издатели были счастливы повторять публичные заявления Google. Они пишут заголовки типа “Google утверждает, что XYZ — правда”. Факты говорят об обратном».
Как отмечает Григорий Бакунов, в поисковике есть отдельная песочница для новых сайтов, а также напрямую используются данные из EWOK — системы, в которой пользователи за деньги оценивают, какой вариант выдачи в поиске лучше. Кроме того, по количеству кликов на странице сайты делятся на 3 категории с соответствующим рангом качества. По словам эксперта, именно клики и навигация по сайту играют главную роль в ранжировании ресурсов, поэтому для большинства мелких компаний и сайтов SEO почти не играет роли, если не выстроен бренд.
Изначально в Google не отвечали на запросы The Verge относительно документов и не стали опровергать их реальность. Фишкин сообщил, что компания не оспаривала достоверность утечки, но её сотрудник попросил его изменить некоторые формулировки.