Как робот вообще находит новые страницы

Прежде чем страница появится в результатах поиска, её должен обнаружить специальный робот — программу такого рода называют краулером или поисковым пауком. Робот начинает с уже известных ему адресов и переходит по ссылкам, которые находит на этих страницах, точно так же, как обычный человек кликает по ссылке и попадает на новый сайт. Каждая найденная ссылка добавляется в список адресов для последующего посещения, и этот список постоянно растёт. Владельцы сайтов могут ограничить робота специальным файлом с правилами, который указывает, какие разделы посещать не стоит — например, служебные страницы админки или личный кабинет пользователя. Робот регулярно возвращается на уже известные страницы, чтобы заметить изменения: новый текст, удалённый раздел или полностью исчезнувший сайт.

Индекс — своего рода библиотека для машины

Когда робот скачивает страницу, поисковая система не хранит её как картинку целиком. Из страницы извлекается текст, заголовки, описания изображений, а также служебные сведения вроде даты публикации и адреса. Всё это превращается в компактную запись и сохраняется в собственной базе поисковика — эту базу и называют индексом. Пока страница не попала в индекс, найти её через поиск невозможно, даже если она давно опубликована и прекрасно работает. Причины бывают разные: робот мог её ещё не посетить, содержимое не прошло внутренние проверки поисковой системы, или сам владелец сайта случайно запретил роботу доступ к разделу.

Обратный индекс — почему поиск не перебирает весь интернет заново

Найти страницу по запросу за долю секунды получается благодаря устройству, которое называют обратным индексом. Вместо того чтобы хранить список слов для каждой страницы, поисковик хранит обратное — список страниц для каждого слова, примерно как алфавитный указатель в конце учебника, где рядом со словом стоят номера страниц, где оно встречается. Когда человек вводит запрос, системе не нужно заново читать миллиарды страниц интернета: она заглядывает в готовый список напротив каждого слова запроса и мгновенно получает набор страниц-кандидатов. Дальше эти кандидаты сравниваются друг с другом и выстраиваются в порядок, и вот тут в дело вступает ранжирование.

Ранжирование — как выбирается порядок ответов

Кандидатов на выдачу обычно набирается очень много, и поисковая система должна решить, какие показать первыми. Для этого используется множество сигналов сразу: насколько текст страницы отвечает смыслу запроса, а не просто совпадает по отдельным словам; сколько других сайтов ссылаются на эту страницу и насколько сами эти сайты заслуживают доверия, ведь такая ссылка работает как своего рода голос в пользу качества материала; насколько быстро страница открывается и удобно ли ей пользоваться с телефона. Для одних запросов важна свежесть материала, для других — стабильность и проверенность годами. Точную формулу, по которой все эти сигналы складываются в итоговый порядок, поисковые компании держат в секрете и меняют по несколько раз в год, поэтому предсказать порядок выдачи со стопроцентной точностью не берётся даже специалист по продвижению сайтов.

Многозначность запроса — одно слово, разные смыслы

Часть несовпадений между ожиданием и выдачей объясняется самим языком, а не ошибкой поисковика. Слово «ключ» одинаково честно означает предмет для замка, гаечный инструмент, родник и элемент нотной записи. Когда человек вводит просто «ключ», система вынуждена угадывать, какой смысл имелся в виду у большинства людей, вводивших этот же запрос раньше, и обычно выбирает самый частый для широкой аудитории вариант, а не редкий и специфический. Похожая история со словом «коса»: для одного это причёска, для другого — инструмент для покоса травы, для третьего — узкая полоска суши. Понять, какой смысл нужен именно сейчас, поисковик пробует по остальным словам запроса и по недавней истории поиска на этом устройстве, но угадывает не всегда.

Персонализация и коммерческие страницы в выдаче

Даже один и тот же запрос с двух разных устройств иногда выдаёт разные результаты. Поисковая система учитывает примерное местоположение человека, историю его предыдущих запросов на этом устройстве и даже тип самого устройства — телефон или компьютер. Запрос про пиццерию у человека в одном городе и у человека в другом закономерно покажет разные заведения, хотя формулировка запроса была одинаковой. Отдельная причина смещённой выдачи — конкуренция коммерческих страниц. Магазины и сервисы специально готовят свои страницы под популярные запросы, и если формулировка звучит похоже и на желание купить, и на желание разобраться в теме, в выдаче нередко преобладают именно магазины, а обзорные и справочные материалы оказываются ниже, хотя человек искал объяснение, а не покупку.

Как сформулировать запрос точнее

  • кавычки вокруг фразы — поиск ищет именно такую последовательность слов подряд, а не отдельные слова по всему тексту
  • минус перед словом — исключает страницы, где встречается это слово, удобно отсекать лишний смысл многозначного запроса
  • site: перед адресом сайта — ограничивает поиск страницами только этого одного сайта
  • лишнее уточняющее слово в самом запросе — сужает многозначность быстрее, чем любые специальные операторы

Частые вопросы

Почему поиск иногда не находит страницу, которая точно существует

Скорее всего, робот ещё не посетил эту страницу или не успел добавить её в индекс — на новых сайтах это может занимать время. Реже причина в том, что сам владелец сайта случайно запретил роботу доступ к разделу через файл с правилами, и страница остаётся невидимой для поиска, пока запрет не снимут.

Можно ли повлиять на то, где страница окажется в выдаче

Частично можно: понятный текст по теме запроса, быстрая загрузка страницы и удобство на телефоне помогают ранжированию. Гарантированного способа занять конкретное место в выдаче не существует, потому что итоговый порядок формируется десятками сигналов одновременно, а точный вес каждого сигнала известен только самой поисковой компании.

Почему разные люди видят разную выдачу по одному и тому же запросу

Поисковая система подстраивает результаты под конкретного человека: учитывает примерное местоположение, историю прошлых запросов на этом устройстве и даже тип устройства. Запрос про кафе рядом закономерно даёт разный список заведений в разных городах при абсолютно одинаковой формулировке.

Что означает оператор site в поисковой строке

Этот оператор ограничивает поиск страницами только одного указанного сайта. Например, запрос «расписание site:example.ru» найдёт страницу про расписание именно на этом сайте, а не по всему интернету, что удобно, когда нужная информация точно есть на конкретном ресурсе, но её сложно найти через обычную навигацию.