Архитектура классического рекомендательного конвейера

Ни один сервис с миллиардной аудиторией не способен прогнать всю базу контента через сложную нейросеть в реальном времени. Если бы сервер пытался рассчитать вероятность клика для каждого из миллиарда роликов при каждом обновлении ленты, инфраструктура мгновенно бы легла от вычислительной перегрузки. Поэтому инженеры разделяют пайплайн рекомендаций на три последовательных шага.

  1. Отбор кандидатов снижает пространство поиска с десятков миллионов до нескольких сотен или тысяч релевантных видео за миллисекунды с помощью легких векторных поисковиков.
  2. Ранжирование оценивает отобранный пул роликов тяжелой нейросетью, которая вычисляет вероятность целевых действий вроде досмотра, лайка или комментария.
  3. Финальная калибровка применяет бизнес-правила, удаляет дубликаты, исключает ролики от одного и того же автора подряд и подмешивает новый исследовательский контент для разнообразия.

Эволюция подходов от матриц к глубоким нейросетям

Раньше сервисы полагались на классическую коллаборативную фильтрацию. В ее основе лежала разреженная матрица взаимодействий, где строки представляли пользователей, столбцы обозначали ролики, а на пересечении стояли оценки или факты просмотров. С помощью сингулярного разложения матрицу факторизовали, находя скрытые факторы сходства. Метод отлично находил закономерности вида «зрителям фильма А также понравился фильм Б», но страдал от проблемы холодного старта, когда для нового пользователя или свежего ролика попросту не было накопленной статистики.

Контентный анализ пытался решить эту проблему через изучение свойств самого медиафайла. Алгоритмы извлекали метаданные, теги, ключевые слова из описания, а позже научились распознавать лица в кадре и транскрибировать аудиодорожку через распознавание речи. Зная, что человек часто смотрит обзоры видеокарт, система подбирала видео со схожим текстовым и аудио-следом.

Современные платформы объединили эти идеи в двухбашенных нейросетевых архитектурах (Two-Tower models). Первая башня нейросети обрабатывает вектор признаков пользователя, включая его недавние действия, тип устройства, время суток и язык. Вторая башня параллельно сжимает в вектор признаки видео, такие как тема, эмбеддинг звуковой дорожки, автор и статистика вовлеченности за первый час. На выходе обе башни выдают плотные векторы одинаковой размерности. Близость интересов пользователя и сути ролика вычисляется через косинусное расстояние или скалярное произведение этих векторов, что позволяет алгоритмам мгновенно находить пересечения в многомерном пространстве.

Специфика алгоритма YouTube

YouTube исторически развивался как видеоархив, где зрители целенаправленно ищут длинный контент или выбирают ролики по превью. Фундаментом современной системы рекомендаций стала архитектура Deep Neural Networks for YouTube Recommendations, представленная инженерами Google в 2016 году, которую впоследствии дополнили мультизадачными моделями класса MMoE (Multi-gate Mixture-of-Experts).

Главный приоритет YouTube — совокупное время просмотра и долгосрочная ценность сессии. Система прогнозирует не просто нажатие на значок видео (CTR), но и то, сколько минут зритель проведет за экраном после клика. Если ролик кликабельный, но зрители уходят на пятнадцатой секунде, модель понижает его в выдаче из-за подозрения на кликбейт.

Помимо этого, алгоритм анализирует граф переходов между роликами, глубину погружения в каналы и сигналы явного недовольства, включая нажатия кнопок «Не интересует» или «Не рекомендовать видео с этого канала». Платформа также калибрует выдачу микроопросами прямо в ленте, пытаясь напрямую измерить ощущение полезности потраченного времени.

Специфика алгоритма TikTok

TikTok изначально создавался под вертикальный экран и непрерывный поток, где между зрителем и контентом нет барьера в виде клика по миниатюре. Здесь пользователь потребляет видео пассивно, а каждое его микродействие транслируется на сервер в режиме реального времени. Архитектура ByteDance под названием Monolith опирается на терабайтные разреженные таблицы эмбеддингов и обновляет веса модели онлайн буквально на лету.

Если на YouTube факт начала просмотра требует волевого решения пользователя, то в TikTok просмотр начинается автоматически. Поэтому алгоритм следит за совершенно другими метриками.

  • Скорость свайпа сигнализирует о скуке, если ролик перелистнули в первые полторы секунды.
  • Процент досмотра отражает базовый интерес к теме.
  • Количество повторных циклов воспроизведения считается самым мощным позитивным фактором ранжирования.
  • Переход в профиль автора, сохранение в избранное и отправка видео через личные сообщения показывают готовность зрителя ассоциировать себя с этим контентом.

Холодный старт в TikTok устроен агрессивно. Любое новое видео сразу после базовой модерации отправляется тестовой выборке из нескольких сотен зрителей. Если метрики удержания и досмотров в этой выборке превышают пороговые значения, алгоритм пускает ролик на следующий круг, увеличивая аудиторию в геометрической прогрессии.

Управление пользовательским опытом и пузыри фильтров

Обе платформы сталкиваются с дилеммой исследования и эксплуатации (Exploration vs Exploitation). Если система будет предлагать исключительно то, что пользователь уже любит (Exploitation), лента станет предсказуемой и быстро наскучит. Человек попадет в информационный пузырь или эхо-камеру, где циркулируют одинаковые идеи и форматы. С другой стороны, если показывать слишком много нового и экспериментального контента (Exploration), у пользователя упадет среднее время сессии из-за постоянных промахов алгоритма.

Математически эту задачу решают с помощью алгоритмов многоруких бандитов (Multi-Armed Bandits) и методов обучения с подкреплением (Reinforcement Learning). Алгоритм непрерывно балансирует между удержанием в текущей зоне комфорта и попытками подмешать неожиданные темы для проверки реакции. Если пользователь задерживает взгляд на новом жанре, модель начинает плавно расширять кластер его интересов.

Частые вопросы

Имеют ли значение хештеги для продвижения видео сегодня?

Значение хештегов заметно снизилось. Современные алгоритмы компьютерного зрения и обработки естественного языка анализируют речь в ролике, визуальный ряд, текст на экране и реакцию аудитории. Хештеги служат лишь слабой подсказкой на этапе первичной категоризации нового контента при холодном старте.

Почему алгоритм иногда показывает видео с нулевым числом просмотров?

Это запланированная фаза исследования (Exploration). Система обязана тестировать новые загрузки на реальных людях, чтобы оценить их потенциал. Без показа видео без просмотров платформа превратилась бы в закрытый клуб популярных каналов, лишая новых авторов шанса на органический рост.

Что важнее на YouTube: процент удержания или абсолютная длительность?

Алгоритм стремится максимизировать общее время просмотра, поэтому длинные видео обладают скрытым преимуществом. Удержание 50% на сорокаминутном выпуске дает платформе двадцать минут внимания, что для рекламной бизнес-модели ценнее, чем 90% удержания на двухминутном клипе.

Можно ли полностью сбросить рекомендации и обучить ленту заново?

Да, для этого достаточно очистить историю просмотров и поисковых запросов в настройках аккаунта. Вектор твоего профиля в пространстве признаков обнулится, и платформа перейдет в режим базового холодного старта, предлагая усредненный трендовый контент для твоего региона.