Два кита рекомендаций: фильтрация по контенту и по поведению
В основе любой рекомендательной системы лежат два фундаментальных подхода, которые математики и программисты комбинируют между собой. Первый подход называется контентной фильтрацией (content-based filtering). Система разбирает сам ролик на составляющие: считывает текст в описании, теги, субтитры, распознает речь через транскрибацию, а компьютерное зрение классифицирует объекты в кадре. Если ты часто смотришь ролики про сборку механических клавиатур или разборы задач по физике, алгоритм находит новые видео с похожими метаданными и аудиодорожками.
Контентный метод имеет жесткое ограничение. Он замыкает человека в узком пузыре уже знакомых тем и ничего не знает о качестве самого материала. Компьютер видит, что перед ним пятиминутный ролик о программировании на Python, но не способен сам по себе понять, полезный он или скучный. Здесь в игру вступает второй подход — коллаборативная фильтрация (collaborative filtering).
Коллаборативная фильтрация отталкивается от поведения аудитории. Математически она строится на матрицах взаимодействия, где по строкам расположены пользователи, по столбцам — ролики, а на пересечениях стоят оценки или факты взаимодействий. Алгоритм вычисляет скрытые векторы интересов. Если твои реакции на сотню разных видео совпали с реакциями условного пользователя из другого города, система считает вас математическими соседями. Когда этот человек находит новый интересный ролик и досматривает его до конца, платформа сразу предлагает его тебе, даже если тема видео для тебя абсолютно нова.
Архитектура рекомендаций в YouTube: отбор кандидатов и ранжирование
Инженеры Google опубликовали классическую архитектуру рекомендаций YouTube в виде двухступенчатой воронки на базе глубоких нейронных сетей. База сервиса содержит миллиарды видео, поэтому обработать весь массив сложными вычислениями для каждого зрителя за миллисекунды технически невозможно. Процесс разделен на два этапа.
- Генерация кандидатов отсекает 99,99% контента и оставляет всего несколько сотен потенциально подходящих роликов с помощью нейросети отбора, опираясь на недавнюю историю просмотров, поисковые запросы и демографические признаки.
- Глубокое ранжирование присваивает каждому кандидату числовой балл полезности, детально сопоставляя контекст пользователя, превью, процент кликабельности и ожидаемую продолжительность просмотра.
- Финальная калибровка перемешивает видео разных авторов, добавляет долю свежих публикаций для тестирования и убирает ролики, которые зритель уже пролистывал без клика.
Для YouTube главной метрикой долгое время оставалось суммарное время просмотра (watch time), дополненное показателем удовлетворенности (satisfaction score). Оценка вычисляется через прямые опросы пользователей прямо в интерфейсе сервиса, процент досмотра длинных видео и поведение после ролика. Если зритель закрыл вкладку в раздражении сразу после клика на яркое превью, алгоритм расценивает это как кликбейт и понижает ролик в выдаче.
Механизм TikTok: микрообратная связь и моментальное обучение
TikTok использует схожие принципы машинного обучения, но адаптировал их под сверхбыстрый темп коротких роликов. Сервис не ждет, пока человек проведет на платформе полчаса. Модель получает сигнал каждые 5-15 секунд, фиксируя микропараметры взаимодействия.
Пока ты свайпаешь ленту, приложение непрерывно регистрирует десятки параметров: скорость пролистывания, задержку пальца на экране, факт включения звука, переход в профиль автора, чтение комментариев и повторный просмотр одного и того же фрагмента (loop rate). Полный досмотр и зацикливание короткого видео служат самым мощным положительным сигналом для распределительной системы.
Каждое новое видео TikTok сначала отправляет на тестовый показ небольшой группе зрителей, которая насчитывает от ста до нескольких сотен человек. Если процент удержания и пересылок среди них превышает статистический порог, алгоритм масштабирует ролик на группу из нескольких тысяч зрителей со схожими интересами. При повторном успехе видео выходит на миллионные охваты. Благодаря такой цепочке аккаунт с нулевым числом подписчиков способен набрать миллионы просмотров за сутки.
Частые вопросы
Влияет ли количество подписчиков на попадание видео в рекомендации?
В TikTok число подписчиков почти не определяет вирусность ролика, система тестирует каждую публикацию независимо от статуса создателя. На YouTube подписчики дают начальный толчок, обеспечивая первые просмотры и сигналы вовлеченности, но если качество удержания аудитории низкое, алгоритм прекращает рекомендовать видео широкой аудитории.
Что делать, если лента рекомендаций замусорилась ненужными темами?
Платформы моментально перестраивают математический профиль при активных действиях. Достаточно перестать досматривать нежелательные видео, нажимать кнопку «Не интересует» или очистить историю просмотров в настройках аккаунта. Через 20-30 минут активного взаимодействия со свежим контентом весовые коэффициенты нейросети полностью обновятся.
Почему алгоритмы часто рекомендуют старые видео?
Нейросети YouTube оптимизируют удовлетворенность зрителя, а не дату выхода файла. Если архивный ролик пятилетней давности стабильно удерживает внимание аудитории и отвечает на текущий интерес пользователя, модель ранжирования ставит его выше свежих, но менее качественных материалов.
Как алгоритмы отличают кликбейт от хорошего контента?
Системы анализируют разрыв между показателем кликабельности обложки (CTR) и средним временем просмотра. Если яркая картинка привлекает зрителей, но большинство из них выключает видео в первые десять секунд, алгоритм штрафует публикацию и снижает показы в ленте.