Как устройство понимает, что зовут именно его

Колонка или смартфон слушают окружающий мир постоянно, но делают это в пределах собственного микропроцессора. Внутри устройства работает маленькая и энергоэффективная нейросеть, обученная реагировать исключительно на ключевую фразу вроде «Привет, Алиса» или «Hey Siri». Эта фраза называется активационным словом или споттером.

Пока ключевая фраза не прозвучала, прибор держит в памяти только последние пару секунд звука, непрерывно перезаписывая их по кругу. Запись никуда не уходит. Как только процессор распознает знакомое сочетание звуков, устройство просыпается, зажигает световую индикацию и начинает передавать дальнейшие звуки на сервер через интернет.

Путь команды от звука к действию

После активации начинается сложный многоступенчатый процесс. Чтобы выполнить просьбу включить музыку или завести таймер, компьютеры выполняют пять последовательных операций.

Очистка звука и фильтрация шума

В комнате почти никогда не бывает полной тишины. Голос звучит на фоне работающего телевизора, гудящего холодильника или шума за окном. В современных умных колонках установлено от двух до семи микрофонов, расположенных по кругу. Они улавливают звук с мизерной разницей во времени, что позволяет процессору вычислить направление источника речи и заглушить все фоновые помехи. Этот метод называют формированием направленного луча. Очищенный аудиопоток оцифровывается и отправляется в облако в виде спектрограммы, визуального рисунка звуковой волны.

Превращение звуковой волны в текст

На сервере аудиозапись попадает в систему автоматического распознавания речи, которую специалисты называют ASR. Здесь работают две нейросети. Акустическая модель сопоставляет фрагменты звуков с фонемами, минимальными звуковыми частицами языка. Языковая модель проверяет вероятность того, как слова складываются в предложения, исправляя ошибки созвучия. Например, фраза «мыло упало» по звукам похожа на «мило у палы», но языковая модель выбирает грамматически осмысленный вариант.

Понимание смысла сказанного

Получить строку текста недостаточно, компьютеру нужно понять намерение человека. Этим занимается модуль понимания естественного языка, известный как NLU. Задача системы заключается в том, чтобы разбить предложение на две составляющие, интент и сущности.

Интент определяет общее намерение пользователя, например, узнать погоду, включить свет или запустить игру. Сущности выступают конкретными переменными данными внутри этого намерения. Если ты говоришь «поставь будильник на завтра на семь утра», интентом становится запуск будильника, а сущностями будут дата и конкретное время.

Выполнение команды и поиск данных

Когда намерение определено, управляющая программа обращается к соответствующему сервису. Если вопрос касается фактов, запускается поиск в поисковой системе или базе знаний. Если запрошена музыка, алгоритм обращается к музыкальной платформе и формирует ссылку на трек. Если нужна информация о пробках, опрашиваются картографические серверы.

Генерация ответа и синтез голоса

Финальный этап возвращает результат пользователю. Система формирует текстовый ответ и передает его в модуль синтеза речи, называемый TTS. Современный синтез речи строится на глубоких нейросетях. Сначала диктор начитывает в студии десятки часов текстов с разными эмоциями, а затем алгоритм учится воспроизводить этот голос, правильно расставляя ударения, паузы и меняя интонацию в зависимости от контекста. Готовый аудиофайл передается обратно на колонку или смартфон и звучит из динамика.

Разница подходов на примере Алисы и Siri

Компания Apple представила Siri в 2011 году, сделав ставку на глубокую интеграцию с операционной системой смартфона. Siri прекрасно взаимодействует с базовыми функциями iPhone: звонками, напоминаниями, системными настройками и умным домом Apple HomeKit. Значительную часть простых запросов современные устройства Apple обрабатывают прямо на встроенном процессоре без отправки записи на сервер, что обеспечивает высокую скорость выполнения базовых задач и сохранность личных данных.

Алиса появилась в 2017 году и разрабатывалась Яндексом с изначальным прицелом на русскую речь. Русский язык сложен для машинной обработки из-за гибкого порядка слов в предложении и огромного количества окончаний. Алису научили хорошо удерживать контекст длительного диалога, шутить, поддерживать разговор на свободные темы и работать с десятками русскоязычных сервисов, от заказа такси до доставки продуктов. Позже в систему встроили большие языковые модели семейства YandexGPT, благодаря чему помощник научился придумывать тексты и объяснять сложные школьные правила своими словами.

Частые вопросы

Почему голосовому помощнику обязательно нужен интернет?

Нейросети для распознавания речи, поиска смысла и синтеза качественного голоса весят десятки гигабайтов и требуют мощных видеокарт для вычислений. Компактная умная колонка или смартфон не вмещают столь тяжелые модели, поэтому основные расчеты производятся на удаленных серверах.

Как помощник отличает голос владельца от чужого?

В системе используется технология голосовой биометрии. При знакомстве помощник просит произнести несколько контрольных фраз и строит слепок голоса, учитывающий тембр, частоту и манеру речи. При следующих командах алгоритм сравнивает входящий звук с сохраненным шаблоном.

Почему ассистент иногда отвечает невпопад?

Сбой может произойти на двух этапах. Сначала система ASR может неверно разобрать слово из-за шума или дикции. Затем система NLU может ошибиться при определении намерения, если фраза построена двусмысленно или содержит сленг, которого пока нет в базе данных помощника.

Могут ли помощники работать полностью без интернета?

Некоторые устройства умеют выполнять простейшие офлайн-команды на встроенном чипе, например, включить таймер, переключить трек или сделать звук тише. Любые запросы к фактам, погоде или стриминговым сервисам требуют обязательного подключения к глобальной сети.