Как DeepDive узнает актеров
Сервис работает на базе сложной системы нейронных сетей, которые анализируют видеопоток и сопоставляют информацию с огромной базой данных. Процесс идентификации людей в кадре состоит из трех последовательных этапов.
Сначала алгоритм определяет, есть ли на изображении человек. Затем система переходит к созданию цифровой сигнатуры — многомерного вектора, который описывает уникальные черты внешности. На этом этапе принципиально не используются параметры одежды или причесок, работа идет только с геометрией лица. Это сделано для того, чтобы соблюсти компромисс между ресурсозатратностью и точностью распознавания.

Полученный вектор сопоставляется с базой данных Кинопоиска. Пока только с ней, чтобы снизить вычислительную нагрузку. Алгоритм сравнивает список артистов, задействованных в конкретной ленте, анализирует фотографии в их профилях и ищет совпадения с созданной сигнатурой. Если нейросети не удается получить точный результат, задачу передают профессиональным редакторам, которые проверяют данные по внешним источникам, включая IMDb и поисковики.
Как система слышит музыку
Распознавание аудио происходит по схожему принципу, хотя в этом случае задействуют другие модели машинного обучения:
- Сначала одна нейросеть отделяет композицию от посторонних шумов — разговоров, звуков природы, города.
- Далее выделенный фрагмент анализируется второй моделью, которая строит спектрограмму звука, учитывая его тоны и обертоны.
- Полученная звуковая сигнатура сравнивается с эталонными записями в библиотеке Яндекс Музыки. Если композиция найдена, можно сразу добавить ее в свой плейлист.

Трудности распознавания
Если песня исполняется персонажем фильма без музыкального сопровождения, созданная спектрограмма сильно отличается от оригинала, и алгоритм может не найти совпадений.
С идентификацией лиц также могут возникнуть нюансы. Например, когда актер находится в тени, снимается сбоку, использует сложный грим, или в профиле установлено старое фото, а в настоящее время артист намного старше. Поэтому, если внешность сильно изменена, DeepDive может не справиться. Также сложности возникают при распознавании актеров массовых сцен, так как получить фотографии всех участников практически невозможно.

Применение технологии за пределами кино
Хотя DeepDive создан специально для Кинопоиска, его отдельные компоненты уже востребованы в других сферах. Так, технология работы с лицевыми сигнатурами использовалась в сервисе Яндекс Такси для предотвращения мошенничества и проверки личности водителей. Наработки по компьютерному зрению находят применение и в других проектах компании, где требуется идентификация объектов.
Вектор развития
Разработчики планируют расширять возможности системы, делая ее более точной. В перспективе — создание следующих функций:
- Распознавание по форме головы — позволит идентифицировать актера, даже если он стоит спиной к камере.
- Чтение титров — поможет автоматически собирать списки актеров прямо из финальных кадров фильма.
- Текстовое описание происходящего в кадре — для удобной навигации по контенту.
- Пополнение архива фотографий актеров из зарубежных проектов для корректной работы с иностранными лентами.
