Как сообщает «The Times», в фильме Джастина Раута «Непробиваемые» был использован ИИ для воссоздания голоса покойного Алена Дорваля, который долгие годы озвучивал Сильвестра Сталлоне на французском языке. Однако дочь актёра, Аурор Берже, выразила недовольство, заявив, что использование голоса произошло без окончательного согласия семьи.

Данные опроса газеты «Комсомольская правда»

Данные опроса газеты «Комсомольская правда»

По данным опроса газеты «Комсомольская правда»: 70 % опрошенных россиян осудили оживление умерших артистов с помощью нейросетей. В специальном интервью для РАПСИ Сергей Матвеев, президент Федерации интеллектуальной собственности, признался, что  считает использование ИИ для воссоздания голосов умерших без согласия наследников нарушением Конституции и Гражданского кодекса РФ, сравнивая это с нелегальной трансплантацией.

Технология создания дипфейка

Как описывается в работе 2024 года «Deepfake Generation and Detection: A Benchmark and Survey»: сначала происходит сбор и обработка данных. Система требует обширного набора изображений лиц, охватывающих различные ракурсы, выражения и условия освещения. Эти изображения проходят предобработку, включая выравнивание лиц, нормализацию освещённости и масштабирование, чтобы обеспечить единообразие входных данных. Потом начинается обучение автоэнкодеров. Автоэнкодеры состоят из энкодера и декодера. Энкодер преобразует входное изображение в низкоразмерное латентное представление, захватывающее существенные особенности лица. Декодер затем восстанавливает изображение из этого представления. Обучение направлено на минимизацию разницы между исходным и восстановленным изображениями, что позволяет модели эффективно кодировать структуру лиц.

Генеративная состязательная сеть для лиц знаменитостей

Генеративная состязательная сеть для лиц знаменитостей

Затем, как сказано в книге 2021 года «Вариационные методы машинного обучения с приложениями к глубоким сетям» начинают работать вариационные автоэнкодеры (VAE). VAE расширяют автоэнкодеры, моделируя латентное пространство как вероятностное распределение, обычно гауссовское. Это позволяет генерации новых, реалистичных изображений лиц путём выборки из латентного пространства. VAE обучаются с использованием функции потерь, включающей как реконструкционную ошибку, так и расхождение Кульбака – Лейблера, обеспечивая баланс между точностью восстановления и регуляризацией латентного пространства. Затем подключаются генеративно-состязательные сети (GAN). GAN состоят из генератора и дискриминатора. Генератор создаёт изображения из случайных латентных векторов, а дискриминатор пытается отличить реальные изображения от сгенерированных. Обе сети обучаются совместно: генератор стремится «обмануть» дискриминатор, а дискриминатор улучшает свои способности к различению. Этот процесс приводит к генерации высококачественных, реалистичных изображений лиц. После обучения энкодер может преобразовывать новые изображения лиц в латентные векторы, которые компактно представляют ключевые особенности лица, такие как форма, выражение и ориентация. Эти векторы могут использоваться для различных задач, включая сравнение лиц, кластеризацию и генерацию новых изображений.

Оживлённый ИИ актёр Галкин в фильме «Диверсант»

Оживлённый ИИ актёр Галкин в фильме «Диверсант»

Как сказано в работе китайских учёных «Реконструкция воспринимаемых изображений лиц на основе мозговой активности на основе многоатрибутивных ограничений», в контексте дипфейков обученные модели могут использоваться для замены лица на видео. Система извлекает латентное представление лица-источника и применяет его к лицу-цели, создавая реалистичную замену. Дополнительные шаги включают синхронизацию губ с аудио и постобработку для устранения артефактов. Таким образом, система «учится» и «понимает» структуру лица путём обучения нейросетей на больших наборах данных, извлекая ключевые особенности и кодируя их в латентные представления, которые затем используются для различных задач, включая генерацию и замену лиц.

Использование и правовые аспекты в России

Как рассказывает в интервью для НИУ ВШЭ культуролог Надежда Маркалова, в России также используется технология дипфейков. Несмотря на это, в профессиональном кино чаще применяются другие методы, основанные на искусственном интеллекте, такие как FaceSwap, performance capture и ShapeShifter. Эти технологии позволяют достоверно воссоздавать внешность и мимику актёров без использования классических дипфейков. Их применение широко варьируется и зависит от задач проекта. По действующим нормам российского права, как описано на сайте «КонсультантПлюс», изображения, на которых можно идентифицировать человека, относятся к биометрическим персональным данным. Их использование допускается только при наличии согласия изображённого лица. Если человек умер, для легального использования его внешности требуется согласие ближайших родственников, что регулируется положениями гражданского законодательства.