Сотрудники Исследовательского центра в сфере искусственного интеллекта МГУ разработали подход для повышения разрешения и визуального качества потокового видео в реальном времени. Работа представлена на международной конференции по обучению репрезентаций (ICLR) 2026 года, которая прошла в Рио-де-Жанейро, Бразилия.
Потоковые видеоплатформы используют сжатие, чтобы передавать видео при ограниченной скорости соединения. Однако из-за этого на изображении могут появляться размытость, блочные искажения и потеря мелких деталей. Методы искусственного интеллекта позволяют повышать разрешение видео, но многие из них обучаются и тестируются на данных, которые не полностью отражают особенности реального потокового видео.
Авторы исследования собрали новый набор данных для изучения этой задачи. В него вошли 5200 видеороликов с открытой лицензией, размещённых в открытом доступе. Они охватывают разные темы, жанры и разрешения. Такой набор позволяет проверять методы повышения разрешения не на искусственно подготовленных примерах, а на данных, близких к реальным условиям просмотра потокового видео.
На основе этого набора исследователи провели сравнение 11 методов повышения разрешения в реальном времени. Они оценивали качество работы моделей по нескольким объективным показателям качества изображения, а также провели пользовательское исследование: участники сравнивали пары видео и выбирали вариант с лучшим визуальным качеством.
Кроме того, авторы предложили собственную модель, оптимизированную для работы в реальном времени. Она сохраняет скорость, достаточную для обработки видео в таком режиме, и при этом лучше восстанавливает детали изображения. Для обучения модели использовалась специальная функция потерь, которая учитывает точность восстановления, особенности зрительного восприятия и сохранение резких границ на изображении.
Расчёты и пользовательское сравнение показали, что предложенный подход улучшает качество потокового видео при сохранении скорости, необходимой для работы в реальном времени. Авторы также показали, что дополнительное обучение других моделей на собранном наборе данных повышает их качество не только на потоковом видео, но и на стандартных проверочных наборах.
«Для потокового видео важно не просто увеличить разрешение кадра, а сделать это быстро и одновременно устранить искажения, возникающие при реальном сжатии. В нашей работе мы постарались приблизить обучение и проверку таких моделей к условиям, с которыми сталкивается зритель при просмотре видео через интернет. Это позволяет точнее оценивать существующие методы и создавать решения, которые лучше работают именно с потоковым видео», — отметил старший научный сотрудник Центра ИИ и факультета ВМК МГУ, руководитель лаборатории «Интеллектуальный анализ видео» Института искусственного интеллекта МГУ Дмитрий Ватолин.
Полученные результаты могут использоваться при разработке систем улучшения качества видео, передаваемого через интернет, а также при создании более точных методов оценки визуального качества. Подготовленный авторами набор данных и результаты сравнения моделей могут быть полезны для дальнейших исследований в области обработки видео и искусственного интеллекта.