Представители НОШ «Мозг, когнитивные системы, искусственный интеллект» предложили подход к формальному определению зрительного образа в произвольной визуальной среде. Работа опубликована в журнале Pattern Recognition and Image Analysis в 2025 году и посвящена одной из базовых задач математической теории распознавания образов.
Распознавание зрительных образов — одна из центральных задач интеллектуальных систем. Несмотря на большое число практических решений в этой области, построение общей математической теории остаётся сложной задачей. Одна из причин состоит в том, что до сих пор нет общепринятого формального определения того, что именно следует считать зрительным образом.
Иными словами, прежде чем строить строгую теорию распознавания образов, нужно математически описать сам объект распознавания: что считать одним образом, его частью, примером того же образа или отдельным образом.
В статье зрительный образ рассматривается как конечный набор изображений, а изображение – как конечный набор точек на плоскости. Такой подход позволяет описывать изображения математически: фигуру, полутоновое изображение или цветное изображение можно представить через наборы точек и их отношения. В работе основное внимание уделено двумерным изображениям, но автор отмечает, что рассуждения могут быть обобщены и на пространства большей размерности.
Предложенный подход строится постепенно. Сначала рассматривается визуальная среда — произвольное изображение, состоящее из конечного числа точек. Затем среди всех возможных частей этой среды выделяются группы, которые могут рассматриваться как образы. Автор описывает три последовательных приближения к такому определению: отдельный образ, полный образ и замкнутый образ.
Первое приближение связано с требованием, чтобы изображения внутри одной группы не пересекались по точкам. Это позволяет исключить случаи, когда одна часть среды одновременно принадлежит разным изображениям и мешает рассматривать их как самостоятельные примеры одного образа.
Второе приближение вводит понятие полного образа. Оно связано с тем, что один и тот же образ можно распознавать по разным наборам примеров. Если несколько групп изображений фактически описывают один и тот же образ и могут быть объединены без потери его структуры, такая более полная группа рассматривается как более подходящее описание образа.
Третье приближение связано с замкнутыми образами. В статье рассматривается, как один образ может содержать существенные части другого образа, как такие части могут продолжаться до более полного образа и как на этой основе можно выделять признаки образа. Это позволяет описывать не только сам образ, но и его внутреннюю структуру.
Для построения определения используются понятия частей изображения, скелета образа и аффинных преобразований. Аффинные преобразования позволяют рассматривать изображения с учётом сдвигов, поворотов, изменения размера, растяжений и сжатий. Такой подход нужен для того, чтобы изучать форму изображения, а не его случайное положение на плоскости.
«При распознавании образов важно не только построить работающий алгоритм для отдельной задачи, но и понять, что именно мы называем образом с математической точки зрения. В работе предложены первые приближения к такому определению: от раздельных групп изображений к полным и затем к замкнутым образам. Это позволяет рассматривать зрительный образ как объект, пригодный для дальнейшего строгого математического исследования», — пояснил Вадим Козлов, профессор кафедры математической теории интеллектуальных систем механико-математического факультета МГУ.
Работа относится к фундаментальным исследованиям в области математической теории распознавания образов и интеллектуальных систем. Её результат может быть полезен для дальнейшего развития математических моделей распознавания зрительных образов.