Учёные из МФТИ и международных исследовательских центров представили новую технологию стереозрения Un-ViTAStereo. Этот алгоритм позволяет роботам и беспилотным автомобилям видеть мир объёмно и без слепых зон. Как сообщили в пресс-службе МФТИ, Un-ViTAStereo определяет расстояние до объектов, не прибегая к дорогостоящим лидарам и ручной разметке, что делает его более доступным и универсальным.
Алгоритм Un-ViTAStereo обучается с использованием модели Depth Anything V2, которая анализирует один кадр и определяет относительную глубину объектов, распознавая тени, перспективу и перекрытия. Это повышает точность работы системы, поскольку алгоритм отбирает только те предсказания, которые соответствуют подсказкам “наставника”.
Система функционирует в три этапа: проверка каждого пикселя, поиск зелёных соседей для коррекции ошибок и построение контуров с помощью сглаживания диспаратности. Тестирование на датасете KITTI 2015 показало, что доля грубых ошибок в определении расстояний уменьшилась до 5%, что на 23% меньше, чем у традиционных алгоритмов.
Итак, учёные убеждены, что текущая версия Un-ViTAStereo — только начало. В планах создание самообучающейся нейросети, которая будет адаптироваться к различным условиям и сможет повысить точность, используя данные лидаров. Это обещает новые возможности для повышения безопасности и функциональности автономных систем.
Стереосистемы для беспилотных автомобилей и роботов действуют аналогично человеческому зрению. Однако, как показывает практика, они сталкиваются с проблемами в условиях недостатка визуальных подсказок, например, перед гладкими стенами или в зонах с повторяющимися узорами. Чтобы решить эту проблему, учёные внедрили нейросети «наставника, который оценивал относительную глубину объектов с одного изображения, анализируя тени и перспективу от одного изображения.
Руководитель проекта Александр Дворкович подчеркнул, что алгоритм проверяет каждый пиксель на соответствие подсказкам, маркируя данные и ошибки. На последующих этапах алгоритмы исправляют ошибки, используя информацию от окружающих корректных пикселей. Кроме того, другой алгоритм убирает цифровой шум в однородных областях, обеспечивая чёткость контуров объектов.
Тестирование на стандартных датасетах подтвердило эффективность нового алгоритма, и уже сейчас он демонстрирует сильные результаты, что указывает на его потенциал в практическом использовании. В дальнейшем, учёные нацелены на создание самообучающейся нейросети, которая будет эффективно работать в самых различных условиях, что может значительно изменить подход к автономному вождению и робототехнике.
