Meta AI представила модель Pixio для обработки изображений

Исследователи из Meta AI создали инновационную модель обработки изображений под названием Pixio, которая обучается через реконструкцию пикселей. Несмотря на свою простоту и меньшее количество параметров, она показывает лучшие результаты по сравнению с более сложными методами, такими как DINOv2 и DINOv3.

Pixio использует метод маскированного автокодировщика (MAE), который позволяет модели понимать структуру и закономерности изображений, заполняя скрытые области. Исследования показали, что Pixio превосходит DINOv3 в ряде практических задач, таких как оценка монокулярной глубины и 3D-реконструкция.

Команда собрала два миллиарда изображений для обучения, избегая оптимизации под конкретные тестовые наборы, что увеличивает универсальность модели. В конечном итоге, Pixio достигает более высокой точности в 78,4% в задачах, связанных с обучением роботов, по сравнению с 75,3% у DINOv2.

Однако у метода маскировки есть ограничения, и исследователи предполагают, что будущие разработки могут включать обучение на основе видео для более естественной обработки информации. Код модели опубликован на GitHub.