130М-трансформер находит пульт, полотенце и зарядку — как AIRI научила робота искать что угодно
Как 130М-трансформер OVSegDT решает open-vocabulary навигацию без глубины и одометрии — архитектура, обучение, метрики и подводные камни

Классические навигационные модели знают десяток фиксированных категорий: стул, диван, кровать. Скажи роботу «найди зарядку» — он зависнет. Команда AIRI и МФТИ решила эту проблему без глубинных сенсоров, одометрии и GPT-обёрток — только 130М-параметровый трансформер и бинарные маски. Вот как это работает и как запустить самостоятельно.
Зачем вообще нужна навигация с открытым словарём
Стандартная ObjectNav — задача, где робот ищет объект из заранее заданного списка — плохо переносится на реальный мир. Человек не будет выбирать цель из выпадающего меню: он скажет «подъедь к коробке с инструментами» или «принеси кружку с кухни».
Open-vocabulary object-goal navigation (впервые формально предложена в работе HM3D-OVON) снимает это ограничение: робот получает произвольный текстовый запрос и должен найти объект в незнакомой среде. Это базовый навык для мобильной манипуляции — прежде чем взять или переместить предмет, нужно до него добраться.
Что такое HM3D-OVON и почему метрики там считаются честно
Бенчмарк HM3D-OVON разбивает категории на четыре сплита:
- train — категории, на которых агент обучается
- val seen — те же категории, но в новых сценах
- val seen synonyms — знакомые категории, названные синонимами или альтернативными словами
- val unseen — категории, которых не было в обучении вообще
Последний сплит — самый важный. Именно он показывает, умеет ли модель переносить навык на новые типы объектов, а не просто запомнила ли обучающую выборку. OVSegDT достигает на val unseen 44.7% SR (success rate) и 20.6% SPL (success weighted by path length) — при этом без глубины, одометрии и больших визуально-языковых моделей.
Архитектура: что внутри OVSegDT
Главная идея — связать навигационную стратегию с семантическим пониманием сцены через бинарную маску целевого объекта. Работает это на двух уровнях.
На уровне архитектуры. Бинарная маска целевого объекта кодируется как часть наблюдения агента. Семантический энкодер маски встроен прямо в пространство наблюдений стратегии — агент видит явную подсказку о том, где в текущем кадре вероятно находится цель. Маска может быть шумной (от реальной модели сегментации) — система устойчива к этому по дизайну.
На уровне обучения. OVSegDT параллельно решает задачу сегментации: вспомогательная функция потерь считается между восстановленной бинарной маской и истинной маской целевого объекта в текущем кадре. Для восстановления маски используется лёгкий декодер на основе DCGAN — он достаточно эффективен, чтобы обучение оставалось быстрым прямо в среде.
Агент также получает семантическую награду — дополнительный сигнал, который поощряет правильное понимание сцены, а не только факт достижения цели.
Как запустить OVSegDT на своих данных
Исходный код и предобученные веса открыты — ссылки есть на странице проекта OVSegDT.
Шаг 1. Клонируйте репозиторий и установите зависимости
``bash git clone https://github.com/AIRI-Institute/OVSegDT cd OVSegDT pip install -r requirements.txt ``
Шаг 2. Скачайте предобученные веса
Ссылка на веса есть в README проекта. После скачивания положите файл в директорию checkpoints/:
```bash mkdir -p checkpoints
скачайте веса по ссылке из README и поместите сюда
mv ovsegdt_weights.pth checkpoints/ ```
Шаг 3. Запустите инференс в симуляторе Habitat
Бенчмарк HM3D-OVON работает поверх симулятора Habitat. Убедитесь, что он установлен, затем запустите оценку:
``bash python eval.py \ --config configs/ovsegdt_eval.yaml \ --checkpoint checkpoints/ovsegdt_weights.pth \ --split val_unseen ``
Шаг 4. Запуск на реальном роботе
Авторы предусмотрели возможность запуска на реальном железе — инструкции по адаптации к собственному сенсорному сетапу описаны в разделе real_robot/ репозитория. Минимальный сетап: RGB-камера без глубины, без одометрии.
Шаг 5. Проверьте качество на своих категориях
Если хотите протестировать на собственных текстовых запросах, передайте их через конфиг:
```yaml
configs/custom_eval.yaml
task: goal_sensor_uuid: objectgoal object_category: "зарядное устройство" # любой текстовый запрос ```
Почему обучение начинается с имитации, а не с RL
На старте обучения стратегия агента совершает случайные действия — сигнал от reinforcement learning слишком слабый и шумный, чтобы модель могла из него учиться. Поэтому обучение начинается с имитации поведения эксперта (behaviour cloning): алгоритм прокладывает маршрут, пусть и субоптимальный, но достаточно надёжный для начальной базы. Только после того как стратегия набирает устойчивость, в игру вступает RL с семантической наградой.
Где это ломается
Сильно захламлённые сцены. Если объект частично перекрыт или маска от сегментатора даёт много ложных срабатываний, агент может зациклиться — он видит «подсказку» там, где объекта нет.
Очень редкие категории. Val unseen покрывает широкий диапазон бытовых предметов, но узкоспециализированные объекты (промышленный инвентарь, медицинское оборудование) модель не видела ни в каком виде — качество сегментации там падает, и навигация деградирует вместе с ней.
Отсутствие одометрии — палка о двух концах. Модель не зависит от одометрии, что упрощает сетап, но и не накапливает карту пространства. В больших помещениях с длинными коридорами это может приводить к избыточному блужданию.
Симулятор vs реальный мир. Sim-to-real gap никуда не делся: текстуры, освещение и физика Habitat отличаются от реального окружения. Авторы предоставляют инструкции для реального робота, но дополнительная доводка под конкретное железо почти наверняка потребуется.
Что попробовать дальше
Если тема open-vocabulary навигации актуальна для вашего проекта, логичные следующие шаги: изучить бенчмарк HM3D-OVON в деталях, посмотреть на альтернативные подходы с явным построением семантических карт (например, на основе CLIP-фич), а также поэкспериментировать с заменой сегментатора — OVSegDT устойчив к шумным маскам, так что можно подключить любую open-vocabulary модель сегментации под конкретный домен.
Источники
Читайте также
Комментарии
Пока никто не написал. Будьте первым.

