
# Робот осваивает новые навыки за 29 секунд по одному видео — без переобучения нейросети
Исследователи из группы, связанной с X Square Robot, представили метод HOST (Human-to-robot One-Shot Skill AcquisiTion), который позволяет роботу перенять человеческий навык после просмотра всего одной видеозаписи. Система не требует дообучения модели или многократных повторений — достаточно единственной демонстрации, чтобы алгоритм понял, что нужно делать.
Среднее время «усвоения» новой задачи составило 29 секунд, а успешность с первой попытки достигла 62%. Показатель, разумеется, далёк от промышленных стандартов, где требуется надёжность 95% и выше, но сам принцип кардинально отличается от традиционных подходов. Вместо того чтобы использовать демонстрацию как новый обучающий набор, HOST превращает её в контекстный запрос для уже обученной и зафиксированной модели. Веса нейросети остаются неизменными — именно это и обеспечивает молниеносную скорость адаптации.
Технически процесс выглядит следующим образом. Система анализирует видео с человеком, выполняющим задачу — скажем, перекладывание объекта из одной ёмкости в другую, — и определяет, на каком этапе процесса находится демонстратор. Затем алгоритм проецирует эту стадию на «восприятие» робота, переводя человеческие движения и сенсорные сигналы в систему координат самой машины. После этого HOST генерирует последовательность действий, которая должна привести робота к аналогичному результату. Одна демонстрация — один проход, без циклов оптимизации и дополнительных итераций.
Сравнительные тесты показывают впечатляющую разницу в эффективности. Без каких-либо подсказок (zero-shot) робот справлялся лишь в 17% случаев. Традиционная тонкая настройка модели на 50 демонстрациях для каждой конкретной задачи давала более высокую точность, но требовала в 507 раз больше времени, чем HOST. При этом метод обходит zero-shot на 45 процентных пунктов, что демонстрирует его практическую ценность. Однако 62% успеха означают, что почти в четырёх случаях из десяти робот ошибается, и это серьёзное ограничение.
Важно отметить, что эксперименты проводились на собственных платформах разработчиков с типовыми задачами. Метод не проверяли н� сторонних роботах, в незнакомых помещениях или с объектами другой формы и текстуры. Это оставляет открытым вопрос о генерализации подхода. Для промышленных применений, где цена ошибки высока, 62% — категорически неприемлемый результат.
Тем не менее сама архитектурная идея заслуживает внимания. Использование замороженной политики с управлением на этапе вывода через контекстные подсказки — это принципиально иной путь, чем бесконечное дообучение на размеченных наборах данных. Если другие исследовательские группы смогут воспроизвести результаты на разных робототехнических платформах и поднять успешность до 85–90% за счёт улучшения модуля оценки прогресса, HOST имеет все шансы стать новым стандартом для быстрой перенастройки промышленных манипуляторов. Но до этого момента метод остаётся скорее многообещающей научной демонстрацией, чем готовым инструментом для производства.
