Робопёс aibo научится танцевать и ходить практически бесшумно

Credit: Watanabe et al.

Aibo — милый робот-пёс компании Sony — уже умеет делать многое: ходит на четырёх лапах, откликается на имя, реагирует на игрушки и команды, а ещё просит ласки.

Однако группа исследователей из Высшей технической школы Цюриха (ETH Zurich) и корпорации Sony недавно представила два подхода на базе обучения с подкреплением (reinforcement learning, RL), которые могут расширить арсенал робопса. Первый метод предназначен для снижения шума при ходьбе, а второй — для освоения плавных «танцевальных» движений.

В чём проблема с шумом?

Многие пользователи aibo жалуются, что при перемещении по дому робот громко стучит лапами о пол. Команда под руководством Рё Ватанабэ (Ryo Watanabe) решила эту задачу, используя симуляцию и RL-алгоритмы. Цель была — минимизировать скорость контакта лапы с поверхностью и тем самым уменьшить громкость шагов. Система использует данные с датчиков на лапах и накладывает «штрафы» за слишком резкие движения.

  1. Эксперимент: Исследователи сравнили новую методику с RL-базовыми контроллерами, а также официальным контроллером Sony.
  2. Результат: Новой модели удалось значительно снизить шум — aibo стал ходить заметно тише, чем при использовании фирменного алгоритма Sony и других стандартных RL-подходов.

Танцы вместо простых движений

Вторая часть работы команды посвящена тому, как научить aibo эффектно «танцевать» и взаимодействовать с окружающими. Для этого разработали модель Deep Fourier Mimic (DFM). Эта технология сочетает представление движений и обучение с подкреплением, позволяя роботу имитировать заданные танцевальные паттерны и дополнять их дополнительными задачами — например, перемещением.

  • Главная «фишка»: Вместо простой «проигрывательной» анимации, робот получает возможность естественно переходить между разными движениями и реагировать на действия пользователей.
  • Преимущество: Плавность и более «живой» характер манёвров: aibo может визуально «подтанцовывать» человеку и выглядит гораздо более синхронно.

Перспективы и ограничения

Исследователи полагают, что новые алгоритмы RL могут быть интегрированы не только в aibo, но и в других домашних или развлекательных роботов (например, в парках аттракционов). Однако при испытаниях наблюдались некоторые тонкости:

  1. Баланс между тихой ходьбой и устойчивостью: Чем меньше скорость контакта лап, тем выше риск потери устойчивости; будущие модели должны учитывать условия среды (поверхность пола, наличие препятствий).
  2. Ограниченная польза для непериодических движений: DFM хорошо работает с ритмичными задачами (шаги, танец), но не столь эффективна для таких действий, как хватание или подъём с пола, которые пока нужно обучать отдельно.

Но даже с учётом этих нюансов, работа открывает путь к тому, чтобы aibo стал ещё более дружелюбным «животным-компаньоном»,