Ssylka

Арена для ИИ-боев: от симуляций к реальным сражениям

В статье представлен пайплайн для обучения нейросетевых агентов, сражающихся на арене в физическом симуляторе MuJoCo. Разработанная среда позволяет двум четыреногим агентам, MuJoCo Ant, взаимодействовать друг с другом и с ареной, используя частично включенные коллизии. Обучение агентов происходит с помощью алгоритма Soft Actor-Critic (SAC), реализованного на базе JAX. Это позволяет эффективно использовать GPU для параллельных расчетов.
Арена для ИИ-боев: от симуляций к реальным сражениям
Изображение носит иллюстративный характер

Ключевым элементом является функция награды, определяющая поведение агентов. Она состоит из поощрения за сближение, пинок противника и штрафа за падение с арены. Цель обучения — достичь баланса между агрессивным поведением и осторожностью. Функция валидации используется для оценки прогресса агентов. Она награждает за нахождение на арене и штрафует за падение.

Пайплайн включает в себя гибкие настройки для оптимизации процесса обучения, такие как размер батча, размер буфера, коэффициент обучения, и т. д. Также предусмотрена возможность добавления референсных агентов для ускорения обучения и ведение логов в Weights & Biases или Tensorboard. В процессе обучения агенты сражаются не только с референсными агентами, но и со своими собственными прошлыми версиями для повышения конкурентоспособности.

Хотя эксперименты с гуманоидами Humanoid не удались из-за высокой вычислительной нагрузки, проект продемонстрировал потенциал для дальнейших исследований. Будущие направления развития включают эксперименты с разными функциями награды, непрямое управление агентами и обучение агентов с полностью включенными коллизиями. Кроме того, рассматривается возможность использования предварительно обученных фрагментов сети для ускорения обучения.


Новое на сайте

18917Зачем первый король Англии приказал создать эту уникальную золотую драгоценность? 18916Действительно ли у кенгуру три вагины, а Исландия избавится от комаров только к октябрю... 18915Проверка эрудиции и факты о легендарном короле динозавров 18914Сотни ледниковых землетрясений обнаружены на разрушающейся кромке антарктического ледника... 18913Анализ архивных окаменелостей выявил новый вид гигантского гадрозавра в Нью-Мексико 18912Древняя азартная игра предлагает ключ к пониманию структуры манускрипта Войнича 18911Трансформация человеческого скелета и феномен добавочных костей 18910Насколько хорошо вы знаете географию и природу первого национального парка йеллоустоун? 18909Как стремление к механической объективности в ранней астрофотографии скрывало... 18908Почему обновленные тактики Transparent Tribe и Patchwork угрожают кибербезопасности в... 18907Почему священное озеро хилук в Канаде покрывается разноцветными пятнами из минералов? 18906Почему рост инвентаря активов не снижает риски и как на самом деле измерять окупаемость... 18905Как киберпреступники использовали Google Cloud Application Integration для обхода систем... 18904Почему эволюция лишила человека способности управлять пальцами ног по отдельности, как...