开源项目

microduckrl

microduckrl

为微型双足机器人 Microduck 提供基于 MuJoCo Warp 的 PPO 强化学习训练环境,覆盖行走、摔倒恢复、翻滚、轮滑等多种任务,并完整封装了 sim2real 流程(BAM 执行器模型、域随机化、齿轮间隙模拟等)。策略在 50Hz 下训练后导出 ONNX 部署到实体机器人,且所有任务共享 61 维观测契约,支持运行时热切换策略。对做机器人 RL 或 sim2real 的开发者很有参考价值,Apache 2.0 许可,3D 模型为 CC BY-SA-NC。

README

Microduck RL

image

RL 训练环境,面向 Microduck —— 一个约 800 克、约 25 厘米高的双足机器人 —— 基于 mjlab(MuJoCo Warp)和 PPO 构建。策略在此以 50 Hz 频率训练,导出为 ONNX,并由 pollen-robotics/microduck 中的运行时部署到真实机器人上。

https://github.com/user-attachments/assets/50c3d537-8db2-4005-9d9c-3472faeec4d0

本仓库包含了完整的 sim2real(仿真到现实)方案:BAM 执行器物理模型、域随机化、齿隙模拟,以及让这套方案奏效的奖励设计经验(提炼后的操作手册见 AGENTS.md)。

快速开始

需要 CUDA GPU(训练通过 MuJoCo Warp 运行)和 uv。

在 ARM 设备(DGX Spark / GB10、Jetson)上: 首次运行时 uv sync 会拉取约 2 GB 的 CUDA wheel 包,而 uv 默认的 30 秒 HTTP 超时可能会在中途中断下载。请为首次同步设置 UV_HTTP_TIMEOUT=600。

git clone https://github.com/pollen-robotics/microduck_rl
cd microduck_rl

# train the walking policy (uses your GPU; ~1-2 h for a usable gait at 4096 envs)
uv run train Mjlab-Velocity-Flat-MicroDuck --env.scene.num-envs 4096

# watch a trained policy in the viewer
uv run play Mjlab-Velocity-Flat-MicroDuck --wandb-run-path <entity/project/run_id>

# export to ONNX for deployment
uv run scripts/export.py Mjlab-Velocity-Flat-MicroDuck --wandb-run-path <...>

# drive the exported policy in CPU MuJoCo with the keyboard
开源项目pollen-robotics2026-08-30原文

相关内容