Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
4 changes: 2 additions & 2 deletions conf/offpolicy/config.yaml
Original file line number Diff line number Diff line change
@@ -1,10 +1,10 @@
defaults:
- _self_
- algo: sac
- task: ${algo}/go1_joystick_flat/mujoco
- task: ${algo}/g1_walk_flat/mujoco

training:
task_name: Go1JoystickFlat
task_name: G1WalkFlat
device: null
logger: tensorboard
wandb_project: unilab
Expand Down
23 changes: 0 additions & 23 deletions conf/offpolicy/task/sac/go1_joystick_flat/motrix.yaml

This file was deleted.

19 changes: 0 additions & 19 deletions conf/offpolicy/task/sac/go1_joystick_flat/mujoco.yaml

This file was deleted.

25 changes: 0 additions & 25 deletions conf/offpolicy/task/sac/go2_joystick_flat/motrix.yaml

This file was deleted.

21 changes: 0 additions & 21 deletions conf/offpolicy/task/sac/go2_joystick_flat/mujoco.yaml

This file was deleted.

37 changes: 37 additions & 0 deletions conf/offpolicy/task/td3/g1_walk_flat/mujoco.yaml
Original file line number Diff line number Diff line change
@@ -0,0 +1,37 @@
# @package _global_
training:
task_name: G1WalkFlat
sim_backend: mujoco
algo:
max_iterations: 100000
env:
control_config:
action_scale: 1.0
gait_phase_init_mode: "offset_phase"
reset_base_qvel_limit: 0.5
noise_config:
scale_gyro: 0.0
scale_gravity: 0.0
scale_joint_angle: 0.01
scale_joint_vel: 0.1
scale_linvel: 0.0
reward:
scales:
tracking_lin_vel: 2.0
tracking_ang_vel: 1.5
penalty_ang_vel_xy: -1.0
penalty_orientation: -10.0
penalty_action_rate: -4.0
pose: -0.5
penalty_feet_ori: -20.0
feet_phase: 5.0
alive: 10.0
tracking_sigma: 0.25
base_height_target: 0.754
min_base_height: 0.3
max_tilt_deg: 65.0
gait_frequency: 1.5
feet_phase_swing_height: 0.09
feet_phase_tracking_sigma: 0.04
close_feet_threshold: 0.15
pose_weights: [0.01, 1.0, 5.0, 0.01, 5.0, 5.0, 0.01, 1.0, 5.0, 0.01, 5.0, 5.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0, 50.0]
23 changes: 0 additions & 23 deletions conf/offpolicy/task/td3/go1_joystick_flat/motrix.yaml

This file was deleted.

19 changes: 0 additions & 19 deletions conf/offpolicy/task/td3/go1_joystick_flat/mujoco.yaml

This file was deleted.

25 changes: 0 additions & 25 deletions conf/offpolicy/task/td3/go2_joystick_flat/motrix.yaml

This file was deleted.

21 changes: 0 additions & 21 deletions conf/offpolicy/task/td3/go2_joystick_flat/mujoco.yaml

This file was deleted.

2 changes: 1 addition & 1 deletion docs/users/zh_CN/01-getting-started.md
Original file line number Diff line number Diff line change
Expand Up @@ -68,7 +68,7 @@ uv run scripts/train_appo.py task=go1_joystick_flat/mujoco

# SAC / TD3
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco
uv run scripts/train_offpolicy.py algo=td3 task=td3/go1_joystick_flat/mujoco
uv run scripts/train_offpolicy.py algo=td3 task=td3/g1_walk_flat/mujoco
```

### 验证环境
Expand Down
5 changes: 1 addition & 4 deletions docs/users/zh_CN/02-simulation-backends.md
Original file line number Diff line number Diff line change
Expand Up @@ -65,12 +65,9 @@ uv run scripts/generate_support_matrix.py --write
| APPO (torch) | `g1_motion_tracking` (G1 motion tracking) | Tested | Tested |
| APPO (torch) | `g1_flip_tracking` (G1 flip tracking) | Tested | Tested |
| APPO (torch) | `allegro_inhand` (Allegro in-hand) | Tested | Registered |
| SAC (torch) | `go1_joystick_flat` (Go1 joystick) | Tested | Tested |
| SAC (torch) | `go2_joystick_flat` (Go2 joystick) | Tested | Tested |
| SAC (torch) | `g1_walk_flat` (G1 walk flat) | Tested | Tested |
| SAC (torch) | `g1_walk_rough` (G1 walk rough) | Tested | Registered |
| TD3 (torch) | `go1_joystick_flat` (Go1 joystick) | Tested | Tested |
| TD3 (torch) | `go2_joystick_flat` (Go2 joystick) | Tested | Tested |
| TD3 (torch) | `g1_walk_flat` (G1 walk flat) | Tested | Registered |

### Source Index

Expand Down
14 changes: 7 additions & 7 deletions docs/users/zh_CN/03-training.md
Original file line number Diff line number Diff line change
Expand Up @@ -28,8 +28,8 @@ uv run scripts/train_mlx_ppo.py task=go1_joystick_flat/mujoco
uv run scripts/train_appo.py task=go1_joystick_flat/mujoco

# Off-policy
uv run scripts/train_offpolicy.py algo=sac task=sac/go1_joystick_flat/mujoco
uv run scripts/train_offpolicy.py algo=td3 task=td3/go1_joystick_flat/mujoco
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco
uv run scripts/train_offpolicy.py algo=td3 task=td3/g1_walk_flat/mujoco

# CLI override
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco algo.num_envs=2048 algo.max_iterations=1000
Expand All @@ -50,20 +50,20 @@ run 目录命名格式是 `YYYY-MM-DD_HH-MM-SS_<sim_backend>`,例如 `2026-03-
```bash
# 回放最新结果
uv run scripts/train_rsl_rl.py task=go2_joystick_flat/mujoco training.play_only=true
uv run scripts/train_offpolicy.py algo=sac task=sac/go2_joystick_flat/mujoco training.play_only=true
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco training.play_only=true

# macOS / MacBook 上的 MotrixSim 原生 renderer
uv run mxpython scripts/train_rsl_rl.py task=go2_joystick_flat/motrix training.play_only=true

# 回放指定 run
uv run scripts/train_offpolicy.py algo=td3 task=td3/go1_joystick_flat/mujoco training.play_only=true algo.load_run="2024-02-04_12-00-00"
uv run scripts/train_offpolicy.py algo=td3 task=td3/g1_walk_flat/mujoco training.play_only=true algo.load_run="2024-02-04_12-00-00"
```

## Resume Training

```bash
uv run scripts/train_rsl_rl.py task=go2_joystick_flat/mujoco algo.load_run="2024-02-04_12-00-00"
uv run scripts/train_offpolicy.py algo=sac task=sac/go2_joystick_flat/mujoco algo.load_run="2024-02-04_12-00-00"
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco algo.load_run="2024-02-04_12-00-00"
```

## Hydra Overrides
Expand Down Expand Up @@ -116,10 +116,10 @@ uv run scripts/train_appo.py \
# 按 task 分组
uv run scripts/train_offpolicy.py \
algo=sac \
task=sac/go2_joystick_flat/mujoco \
task=sac/g1_walk_flat/mujoco \
training.logger=wandb \
training.wandb_project=unilab-benchmark \
training.wandb_group=go2_joystick_flat
training.wandb_group=g1_walk_flat
```

常用字段:
Expand Down
14 changes: 7 additions & 7 deletions docs/users/zh_CN/04-algorithms.md
Original file line number Diff line number Diff line change
Expand Up @@ -84,29 +84,29 @@ FastSAC 和 FastTD3 使用同一套异步多进程架构,通过 shared memory

```bash
# 基本训练
uv run scripts/train_offpolicy.py algo=sac task=sac/go2_joystick_flat/mujoco
uv run scripts/train_offpolicy.py algo=td3 task=td3/go1_joystick_flat/mujoco
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco
uv run scripts/train_offpolicy.py algo=td3 task=td3/g1_walk_flat/mujoco

# 异步采集模式
uv run scripts/train_offpolicy.py algo=sac task=sac/go2_joystick_flat/mujoco training.no_sync_collection=true
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco training.no_sync_collection=true

# 跳过自动回放
uv run scripts/train_offpolicy.py algo=td3 task=td3/go1_joystick_flat/mujoco training.no_play=true
uv run scripts/train_offpolicy.py algo=td3 task=td3/g1_walk_flat/mujoco training.no_play=true
```

### Playback

```bash
uv run scripts/train_offpolicy.py algo=sac task=sac/go2_joystick_flat/mujoco training.play_only=true
uv run scripts/train_offpolicy.py algo=td3 task=td3/go1_joystick_flat/mujoco training.play_only=true algo.load_run="2024-02-04_12-00-00"
uv run scripts/train_offpolicy.py algo=sac task=sac/g1_walk_flat/mujoco training.play_only=true
uv run scripts/train_offpolicy.py algo=td3 task=td3/g1_walk_flat/mujoco training.play_only=true algo.load_run="2024-02-04_12-00-00"
```

### Key Parameters

| 参数 | 默认值 | 说明 |
|------|--------|------|
| `algo` | `sac` | 算法选择 |
| `task` | `sac/go1_joystick_flat/mujoco` | 单个 task 配置入口,内部同时定义 algo + task + backend |
| `task` | `sac/g1_walk_flat/mujoco` | 单个 task 配置入口,内部同时定义 algo + task + backend |
| `algo.max_iterations` | 500 (SAC) / 5000 (TD3) | 最大训练迭代数 |
| `algo.num_envs` | 4096 | 并行环境数量 |
| `training.device` | 自动检测 | learner 设备 |
Expand Down
Loading
Loading