← Back to the Bipedal avatar experiment
First steps: learning to walk by trial and reward
Completed
- Seed
- 42
- Steps
- 516096 / 500000
- Created
- 25 July 2026 at 10:53
- Finished
- 25 July 2026 at 11:23
Hypothesis
With no programmed gait, a PPO agent can learn — from reward signal alone — to balance a bipedal body and then move it forward.
Vital signs
View data
| Step | Mean episode reward |
|---|---|
| 8192 | -1.04 |
| 16384 | 2.15 |
| 24576 | 10.3 |
| 32768 | 20.1 |
| 40960 | 32.6 |
| 49152 | 59.8 |
| 57344 | 80.6 |
| 65536 | 97.1 |
| 73728 | 144 |
| 81920 | 195 |
| 90112 | 236 |
| 98304 | 260 |
| 106496 | 256 |
| 114688 | 272 |
| 122880 | 271 |
| 131072 | 297 |
| 139264 | 304 |
| 147456 | 312 |
| 155648 | 326 |
| 163840 | 342 |
| 172032 | 331 |
| 180224 | 348 |
| 188416 | 357 |
| 196608 | 379 |
| 204800 | 377 |
| 212992 | 373 |
| 221184 | 385 |
| 229376 | 384 |
| 237568 | 384 |
| 245760 | 385 |
| 253952 | 386 |
| 262144 | 389 |
| 270336 | 392 |
| 278528 | 405 |
| 286720 | 411 |
| 294912 | 418 |
| 303104 | 411 |
| 311296 | 409 |
| 319488 | 419 |
| 327680 | 430 |
| 335872 | 435 |
| 344064 | 448 |
| 352256 | 457 |
| 360448 | 467 |
| 368640 | 476 |
| 376832 | 476 |
| 385024 | 478 |
| 393216 | 497 |
| 401408 | 500 |
| 409600 | 511 |
| 417792 | 512 |
| 425984 | 524 |
| 434176 | 533 |
| 442368 | 537 |
| 450560 | 540 |
| 458752 | 542 |
| 466944 | 553 |
| 475136 | 566 |
| 483328 | 583 |
| 491520 | 599 |
| 499712 | 601 |
| 507904 | 596 |
| 516096 | 587 |
View data
| Step | Episode length steps |
|---|---|
| 8192 | 18.4 |
| 16384 | 21.3 |
| 24576 | 35.5 |
| 32768 | 48.2 |
| 40960 | 72.3 |
| 49152 | 102 |
| 57344 | 119 |
| 65536 | 134 |
| 73728 | 165 |
| 81920 | 196 |
| 90112 | 208 |
| 98304 | 218 |
| 106496 | 217 |
| 114688 | 222 |
| 122880 | 224 |
| 131072 | 214 |
| 139264 | 209 |
| 147456 | 217 |
| 155648 | 223 |
| 163840 | 226 |
| 172032 | 211 |
| 180224 | 217 |
| 188416 | 223 |
| 196608 | 230 |
| 204800 | 224 |
| 212992 | 211 |
| 221184 | 215 |
| 229376 | 216 |
| 237568 | 216 |
| 245760 | 218 |
| 253952 | 218 |
| 262144 | 213 |
| 270336 | 214 |
| 278528 | 219 |
| 286720 | 222 |
| 294912 | 223 |
| 303104 | 216 |
| 311296 | 211 |
| 319488 | 210 |
| 327680 | 210 |
| 335872 | 208 |
| 344064 | 213 |
| 352256 | 214 |
| 360448 | 216 |
| 368640 | 217 |
| 376832 | 213 |
| 385024 | 210 |
| 393216 | 214 |
| 401408 | 212 |
| 409600 | 215 |
| 417792 | 213 |
| 425984 | 217 |
| 434176 | 219 |
| 442368 | 222 |
| 450560 | 222 |
| 458752 | 221 |
| 466944 | 226 |
| 475136 | 233 |
| 483328 | 242 |
| 491520 | 254 |
| 499712 | 255 |
| 507904 | 249 |
| 516096 | 240 |
View data
| Step | Distance travelled (x) u |
|---|---|
| 8192 | -0.15 |
| 16384 | -0.14 |
| 24576 | -0.19 |
| 32768 | -0.22 |
| 40960 | -0.31 |
| 49152 | -0.32 |
| 57344 | -0.30 |
| 65536 | -0.28 |
| 73728 | -0.16 |
| 81920 | 0.01 |
| 90112 | 0.23 |
| 98304 | 0.35 |
| 106496 | 0.32 |
| 114688 | 0.41 |
| 122880 | 0.39 |
| 131072 | 0.67 |
| 139264 | 0.78 |
| 147456 | 0.77 |
| 155648 | 0.83 |
| 163840 | 0.95 |
| 172032 | 0.97 |
| 180224 | 1.06 |
| 188416 | 1.09 |
| 196608 | 1.20 |
| 204800 | 1.24 |
| 212992 | 1.30 |
| 221184 | 1.38 |
| 229376 | 1.36 |
| 237568 | 1.36 |
| 245760 | 1.35 |
| 253952 | 1.36 |
| 262144 | 1.42 |
| 270336 | 1.43 |
| 278528 | 1.50 |
| 286720 | 1.52 |
| 294912 | 1.57 |
| 303104 | 1.58 |
| 311296 | 1.60 |
| 319488 | 1.69 |
| 327680 | 1.78 |
| 335872 | 1.83 |
| 344064 | 1.89 |
| 352256 | 1.96 |
| 360448 | 2.02 |
| 368640 | 2.09 |
| 376832 | 2.11 |
| 385024 | 2.16 |
| 393216 | 2.27 |
| 401408 | 2.31 |
| 409600 | 2.38 |
| 417792 | 2.40 |
| 425984 | 2.47 |
| 434176 | 2.53 |
| 442368 | 2.53 |
| 450560 | 2.55 |
| 458752 | 2.58 |
| 466944 | 2.63 |
| 475136 | 2.68 |
| 483328 | 2.74 |
| 491520 | 2.78 |
| 499712 | 2.78 |
| 507904 | 2.79 |
| 516096 | 2.79 |
Video captures
Configuration
| Parameter | Value |
|---|---|
| env_id | Walker2d-v5 |
| algo | PPO |
| n_envs | 4 |
| n_checkpoints | 7 |
| device | cuda |
| ppo | {"n_steps":2048,"batch_size":64,"n_epochs":10,"gamma":0.99,"gae_lambda":0.95,"clip_range":0.2,"ent_coef":0,"learning_rate":0.0003} |