返回模型
说明文档
SnowballTarget PPO 模型
使用 ML-Agents(版本 21)在 SnowballTarget 环境中训练。
- 平均奖励: ~28–29(100万步时)
- 训练步数: 1,000,000
- 训练时间: ~26 分钟
- 环境数: 4 (CPU)
- 配置: 参见 SnowballTarget.yaml
仓库: AMZ2004/SnowballTarget-2025-08-03
AMZ2004/SnowballTarget-2025-08-03
作者 AMZ2004
reinforcement-learning
ml-agents
↓ 0
♥ 0
创建时间: 2025-08-03 15:42:09+00:00
更新时间: 2025-08-03 15:42:12+00:00
在 Hugging Face 上查看文件 (4)
.gitattributes
README.md
SnowballTarget.yaml
results/SnowballTarget.onnx
ONNX