ONNX 模型库
返回模型

说明文档

SnowballTarget PPO 模型

使用 ML-Agents(版本 21)在 SnowballTarget 环境中训练。

  • 平均奖励: ~28–29(100万步时)
  • 训练步数: 1,000,000
  • 训练时间: ~26 分钟
  • 环境数: 4 (CPU)
  • 配置: 参见 SnowballTarget.yaml

仓库: AMZ2004/SnowballTarget-2025-08-03

AMZ2004/SnowballTarget-2025-08-03

作者 AMZ2004

reinforcement-learning ml-agents
↓ 0 ♥ 0

创建时间: 2025-08-03 15:42:09+00:00

更新时间: 2025-08-03 15:42:12+00:00

在 Hugging Face 上查看

文件 (4)

.gitattributes
README.md
SnowballTarget.yaml
results/SnowballTarget.onnx ONNX