加载中...
单指旋转 · 双指平移 / 缩放
Actor 策略(可训练)
参考模型(冻结)
Critic 价值网络
数据 / 张量流
损失 / GAE 计算
优化 / 更新
奖励模型 / 辅助
同步训练组 (Actor+Critic)
冻结组 (Ref+Reward)
损失函数组 (Policy+Value)