MiniMind PPO训练 脚本可视化
☰
导航
整体结构
0
脚本总览
初始化阶段
1
参数解析
2
分布式 & 种子
3
MiniMindConfig
4
混合精度
5
实验追踪
四大模型组件
6
Actor 策略模型
7
参考模型 (Ref)
8
CriticModel 类
9
奖励模型
10
Rollout 引擎
数据与优化器
11
RLAIFDataset
12
优化器 & 调度器
PPO 训练轮次核心
13
Prompt 编码
14
Rollout 生成
15
calculate_rewards
16
掩码与位置索引
17
Critic计算旧actor模型
每个token的即时分数
18
参考 log 概率
19
Token 即时奖励
20
GAE 优势估计
21
优势标准化
22
PPO 多轮更新
23
Policy Loss
(让新actor别离旧actor和参考模型太远)
24
Value Loss
(让新actor朝向表现超预期的w参数更新)
25
KL 惩罚 & 早停
26
反向 & 参数更新
27
检查点保存
辅助函数
R
rep_penalty
加载中...
单指旋转 · 双指平移 / 缩放
×
Actor 策略(可训练)
参考模型(冻结)
Critic 价值网络
数据 / 张量流
损失 / GAE 计算
优化 / 更新
奖励模型 / 辅助
同步训练组 (Actor+Critic)
冻结组 (Ref+Reward)
损失函数组 (Policy+Value)