☰
MiniMind GRPO训练 脚本可视化
v2
导航
整体结构
0
脚本总览
初始化阶段
1
参数解析
2
分布式 & 种子
3
MiniMindConfig
4
混合精度
5
实验追踪
三大模型组件
6
策略模型 (Actor)
7
参考模型 (Ref)
8
奖励模型
9
Rollout 引擎
数据与优化器
10
RLAIFDataset
11
优化器 & 调度器
GRPO 训练轮次核心
12
Prompt 编码
13
Rollout 生成 (×N)
14
calculate_rewards
15
当前策略 log 概率
16
参考模型 log 概率
17
组相对优势
18
掩码构造
19
KL 散度计算
20
策略损失 (GRPO/CIsPO)
21
反向 & 参数更新
22
检查点保存
辅助函数
R
rep_penalty
加载中...
单指旋转 · 双指平移 / 缩放
×
策略模型
参考模型
数据流
损失/优势
优化
奖励/辅助
Rollout