← 全部课程 高阶 · 大模型工程

大模型后训练与对齐:从 SFT、LoRA 到 DPO

把只会续写的 Base Model,训练成可评测的助手

用 SFT、LoRA/QLoRA、偏好优化与安全评测,把 Base Model 交付成 MiniChat Assistant。

建议具备 GPU 环境 13 个学习单元

适合你,如果你已经会:Python、PyTorch、Token、交叉熵与 Decoder-only Transformer;建议先完成预训练课程。

即将开放 · 价格待定 登录
大模型后训练与对齐:从 SFT、LoRA 到 DPO 课程主视觉 大模型工程
13个结构化单元
CodeLab边学边写、边写边运行
自主节奏进度自动保存
01

构造高质量指令数据

设计 Chat Template、清理对话数据,并理解 SFT 真正在优化什么。

02

完成高效对齐训练

用 LoRA、QLoRA 与 DPO 完成可控、可诊断的后训练流程。

03

评测并安全交付

建立能力、安全与回归评测,交付一个有边界的 MiniChat 助手。

你将学到什么

课程大纲

  1. 01

    Base Model 为什么不像助手

  2. 02

    Chat Template:先把角色座位排对

  3. 03

    指令数据:先验明正身,再喂给模型

  4. 04

    SFT:只在答案位置计算损失

  5. 05

    LoRA:冻结底座,只训练低秩增量

  6. 06

    QLoRA:底座压到 4 bit,梯度仍往适配器走

  7. 07

    Loss 降了,助手真的变好了吗

  8. 08

    偏好数据:chosen 不只是一个赞

  9. 09

    奖励模型:把“更好”压成一个分数

  10. 10

    DPO:把偏好直接写进分类损失

  11. 11

    DPO 训练现场:β、参考模型与翻车诊断

  12. 12

    安全对齐:会拒绝不等于拒绝一切

  13. 13

    从 Base 到 Assistant:交付 MiniChat

服务与购买保障

付款之前,每一项都说清楚

01

支付验证后自动交付

课程自动加入购买账号,订单与交付状态可以追踪。

02

即将开放 · 价格待定

课程介绍和完整大纲已经公开;课程尚未开放购买,正式售价与购买入口将在确认后启用。

03

7 日退款保障

购买后 7 日内,如课程学习进度不超过 10% 且未提交作业,可联系客服申请原路退款;法律法规另有规定的,从其规定。

04

发票与人工客服

支持申请电子普通发票;付款完成后可联系客服提交准确的开票信息。

准备好了吗?

今天就开始学习

即将开放 · 价格待定