返回关卡地图
闯关题:0 / 3 XP 0 / 300

Level 86 | 零基础导学关卡

DPO 在线基准

DPO Online Benchmark

在线 DPO benchmark 观察持续反馈与更新的完整循环。它像长期运营一间店:一次好评高峰不代表可以忽略质量下限和更新成本。

本课官方 Notebook ↗
86_DPO_Online_Benchmark.ipynb 后训练对齐在线对齐基准对比
Mission 1 01 / 建立直觉

线上胜率涨了,可更新越来越慢,这条改进能持续吗?

图解原理

在线 DPO benchmark 观察持续反馈与更新的完整循环。它像长期运营一间店:一次好评高峰不代表可以忽略质量下限和更新成本。

先认识这三个词

window
同一次统计使用的反馈与评测区间。
update latency
从反馈准备到新策略可用的时间,需固定口径。
release gate
决定可上线、继续观察还是暂停的规则。
试着说给朋友听

先不看公式:用上面的生活场景,说一说这节课想减少哪种浪费、需要付出什么代价。

闯关题

本课中的「window」指什么?

学完这一段,试着做

用一个小动作确认自己理解了;最后再进入官方题目。

Mission 2 02 / 操作与推演

把一个小例子算到最后

图解原理

先用默认数值手算,再只改一个参数。让结果来检验你的猜想。

  1. 固定比较

    baseline 和 candidate 使用相同反馈流、初始模型与评测窗口。

  2. 列硬门槛

    候选胜率 0.65,比 0.60 好,但安全分 0.92 低于 0.95,仍不能通过。

  3. 检查持续性

    满足安全后,再看更新时延、稳定性和重复窗口是否保持收益;回退路径也应清楚。

动手实验室 / 只在浏览器中演示

当一次有原则的方案评审员

改变显存和质量门槛。先过滤,再在合格者中比较速度。

教学简化模型:所有数值来自上方规则,不是 GPU 性能实测。播放可以暂停,键盘方向键可调整滑块。

闯关题

胜率提高,但安全 0.92<0.95,更新 120ms>100ms,能通过吗?

学完这一段,试着做

用一个小动作确认自己理解了;最后再进入官方题目。

Mission 3 03 / 纠错与迁移

从会看,走到会写与会判断

图解原理

下面是一段独立的小练习。它把计算关系写清楚,帮助你进入官方题目;不是整份作业的答案。

读懂这段最小 Python

candidate = {"win":.65, "safety":.92, "update_ms":120}
pass_gate = candidate["safety"] >= .95 and candidate["update_ms"] <= 100
print(pass_gate)  # False

先找输入变量,再找中间量,最后核对注释里的输出。改一个输入,手算后再运行。

最容易踩的坑

把一次模拟门槛通过当成真实线上验收;逻辑测试只证明决策函数在给定输入下的行为。

去官方题目做什么

  1. 到官方 Notebook 阅读题目函数与测试;先写出输入、输出和一个最小例子。
  2. 把本课手算过程转换成实现,先跑最小测试,再检查空输入、边界值或未达门槛的情况。
  3. 记录一个与预期不同的结果,并用本课术语说明原因。

闯关题

同学提出下面的做法,哪一项会导致本课讨论的误判?

学完这一段,试着做

用一个小动作确认自己理解了;最后再进入官方题目。

把理解变成自己的代码

准备好,去官方题目试一试

在本页用小例子建立直觉,再去官方 Notebook 完成实现。先运行你自己的测试,遇到困难时再查看官方提示与参考答案。

前往本课官方 Notebook ↗

这节课会遇到的代码对象

summarize_online_dpo_runs · compare_online_dpo_to_baseline · recommend_online_dpo_run

先找题目里的输入、输出与 TODO,再把本课的手算过程对应进去;以官方题目中的函数说明和测试为准。

练习来源:Datawhale 官方仓库 · 518cc45。这里的入口直接打开官方版本,不读取或分享你的本地 Notebook。

完成 3 道闯关题后,本关即算完成;作业 checklist 用来辅助你回 notebook 练习。
进度只保存在当前浏览器 localStorage,分享 HTML 不会带走你的记录。
上一关:L85 回到地图