LoRA SFT
rank 4 / 16 / 64,300 steps。rank-64 Dev loss 最低,但参数约为 rank-16 的四倍。
q_proj + v_projTRAINING CONTRACT
历史策略从 rank-16 SFT adapter 初始化;锁定 TRL 0.13.0 在 ref_model=None 的 PEFT 路径下通过 disable_adapter() 计算 reference。因此有效 reference 是 Base,而不是另一个冻结 SFT。
rank 4 / 16 / 64,300 steps。rank-64 Dev loss 最低,但参数约为 rank-16 的四倍。
q_proj + v_proj策略从 SFT adapter 初始化;beta 0.05 / 0.1 / 0.3。历史 reference 是 adapter-disabled Base。
not frozen-SFT-reference DPO同源 Dev 只看训练动态;最终泛化判断转移到冻结 36-case 自动 holdout。
paired by caseCONTAMINATION AUDIT
随机切分的 prompt 大多不同,但模板答案跨 split 大量重复;偏好数据又从完整 SFT 池派生。训练 loss 和 reward margin 不能单独证明泛化。
在训练记录中出现
在 SFT train 中出现
exact / thresholded near overlap
更贴近实际运行子集:SFT eval 前 200 条中 122 条答案见于 train;preference eval 前 100 条中 96 条 chosen 见于 SFT train。
INTERACTIVE SYNTHETIC LAB
切换模型对照,观察点估计、Bootstrap 区间和解释边界。页面数字为冻结聚合证据;回答示例完全合成。
Δ 基于未舍入逐案例值;Bootstrap CI 未做多重校正,p 值按 outcome family 做 Holm 校正。
FROZEN HOLDOUT
36 条后训练手写样本,六个场景均衡。自动 rubric 是确定性回归门禁,不是用户偏好或业务解决率。
Preference − SFT score = −1.58,95% CI [−6.58, +3.89]。历史同源 Dev 的优势没有迁移。
LABEL-NOISE SENSITIVITY
噪声文件在完整 1,800 对中翻转 10%/30%,训练却只读取前 800 对;真正进入模型的是 90/800 和 250/800。
只支持“当前模板偏好数据的训练信号对标签翻转敏感”,不支持真实偏好质量与线上指标因果结论。
CLAIM BOUNDARY
证据不够时,正确动作不是补一个看起来像结果的数字,而是让门禁保持关闭。
missing ratings · 0 valid decisions · no kappa