ASAlignScope CSALIGNMENT EVIDENCE LAB SOURCE ↗

EVIDENCE BEFORE ALIGNMENT CLAIMS

训练模型,也审计
训练结论

Qwen3-0.6B 的 LoRA SFT、偏好训练和 rank / beta / 标签噪声实验。这里展示的重点不是一个方便的 DPO 胜利,而是如何识别同源 Dev 污染、重建冻结 holdout,并让负结果保持可见。

5,800SFT 样本5,200 train / 600 dev
2,000偏好对800 used in main runs
36冻结 holdout6 scenes × 6 cases
22/22公共测试fresh-clone PASS

TRAINING CONTRACT

先把训练语义说准确

历史策略从 rank-16 SFT adapter 初始化;锁定 TRL 0.13.0 在 ref_model=None 的 PEFT 路径下通过 disable_adapter() 计算 reference。因此有效 reference 是 Base,而不是另一个冻结 SFT。

01

LoRA SFT

rank 4 / 16 / 64,300 steps。rank-64 Dev loss 最低,但参数约为 rank-16 的四倍。

q_proj + v_proj
02

Preference run

策略从 SFT adapter 初始化;beta 0.05 / 0.1 / 0.3。历史 reference 是 adapter-disabled Base。

not frozen-SFT-reference DPO
03

Evaluation gate

同源 Dev 只看训练动态;最终泛化判断转移到冻结 36-case 自动 holdout。

paired by case

CONTAMINATION AUDIT

旧高分为何被降级

随机切分的 prompt 大多不同,但模板答案跨 split 大量重复;偏好数据又从完整 SFT 池派生。训练 loss 和 reward margin 不能单独证明泛化。

384/ 600 SFT Dev answers

在训练记录中出现

191/ 200 preference Dev chosen

在 SFT train 中出现

0/ 36 holdout prompts

exact / thresholded near overlap

更贴近实际运行子集:SFT eval 前 200 条中 122 条答案见于 train;preference eval 前 100 条中 96 条 chosen 见于 SFT train。

INTERACTIVE SYNTHETIC LAB

配对统计评测台

切换模型对照,观察点估计、Bootstrap 区间和解释边界。页面数字为冻结聚合证据;回答示例完全合成。

SYNTHETIC RESPONSES下方客服回答均为虚构文本,不来自 JDDC、holdout 或真实模型输出。
对照
SYNTHETIC CANDIDATE A

SYNTHETIC CANDIDATE B

AUTOMATIC RUBRIC DELTA+8.39SFT minus Base
−100+15
paired bootstrap 95%
[+2.08, +14.78]
Holm-adjusted p
0.102
结论
正向点估计;多重校正后不显著

Δ 基于未舍入逐案例值;Bootstrap CI 未做多重校正,p 值按 outcome family 做 Holm 校正。

FROZEN HOLDOUT

Base / SFT / Preference

36 条后训练手写样本,六个场景均衡。自动 rubric 是确定性回归门禁,不是用户偏好或业务解决率。

modelmean scorecoveragestrict pass
Base54.9232.73%8.33%
Preference β=.161.7236.44%8.33%
NEGATIVE RESULT KEPT

Preference − SFT score = −1.58,95% CI [−6.58, +3.89]。历史同源 Dev 的优势没有迁移。

LABEL-NOISE SENSITIVITY

名义比例 ≠ 实际训练比例

噪声文件在完整 1,800 对中翻转 10%/30%,训练却只读取前 800 对;真正进入模型的是 90/800 和 250/800。

clean10.84reward margin
effective 11.25%8.65−20.2%
effective 31.25%6.28−42.1%

只支持“当前模板偏好数据的训练信号对标签翻转敏感”,不支持真实偏好质量与线上指标因果结论。

CLAIM BOUNDARY

简历能写什么

证据不够时,正确动作不是补一个看起来像结果的数字,而是让门禁保持关闭。

可以写

  • Qwen3-0.6B LoRA SFT 与偏好训练链路
  • rank / beta / 有效噪声比例消融
  • 同源 Dev 污染审计与冻结 holdout
  • 配对 Bootstrap、置换、McNemar、Holm
  • DPO 优势未迁移的负结果

不能写

  • 标准冻结 SFT-reference DPO 已完成
  • DPO 人工胜率或 13/30 用户偏好
  • 统计显著提升或模型等效
  • 100% 安全、生产 SLA、线上 CSAT
  • SOTA 或业务自动解决率提升
HUMAN REVIEW GATE0 / 72

missing ratings · 0 valid decisions · no kappa