实验结果
所有实验基于 Qwen2.5-3B-Instruct QLoRA 微调,评估代码见代码页,训练数据见数据集页。
数字均为精确值,(显示为 0.016),(Interface A 合规)。
核心指标汇总
0.944
全局命中率 Q(f)
≥0.90 阈值 ✅
0.016
危险对幻觉率 H
<0.05 阈值 ✅(16.5× 降低)
1253 ms
平均推理延迟
P95=1323 ms,99.6% 合规
≤155 ppm
P(unsafe)
三层安全链上界
四模型对比表
以下表格对比了零样本基线与 QLoRA 微调后模型的路由性能,并以 Phi-3.5-mini 作为负控组。
| 模型 | 说明 | |||
|---|---|---|---|---|
| Qwen2.5-7B(零样本) | 0.678 | 0.070 | 0.322 | 满足 H 但不满足 Q |
| Phi-3.5-mini(零样本) | 0.565 | 0.163 | 0.435 | 负控组:两者均不满足 |
| Qwen2.5-3B(零样本) | 0.480 | 0.256 | 0.520 | 两者均不满足,验证微调必要性 |
| Qwen2.5-3B(QLoRA FT) | 0.944 | 0.016 | 0.056 | 两项指标均满足 ✅ |
,表示路由对齐误差距离,与 谱泛化界直接关联。
详细分析
Q(f):全局命中率
零样本 3B 模型 ,7B 模型 ,两者均低于 0.90 部署阈值。QLoRA 微调后 3B 模型跃升至 ,超越零样本 7B 基线 +39%,验证了”小模型+领域微调 > 大模型零样本”的核心结论。
Phi-3.5-mini 负控组(3.8B,INT4 量化)仅达 ,低于同参数量零样本 3B 基线,说明模型架构和预训练数据对中文语义流形的匹配至关重要,参数量非决定性因素。
H:危险对幻觉率
| 模型对 | H 值 | 评估 |
|---|---|---|
| 3B 零样本 | 0.256 | 不满足(>0.05) |
| 7B 零样本 | 0.070 | 接近满足(>0.05) |
| Phi-3.5-mini | 0.163 | 不满足,高达 3B 零样本 64% |
| 3B QLoRA FT | 0.016 | 满足(<0.05) ✅ |
从 0.256 降至 0.016,降低 16.5 倍()。微调使模型习得了危险对语义边界,不再将”拧松”(R07)与”拧紧”(R09)混淆。
Interface A 推理延迟
| 指标 | 值 | 合规要求 |
|---|---|---|
| 平均延迟 | 1253 ms | [500, 2000] ms |
| P95 延迟 | 1323 ms | ≤2000 ms ✅ |
| 合规率 | 99.6% | ≥95% ✅ |
| 硬件 | RTX 4090 24G(bfloat16 推理) | — |
Phi-3.5-mini 负控组延迟为 (),因架构差异快于微调 3B 模型,但路由质量不达标,不能用于部署。
安全链上界估计
基于三层安全链结构,Paper-02 微调使 Brain 层危险对幻觉率从 降至 :
理论上界降低至 ≤155 ppm(保守估计),比零样本基线 降低 15.8 倍。
结果汇总
| 实验 | 指标 | 3B 零样本 | 3B QLoRA FT | 目标 | 通过 |
|---|---|---|---|---|---|
| 模型对比 | 0.480 | 0.944 | ≥0.90 | ✅ | |
| 模型对比 | 0.256 | 0.016 | <0.05 | ✅ | |
| 模型对比 | 0.520 | 0.056 | — | — | |
| 延迟测试 | — | 1323 ms | ≤2000 ms | ✅ | |
| 延迟测试 | Interface A 合规率 | — | 99.6% | ≥95% | ✅ |
| 安全链 | 上界 | ~435 ppm | ≤155 ppm | — | ↓15.8× |