危险对幻觉率 H 是什么,是我们自己定义的吗?
一句话回答
底层直觉来自已有研究,在这个问题上的形式化是 Paper-02 的贡献。
什么是”危险对”
V167L 词汇表里有些条目,描述的是同一类异物、同一个位置,唯一的差别是电气状态:
| 编号 | 描述 | 混淆后果 |
|---|---|---|
| v011 | 导线风筝线 · 带电(正常天气) | 触电 |
| v013 | 导线风筝线 · 停电 | 参数错误 |
| v014 | 导线风筝线 · 紧急带电 | 触电 |
这三条指令外表极为相似,但处理方式完全不同。把带电线路当停电处理,机器人靠太近——触电事故。
“语义相近 + 混淆后有物理安全后果”的节点对,称为危险对。V167L 中共识别出 32 对,涉及 43 个节点。
H 的定义
即:在所有”真实意图是危险对节点 的指令”中,LLM 错误输出了其危险对手节点 的概率。
零样本实测:H = 0.256(4 条危险对指令中 1 条路由到危险邻居)。目标:微调后 H < 0.05。
它是”原创”的吗?
借鉴了什么
- LLM 幻觉:已有标准概念(Ji et al. 2023 综述引用 5000+),指模型输出看似合理但错误的内容
- 类间混淆:混淆矩阵、inter-class confusion,分类领域标准工具
- 安全关键误分类:医疗 AI 中”把恶性误诊为良性”比反向代价更高,已有非对称损失函数研究
我们做了什么
- 定义了危险对的识别标准——不是所有混淆都危险,只有”语义相近 + 物理安全后果”的才算,并从 V167L 系统识别出 32 对
- 给出 H 的精确数学定义,作为独立于 Q(f) 的评测维度
- 把 H 接入安全链方程,赋予工程意义:
为什么不能用总准确率 Q(f) 代替 H
Q(f) 和 H 是独立指标,不能互替:
| 情况 | Q(f) | H | 能部署? |
|---|---|---|---|
| 总体答对率高,危险对混淆严重 | 高 | 高 | ❌ |
| 总体答对率低,危险对从不混淆 | 低 | 低 | ❌ |
| 两项同时达标 | ≥90% | <5% | ✅ |
模型可以在大多数普通指令上表现良好(Q 高),但偏偏在最危险的场景反复出错(H 高)。只看 Q 的话,这个隐患完全看不出来。
H 在安全链中的地位
H 是 不等式的源头系数——H 降低一半,即使 L2/L3 拦截率不变,系统不安全概率上界至少降低一半。这就是为什么 H < 0.05 是硬性红线,而不是软性目标。
面对审稿人的预期问题
“H 本质上不就是混淆矩阵的某个子集吗?”
回应:混淆矩阵记录所有错误,H 只追踪有物理安全后果的定向混淆,并与下游安全链形成可推导的数学关系。从指标到系统安全界的闭环,在已有 LLM 指令路由文献中没有见到形式化版本。Related Work 需诚实引用幻觉文献和安全分类文献,再说清 H 的独特之处。