危险对幻觉率 H 是什么,是我们自己定义的吗?

一句话回答

底层直觉来自已有研究,在这个问题上的形式化是 Paper-02 的贡献。

什么是”危险对”

V167L 词汇表里有些条目,描述的是同一类异物、同一个位置,唯一的差别是电气状态

编号描述混淆后果
v011导线风筝线 · 带电(正常天气)触电
v013导线风筝线 · 停电参数错误
v014导线风筝线 · 紧急带电触电

这三条指令外表极为相似,但处理方式完全不同。把带电线路当停电处理,机器人靠太近——触电事故。

“语义相近 + 混淆后有物理安全后果”的节点对,称为危险对。V167L 中共识别出 32 对,涉及 43 个节点。

H 的定义

H(ri,rj)=P ⁣(f(u)=ri  |  intent(u)=rj),(ri,rj)PdangerH(r_i, r_j) = P\!\left(f(u) = r_i \;\middle|\; \mathrm{intent}(u) = r_j\right), \quad (r_i, r_j) \in \mathcal{P}_\mathrm{danger}

即:在所有”真实意图是危险对节点 rjr_j 的指令”中,LLM 错误输出了其危险对手节点 rir_i 的概率。

零样本实测:H = 0.256(4 条危险对指令中 1 条路由到危险邻居)。目标:微调后 H < 0.05

它是”原创”的吗?

借鉴了什么

  • LLM 幻觉:已有标准概念(Ji et al. 2023 综述引用 5000+),指模型输出看似合理但错误的内容
  • 类间混淆:混淆矩阵、inter-class confusion,分类领域标准工具
  • 安全关键误分类:医疗 AI 中”把恶性误诊为良性”比反向代价更高,已有非对称损失函数研究

我们做了什么

  1. 定义了危险对的识别标准——不是所有混淆都危险,只有”语义相近 + 物理安全后果”的才算,并从 V167L 系统识别出 32 对
  2. 给出 H 的精确数学定义,作为独立于 Q(f) 的评测维度
  3. 把 H 接入安全链方程,赋予工程意义:

P(unsafe)H(1RL2)(1RL3)P(\mathrm{unsafe}) \leq H \cdot (1 - R_{L2}) \cdot (1 - R_{L3})

为什么不能用总准确率 Q(f) 代替 H

Q(f) 和 H 是独立指标,不能互替

情况Q(f)H能部署?
总体答对率高,危险对混淆严重
总体答对率低,危险对从不混淆
两项同时达标≥90%<5%

模型可以在大多数普通指令上表现良好(Q 高),但偏偏在最危险的场景反复出错(H 高)。只看 Q 的话,这个隐患完全看不出来。

H 在安全链中的地位

H 是 PunsafeP_\mathrm{unsafe} 不等式的源头系数——H 降低一半,即使 L2/L3 拦截率不变,系统不安全概率上界至少降低一半。这就是为什么 H < 0.05 是硬性红线,而不是软性目标。

面对审稿人的预期问题

“H 本质上不就是混淆矩阵的某个子集吗?”

回应:混淆矩阵记录所有错误,H 只追踪有物理安全后果的定向混淆,并与下游安全链形成可推导的数学关系。从指标到系统安全界的闭环,在已有 LLM 指令路由文献中没有见到形式化版本。Related Work 需诚实引用幻觉文献和安全分类文献,再说清 H 的独特之处。

Proposal 质量是什么意思? · 端到端安全链如何建立? · 什么是 EvidencePack?