Brain 层边缘 LLM 的 Proposal 质量是什么意思?
Paper-02 的核心问题可以一句话表达:
在边缘硬件约束下(≤ 4B 参数、INT4 量化、Jetson Orin 8GB),LLM 接收操作员的自然语言指令,能不能稳定输出 V167L 词汇表中正确的那一条——尤其是在语义相近的危险对节点上不出错?
“Proposal 质量”就是对这个”能不能”的系统量化。
信息流
ASR(语音→文字)→ Brain LLM → Proposal {"id":"v015","conf":0.91}
↓ 接口 A(500–2000ms)
Spine(安全路由 L1/L2/L3)
Brain 层唯一的输出是 EvidencePack Proposal(Stage 1):V167L 59 条词条中的一条词条 ID,加置信度。这条结构化记录经接口 A 下发给 Spine,触发后续的安全路由和物理执行。
三个指标
Q(f) — Proposal 命中率
LLM 输出落在 V167L 内正确节点的概率。零样本实测:0.480(85/177 清晰指令)。目标:微调后 ≥ 0.90。
H(rᵢ,rⱼ) — 危险对幻觉率
在危险对节点上,把 错误路由成 的概率。零样本实测:0.256(4 条危险指令里 1 条路由错误)。目标:微调后 < 0.05。
接口 A 合规率
推理延迟落在 [500ms, 2000ms] 内的比例。零样本实测:100%,均值 992ms,P95 = 1039ms。这项零样本已达标,3B 模型的边缘部署延迟可行性得到验证。
三个指标的关系
三个指标独立,不能互相替代:
- Q(f) 高但 H 也高 → 总体答对,但危险场景下会幻觉,不可部署
- Q(f) 高、H 低但延迟超标 → 语义能力够但实时性不满足接口 A
- 三个同时满足 → Brain 层验证通过,可以进入 Spine 层部署
为什么这是 Paper-02 的核心问题
Paper-01 已经证明 V167L 词汇表的覆盖完备性(SEC = 1):理论上每条合法操作员指令都能被词汇表中的某个节点覆盖。但那是”词汇表设计得够不够用”的问题。
Paper-02 验证的是另一个此前从未独立验证的隐含假设:真实 LLM 在边缘约束下能否实现这个覆盖。零样本结果(Q = 0.48,H = 0.256)表明不能;LoRA 微调目标(Q ≥ 0.90,H < 0.05)是让理论保证在工程层面成立的前提。
Proposal 质量在安全链中的地位
是这个不等式的源头系数——Brain 层的危险对幻觉率直接决定了系统不安全概率的上界。H 降低一半,即使 L2/L3 拦截率不变,系统不安全概率至少降低一半。这就是为什么 H < 0.05 是硬性目标,而不只是评测统计量。