Brain 层边缘 LLM 的 Proposal 质量是什么意思?

Paper-02 的核心问题可以一句话表达:

在边缘硬件约束下(≤ 4B 参数、INT4 量化、Jetson Orin 8GB),LLM 接收操作员的自然语言指令,能不能稳定输出 V167L 词汇表中正确的那一条——尤其是在语义相近的危险对节点上不出错?

“Proposal 质量”就是对这个”能不能”的系统量化。

Brain层Proposal质量概览:信息流、三个指标和端到端安全链

信息流

ASR(语音→文字)→ Brain LLM → Proposal {"id":"v015","conf":0.91}
                                    ↓ 接口 A(500–2000ms)
                                  Spine(安全路由 L1/L2/L3)

Brain 层唯一的输出是 EvidencePack Proposal(Stage 1):V167L 59 条词条中的一条词条 ID,加置信度。这条结构化记录经接口 A 下发给 Spine,触发后续的安全路由和物理执行。

三个指标

Q(f) — Proposal 命中率

Q(f)=P ⁣(f(u)V167L,correct  |  uUdomain)Q(f) = P\!\left(f(u) \in \mathcal{V}_{167}^{L,\mathrm{correct}} \;\middle|\; u \in \mathcal{U}_\mathrm{domain}\right)

LLM 输出落在 V167L 内正确节点的概率。零样本实测:0.480(85/177 清晰指令)。目标:微调后 ≥ 0.90。

H(rᵢ,rⱼ) — 危险对幻觉率

H(ri,rj)=P ⁣(f(u)=ri  |  intent(u)=rj),(ri,rj)PdangerH(r_i,r_j) = P\!\left(f(u)=r_i \;\middle|\; \mathrm{intent}(u)=r_j\right),\quad (r_i,r_j)\in\mathcal{P}_\mathrm{danger}

在危险对节点上,把 rjr_j 错误路由成 rir_i 的概率。零样本实测:0.256(4 条危险指令里 1 条路由错误)。目标:微调后 < 0.05。

接口 A 合规率

推理延迟落在 [500ms, 2000ms] 内的比例。零样本实测:100%,均值 992ms,P95 = 1039ms。这项零样本已达标,3B 模型的边缘部署延迟可行性得到验证。

三个指标的关系

三个指标独立,不能互相替代:

  • Q(f) 高但 H 也高 → 总体答对,但危险场景下会幻觉,不可部署
  • Q(f) 高、H 低但延迟超标 → 语义能力够但实时性不满足接口 A
  • 三个同时满足 → Brain 层验证通过,可以进入 Spine 层部署

为什么这是 Paper-02 的核心问题

Paper-01 已经证明 V167L 词汇表的覆盖完备性(SEC = 1):理论上每条合法操作员指令都能被词汇表中的某个节点覆盖。但那是”词汇表设计得够不够用”的问题。

Paper-02 验证的是另一个此前从未独立验证的隐含假设:真实 LLM 在边缘约束下能否实现这个覆盖。零样本结果(Q = 0.48,H = 0.256)表明不能;LoRA 微调目标(Q ≥ 0.90,H < 0.05)是让理论保证在工程层面成立的前提。

Proposal 质量在安全链中的地位

P(unsafe)H(1RL2)(1RL3)P(\mathrm{unsafe}) \leq H \cdot (1 - R_{L2}) \cdot (1 - R_{L3})

HH 是这个不等式的源头系数——Brain 层的危险对幻觉率直接决定了系统不安全概率的上界。H 降低一半,即使 L2/L3 拦截率不变,系统不安全概率至少降低一半。这就是为什么 H < 0.05 是硬性目标,而不只是评测统计量。

Proposal 是结构化表达吗? · 语义流形对齐是什么? · 什么是 EvidencePack?