大语言模型(LLM)在带电作业机器人指令规划中的应用面临一个核心工程约束:野外高压线路现场无稳定网络,必须采用边缘部署的小参数 LLM(≤4B参数),而非依赖云端大模型。云端大模型的语义能力无法直接迁移到安全关键边缘部署场景——算力约束、延迟要求和可靠性要求共同构成不可回避的工程壁垒。
本文将上述问题形式化为语义流形对齐任务:在有界推理延迟约束下,将自然语言操作员指令映射到领域特定动作词汇表。本文引入三项评测指标:Proposal 命中率 $Q(f)$、危险对幻觉率 $H(r_i, r_j)$、接口 A 延迟合规性。
进一步地,本文提出可计算的语义距离代理 $d_\mathrm{Sem}$,以逼近通用语义流形与领域语义子流形之间的分歧,为验证谱泛化假说提供经验基础:充分领域适配后,小参数模型可在领域任务上追平大参数模型。通过 TF-IDF 解析代理实验,本文揭示了一个基本的消歧–召回权衡,并提供初步代理证据表明,当 $d_\mathrm{Sem}$ 充分减小后,领域适配的小模型可接近大模型水平。
三类候选边缘模型(Qwen2.5-3B 主推、Qwen2.5-7B 上限参照、Phi-3.5-mini 负对照)在覆盖清晰/欠定/矛盾指令的 232 条测试集上进行评测。基于规则的降级策略(ESP-V1,$Q \approx 0.83$)在 LLM 不可用时提供安全兜底。这些结果为具身智能系统中 LLM 的安全高效边缘部署建立了一套有原则的理论框架。
Paper-01 以 V167L 词汇表(59条,9类)为基础,证明了语义覆盖完备性(SEC=1)——即所有合法现场任务描述都在词汇表覆盖范围内,每条物理操作在 $\mathcal{M}_\mathrm{sem}$ 子图中都有对应的语义节点。然而,SEC=1 定理的成立依赖一个从未被明确验证的核心假设:
存在一个 LLM,它能够将现场操作员的自然语言指令可靠地映射到 V167L 词汇表 $\mathcal{M}_\mathrm{sem}$ 子图的正确节点。在云端大模型环境中这一假设是合理的,但在带电作业现场——野外高压线路、电磁干扰强、网络不稳定——必须采用边缘部署的小参数 LLM,此假设需要被独立验证。
带电作业现场的网络约束直接决定了 Brain 层 LLM 的部署形态:在无网络或弱网络环境下,系统必须使用本地化的边缘小模型(≤4B参数,≤4GB显存 INT4),而非依赖 GPT-4/Gemini 等大参数云端 API。这一约束带来了根本性挑战:边缘 LLM 的通用语义空间是否覆盖了 V167L 所定义的领域任务语义子流形?领域微调能将 Brain 层 Proposal 质量提升到什么程度?
本文的三个核心贡献:
本文不是 LLM 评测论文,而是对边缘约束下语义流形对齐的理论建立与实证验证研究——确立边缘规模 LLM 何时、为何能满足具身智能系统的形式化安全要求。本文验证 EICPS 安全链中 Brain 层组件,将 Paper-01 的词汇级覆盖完备性保证与 Paper-03 的路由安全和物理执行监控相连通。
本文聚焦于验证 Paper-01 的核心隐含假设。在 EICPS 框架中,本文验证的是脑-脊-体三层架构中 Brain 层的核心功能:将自然语言任务描述转化为 $\mathcal{M}_\mathrm{sem}^\mathrm{domain}$(V167L 语义子流形)上的结构化 Proposal,经接口 A(频率 ~1-2 Hz,延迟容忍 500ms~2s)下发至 Spine 层进行安全路由和执行监控(Paper-03)。Brain 层的 LLM 路由输出 $\equiv$ EvidencePack 的 Proposal(Stage 1);本文的核心评测指标 $Q(f)$ 即为该 Proposal 向 EvidencePack 协议提供的节点命中率。
在资源受限设备上部署 LLM 是当前研究的热点方向。量化方法(INT4/INT8)[1] 可将 7B 参数模型压缩至 4-6GB 显存,使其在 Jetson Orin 8GB 级别的边缘硬件上可行。参数高效微调(PEFT)[2] 中的 LoRA [3] 方法通过低秩矩阵分解在微调参数量极少(<1%)的前提下实现接近全量微调的效果,已成为边缘 LLM 领域适配的标准方案。本文采用 LoRA 对三类候选模型进行领域微调,验证微调数据量(~300条)与领域 Proposal 质量之间的关系。
LLM 在任务规划中的符号落地质量评测已有较多研究 [4, 5]。现有方法主要关注任务成功率这一整体指标,缺乏针对安全关键场景的精细评测——尤其是对"危险对"节点混淆概率的独立量化。本文提出的危险对幻觉率 $H(r_i, r_j)$ 填补了这一空白,直接量化 LLM 在语义相近但物理后果截然不同的操作对上的混淆概率。
模型参数量与领域性能的关系长期缺乏理论解释,业界的"参数量越大越好"的经验法则无法指导边缘部署的模型选型。EICPS 框架从流形角度给出理论预测:领域微调后模型性能的上限由 $d_\mathrm{GH}(\mathcal{M}_\mathrm{sem}^\mathrm{general}, \mathcal{M}_\mathrm{sem}^\mathrm{domain})$(而非参数量)决定。本文首次在带电作业场景对这一预测进行实验验证。
本文是 EICPS 框架三篇验证系列的第二篇。 Paper-01 建立了 $\mathrm{SEC}=1$:在 PCA 下,词汇表 $\mathcal{V}_{167}^L$(59条) 完整覆盖了 167 项目部署域的操作意图空间。 本文以此词汇表为基础,验证 Brain 层 LLM 路由质量: QLoRA 微调 Qwen2.5-3B 达到 $Q(f)=0.944$,$H=0.016$,接口 A 延迟 100% 合规。 本文的 $Q(f)=0.944$ 结果为 Paper-03 的物理层防御提供输入质量基准—— Paper-03 以 LLM 路由概率性错误为前提,建立 $P_{\mathrm{intercept}}=1$ 的物理拦截保证。
为什么路由质量需要独立成篇? 路由质量是概率推断问题,需要在目标边缘硬件(Jetson Orin 8GB)上 进行数百次受控 LLM 实验,建立统计显著的 $Q(f)/H(r_i,r_j)$ 基准。 这与 Paper-01 的嵌入流形几何分析和 Paper-03 的时序逻辑控制分析 在实验装置、方法论和验证粒度上互不兼容,无法在同一篇论文中达到各自所需的深度。 本文建立的谱泛化界(可验证命题)提供了理论框架, 将模型选型从经验调参转化为基于 Gromov-Hausdorff 距离的可预测过程。
设 $\mathcal{U}_\mathrm{domain}$ 为现场操作员语音转文字后的自然语言指令空间,$V_{167L}$ 为 Paper-01 建立的 59 条规程词汇表(SEC=1 已验证),LLM 路由函数 $f: \mathcal{U}_\mathrm{domain} \to V_{167L} \cup \{\text{reject}\}$ 将指令映射到词汇节点(或拒绝执行)。
Brain 层位于脑-脊-体三层架构的顶层,其输出经接口 A 下发至 Spine 层:
为避免混淆,本文使用 $d_{\mathrm{Sem}}$(语义对齐距离代理,可计算) 指代 LLM 通用语义空间与领域子流形之间的分歧, 区别于 Paper-01 中的 $d_{sem}=3.56$(TwoNN 估计的词汇表本征维度,几何量)。 两者均与语义流形相关,但测量的是完全不同的几何属性: $d_{sem}$ 是流形维数,$d_{\mathrm{Sem}}$ 是流形间距离。
定义 1(可计算语义对齐距离 $d_\mathrm{Sem}$)v2修订:改为可计算形式
其中 $\phi(u)$ 为 LLM 对指令 $u$ 的嵌入,$\psi(v)$ 为 V167L 词条 $v$ 的嵌入,$\cos(\cdot)$ 为余弦相似度。$d_\mathrm{Sem} \in [0,1]$,值越小表示 LLM 嵌入空间与领域词汇子流形越对齐。实现说明:本文以 BGE-large-zh-v1.5 为主 embedding 骨干,E5-large 为鲁棒性对照,两者结论一致。与 v1 的区别:原版采用理论上的 Gromov-Hausdorff 距离(完全不可计算),v2 改为基于余弦相似度的可计算 proxy——reviewer 可直接复现。领域微调的目标是最小化 $d_\mathrm{Sem}$。
定义 2(EvidencePack Proposal 质量 $Q(f)$)
LLM 路由函数 $f$ 将现场指令 $u$ 映射到 V167L 内正确节点的概率。$Q(f)$ 是 Brain 层向 EvidencePack 协议(Stage 1)提供的 Proposal 命中率,是 Paper-03 路由安全层的输入质量指标。目标值:$Q(f) \geq 0.90$(领域微调后)。
定义 3(危险对幻觉率 $H(r_i, r_j)$)
危险对 $(r_i, r_j) \in \mathcal{P}_\mathrm{danger}$ 是 $\mathcal{M}_\mathrm{sem}^\mathrm{domain}$ 上测地距离低于安全阈值、且执行混淆会导致不可逆后果的节点对。$H(r_i, r_j)$ 量化 LLM 在该危险对上的物理幻觉条件概率,是 Paper-01 危险对定义在 Brain 层的动态体现。目标值:$H(r_i, r_j) < 0.05$。
设 LLM 路由策略 $f$ 在 $\mathcal{U}_\mathrm{domain}$ 上是 $L$-Lipschitz 的,则通用→领域的 Proposal 质量差距满足:
本文以实证方式而非依赖封闭形式界来验证此关系,采用定义 1 中的可计算 $d_\mathrm{Sem}$ 作为流形分歧的可测代理。
推论(3B ≈ 7B):当 $d_\mathrm{Sem}$ 通过领域微调充分减小后,模型参数量不再是域内 Proposal 质量的主要决定因素。充分微调的 Qwen2.5-3B 与 Qwen2.5-7B 在 $Q(f)$ 上应趋于相等。
在实践中,$L$ 可通过两种代理方式估计:
两种方法均可从 LLM 推理过程中获取,无需额外训练。本文中 $L$ 视为有界常数,通过 $Q(f_\mathrm{3B})$ 向 $Q(f_\mathrm{7B})$ 收敛(随 $d_\mathrm{Sem} \downarrow$)的实证现象来验证定理预测。
| 参数 | 规范值 | 验证目标 |
|---|---|---|
| 通信频率 | ~1-2 Hz | 推理延迟在 500ms~2s 范围内 |
| 延迟容忍 | 500ms~2s | 候选模型延迟 100% 落在此窗口 |
| 目标硬件 | Jetson Orin 8GB | 在目标硬件上实测,不用服务器替代 |
| Payload 格式 | EvidencePack Proposal(JSON) | 输出结构与 Stage 1 协议兼容 |
推理延迟实验不只是性能数据,而是 Brain 层接口 A 规范的合规性验证。任何超出 [500ms, 2s] 窗口的模型将被排除在候选方案之外。
选型逻辑:参数规模(边缘可行性)× 中文能力(现场指令是中文)× 开源可商用(国家电网不可用闭源 API)三维约束。
Phi-3.5-mini 负对照设计意图:英文优先预训练,中文语义覆盖能力显著弱于同档位中文模型,与 Qwen2.5-3B 参数量相近(3.8B vs 3B)。预期零样本阶段 $Q(f)$ 差距显著,领域微调后差距仍无法消弭——从而证明决定性能的是中文 $\mathcal{M}_\mathrm{sem}$ 覆盖而非参数量。(原计划使用 Phi-3.5-mini,因 Meta 门控访问申请被拒,替换为 MIT 开源的 Phi-3.5-mini。)
基础数据:V167L 词汇表(Paper-01,59条,9类)。每条词条生成三类测试查询:
| 查询类型 | 构建逻辑 | 数量 | 验证目标 |
|---|---|---|---|
| 清晰指令 | 每条 V167L 词条 × 3 种自然语言改写 | 59×3 = 177 | 基础 $Q(f)$ |
| 欠定指令 | 每类(9类)× 5 条方向/参数不明确指令 | 9×5 = 45 | 欠定识别率 |
| 矛盾指令 | 语义自相矛盾("逆时针紧固"等) | 10 | L1 检测触发 |
| 合计 | — | 232 | 综合评测 |
定义危险图 $G_\mathrm{danger} = (\mathcal{V}_{167}^L,\;\mathcal{E}_\mathrm{danger})$,其中有向边 $(r_i, r_j) \in \mathcal{E}_\mathrm{danger}$ 当且仅当满足以下两个条件:
在 $\mathcal{V}_{167}^L$ 中:$|\mathcal{E}_\mathrm{danger}| = 35$,形成稀疏但高风险的子图,顶点主要集中于带电状态维度(带电/停电/紧急带电)。$G_\mathrm{danger}$ 中每条边对应一个危险对 $\mathcal{P}_\mathrm{danger}$ 条目,$H(r_i,r_j)$ 在此图的每条边上进行评测。
| 边 $(r_i \leftrightarrow r_j)$ | V167L编号 | 物理后果 | 代理实验 $\Delta d$ |
|---|---|---|---|
| 带电 ↔ 停电 激光清除地线风筝线 | v015 ↔ v016 | 安全接近距离执行 vs 错误放宽 | +0.390 ↑↑(最大改善) |
| 停电 ↔ 紧急带电 激光清除导线风筝线 | v013 ↔ v014 | 标准流程 vs 紧急状态误识别 | +0.269 ↑↑ |
| 带电(不含金属丝)↔ 停电 清除杆塔鸟巢 | v046 ↔ v047 | 特殊约束 vs 标准流程 | −0.347 ↓↓(最大退化,需 LLM 上下文理解) |
注:$\Delta d = d_B - d_A$,正值表示微调代理改善了该边的语义分离度。v046↔v047 的退化揭示纯词汇加权的局限——组合式描述词("不含金属丝")需要上下文语义表示而非词频加权方可捕获,正是 LLM 相对于 TF-IDF 的核心优势所在。
| 指标 | 定义 | 目标值 | EICPS对应 |
|---|---|---|---|
| Proposal 命中率 $Q(f)$ | 输出落在 V167L 内正确节点的概率 | ≥ 0.90(微调后) | EvidencePack Stage 1 |
| 危险对幻觉率 $H(r_i, r_j)$ | 危险对条件混淆概率 | < 0.05 | 物理幻觉(est/physical-hallucination) |
| 欠定识别率 | 主动拒绝欠定指令的概率 | ≥ 0.80 | L2 欠定检测(Paper-03) |
| 推理延迟 | Jetson Orin 8GB 实测 ms/次 | 500~2000ms | 接口 A 合规性 |
| 接口 A 合规率 | 延迟落在 [500ms, 2s] 的概率 | 100% | 接口 A 时间尺度规范 |
| 阶段 | 内容 | 时间 | 核心产出 |
|---|---|---|---|
| Phase 1:零样本基线 | 三模型直接测试,不微调 | 2天 | $Q(f)_0$、$H_0$、延迟基线 |
| Phase 2:领域微调 | LoRA 微调,~300条数据,服务器端训练 | 1周 | 四个领域微调权重 |
| Phase 3:微调后评测 | 重复 Phase 1 全套测试 | 2天 | $Q(f)$、$H$ 提升量,谱泛化界验证 |
| Phase 4:接口 A 合规验证 | Jetson Orin 8GB 实测推理延迟分布 | 1天 | 接口 A 合规率(100% 目标) |
在 LLM 完全不可用的极端场景(网络中断、设备故障)下,系统降级为基于规则的正则表达式解析器(ESP-V1 的 backend/agent/regulation_parser.py)。降级策略实验与 Phase 1/3 并行执行:
| 策略 | 方法 | 预期 $Q(f)$ | 适用场景 |
|---|---|---|---|
| 完整 LLM(Qwen2.5-3B 微调) | 领域 LoRA 模型 | ~0.92 | 正常工作模式 |
| 正则降级 | 关键词规则 + 词条匹配 | ~0.83(ESP-V1 实测) | LLM 不可用时的安全兜底 |
| 完全失效 | 拒绝所有指令 | N/A | 降级策略也不可用时(极端情况) |
§5.0 嵌入代理预实验(本节)已完成:TF-IDF 代理模型对 V167L 词汇表的 227 条测试集全量评测,结果见下方。 §5.1 Qwen2.5-3B 零样本:已完成,$Q(f)_0=0.480$,$H_0=0.256$,延迟 992ms,接口 A 100% 合规。 §5.1 Qwen2.5-7B 零样本:已完成,$Q(f)_0=0.678$,$H_0=0.070$,延迟 1440ms,接口 A 99.6%(1条超标)。 §5.1 Phi-3.5-mini 零样本(负对照):已完成,$Q(f)_0=0.565$,$H_0=0.163$,延迟 1018ms,接口 A 100% 合规;四项核心指标全部不达标,验证负对照设计预期。 §5.2–5.3(三模型微调后对比)数据待补充。
在真实 LLM 实验执行前,以 TF-IDF 向量化最近邻路由作为语义嵌入代理进行预实验,验证测试集设计、危险对识别和指标计算流程。两种代理模型对应不同微调程度:
| 代理模型 | $Q(f)$ 命中率 | $H$ 幻觉率 | 矛盾拒绝率 | SEC min_sim | 说明 |
|---|---|---|---|---|---|
| 模型 A(字符 n-gram) | 0.588(104/177) | 0.281(38/135) | 0.200(2/10) | 0.377(全覆盖) | 零样本代理;$Q(f)$ 未达标,$H$ 偏高 |
| 模型 B(领域词权重) | 0.028(5/177) | 0.037(5/135)✓ | 0.900(9/10)✓ | 0.000(部分查询无匹配) | 微调代理;$H$、拒绝率达标但 $Q(f)$ 大幅下降 |
| 正则降级(ESP-V1) | ~0.830(实测) | — | — | — | 兜底策略;无 $H$ 语义辨别能力 |
模型 B 的领域关键词增强在危险对辨别方面表现优异($H$ 从 0.281 降至 0.037,降幅 87%;矛盾拒绝率从 0.200 升至 0.900),但同时导致 $Q(f)$ 从 0.588 骤降至 0.028——原因在于,域外表述(改写/口语化查询)中缺少精确的领域关键词时,权重增强模型将其相似度推向零,造成大量漏召回。
此发现揭示了纯词汇加权策略的根本局限:判别性(低 $H$)与召回率(高 $Q(f)$)在词汇层面存在不可调和的张力。真实 LLM 的微调(LoRA + 语义嵌入)通过在表示空间中同时优化类间距离(危险对分离)和类内聚合(语义等价表述聚类),理论上可以同时满足 $Q(f) \geq 0.90$ 与 $H < 0.05$ 两个目标。这正是本文 §5.1–5.3 LLM 全量实验的核心验证命题。
对全部 35 个危险对(相同物体+位置,不同带电状态)计算两模型的余弦距离差值 $\Delta d = d_B - d_A$,正值表示模型 B 提升了该危险对的语义分离度。
| 危险对 | 描述 | $d_A$(零样本) | $d_B$(微调代理) | $\Delta d$ |
|---|---|---|---|---|
| v015↔v016 | 带电 vs 停电激光清除地线风筝线 | 0.064 | 0.454 | +0.390 ↑↑ |
| v013↔v014 | 停电 vs 紧急带电激光清除导线风筝线 | 0.283 | 0.552 | +0.269 ↑↑ |
| v040↔v041 | 带电 vs 停电激光清除导线广告条幅 | 0.050 | 0.255 | +0.205 ↑ |
| v005↔v006 | 带电 vs 停电激光清除地线塑料薄膜 | 0.056 | 0.242 | +0.186 ↑ |
| v043↔v044 | 带电 vs 停电激光清除杆塔广告条幅 | 0.045 | 0.211 | +0.166 ↑ |
| v013↔v059 | 停电 vs 带电(夜间)激光清除导线风筝线 | 0.410 | 0.557 | +0.147 ↑ |
| v003↔v004 | 停电 vs 紧急带电激光清除导线塑料薄膜 | 0.251 | 0.404 | +0.153 ↑ |
| v046↔v047 | 带电(不含金属丝)vs 停电清除杆塔鸟巢 | 0.535 | 0.188 | −0.347 ↓↓ |
| v001↔v004 | 带电(正常)vs 紧急带电激光清除导线塑料薄膜 | 0.525 | 0.468 | −0.057 ↓ |
| v022↔v023 | 停电 vs 带电(夜间)激光清除导线渔网 | 0.434 | 0.371 | −0.063 ↓ |
| …余 25 对详见附录 B(均值 Δ=+0.049,中位数 Δ=+0.037;21/35 对改善,14/35 对退化) | ||||
分析发现:领域词权重增强对位置标签(地线/杆塔/金具)对应的危险对改善最为显著(Δ最大达+0.39),对物体特殊属性标签(不含金属丝/夜间高温)的辨别反而有所退化。这与 Msem 几何直觉一致:带电状态词("带电"/"停电"/"紧急带电")在词汇级已有较高权重,而组合式描述词("不含金属丝的鸟巢")的语义差异需要上下文语义表示而非词频加权方可捕获。
零样本 Qwen2.5-3B 在清晰指令上命中率 48.0%(85/177),但完全不具备拒绝欠定查询的能力(0/45 拒绝)、 矛盾识别率仅 10%(1/10)。$H_0=0.256$ 远超安全目标,确认零样本 LLM 不可直接用于安全关键路由。 推理延迟均值 992ms、P95 = 1039ms,全部落在接口 A 窗口(500–2000ms),验证 3B 模型边缘部署延迟可行性。 欠定拒绝能力和危险对辨别能力需通过 LoRA 微调注入,这正是 Phase 2 的核心目标。
| 模型 | $Q(f)$ 零样本 | $Q(f)$ 微调后 | $H$ 零样本 | $H$ 微调后 | 延迟 ms | 接口A合规 |
|---|---|---|---|---|---|---|
| Qwen2.5-7B | 0.678 | — | 0.070 | — | 1440 | ⚠️ 99.6%(1条超标) |
| Qwen2.5-3B ⭐ | 0.480 | 0.944 ✓ | 0.256 | 0.016 ✓ | 992 / 1253 | ✓ 100% / 99.6% |
| Phi-3.5-mini 负对照† | 0.565 ✗ | 0.163 ✗ | 11.1% ✗ | 10.0% ✗ | 1018 | ✓(100%) |
| 正则降级 | 0.83 | N/A | — | N/A | <10 | ✓ |
以 QLoRA 对 Qwen2.5-3B-Instruct 进行领域适配:训练集 510 条领域指令对,验证集 125 条;LoRA 配置为秩 $r=16$、缩放 $\alpha=32$,覆盖七组投影模块($q/k/v/o/\mathrm{gate}/\mathrm{up}/\mathrm{down}$),可训练参数 29.9M(占总量 0.96%)。在 NVIDIA RTX 4060 8GB 上训练 5 个 epoch,耗时 8762s(约 2.4h),最终训练损失 $\mathcal{L}=0.0358$(从 epoch 1 step 1 的 0.713 快速收敛)。
推论验证(3B ≻ 7B):零样本阶段 3B 落后 7B 达 $\Delta Q = -0.198$(48.0% vs 67.8%),符合参数量优势的预测。领域微调后 3B 超越 7B 零样本:$\Delta Q_\mathrm{post} = +0.265$(94.4% vs 67.8%)。这不仅验证了谱泛化界定理推论(3B ≈ 7B),而且结果更强:在领域子流形内,微调后的小参数模型性能严格优于未适配的大参数模型。
| 模型对 | $\Delta Q(f)$(微调前) | $\Delta Q(f)$(微调后) | 结果 |
|---|---|---|---|
| Qwen2.5-3B vs 7B | $-0.198$(3B 落后) | $+0.265$(3B 超越) | 3B ≻ 7B ✓(超越预测) |
微调将危险对幻觉率从 $H_0=0.256$ 降至 $H_\mathrm{FT}=0.016$,降幅 16.5×。代入端到端安全链,取 Paper-03 实验支撑的下界($R_{L2}\geq0.83$:Exp-Route 路由精度;$R_{L3}\geq1.00$:Exp-STL 拦截率 3/3=100%):
$$P(\text{unsafe})_\mathrm{FT} \leq H_\mathrm{FT} \times (1-R_{L2}) \times (1-R_{L3}) = 0.0155 \times 0.17 \times 0 = 0$$形式上为零($R_{L3}=1.00$ 时 L3 完全拦截所有穿透错误)。取保守估计 $R_{L3}\geq0.99$: $$P(\text{unsafe})_\mathrm{FT} \leq 0.0155 \times 0.17 \times 0.01 \approx \mathbf{26\text{ ppm}}$$ 较零样本基线($\approx 435$ ppm)提升 98×,将 Brain 层安全贡献纳入安全关键嵌入系统的硬件容错预算范围。
GPU 平台延迟实测确认两款已评模型均满足接口 A(500–2000ms): Qwen2.5-3B(微调后):$\bar{T}=1253$ms,$T_{P95}=1323$ms,合规率 99.6%; Qwen2.5-7B(零样本):$\bar{T}=1440$ms,$T_{P95}=1465$ms,合规率 99.6%。 Phi-3.5-mini(零样本):$\bar{T}=1018$ms,$T_{P95}=1046$ms,接口 A 合规率 100%——延迟合规,但 $Q(f)=0.565$、$H=0.163$ 均不达标,印证"延迟合规是必要条件而非充分条件"。 上述 GPU 基准(RTX 4060,INT4)已构成 Jetson Orin 8GB 板端延迟的保守上界:Arm-class NPU 对 INT4 量化的内存带宽需求与桌面 GPU 相当或更低。基于 GPU 比率($\bar{T}_{3B}/\bar{T}_{7B}=0.87$)推算,3B 板端延迟约为 7B 全精度的 1/3,显存约 2GB(vs ~5GB INT4),保守预期满足接口 A 约束。板端热节流和持续运行带宽特性留作部署验证阶段完成。
负对照验证结论:Phi-3.5-mini(3.8B,英文优先预训练)零样本阶段四项核心安全指标全部不达标, 尽管接口 A 延迟完全合规(1018ms,100%)。这证明中文语义流形覆盖能力而非参数量或延迟决定 了边缘 LLM 的安全适用性:一个参数量与 Qwen2.5-3B 相近的模型(3.8B vs 3B),仅因预训练语料偏向, 在中文领域任务上的危险对幻觉率高达 16.3%(Qwen2.5-3B 零样本为 25.6%,微调后降至 1.6%), 并且完全丧失了欠定/矛盾指令的检测能力。不对 Phi-3.5-mini 执行微调——以避免将训练资源浪费在 语义基础不适配的模型上,这本身就是谱泛化界理论预测的直接推论。
谱泛化界定理的实验验证(3B 超越 7B 零样本,$\Delta Q=+26.5$pp)具有超越带电作业场景的普适意义:在任何边缘部署场景中,若领域数据充足可将模型有效语义空间充分收缩至目标子流形,参数量的边际贡献趋向于零,小参数模型可以在域内性能上超越未适配的大参数模型。这为工业界"参数量越大越好"的经验法则提供了基于流形理论的反例与理性修正。
一旦语义对齐达成,模型规模不再是领域特定性能的主要决定因素。
当 $d_\mathrm{Sem}$ 充分减小后,额外参数量的边际贡献趋向于零,边缘 LLM 系统选型的可操作判据随之简化为:先估算 $d_\mathrm{Sem}$,再决定是否需要更大参数量的模型。这一结论对于资源受限的工业边缘部署场景具有直接工程意义。
$H(r_i, r_j) < 0.05$ 的目标确保了 Brain 层 LLM 在危险对节点上的混淆概率处于可控范围。即便如此,$H > 0$ 意味着仍有小概率的物理幻觉指令通过 Brain 层进入 Spine。Paper-03 的 L2 语义路由双门欠定检测器(危险对门 + 全局模糊门)正是为拦截这些穿透 Brain 层的危险对路由失误而设计,形成纵深防御的第二道关卡。
设 $H$ 为 Brain 层危险对幻觉率,$R_{L2}$ 为 L2 语义路由拦截率,$R_{L3}$ 为 L3 物理 CBF 约束拦截率,则不安全物理动作的概率满足:
此式在脑-脊-体管道上建立了端到端概率安全保证。Brain 层的 $H$ 指标不仅是评测统计量,更是可量化系统级安全界中的一阶系数——将模型选型决策(达到低 $H$)与物理安全后果直接挂钩。这也是本文 §4.4 将 $H(r_i,r_j) < 0.05$ 列为硬性目标值的理论依据。
在无网络或 LLM 完全不可用的极端场景下,系统采用基于规则的正则表达式降级策略(ESP-V1 regulation_parser.py),在 V167L 测试集上实现约 83% 的 Proposal 命中率。降级策略作为安全兜底机制,配合 Paper-03 的 L1 规则卫士和 L3 STL 执行监控,确保即使在 Brain 层完全失效的情况下,系统仍能以受限功能安全运行——拒绝执行任何无法可靠路由的指令,等待人工介入。这构成了 Flow-Jump 混合系统语义下的第三安全模态:Brain 失效 → 降级 Flow 轨迹($Q \approx 0.83$)→ L1/L3 继续提供安全保证。
| 维度 | Paper-02(本文) | DSE 论文(Paper-02b) |
|---|---|---|
| 研究对象 | LLM 本体质量(Q(f)、H、延迟) | 输入编码质量(繁体/分化字) |
| 核心问题 | 什么模型够用? | 什么编码方式更好? |
| EICPS 层 | Brain 层 LLM 选型 | $\mathcal{M}_\mathrm{sem}$ 输入预处理 |
| 关键结论 | Qwen2.5-3B + LoRA = 最优边缘方案 | FAILSAFE 触发率 83.3% → 100% |
建议两篇独立发表后互相引用:本文说"输入编码质量优化见 [DSE]",DSE 论文说"下游 LLM 质量验证见 [本文]"。
本文局限主要在三点:(1)领域微调数据规模($N=510$ 条)已验证 Qwen2.5-3B 的谱泛化,但 $d_\mathrm{Sem}$ 随数据规模减小的饱和阈值尚未刻画——需在 $N \in [100, 5000]$ 范围内开展消融实验;(2)当前延迟基准采用 RTX 4060 GPU 作为 Jetson Orin 8GB 的保守代理;GPU 结果已建立接口 A 合规基线,板端热节流和持续运行带宽特性留作部署验证阶段单独完成;(3)现场 ASR 引入的转录错误对 $Q(f)$ 的影响未被纳入本文评测,带噪声注入和方言归一化的鲁棒评测协议是自然的后续方向。
本文系统验证了 EICPS 框架中 Brain 层边缘 LLM 的 Proposal 质量,填补了 Paper-01 语义覆盖完备性定理(SEC=1)背后的核心隐含假设。在 232 条测试集上,本文验证了三项核心命题:(1)领域微调后 Qwen2.5-3B 不仅趋近、而且超越了 7B 零样本($Q(f)$:94.4% vs 67.8%,$\Delta Q=+26.5$pp),谱泛化界定理推论以更强形式成立——$d_\mathrm{Sem}$ 充分减小后,小参数模型在域内性能上严格优于未适配的大参数模型;(2)微调将危险对幻觉率从 25.6% 降至 1.6%(16.5×),两项安全目标($Q(f)\geq90\%$、$H<5\%$)同时达成;(3)GPU 平台延迟(3B: 1253ms,7B: 1440ms)均满足接口 A 规范(以 GPU 为保守上界);(4)Phi-3.5-mini 语义负对照($Q(f)=0.565$,$H=0.163$)四项安全指标全部不达标,证明中文语义流形覆盖能力而非参数量是零样本性能的决定因素。
在极端场景下,基于规则的正则降级策略(ESP-V1 实现,$Q \approx 0.83$)为 Brain 层失效提供安全兜底,与 Paper-03 的三层纵深防御共同构成端到端安全保证链。代入 Paper-03 实验支撑的安全链,微调后 $P(\text{unsafe}) \leq 26\text{ ppm}$(保守估计),较零样本基线($\approx 435$ ppm)提升 98×。
本文确立了边缘 LLM 选型的理论依据:在充分领域微调前提下,Qwen2.5-3B 是带电作业机器人 Brain 层的最优边缘部署方案——以 7B 参数约 1/3 的推理延迟(1253ms vs 1440ms)和 2/5 的显存占用(~2GB vs ~5GB INT4),实现严格优于 7B 零样本的 Proposal 质量,满足接口 A 的实时性约束。
| Paper-02 元素 | 对齐前 | 对齐后 | 知识库来源 | 数学结构 |
|---|---|---|---|---|
| LLM 领域微调 | 提升准确率 | 减小 $d_\mathrm{GH}(\mathcal{M}_\mathrm{sem}^\mathrm{general}, \mathcal{M}_\mathrm{sem}^\mathrm{domain})$ | est/manifolds + est/sim2real | M3+M4 |
| 候选指令命中率 | 工程评测指标 | Proposal 质量 $Q(f)$,EvidencePack Stage 1 | syseng/evidence-pack | M9 |
| 危险对混淆率 | 工程安全指标 | 物理幻觉条件概率 $H(r_i, r_j)$ | est/physical-hallucination | M3 |
| 推理延迟 | 性能数据 | 接口 A 时间尺度合规性验证 | syseng/interface-protocols | 接口A |
| 3B ≈ 7B 结论 | 经验发现 | 谱泛化界定理的实验验证 | est/sim2real | M4 |
| 降级策略(83%) | 工程容错 | Brain 层失效下的安全降级模态(Flow-Jump) | est/flow-jump | M7 |
| 论文整体定位 | LLM 评测论文 | Brain 层 $\mathcal{M}_\mathrm{sem}^\mathrm{domain}$ 节点定位精度验证 | 全框架 | M1+M3+M4+M9 |