方法详解

问题形式化

Brain 层安全路由要求

设操作员自然语言指令集合为 Udomain\mathcal{U}_{\mathrm{domain}},V167L 词汇表为 V167L\mathcal{V}_{167}^L(59 条,Paper-01 验证 SEC=1)。Brain 层 LLM 实现路由函数:

f:UV167L{reject}f: \mathcal{U} \to \mathcal{V}_{167}^L \cup \{\text{reject}\}

安全路由需同时满足两个独立条件:

  • 全局命中率 Q(f)=P(r^=ruUdomain)0.90Q(f) = P(\hat{r} = r^* | u \sim \mathcal{U}_{\mathrm{domain}}) \geq 0.90
  • 危险对幻觉率 H(ri,rj)=P(f(u)=riintent(u)=rj)<0.05H(r_i, r_j) = P(f(u)=r_i | \mathrm{intent}(u)=r_j) < 0.05(ri,rj)Pdanger\forall (r_i,r_j) \in \mathcal{P}_{\mathrm{danger}}

两者独立不可互替:7B 零样本模型 Q=0.678Q=0.678(不满足),但 H=0.070H=0.070(接近满足);3B 零样本 Q=0.480Q=0.480H=0.256H=0.256——两者均不满足,微调是必要条件。

d_Sem:子流形距离形式化微调目标

通用预训练 LLM 的嵌入空间在 Msemgen\mathcal{M}_{\mathrm{sem}}^{\mathrm{gen}}(通用语义流形)上训练,与领域子流形 Msemdomain\mathcal{M}_{\mathrm{sem}}^{\mathrm{domain}}(V167L 词条张成的紧致子图)存在测地距离。定义:

dSem=11VvVmaxuUtraincos(ϕ(u),ψ(v))d_{\mathrm{Sem}} = 1 - \frac{1}{|\mathcal{V}|} \sum_{v \in \mathcal{V}} \max_{u \in \mathcal{U}_{\mathrm{train}}} \cos(\phi(u), \psi(v))

其中 ϕ(u)\phi(u) 为 LLM 指令嵌入,ψ(v)\psi(v) 为 BGE-large-zh-v1.5 领域参考嵌入。dSemd_{\mathrm{Sem}} 越小,LLM 在 V167L 子流形邻域的路由越精确。


QLoRA 微调配置

参数配置
基座模型Qwen2.5-3B-Instruct
量化精度4-bit NF4(bitsandbytes)
LoRA rank16,alpha=32
目标模块q_proj, v_proj, k_proj, o_proj
学习率2×10⁻⁴(余弦衰减)
训练轮次5 epochs
Batch size8(梯度累积×4)
VRAM 峰值6.8 GB(RTX 4090 24G)
推理精度bfloat16

训练数据构造

510 条训练样本来自三类来源:

模板扩充(V167L × 8 改写):对每条 V167L 词条生成 8 种自然语言表述(简短命令、完整操作描述、带语境前缀、含 ASR 转录噪声等),共 59×8=472 条。

危险对强化(|E_danger|=35 条边):对每个危险对 (ri,rj)Pdanger(r_i, r_j) \in \mathcal{P}_{\mathrm{danger}} 构造混淆样本并标注正确路由,防止 H 虚高。

欠定/矛盾样本:构造语义欠定(“再检查一下”)和矛盾指令(“先拧紧再拆开”),标注为 reject,共 15 条。

验证集 125 条,按任务类别分层采样(9 类均衡)。


谱泛化界

基于 Paper-01 Theorem 1 推广,跨域 Proposal 质量差距上界为:

Q(fgen)Q(fdom)LdSemQ(f_{\mathrm{gen}}) - Q(f_{\mathrm{dom}}) \leq L \cdot d_{\mathrm{Sem}}

其中 L=E[ulogPf]L = \mathbb{E}[\|\nabla_u \log P_f\|] 为 Lipschitz 常数(实践中以梯度范数代理 L^\hat{L})。

此界说明:dSemd_{\mathrm{Sem}} 是 Brain-LLM 选型和微调效果的理论上界估计器,为跨模型对比(3B/7B/Phi-3.5)提供统一理论框架。