方法详解

三层纵深防御架构概览

纵深防御架构将自然语言执行误差链的三个风险点分配到三个独立可验证的防御层:

L1(规程合规)  通过  L2(语义路由)  通过  L3(物理执行)  通过  安全执行\text{L1(规程合规)} \;\xrightarrow{\text{通过}}\; \text{L2(语义路由)} \;\xrightarrow{\text{通过}}\; \text{L3(物理执行)} \;\xrightarrow{\text{通过}}\; \text{安全执行}

任何一层触发 FAILSAFE,立即终止执行链,无需后续层介入。


L1:领域规则守卫

L1 层基于 Paper-01 验证的 V167L\mathcal{V}_{167}^L(59 条,SEC=1)构建领域词汇表边界检测。

对任意自然语言指令 uu,计算其与词汇表的最小嵌入距离:

dmin(u,V)=minvV167Ldemb(u,v)d_{\min}(u, \mathcal{V}) = \min_{v \in \mathcal{V}_{167}^L} d_{\mathrm{emb}}(u, v)

L1 判决规则

L1(u)={通过dmin(u,V)<τdep=0.30FAILSAFEdmin(u,V)τdep\text{L1}(u) = \begin{cases} \text{通过} & d_{\min}(u, \mathcal{V}) < \tau_\mathrm{dep} = 0.30 \\ \text{FAILSAFE} & d_{\min}(u, \mathcal{V}) \geq \tau_\mathrm{dep} \end{cases}

其中 τdep=0.30\tau_\mathrm{dep}=0.30 由 Paper-01 Step D 实验确定(规程外指令距离均 0.30\geq 0.30,合规区阈值 τ=0.0291\tau^*=0.0291,安全间隙 0.115)。


L2:正交化词汇语义路由

布里丹之驴困境

Paper-02 验证的 Brain-LLM(Q(f)=0.944Q(f)=0.944)使用完整 V167L\mathcal{V}_{167}^L(59 条)路由时,危险对 (R07,R09)(R_{07}, R_{09}) 的嵌入距离为:

dorig(R07,R09)=0.1225d_{\mathrm{orig}}(R_{07}, R_{09}) = 0.1225

仅略高于全局 dmin=0.0734d_\mathrm{min}=0.0734,当路由置信度差 <δ/2< \delta/2 时,模型进入布里丹之驴困境——两个选项等距但含义相反(拧松 vs 拧紧)。

跨域正交化原理

核心观察R07R_{07}(Phase 2:拆除阶段)与 R09R_{09}(Phase 3:安装阶段)来自不同任务域。通过在词条描述中纳入相位标签(Phase Labels),强制编码任务目的差异:

词条v1.0(无相位)v2.0(含相位标签)
R07”拧松螺栓固定夹具”[P2-Remove] 拧松螺栓固定夹具(拆除阶段)
R09”拧紧螺栓固定夹具”[P3-Install] 拧紧螺栓固定夹具(安装阶段)

效果:P2-Remove 与 P3-Install 编码正交任务目的,嵌入距离跃升至:

dortho(R07,R09)=0.1889(+54%)d_{\mathrm{ortho}}(R_{07}, R_{09}) = 0.1889 \quad (+54\%)

全局 dmind_\mathrm{min} 同步提升:0.07340.11730.0734 \to 0.1173+60%+60\%),消除之前的”隐藏危险对”问题。

五步消融实验(V_damp 设计)

VdampV_\mathrm{damp} 词汇表从 v1.0 逐步演进到 v2.0 的消融过程:

步骤添加维度d(R07,R09)d(R_{07},R_{09})Δ\Delta
1基础描述(动词+宾语)0.1225
2+ 动作方向(顺时针/逆时针)0.1520+0.0295
3+ 力矩值(拧紧力矩范围)0.1734+0.0214
4+ 结果状态(disengage/secure)0.1987+0.0253
5+ 跨域相位标签(P2/P3)0.1889

注:步骤 5 在步骤 4 基础上重新平衡,最终 v2.0 的全局 dmind_\mathrm{min} 更优(0.1173 vs 步骤 4 的局部优化值),消除隐藏危险对副作用。

二门检测机制

L2 层在路由前执行二门检测:

门 1(全局歧义门)Δglobal=d(r^1,r^2)δ,δ=0.05\Delta_\mathrm{global} = d(\hat{r}_1, \hat{r}_2) \geq \delta, \quad \delta = 0.05

Δglobal<δ\Delta_\mathrm{global} < \delta,指令语义欠定,触发 reject(对应 “under-specification”)。

门 2(危险对安全门)dgap(r^1,r^j)δ/2,jNdanger(r^1)d_\mathrm{gap}(\hat{r}_1, \hat{r}_j) \geq \delta/2, \quad \forall j \in \mathcal{N}_\mathrm{danger}(\hat{r}_1)

若危险对之一进入 δ/2\delta/2 邻域,触发人机协同确认(conservative failure,非静默误路由)。


L3:STL 执行监控

L3 层基于信号时序逻辑(STL)形式化物理约束,对实时力矩/位移传感器数据执行监控。

STL-101:力矩约束

φ101:[tact,T](τ(t)[40,60]  Nm)\varphi_{101}: \square_{[t_\mathrm{act}, T]}\bigl(\tau(t) \in [40, 60]\;\mathrm{N{\cdot}m}\bigr)

其中 tact=25st_\mathrm{act}=25\,\mathrm{s}(螺栓锁紧激活时刻),T=60sT=60\,\mathrm{s}(任务时长)。

鲁棒性度量(STL 鲁棒度):

ρ(φ101)=mint[tact,T]min(τ(t)40,  60τ(t))\rho(\varphi_{101}) = \min_{t \in [t_\mathrm{act}, T]} \min\bigl(\tau(t) - 40,\; 60 - \tau(t)\bigr)

ρ>0\rho > 0 表示处于安全区间;ρ<0\rho < 0 立即触发 FAILSAFE。在 σ=0.5Nm\sigma=0.5\,\mathrm{N{\cdot}m} 基准噪声下,ρˉS1=4.34±0.40Nm\bar{\rho}_{S1} = 4.34 \pm 0.40\,\mathrm{N{\cdot}m},安全裕度充足。

STL-102:位置约束

φ102:[tver,T](θ(t)[θrefε,  θref+ε])\varphi_{102}: \diamond_{[t_\mathrm{ver}, T]}\bigl(\theta(t) \in [\theta_\mathrm{ref} - \varepsilon,\; \theta_\mathrm{ref} + \varepsilon]\bigr)

其中 θref\theta_\mathrm{ref} 为规程规定的目标角位移,ε\varepsilon 为验收容差。STL-102 在验收阶段(ttvert \geq t_\mathrm{ver})对位置偏移类错误(S4 场景)进行独立检测。

FAILSAFE 作为 Flow-Jump 系统的 Jump 集

FAILSAFE 机制直接实例化为 EICPS 框架的 Flow-Jump 混杂系统 H=(C,f,D,g)\mathcal{H} = (C, f, D, g)

C={x:ρ(φ101,σ)0}C = \{x : \rho(\varphi_{101}, \sigma) \geq 0\} Demergency={x:ρ(φ101,σ)<0}\mathcal{D}_\mathrm{emergency} = \{x : \rho(\varphi_{101}, \sigma) < 0\} gemergency(x)=xsafe-haltg_\mathrm{emergency}(x) = x_\mathrm{safe\text{-}halt}

正常执行在连续流集 CC 中进行;当鲁棒度 ρ<0\rho < 0 时,系统迁移至离散跳转集 Demergency\mathcal{D}_\mathrm{emergency},执行安全停止映射 gemergencyg_\mathrm{emergency}(立即制动 + 安全状态复位)。