论文专著 具身空间 形式化自主验证链

规划质量的几何度量(V-PLN)

写作中

提出规划质量的几何度量框架,将大模型幻觉量化为语义流形上的分歧度

⚠️ 已废止表述 · 历史页面 V0.1

本章属专著书稿 V0.1 版,整体定格为历史快照。书稿将依据《EICPS 与具身空间 ES 理论阶段性梳理 V0.2》整体修订(三流形相乘、语义流形、Spine 单层等表述废止);修订完成前网站不逐章更新。现行口径见修订说明与各栏目 V0.2 页面。 现行口径以 V0.2 修订说明 为准。

V-PLN是验证链的第二环,解决一个本质困难的问题:如何形式化地评估大语言模型规划输出的质量?答案不是通过人工评估(不可扩展)或统计基准测试(不可解释),而是通过几何度量——将LLM幻觉量化为语义流形上的可测量距离。


12.1 规划质量评估的核心挑战

12.1.1 LLM规划质量的定义问题

“规划质量好”是一个直觉清晰但形式定义困难的概念。直觉上,规划质量好意味着:LLM生成的任务分解(HTN树)正确反映了实际应执行的操作序列,生成的ESTL描述准确捕获了任务的语义意图,所选择的规约模板参数与实际场景约束一致。但将这些直觉转化为可量化的指标,需要一个基准(“正确规划”是什么),而在实际部署中,“正确规划”本身可能是未知的(没有先验的ground truth)。

EICPS的解决方案是将规划质量转化为几何一致性度量:正确的规划应当生成在 Msem\mathcal{M}_{\mathrm{sem}} 上与任务描述语义一致的输出;不一致(幻觉)则表现为LLM输出的语义位置与任务描述的语义位置在 Msem\mathcal{M}_{\mathrm{sem}} 上存在可测量的偏差。这种转化将主观的”质量好坏”判断转化为客观的”几何距离测量”,是V-PLN的核心思想。

12.1.2 LLM幻觉的几何本质

大语言模型的幻觉(Hallucination)在语义流形上有一个几何解释:模型生成的内容在表面上语言流畅、符合语法,但其语义位置(在 Msem\mathcal{M}_{\mathrm{sem}} 上的嵌入位置)与给定任务描述的语义位置存在显著偏离。这种偏离不一定是随机的——LLM倾向于向其训练数据中高频出现的语义区域”漂移”,即使当前任务描述指向了一个不同的语义区域。

几何视角使幻觉变得可以定量化:偏离越大,幻觉越严重;偏离方向(漂移到哪个语义区域)揭示了幻觉的根本原因(向哪类训练数据漂移)。这为幻觉的诊断和修复提供了比单纯”错误/正确”标注更丰富的信息。

12.1.3 V-PLN在验证链中的作用

V-PLN的验证目标可以精确表述为:给定V-SEM验证通过(语义路由正确)的前提,证明对V-167中每个词汇条目类型的任务,LLM规划模块生成的ESTL描述的规划质量 Q(f)Q(f) 满足预设的下界 QminQ_{\min}。这里 Q(f)Q(f) 是本章定义的几何规划质量度量,QminQ_{\min} 是从安全执行角度确定的最低可接受质量阈值。V-PLN通过则保证了”在正确的语义类别下,规划质量有形式化的下界保证”,是V-SAF执行安全验证的前提条件。


12.2 规划质量度量 Q(f) 的定义

12.2.1 语义一致性的形式化

给定任务描述 τMsem\tau \in \mathcal{M}_{\mathrm{sem}} 和LLM生成的ESTL描述 e(τ)e(\tau)规划质量定义为 τ\taue(τ)e(\tau) 的语义嵌入向量在 Msem\mathcal{M}_{\mathrm{sem}} 上的一致性度量:

Q(f)(τ)=cos(v(τ),v(e(τ)))=v(τ),v(e(τ))v(τ)v(e(τ))Q(f)(\tau) = \cos(v(\tau), v(e(\tau))) = \frac{\langle v(\tau), v(e(\tau)) \rangle}{\|v(\tau)\| \cdot \|v(e(\tau))\|}

其中 v():MsemR768v(\cdot): \mathcal{M}_{\mathrm{sem}} \to \mathbb{R}^{768} 是语义嵌入函数(将ESTL描述编译为STL规约后,计算规约的”执行意图”嵌入向量)。Q(f)(τ)=1Q(f)(\tau) = 1 表示完全语义一致(LLM规划完美捕获了任务意图),Q(f)(τ)<QminQ(f)(\tau) < Q_{\min} 表示规划质量不足(存在需要干预的幻觉)。

12.2.2 Q(f) 的多维分解

单一的 Q(f)Q(f) 值提供了规划质量的整体评估,但对调试和改进不够具体。EICPS将 Q(f)Q(f) 分解为三个维度:任务类型一致性 QtypeQ_{\mathrm{type}}(LLM路由的词汇类型是否与V-SEM的语义路由结果一致?)、阶段序列一致性 QseqQ_{\mathrm{seq}}(HTN分解树的阶段顺序是否与规范流程一致?)、参数一致性 QparamQ_{\mathrm{param}}(ESTL中的数值参数与规约库模板参数的偏差)。三个维度的加权组合给出总体 Q(f)=wtypeQtype+wseqQseq+wparamQparamQ(f) = w_{\mathrm{type}} Q_{\mathrm{type}} + w_{\mathrm{seq}} Q_{\mathrm{seq}} + w_{\mathrm{param}} Q_{\mathrm{param}},权重 ww 由各维度对执行安全的重要性决定(任务类型错误最危险,参数偏差次之,阶段顺序问题危险性最低)。

12.2.3 Q_min 的确定方法

QminQ_{\min} 的值不是任意设定的,而是通过安全分析反推确定:找到 Q(f)=Q0Q(f) = Q_0 的边界值,使得 Q(f)Q0Q(f) \geq Q_0 的规划输出,在经过HTN合法性验证和STL编译后,能够产生在V-SAF验证中通过的安全执行轨迹(根据历史执行数据的统计分析)。这种”从安全结果反推质量下界”的方法,使 QminQ_{\min} 与系统的实际安全保证直接关联,而非一个独立于其他验证环节的自定义指标。实验结果(第14章)将给出 Qmin=0.944Q_{\min} = 0.944 对应的置信度和安全统计数据。


12.3 幻觉的几何分类

12.3.1 类型一幻觉:语义漂移

语义漂移是最常见的幻觉类型:LLM生成的规划内容的整体语义方向正确(任务类型认知正确),但在细节层面向LLM训练数据中高频场景漂移,导致具体操作步骤不符合当前任务的具体要求。在 Msem\mathcal{M}_{\mathrm{sem}} 上,语义漂移表现为 v(e(τ))v(e(\tau))v(τ)v(\tau) 在同一语义子流形内但存在方向偏差。对带电作业场景,典型的语义漂移是将”110kV输电线路绝缘子更换”的操作步骤漂移到更常见的”10kV配网绝缘子更换”步骤(训练数据中配网作业更多),两者电压等级不同,对应不同的安全距离要求和操作规程。

语义漂移通过 Qparam<Qmin,paramQ_{\mathrm{param}} < Q_{\min,\mathrm{param}} 检测(参数值与当前场景不符),在HTN合法性验证中可以部分拦截(参数超出合法范围时验证失败)。

12.3.2 类型二幻觉:结构幻觉

结构幻觉是更严重的幻觉类型:LLM生成的任务分解结构本身不合法(不存在于HTN方法库中),或者分解层级不正确(把不应作为叶节点的子任务当作可直接执行的原始任务)。结构幻觉表现为 QseqQmin,seqQ_{\mathrm{seq}} \ll Q_{\min,\mathrm{seq}}(阶段序列与规范流程偏差大),或HTN合法性验证直接失败(找不到对应的方法)。结构幻觉比语义漂移更容易被系统拦截(HTN验证是硬性过滤器),但一旦未被拦截(例如LLM生成了听起来合理但实际不存在于方法库的方法名),其危害更大(执行了无规范依据的操作序列)。

12.3.3 类型三幻觉:置信过度

置信过度(Overconfidence)是LLM特有的幻觉形式:LLM以高置信度生成了错误的规划内容,而没有触发歧义消解协议(因为语法验证通过,参数值在合理范围内)。置信过度难以通过几何距离直接检测,因为 v(e(τ))v(e(\tau))v(τ)v(\tau) 的距离可能并不大(规划内容看起来合理)。EICPS通过不确定性校准(Uncertainty Calibration)处理置信过度:要求LLM在生成规划时同时给出置信度估计,并通过历史规划数据校准LLM置信度与实际准确率的关系,对置信度与历史准确率不一致的规划输出触发额外的人工审核请求。

写作占位 — 三类幻觉在V-167数据集上的频率分布与案例分析


12.4 V-PLN验证的实施流程

12.4.1 验证数据集的构建

V-PLN验证需要一个包含已知ground truth的规划数据集:对每个任务描述 τ\tau,知道”正确的规划”应该是什么(正确的HTN分解树和ESTL描述)。ground truth来自两个来源:规程文档解析(由规程专家将操作步骤逐条翻译为HTN方法,作为标准规划的参考)和专家规划标注(由资深操作员在仿真环境中演示正确操作序列,记录为标准规划)。V-PLN验证数据集包含V-167每个词汇条目至少5个ground truth规划示例,共计约835个(167×5)标注样本。

12.4.2 Q(f) 的计算与阈值测试

对验证数据集中的每个样本,V-PLN验证按以下步骤计算并测试 Q(f)Q(f):(1)用Brain层的LLM模块生成规划(包含ESTL描述和HTN分解树);(2)计算生成规划的 Q(f)Q(f) 值(使用§12.2.1的公式);(3)记录HTN合法性验证结果(通过/失败);(4)对通过HTN合法性验证的样本,测试 Q(f)QminQ(f) \geq Q_{\min} 是否成立;(5)统计通过率、幻觉类型分布、多轮对话消解率。V-PLN通过的标准:对835个样本,Q(f)QminQ(f) \geq Q_{\min} 的通过率不低于94.4%(对应Qmin=0.944Q_{\min} = 0.944),且结构幻觉(HTN验证失败)通过多轮消解后最终通过率不低于99%。

12.4.3 Q(f) 下界在验证链中的传递

V-PLN通过(Q(f)QminQ(f) \geq Q_{\min})为V-SAF提供的保证是:语义路由和规划的联合质量满足下界,使得进入Spine层执行的任务规划(HTN分解树 + STL规约)达到了V-SAF验证所需要的语义正确性前提。具体地,Q(f)Qmin=0.944Q(f) \geq Q_{\min} = 0.944 保证了生成的STL规约与任务意图的语义相似度达到阈值,规约实例化的参数值在合理范围内,HTN分解树在方法库中有对应合法方法。这三点共同构成V-SAF”规约选择无误”的前提,使V-SAF可以聚焦于”给定正确规约后的执行安全验证”。


12.5 V-PLN的工程意义与局限

12.5.1 V-PLN将LLM质量保证纳入形式化框架

V-PLN的主要工程意义在于将LLM这一本质上是统计性的系统纳入了形式化验证框架。传统的形式化验证方法无法直接处理LLM——LLM没有数学上可证明的输入-输出关系。V-PLN的处理方式是:不证明LLM的内部行为,而是证明LLM输出的几何属性(与任务描述的语义一致性)满足可量化的下界。这是一种”黑盒验证”策略——对LLM内部不做假设,仅对其输出进行形式化检验。这种策略在处理”不可理解的大型神经网络 + 形式化系统框架”的集成问题上,提供了一个可借鉴的范式。

12.5.2 Q(f) 度量的局限与改进方向

Q(f)Q(f) 基于语义嵌入向量的余弦相似度,继承了语义嵌入的所有已知局限:嵌入质量依赖于预训练模型的训练数据分布(若训练数据不包含电力专业术语,嵌入的判别力可能不足);余弦相似度在高维空间中的鉴别力有限(维度诅咒效应);对措辞变化敏感(同一操作的不同表达可能产生非平凡的余弦差异)。这些局限意味着 Q(f)QminQ(f) \geq Q_{\min} 是规划质量的必要条件而非充分条件。改进方向包括:使用电力领域特化的嵌入模型替代通用模型,以及将 Q(f)Q(f) 与基于HTN结构相似度的辅助度量联合使用。第15章将这些局限列入已知边界清单。

12.5.3 V-PLN的持续验证需求

V-PLN的验证结论(Q(f)QminQ(f) \geq Q_{\min} 在验证数据集上成立)依赖于LLM模块的版本和配置。当LLM模型更新(新版本的API)、提示模板修改、或规约库更新后,V-PLN验证需要重新运行。EICPS为此设计了持续验证流水线:每次上述变更后,自动触发V-PLN验证数据集上的回归测试,若通过率低于阈值则阻止变更部署,要求人工介入分析失败原因。这种持续验证机制将V-PLN从一次性认证转变为系统生命周期中的常态化质量监控。


V-PLN完成了语义到规划层的质量保证。第13章转向最后一环V-SAF——在V-SEM和V-PLN的前提下,证明物理执行层的零误触安全保证。


参考文献

写作占位 — 本章参考文献列表(随正文写作逐步完善)