Proposal 已经是结构化表达了吗?

是的,Proposal 就是 V167L 59 条里的一条——一个结构化的词条 ID:

{"id": "v015", "conf": 0.91}

这就是 EvidencePack Stage 1 的完整输出。Brain 层 LLM 接收操作员的自然语言指令,输出这样一条结构化记录,经接口 A 下发给 Spine 层。

关键区别:生成模型 vs 分类模型

Proposal 虽然是结构化的,但它不是分类模型的输出,而是生成模型被要求收敛到结构化空间。这个区别很重要:

传统 59 类分类器LLM 生成 Proposal
输出空间59 个类别的 softmax无限词汇表,需要自己”找到” v015
能拒绝吗不能(必须选一个)能输出 reject(欠定/矛盾时)
上下文理解不能能(“带电”和”停电”在语境里有本质区别)
可解释性可要求输出推理链

举例:操作员说”把地线上的风筝线激光清除掉,现在线路带电”——分类器只能在 59 个类别里选一个概率最高的;LLM 能理解”带电”这个语境限定词,并在 v015(带电)和 v016(停电)之间作出有语义依据的区分。

为什么不直接训练分类器

分类器有两个根本缺陷在安全关键场景下无法接受:

① 没有拒绝能力。 分类器面对”把螺栓逆时针拧紧”(自相矛盾指令)只能硬选一个类别,无法识别指令本身有问题。LLM 可以输出 reject 并附上理由,触发 L1 规则守卫。

② 无法处理欠定指令。 “清除一下导线上的东西”——缺少带电状态信息,分类器会给出一个”最可能”的类别;LLM 可以识别参数缺失并拒绝,要求操作员补充。

这两种情况在 Paper-02 的 232 条测试集里各有 45 条(欠定)和 10 条(矛盾),零样本 Qwen2.5-3B 的拒绝率分别为 24.4% 和 10%——说明这种能力需要通过领域微调显式注入。

用生成模型的代价

把无限生成空间约束到 59 条词条,带来两类风险:

  • 格式不合规:模型可能输出 V167L 之外的内容(如”v060”或自由文本),需要后处理解析和回退
  • 危险对幻觉:在语义相近的词条之间(v015 带电 ↔ v016 停电)产生错误路由,这是 H(ri,rj)H(r_i, r_j) 指标要量化的核心风险

这也是 Paper-02 的核心工程问题:如何让生成模型在保持拒绝能力的同时,将危险对幻觉率 HH 压到 5% 以下。 分类器做不到前者,未经微调的 LLM 做不到后者——LoRA 领域微调是让两者同时成立的工程路径。

什么是 EvidencePack? · 语义流形对齐是什么? · Brain 层 Proposal 质量