第三讲:语义嵌入的流形假设与覆盖性

V0.2 修订注记(2026-07-23):本讲的”语义流形”指嵌入向量满足流形假设的数据流形——这是机器学习的成熟概念(Tenenbaum/Roweis 2000 谱系),作为工程近似使用,注明来源;不主张概念图结构是流形,对”语义流形”不作命名来源方面的主张(V0.1 相关定性已废止,见修订说明第 2 条)。SEC = 1 是条件性等式:在词汇集固定、嵌入模型固定、τ 依 reach 条件选定的假设下成立(A ⇒ P,见保证的条件性)。

本讲的地位:这是流形几何与三篇系列论文之间的理论桥梁。前两讲建立了流形几何基础,第三讲回答:这些几何工具,如何让”语义理解无盲区”从统计主张变为可证明的形式等式?


0 本讲解决的核心问题

带电作业机器人收到自然语言指令,必须把它映射到规程动作。问题是:

怎么知道词汇表覆盖了所有合法任务?有没有语义盲区?

传统方法的答案是测试集准确率 ≥ 95%——这是统计性的,永远有 δ>0\delta > 0 的遗漏概率。

本讲给出 EICPS 的答案:用语义流形的拓扑覆盖理论,把这个问题转化为形式化的几何命题,得到精确等式 SEC = 1。


1 语义流形假设

设系统词汇表 V\mathcal{V} 中每个条目经过语言模型编码,得到高维向量 vRD\mathbf{v} \in \mathbb{R}^DDD 一般为 768 或 1024)。

流形假设:这些向量不是均匀散布在 RD\mathbb{R}^D 中,而是聚集在一个低维光滑子流形附近:

VMsemRD,dim(Msem)=dsemD\mathcal{V} \subset \mathcal{M}_{sem} \hookrightarrow \mathbb{R}^D, \quad \dim(\mathcal{M}_{sem}) = d_{sem} \ll D

这不是假设,而是可以测量的。

Swiss Roll 流形可视化:3D 空间中的点(左)内在维度只有 2;t-SNE 展开后揭示低维结构(右)


2 内在维度 dsemd_{sem}:流形弯曲程度的测量

2.1 两点距离法(Two-NN 估计)

给定样本集 {vi}\{\mathbf{v}_i\},对每个点找到它的第一近邻距离 r1r_1 和第二近邻距离 r2r_2,利用比值:

μi=r2r1>1\mu_i = \frac{r_2}{r_1} > 1

dd-维流形上,μ\mu 服从 Pareto 分布,其形状参数恰好等于 dd

P(μ>x)=xd,x1P(\mu > x) = x^{-d}, \quad x \geq 1

因此,对 logμi\log \mu_i 做线性拟合即可估计 dsemd_{sem}

import numpy as np
from sklearn.neighbors import NearestNeighbors

def estimate_intrinsic_dim(X, k=5):
    """Two-NN 内在维度估计"""
    nbrs = NearestNeighbors(n_neighbors=k+1).fit(X)
    distances, _ = nbrs.kneighbors(X)
    # 取第1和第2近邻距离(排除自身)
    r1 = distances[:, 1]
    r2 = distances[:, 2]
    mu = r2 / r1  # 比值,> 1
    # Pareto 分布最大似然估计
    d_hat = 1.0 / (np.mean(np.log(mu)))
    return d_hat

# V-167 实验结果
# d_sem = estimate_intrinsic_dim(embeddings_167)
# 实测值: d_sem = 1.8767

2.2 V-167 的关键发现

对 167 条电网带电作业任务(塑料薄膜/风筝线/渔网 × 导线/地线/杆塔 × 带电/停电 × 正常/高温/夜间)做嵌入后测量:

dsem=1.87672d_{sem} = 1.8767 \approx 2

这意味着什么?

167 条表面各不相同的任务,其语义结构本质上只有约 2 个自由度。这 2 个维度大致对应:

维度 1:异物类型 × 作业难度(物理复杂性轴)
维度 2:电气状态 × 危险等级(安全复杂性轴)

所有任务都是这张二维语义地图上的点。这不是”问题简单”,而是 EICPS 找到了正确的几何语言,让复杂问题的内在低维结构得以显现。

Two-NN 内在维度估计验证:在已知维度的球面上,估计值收敛至真实维度;V-167 实测 d_sem ≈ 1.88


3 规范闭合性:有限支撑集的来源

dsem2d_{sem} \approx 2 能成立,根源在于电力作业领域的一个特殊属性:

规范闭合性(Normative Closure):电力作业规程文件具有有限可枚举性——所有合法任务类型都在规程文件中显式列举,不存在规程之外的”未知未知”任务。

这使任务分布的支撑集 supp(Ptask)\operatorname{supp}(P_{task}) 从理论上无限收缩为有限离散集合

supp(Ptask)i=1N{ti},N<\operatorname{supp}(P_{task}) \subseteq \bigcup_{i=1}^{N} \{t_i\}, \quad N < \infty

这是 EICPS 区别于所有开放世界 AI 系统的根本前提。没有规范闭合性,支撑集无限,SEC 永远不可能 = 1。有了规范闭合性,覆盖问题从”开放世界统计问题”变成”闭合域几何问题”。

V-167 任务嵌入的 t-SNE 可视化(左):167 条任务在语义空间中形成二维流形结构;d_sem 估计稳定性(右):随近邻数 k 变化,估计值稳定在 1.85–1.95


4 语义覆盖率 SEC:从几何到形式保证

4.1 定义

给定词汇表 Q={q1,,qn}Msem\mathcal{Q} = \{\mathbf{q}_1, \ldots, \mathbf{q}_n\} \subset \mathcal{M}_{sem} 和覆盖半径 τ>0\tau > 0语义覆盖率定义为:

SEC(Q,τ)=μ ⁣(supp(Ptask)i=1nBτ(qi))μ ⁣(supp(Ptask))\text{SEC}(\mathcal{Q}, \tau) = \frac{\mu\!\left(\operatorname{supp}(P_{task}) \cap \bigcup_{i=1}^n B_\tau(\mathbf{q}_i)\right)}{\mu\!\left(\operatorname{supp}(P_{task})\right)}

其中 Bτ(qi)B_\tau(\mathbf{q}_i)Msem\mathcal{M}_{sem} 上以 qi\mathbf{q}_i 为中心、半径 τ\tau 的测地球,μ\mu 是流形上的体积测度。

4.2 最优覆盖半径 τ\tau^*

覆盖半径不能任意设置——太大则词义模糊,太小则无法覆盖全域。Nyquist 覆盖条件给出最优半径:

τ=12reach(Msem)\tau^* = \frac{1}{2} \cdot \text{reach}(\mathcal{M}_{sem})

其中 reach(Msem)\text{reach}(\mathcal{M}_{sem}) 是流形的到达半径(局部可近似为欧氏空间的最大尺度)。

V-167 实验测得:τ=0.046\tau^* = 0.046(余弦距离)

4.3 Theorem Q-18:SEC = 1

定理(Theorem Q-18):设词汇表 V167L\mathcal{V}_{167}^L 满足规范闭合性,且 Q=V167L\mathcal{Q} = \mathcal{V}_{167}^L 的每个元素在 Msem\mathcal{M}_{sem} 上的 τ\tau^*-邻域覆盖了对应规程条目,则: SEC(Q,τ)=1\text{SEC}(\mathcal{Q}, \tau^*) = 1

证明思路

规范闭合性
  → supp(P_task) 是 M_sem 上的有限离散集合
  → 对每个支撑点,V_167^L 中存在 τ*-邻域内的词条
  → 所有支撑点被覆盖
  → SEC = μ(覆盖区域) / μ(支撑集) = 1   □
def compute_sec(query_embeddings, task_embeddings, tau):
    """计算语义覆盖率 SEC"""
    from sklearn.metrics.pairwise import cosine_distances
    
    # 对每个任务点,找最近的词条距离
    dist_matrix = cosine_distances(task_embeddings, query_embeddings)
    min_distances = dist_matrix.min(axis=1)  # 每个任务点到最近词条的距离
    
    # 被覆盖的任务点数量
    covered = (min_distances <= tau).sum()
    total = len(task_embeddings)
    
    sec = covered / total
    return sec, min_distances

# 实验结果:
# sec, dists = compute_sec(V167L_embeddings, task_embeddings, tau=0.046)
# assert sec == 1.0  # SEC = 1,精确等式

SEC 随覆盖半径 τ 的变化曲线:τ* = 0.046 处 SEC 跃升至 1.0(左);各任务点到最近词条的距离分布(右),全部落在 τ* 以内


5 三篇论文的安全链:流形语言的统一视角

SEC = 1 只是安全链的第一环。三篇论文在同一个语义流形 Msem\mathcal{M}_{sem} 上承担不同的数学角色:

论文Msem\mathcal{M}_{sem} 的角色数学命题
Paper-01被覆盖的对象V167L\mathcal{V}_{167}^Lτ\tau^*-邻域覆盖全支撑集,SEC=1
Paper-02被对齐的目标量化 Msemgeneral\mathcal{M}_{sem}^{general}Msemdomain\mathcal{M}_{sem}^{domain} 的分歧 dSemd_{Sem},QLoRA 微调缩小分歧,Q(f)=0.944
Paper-03路由的执行空间L1/L2 在 Msem\mathcal{M}_{sem} 上做符号过滤与最近邻路由,危险图 Gdanger\mathcal{G}_{danger} 是其高风险子结构,FPR=0%

三条保证依次咬合:词汇无盲区(SEC=1)→ 模型质量可量化(Q(f)=0.944)→ 执行层零误触(FPR=0%)。

这条链的数学本质:都是关于 Msem\mathcal{M}_{sem} 的几何命题——覆盖性、分布对齐、拓扑路由。流形语言是统一三篇论文的共同坐标系。


6 PAC 覆盖下界:需要多少样本?

规范闭合性告诉我们支撑集有限,但”有限”有多少?PAC(Probably Approximately Correct)学习理论给出覆盖所需最小样本量的下界:

Qmin=ln(1/δ)ln(1/(1ϵ))|\mathcal{Q}|_{min} = \left\lceil \frac{\ln(1/\delta)}{\ln(1/(1-\epsilon))} \right\rceil

其中 ϵ\epsilon 是允许遗漏的概率质量,δ\delta 是置信失败概率。

V-167 实验参数下(ϵ=0.01\epsilon = 0.01δ=0.05\delta = 0.05):

Qmin=322|\mathcal{Q}|_{min} = 322

这意味着:若随机从任务分布中采样,至少需要 322 个样本,才能以 95% 置信度覆盖 99% 的任务分布。而 V-167 使用了 167 条精心设计的词条——之所以少于 322,是因为词条是规范化的,不是随机采样的。

import math

def pac_coverage_bound(epsilon=0.01, delta=0.05):
    """PAC 覆盖下界"""
    n_min = math.ceil(math.log(1/delta) / math.log(1/(1-epsilon)))
    return n_min

# pac_coverage_bound() → 322
# 解读:随机采样至少需要 322 个查询样本
# V-167 用 167 个规范词条实现了 SEC=1,
# 因为规范闭合性使词条选择是确定性的,而非随机的

PAC 覆盖下界参数扫描:不同 ε(遗漏率)下最小样本量随置信度 δ 的变化(左);V-167 的 167 词条 vs 随机采样所需 322 个样本的直观对比(右)


7 与 PCA 的对比:为什么不能用线性降维

PCA 的 Kaiser 准则(保留特征值 > 1 的主成分)对 V-167 的嵌入做验证:

from sklearn.decomposition import PCA
import numpy as np

# pca = PCA().fit(embeddings_167)
# 结果:前几个主成分的累积解释方差
# PC1: 62.3%, PC2: 18.1%, PC3: 8.7%, ...
# PCA (线性) 认为需要 3-5 个维度
# 而 Two-NN 估计 d_sem = 1.8767(约 2 维)
# 
# 原因:语义流形是弯曲的,PCA 用平坦超平面近似弯曲流形,
# 需要更多维度才能解释方差。
# Two-NN 直接测量流形的内在曲率,得到真正的低维度。

结论:PCA 过高估计了维度,因为它把弯曲流形当平坦空间处理。dsem=1.8767d_{sem} = 1.8767内禀维度——弯曲结构下的真实自由度数。

这正是流形语言比欧氏线性近似更精确的体现。

PCA 累积解释方差(左):需要 3–5 个主成分才能超过 90% 方差;Three 种维度估计方法对比(右):Two-NN 给出最小的真实内禀维度 ≈ 2


8 小结:为什么 SEC=1 是形式等式而非统计估计

性质统计方法流形覆盖方法(EICPS)
保证形式P(SEC1δ)1ϵP(\text{SEC} \geq 1-\delta) \geq 1-\epsilon(双层概率)SEC = 1(精确等式)
依赖前提测试集代表性规范闭合性(领域属性)
随样本增加趋近但永不等于 1条件满足即精确成立
可审计性每次部署需重新验证一次证明,永久有效

规范闭合性是关键的哲学前提:它把”开放世界”变成”闭合域”,从而让形式等式成为可能。没有这个前提,统计近似是唯一的路。有了这个前提,形式保证是更优的路。


配套 Notebook

在 Colab 中运行 →

Notebook 包含:

  • Two-NN 内在维度估计(可视化估计过程)
  • V-167 嵌入空间的流形可视化(t-SNE 投影)
  • SEC 计算与 τ\tau 扫描实验
  • PAC 下界的参数敏感性分析
  • PCA vs 流形维度对比

延伸阅读