第三讲:语义嵌入的流形假设与覆盖性
V0.2 修订注记(2026-07-23):本讲的”语义流形”指嵌入向量满足流形假设的数据流形——这是机器学习的成熟概念(Tenenbaum/Roweis 2000 谱系),作为工程近似使用,注明来源;不主张概念图结构是流形,对”语义流形”不作命名来源方面的主张(V0.1 相关定性已废止,见修订说明第 2 条)。SEC = 1 是条件性等式:在词汇集固定、嵌入模型固定、τ 依 reach 条件选定的假设下成立(A ⇒ P,见保证的条件性)。
本讲的地位:这是流形几何与三篇系列论文之间的理论桥梁。前两讲建立了流形几何基础,第三讲回答:这些几何工具,如何让”语义理解无盲区”从统计主张变为可证明的形式等式?
0 本讲解决的核心问题
带电作业机器人收到自然语言指令,必须把它映射到规程动作。问题是:
怎么知道词汇表覆盖了所有合法任务?有没有语义盲区?
传统方法的答案是测试集准确率 ≥ 95%——这是统计性的,永远有 的遗漏概率。
本讲给出 EICPS 的答案:用语义流形的拓扑覆盖理论,把这个问题转化为形式化的几何命题,得到精确等式 SEC = 1。
1 语义流形假设
设系统词汇表 中每个条目经过语言模型编码,得到高维向量 ( 一般为 768 或 1024)。
流形假设:这些向量不是均匀散布在 中,而是聚集在一个低维光滑子流形附近:
这不是假设,而是可以测量的。

2 内在维度 :流形弯曲程度的测量
2.1 两点距离法(Two-NN 估计)
给定样本集 ,对每个点找到它的第一近邻距离 和第二近邻距离 ,利用比值:
在 -维流形上, 服从 Pareto 分布,其形状参数恰好等于 :
因此,对 做线性拟合即可估计 :
import numpy as np
from sklearn.neighbors import NearestNeighbors
def estimate_intrinsic_dim(X, k=5):
"""Two-NN 内在维度估计"""
nbrs = NearestNeighbors(n_neighbors=k+1).fit(X)
distances, _ = nbrs.kneighbors(X)
# 取第1和第2近邻距离(排除自身)
r1 = distances[:, 1]
r2 = distances[:, 2]
mu = r2 / r1 # 比值,> 1
# Pareto 分布最大似然估计
d_hat = 1.0 / (np.mean(np.log(mu)))
return d_hat
# V-167 实验结果
# d_sem = estimate_intrinsic_dim(embeddings_167)
# 实测值: d_sem = 1.8767
2.2 V-167 的关键发现
对 167 条电网带电作业任务(塑料薄膜/风筝线/渔网 × 导线/地线/杆塔 × 带电/停电 × 正常/高温/夜间)做嵌入后测量:
这意味着什么?
167 条表面各不相同的任务,其语义结构本质上只有约 2 个自由度。这 2 个维度大致对应:
维度 1:异物类型 × 作业难度(物理复杂性轴)
维度 2:电气状态 × 危险等级(安全复杂性轴)
所有任务都是这张二维语义地图上的点。这不是”问题简单”,而是 EICPS 找到了正确的几何语言,让复杂问题的内在低维结构得以显现。

3 规范闭合性:有限支撑集的来源
能成立,根源在于电力作业领域的一个特殊属性:
规范闭合性(Normative Closure):电力作业规程文件具有有限可枚举性——所有合法任务类型都在规程文件中显式列举,不存在规程之外的”未知未知”任务。
这使任务分布的支撑集 从理论上无限收缩为有限离散集合:
这是 EICPS 区别于所有开放世界 AI 系统的根本前提。没有规范闭合性,支撑集无限,SEC 永远不可能 = 1。有了规范闭合性,覆盖问题从”开放世界统计问题”变成”闭合域几何问题”。

4 语义覆盖率 SEC:从几何到形式保证
4.1 定义
给定词汇表 和覆盖半径 ,语义覆盖率定义为:
其中 是 上以 为中心、半径 的测地球, 是流形上的体积测度。
4.2 最优覆盖半径
覆盖半径不能任意设置——太大则词义模糊,太小则无法覆盖全域。Nyquist 覆盖条件给出最优半径:
其中 是流形的到达半径(局部可近似为欧氏空间的最大尺度)。
V-167 实验测得:(余弦距离)
4.3 Theorem Q-18:SEC = 1
定理(Theorem Q-18):设词汇表 满足规范闭合性,且 的每个元素在 上的 -邻域覆盖了对应规程条目,则:
证明思路:
规范闭合性
→ supp(P_task) 是 M_sem 上的有限离散集合
→ 对每个支撑点,V_167^L 中存在 τ*-邻域内的词条
→ 所有支撑点被覆盖
→ SEC = μ(覆盖区域) / μ(支撑集) = 1 □
def compute_sec(query_embeddings, task_embeddings, tau):
"""计算语义覆盖率 SEC"""
from sklearn.metrics.pairwise import cosine_distances
# 对每个任务点,找最近的词条距离
dist_matrix = cosine_distances(task_embeddings, query_embeddings)
min_distances = dist_matrix.min(axis=1) # 每个任务点到最近词条的距离
# 被覆盖的任务点数量
covered = (min_distances <= tau).sum()
total = len(task_embeddings)
sec = covered / total
return sec, min_distances
# 实验结果:
# sec, dists = compute_sec(V167L_embeddings, task_embeddings, tau=0.046)
# assert sec == 1.0 # SEC = 1,精确等式

5 三篇论文的安全链:流形语言的统一视角
SEC = 1 只是安全链的第一环。三篇论文在同一个语义流形 上承担不同的数学角色:
| 论文 | 的角色 | 数学命题 |
|---|---|---|
| Paper-01 | 被覆盖的对象 | 的 -邻域覆盖全支撑集,SEC=1 |
| Paper-02 | 被对齐的目标 | 量化 与 的分歧 ,QLoRA 微调缩小分歧,Q(f)=0.944 |
| Paper-03 | 路由的执行空间 | L1/L2 在 上做符号过滤与最近邻路由,危险图 是其高风险子结构,FPR=0% |
三条保证依次咬合:词汇无盲区(SEC=1)→ 模型质量可量化(Q(f)=0.944)→ 执行层零误触(FPR=0%)。
这条链的数学本质:都是关于 的几何命题——覆盖性、分布对齐、拓扑路由。流形语言是统一三篇论文的共同坐标系。
6 PAC 覆盖下界:需要多少样本?
规范闭合性告诉我们支撑集有限,但”有限”有多少?PAC(Probably Approximately Correct)学习理论给出覆盖所需最小样本量的下界:
其中 是允许遗漏的概率质量, 是置信失败概率。
V-167 实验参数下(,):
这意味着:若随机从任务分布中采样,至少需要 322 个样本,才能以 95% 置信度覆盖 99% 的任务分布。而 V-167 使用了 167 条精心设计的词条——之所以少于 322,是因为词条是规范化的,不是随机采样的。
import math
def pac_coverage_bound(epsilon=0.01, delta=0.05):
"""PAC 覆盖下界"""
n_min = math.ceil(math.log(1/delta) / math.log(1/(1-epsilon)))
return n_min
# pac_coverage_bound() → 322
# 解读:随机采样至少需要 322 个查询样本
# V-167 用 167 个规范词条实现了 SEC=1,
# 因为规范闭合性使词条选择是确定性的,而非随机的

7 与 PCA 的对比:为什么不能用线性降维
PCA 的 Kaiser 准则(保留特征值 > 1 的主成分)对 V-167 的嵌入做验证:
from sklearn.decomposition import PCA
import numpy as np
# pca = PCA().fit(embeddings_167)
# 结果:前几个主成分的累积解释方差
# PC1: 62.3%, PC2: 18.1%, PC3: 8.7%, ...
# PCA (线性) 认为需要 3-5 个维度
# 而 Two-NN 估计 d_sem = 1.8767(约 2 维)
#
# 原因:语义流形是弯曲的,PCA 用平坦超平面近似弯曲流形,
# 需要更多维度才能解释方差。
# Two-NN 直接测量流形的内在曲率,得到真正的低维度。
结论:PCA 过高估计了维度,因为它把弯曲流形当平坦空间处理。 是内禀维度——弯曲结构下的真实自由度数。
这正是流形语言比欧氏线性近似更精确的体现。

8 小结:为什么 SEC=1 是形式等式而非统计估计
| 性质 | 统计方法 | 流形覆盖方法(EICPS) |
|---|---|---|
| 保证形式 | (双层概率) | SEC = 1(精确等式) |
| 依赖前提 | 测试集代表性 | 规范闭合性(领域属性) |
| 随样本增加 | 趋近但永不等于 1 | 条件满足即精确成立 |
| 可审计性 | 每次部署需重新验证 | 一次证明,永久有效 |
规范闭合性是关键的哲学前提:它把”开放世界”变成”闭合域”,从而让形式等式成为可能。没有这个前提,统计近似是唯一的路。有了这个前提,形式保证是更优的路。
配套 Notebook
Notebook 包含:
- Two-NN 内在维度估计(可视化估计过程)
- V-167 嵌入空间的流形可视化(t-SNE 投影)
- SEC 计算与 扫描实验
- PAC 下界的参数敏感性分析
- PCA vs 流形维度对比
延伸阅读
- 具身空间几何 →: 的单调扩张性质(命题 2.1)
- Paper-01 方法详解 →:Theorem Q-18 完整证明
- Paper-02 方法详解 →: 距离的定义与测量
- EICPS 有什么用 →:三条形式保证的工程含义