← 返回讲义总纲 · 第六章 · 能量–熵(核心)

第六章 · 最硬的一环
能量胜过熵,Lemma D 造出能量

第四章把整个证明压到一句话:次谷 $B_m<$ 主峰 $c_3/\sigma_E$。第三章又把 $B_m$ 化成能量和 $\sum_h e^{-\frac{16}{9}Q_{\mathrm{ctrl}}(h)}$。这一章把它证出来。真正的敌人是「低能量频率可能很多」——数量()也许压不住每项的大小。破解靠两把武器:一把是纯组合的 Lemma D(一段区间打不中一个同余类超过 2 次),它保证能量普遍偏大;另一把是 Peierls 能量–熵不等式,它把「能量大」翻译成「配置数被指数压制」。这两样我们完整推导;顶层的层级集装配(Theorem B / G5 / Sector-I)体量达上百页的机械记账,给精确陈述 + 策略 + Lean 定位,可按需展开。

Lemma D · 色散 · Peierls 全证 顶层装配:陈述+策略(篇幅黑箱)

1. 敌人:低能量频率的数量

要证 $\displaystyle B_m=\sum_{h\ \text{off-main}}e^{-\frac{16}{9}Q_{\mathrm{ctrl}}(h)}<\frac{c_3}{\sigma_E}$。每一项 $e^{-\frac{16}{9}Q}$ 单独看很小($Q$ 大时),但项数是天文数字(频率 $h$ 遍历 $0\dots L-1$)。所以关键不是「单项小」,而是:

胜负手

能量小的频率必须足够稀少。若「$Q_{\mathrm{ctrl}}(h)\le E$」的频率个数(熵)随 $E$ 增长得比 $e^{\frac{16}{9}E}$ 慢,则求和收敛且小。这正是统计物理里 Peierls 能量–熵较量的数学骨架:能量项 $e^{-cQ}$ 衰减 vs. 低能量态计数 $e^{(\text{熵})}$ 增长,谁赢谁说了算。

于是任务分两半:(A) 证明能量 $Q_{\mathrm{ctrl}}$ 普遍偏大(很少有频率能让所有控制边同时接近整数)——靠 Lemma D 与色散下界;(B) 把「能量大」正式换算成「配置数受控」——靠 Peierls 不等式。

2. 能量的 CRT 结构

控制边 $e=pq$($p,q$ 不同块素数,互素)。频率 $h$ 在这条边上的贡献是 $\|h/(pq)\|^2$。因 $p,q$ 互素,中国剩余定理让 $h\bmod pq$ 等价于一对独立的余数 $(h\bmod p,\ h\bmod q)$。核心量是「倒数相位」

倒数相位 phase · SBEEDispersion.lean:102
$$\mathrm{phase}(E,q,p)=\Big\|\frac{E\cdot \bar q}{p}\Big\|\in[0,\tfrac12],\qquad \bar q\equiv q^{-1}\!\!\pmod p.$$ 它度量「频率的残差 $E$ 经边 $pq$ 折算后离整数多远」。能量 $=$ 相位平方之和:控制能量本质是 $\sum_{p}\mathrm{phase}(E,q,p)^2$ 在一块素数 $F$ 上的求和。

要证能量大,就要证「相位普遍不接近 $0$」,即接近 $0$ 的素数 $p$ 很少。这是一个纯粹的初等数论计数——Lemma D。

3. Lemma D 全证:区间打不中同余类超过 2 次

引理 6.1(Lemma D)lemmaD · SBEEDispersion.lean:71
设 $q$ 为素数、$X\le q$、整数 $w$ 满足 $q\nmid w$、$U<X$。则 $$\#\Big\{(u,p):\ p\in[X,2X]\ \text{素数},\ |u|\le U,\ u\,p\equiv w\!\!\pmod q\Big\}\ \le\ 2\,(2U+1).$$

证明。按 $u$ 分纤维,先证每个固定 $u$ 至多 2 个 $p$(这是灵魂,lemmaD_fiber)。固定 $u\in[-U,U]$,看方程 $u\,p\equiv w\pmod q$:

现在关键的鸽笼:区间 $[X,2X]$ 长度为 $X\le q$。同一个 mod $q$ 类里的整数两两相差至少 $q$。若类里有 $\ge3$ 个落在 $[X,2X]$,则最大与最小相差 $\ge2q>X$,超出区间长度,矛盾。故至多 2 个

每纤维 ≤ 2 lemmaD_fiber · SBEEDispersion.lean:47

对每个 $u$,满足条件的素数 $p\in[X,2X]$ 至多 2 个。$u$ 取遍 $[-U,U]$ 共 $2U+1$ 个值,求和得总数 $\le 2(2U+1)$。$\qquad\blacksquare$

等价的对偶视角(card_prime_factors_dyadic_le_two, :163):一个非零整数 $n$ 若 $|n|<X^3$,则它在 $[X,2X]$ 里至多有 2 个素因子——因为 3 个 $\ge X$ 的素数乘积已 $\ge X^3>|n|$。两种说法同一枚硬币。

X 2X 区间长度 = X ≤ q p₁ p₂ 同类相邻间距 = q 第 3 个必在区间外(≥ 2q > X) 同一 mod q 同余类的素数,最多命中 2 个
图 6.1 · Lemma D 的鸽笼。方程把 $p$ 钉进单一 mod $q$ 同余类(绿点,间距 $q$);区间 $[X,2X]$ 长度 $X\le q$ 只装得下该类的 2 个成员,第 3 个(灰)必然溢出。

4. 色散能量下界 $\ge|F|^3/(2^{11}X^2)$(全证)

把 Lemma D 变现成能量下界。设 $F$ 是块内一撮素数($F\subseteq[X,2X]$)、$q\notin F$、整数 $E$ 满足 $0<|E|<q$ 且 $q\nmid E$。取阈值 $\delta:=\dfrac{|F|}{32X}$。

引理 6.2 · 色散能量 dispersion 段 · SBEEDispersion.lean:90
$$\#\{p\in F:\ \mathrm{phase}(E,q,p)\le\delta\}\ \le\ 2(4\delta X+1)\ \le\ \frac{|F|}{2}, \qquad\Longrightarrow\qquad \sum_{p\in F}\mathrm{phase}(E,q,p)^2\ \ge\ \frac{|F|^3}{2^{11}X^2}.$$

证明——三步。

第一步:低相位 ⟹ 落进 Lemma D 的计数集。phase_dvd_witness, :192)若 $\mathrm{phase}(E,q,p)\le\delta$,则存在整数 $s$,$|s|\le2\delta X$,且 $p\mid(E-s\,q)$。也即 $E\equiv s\,q\pmod p$,把 $p$ 归进以 $u=s$ 为标签的纤维。

第二步:用 Lemma D 数。标签 $s$ 满足 $|s|\le 2\delta X=:U$,故 $2U+1=4\delta X+1$ 个纤维,每纤维 $\le2$ 个素数(引理 6.1,$q\nmid E$ 提供 $q\nmid w$ 前提)。于是

$$\#\{p\in F:\ \mathrm{phase}\le\delta\}\ \le\ 2(2U+1)=2(4\delta X+1)=8\delta X+2.$$

代入 $\delta=\dfrac{|F|}{32X}$:$8\delta X=8\cdot\dfrac{|F|}{32X}\cdot X=\dfrac{|F|}{4}$,故上界 $=\dfrac{|F|}4+2\le\dfrac{|F|}2$(当 $|F|\ge8$)。

第三步:剩下一半贡献能量。既然低相位素数 $\le|F|/2$,就有至少 $|F|/2$ 个素数 $p\in F$ 满足 $\mathrm{phase}(E,q,p)>\delta$,每个的平方 $>\delta^2$。因此

$$\sum_{p\in F}\mathrm{phase}^2\ \ge\ \frac{|F|}{2}\cdot\delta^2=\frac{|F|}{2}\cdot\Big(\frac{|F|}{32X}\Big)^2=\frac{|F|}{2}\cdot\frac{|F|^2}{1024\,X^2}=\frac{|F|^3}{2048\,X^2}=\frac{|F|^3}{2^{11}X^2}.$$

($2\cdot1024=2048=2^{11}$。)$\qquad\blacksquare$

这一步的意义

只要频率的残差 $E$ 非零(即频率不在对应主弧),它在整块 $F$ 上就被迫积累起 $\gtrsim|F|^3/X^2$ 的能量。能量不是偶尔大,是结构性地必然大——这就是 Lemma D 造能量的方式。「$|F|^3$」的三次方来自「阈值 $\delta\propto|F|$」与「计数 $\ge|F|/2$」的复利。

5. Peierls 能量–熵不等式(全证)

现在把「能量大」正式换算成「配置和小」。这是全书最漂亮的一个初等引理,只用 $1+x\le e^x$ 和乘积展开。

引理 6.3 · 加权子集熵 weighted_subset_entropy · GlobalPeierlsBookkeeping.lean:35
设有限指标集 $I$,非负权重 $w_i\ge0$、非负代价 $\mathrm{cost}_i\ge0$,且 $\varepsilon\ge0$ 满足相容条件 $\mathrm{cost}_i\le e^{\varepsilon w_i/4}$。则对所有「总权重不超过 $R$」的子集求和: $$\sum_{\substack{S\subseteq I\\ \sum_{i\in S}w_i\le R}}\ \prod_{i\in S}\mathrm{cost}_i\ \le\ e^{\varepsilon R/2}\cdot\exp\!\Big(\sum_{i\in I}e^{-\varepsilon w_i/4}\Big).$$

证明——四步。

(i)给每个可行 $S$ 塞一个免费因子。可行即 $w(S):=\sum_{i\in S}w_i\le R$。于是 $e^{-\varepsilon R/2}\le e^{-\varepsilon w(S)/2}=\prod_{i\in S}e^{-\varepsilon w_i/2}$。两边乘 $e^{\varepsilon R/2}\prod_{i\in S}\mathrm{cost}_i\ (\ge0)$:

$$\prod_{i\in S}\mathrm{cost}_i\ \le\ e^{\varepsilon R/2}\prod_{i\in S}\big(\mathrm{cost}_i\,e^{-\varepsilon w_i/2}\big).$$

(ii)可行子集之和 $\le$ 全体子集之和(每项非负,放宽求和范围只会变大):

$$\sum_{\text{可行 }S}\prod_{i\in S}\mathrm{cost}_i\ \le\ e^{\varepsilon R/2}\sum_{S\subseteq I}\prod_{i\in S}\big(\mathrm{cost}_i\,e^{-\varepsilon w_i/2}\big).$$

(iii)全体子集之和 $=$ 乘积。记 $a_i:=\mathrm{cost}_i\,e^{-\varepsilon w_i/2}$。经典展开 $\displaystyle\sum_{S\subseteq I}\prod_{i\in S}a_i=\prod_{i\in I}(1+a_i)$(每个 $i$ 独立选「入 $S$」贡献 $a_i$ 或「不入」贡献 $1$)。

(iv)用相容条件收尾。$1+a_i\le e^{a_i}$,而相容条件给 $a_i=\mathrm{cost}_i\,e^{-\varepsilon w_i/2}\le e^{\varepsilon w_i/4}e^{-\varepsilon w_i/2}=e^{-\varepsilon w_i/4}$。故

$$\prod_{i\in I}(1+a_i)\le\prod_{i\in I}e^{a_i}=\exp\Big(\sum_i a_i\Big)\le\exp\Big(\sum_i e^{-\varepsilon w_i/4}\Big).$$

合并 (ii)(iii)(iv) 即得引理。$\qquad\blacksquare$

「能量胜过熵」怎么读这个式子

右边两个因子分别是能量的账:

两账相抵,配置和被压到 $c_3/\sigma_E$ 之下。这就是 $B_m<c_3/\sigma_E$ 的引擎。

6. G6 二分与装配逻辑

把 §3–5 的「一块 $F$」升级到「所有块、所有频率」,需要一个分类讨论——G6 局部化二分。

G6 局部化二分 g6_localization · GlobalControlG6.lean
任一 off-main 频率(全局配置 $a$)落入两种情形之一,对应能量地板 $$\mathrm{Floor}=\min\big(\underbrace{Rw(c_2,k_0)}_{\text{Theorem B 强迫地板}},\ \underbrace{\Pi\mathrm{floor}(e_0,k_0)}_{\text{块能量地板}}\big):$$
  • 对角扇区:全局对角、但标签落在主弧窗之外 → 由 Theorem B(非主导强迫)给出地板 $Rw(c_2,k_0)$。
  • 非对角:某块 $F$ 的残差非零 → 由 §4 色散下界给出块能量地板 $\Pi\mathrm{floor}$。
两种情形都保证能量 $\ge\mathrm{Floor}$,且 $\mathrm{Floor}$ 随 $k_0$ 增长

装配(G7 路线闭合)。把每个频率的能量地板喂进引理 6.3($w_i\leftarrow$ 能量、$R\leftarrow$ 地板、$\mathrm{cost}\leftarrow e^{\cdots}$),层级集计数(G5,下节)贡献一个 $e^{8\varepsilon R}$ 型的熵因子,而增长的 Peierls 地板 $F_0(k_0)$ 把它吸收。选 $\varepsilon$ 足够小——记 $c$ 为衰减常数(这里 $c=\tfrac{16}{9}$ 一路的化身),取

$$\varepsilon_0=\min\Big(\frac{c}{16},\ \frac12\Big)\quad\Longrightarrow\quad 8\varepsilon_0\le\frac c2<c,$$

于是熵因子 $e^{8\varepsilon_0 R}$ 被能量项 $e^{-cR}$ 净压制,级数收敛且 $B_m<c_3/\sigma_E$。GlobalControlG7.lean

一个曾经的坑(已修)

早期「自由 $C_{\mathrm{glob}}$」路线是不健全的:一个与 $k_0$ 无关的 $k_0^{\min}$ 无法吸收随 $k_0$ 增长的层级集因子。正确做法是让 Peierls 地板随 $k_0$ 增长、选 $k_0^{\min}$,次序不能反。(G7 模块注释明确记录了这一点。)这正是「精确常数、正确次序」在形式化里被卡死的价值。

7. 顶层装配:Theorem B / G5 / Sector-I(陈述 + 策略)

下面三块是把上述机制装成全局定理的骨架。它们在 Lean 里全部 sorry-free、完整证明;只是展开成人读文字约上百页、且绝大部分是机械的层级集记账与单调性核对。按讲义的诚实边界,这里给精确陈述 + 证明策略 + Lean 定位,可按需逐条展开。请注意:这是「篇幅」黑箱,不是「深度」或「漏洞」黑箱。

Theorem A / B · 强迫计数 SBEEForcing.lean:18,26(均已完整证明)
陈述。把 off-main 配置按「与标签 $m$ 的吻合度」分主导(dominant)/非主导(nondominant)两类。Theorem A(主导):主导配置的编码计数 × 熵被 A4 编码/熵引理压住。Theorem B(非主导,强迫地板 $Rw(c_2,k_0)$):非主导配置被迫在某方向积累能量 $\ge Rw$。
策略。Theorem A 用「A4 段编码 + 子集熵(引理 6.3)」;Theorem B 用 Lemma E(跨标签能量 CrossLabelEnergy.lean)把非主导性翻译成色散前提,再调 §4。可展开点:A4 编码的具体比特记账、$Rw$ 的显式表达式与单调性(下条)。
G5 冷主层级集 · level-set 计数 global_levelset · GlobalControl(cold-master)
陈述. 能量 $\le R$ 的全局配置数 $\le C_{\mathrm{glob}}\cdot e^{8\varepsilon R}\cdot(1+\sqrt R/\sigma_{\mathrm{ctrl}})$,其中因子 $e^{A\cdot\mathrm{numBlocks}}$ 在 $k_0^{\min}$ 选定之前固定。
策略. 逐块用引理 6.3 的子集熵、跨块用高斯型求和(一维整数高斯可和,summable_int_gaussian)拼装;难点全在「因子随块数增长」与「地板增长」的定量赛跑,交给 Sector-I。可展开点:$\sqrt R/\sigma_{\mathrm{ctrl}}$ 因子来源、$A$ 的取值。
Sector-I · 地板超线性增长 GlobalControlSectorI.lean:91,164
陈述. 强迫地板满足 $\dfrac{Rw(c_2,k)}{k+1}\to\infty$(经与 $2^k/(k+1)^4$ 比较)。
策略. 「指数最终压过任意仿射」:$Rw$ 含 $2^k$ 型增长,除以线性 $(k+1)$ 仍趋于 $\infty$(beats_affine_of_tendsto, Rw_div_linear_tendsto)。据此,逐块地板之和最终吸收 G5 的层级集熵因子,Sector-I 部分求和收敛。可展开点:比较判别法的显式 $k$ 阈值、绝对常数 $c_2$ 的来历。
三块如何合流

G6(§6)把每个频率分派到「Theorem B 地板」或「色散地板」;G5 数清每个能量层的配置数;Sector-I 保证地板增长快过 G5 的计数;G7 选足够小的 $\varepsilon_0$ 与足够大的 $k_0^{\min}$ 让能量项净胜。合起来:$B_m<c_3/\sigma_E$。回到第四章引理 4.1,$\mathrm{Wcount}>0$。整台机器闭合。

8. 为什么不需要 Kloosterman

经典圆法在这种「倒数相位」求和处常要动用 Kloosterman 和的深刻消去(Weil 界 $\sqrt p$)。Tang 的证明完全绕开了它,原因正是这一章的两块武器:

确定性代替消去

代价是常数不最优($2^{11}$、$16/9$ 都很松),但换来完全初等、可形式化、无解析数论深水区的证明——这也是它能被 Lean 逐行核验、且能被本讲义逐行复算的根本原因。