# A misalignment of AI in mathematics

> 来源：[HackerNews](https://mathandai.org/)

# AI 在数学领域的"错位"：当智能遇上严谨

> 原文标题：A misalignment of AI in mathematics
> 来源：HackerNews 热帖 | 原文链接：https://mathandai.org/

## 背景与概述

过去几年，AI 在数学领域的进展令人瞩目：从 AlphaProof 在国际数学奥林匹克（IMO）级别的比赛中摘金，到 GPT 系列模型在各类数学基准测试中屡创新高。然而，伴随这些突破而来的，是一个值得警惕的现象——**AI 系统的能力与其"工作方式"之间存在深刻的错位（misalignment）**。

这里的"错位"并非指 AI 有了自我意识或价值观偏差，而是指：AI 优化的是"看起来像正确答案"这一目标，而数学需要的是"逻辑上严格正确的推理"。大语言模型本质上是概率模型，它通过预测下一个最可能的 token 来生成内容。在大多数任务中，这种"似然性"与"正确性"高度相关，但在数学中，一步之差就是天壤之别——一个看似流畅的推导，可能包含致命的逻辑漏洞。

更值得注意的是，随着 AI 生成的内容大量涌入互联网，数学社区正在面临一种新的生态问题：错误的"AI 风格证明"正在污染知识库，而人类审稿人和学习者往往难以辨别这些内容的真伪。

## 核心内容

**1. 推理表面化：形式严谨让位于语言流畅**

大语言模型生成数学证明时，倾向于选择"读起来自然"的表达方式，而非"逻辑上无懈可击"的推导链条。这种倾向在低难度问题上表现不明显，但在高难度的定理证明中，AI 常常会用含糊其辞的步骤掩盖推理断层，例如频繁使用"显然（obviously）""不难看出（it is easy to see）"这类措辞跳过关键论证。

**2. 基准测试的"刷分"与真实能力的差距**

当前主流的数学评测（如 MATH、GSM8K）已逐渐饱和，但这部分得益于模型在训练中"见过"大量相似题型。当题目被重新表述、条件被微妙修改后，模型的表现往往断崖式下跌。这说明模型掌握的是**题型的分布特征**，而非**可迁移的推理能力**——这本身就是一种错位。

**3. 错误内容的大规模扩散**

AI 生成数学内容成本极低，正在被批量用于解答网站、作业辅导平台甚至学术论文。其中混杂的错误证明如果未经审核便进入训练语料和知识库，将形成"错误自我强化"的恶性循环。

**4. 人类过度依赖的风险**

当研究者把繁琐的验证工作交给 AI，自身审校能力却在退化。数学的进步恰恰依赖于对细节的死磕——一旦这种文化被侵蚀，伤害的是整个学科的长远根基。

**5. 形式化数学的崛起**

好消息是，Lean 等形式化证明语言正在提供一条出路：让 AI 的每一步推理都可被机器验证，从机制上消除"似是而非"的空间。

## 技术分析

问题的根源在于**训练目标与评价目标的不一致**。语言模型通过最小化交叉熵损失来训练：

$$
\mathcal{L} = -\sum_{t=1}^{T} \log P_\theta(x_t \mid x_{<t})
$$

这个目标奖励"与训练数据分布一致"的输出，而非"逻辑上正确"的输出。在数学场景中，正确的证明和错误的证明在 token 层面可能只有一两个词之差，但损失函数无法区分这两者的本质区别。

目前的缓解方案主要有三条技术路线：

1. **RLHF / RLVR（可验证奖励的强化学习）**：用形式化验证器作为奖励信号，让模型倾向于生成可被验证的正确推理。代表性方向如 Lean 辅助训练、AlphaProof 的搜索增强学习。
2. **思维链（Chain-of-Thought）+ 自我验证**：让模型显式展开中间推理步骤，并通过采样多个解并交叉验证（self-consistency）来提升可靠性：

```python
import random

def self_consistency_verify(problem, model, n_samples=5, threshold=0.6):
    answers = [model.generate(problem, temperature=0.8) for _ in range(n_samples)]
    votes = {}
    for ans in answers:
        key = extract_final_answer(ans)
        votes[key] = votes.get(key, 0) + 1
    best = max(votes, key=votes.get)
    return best if votes[best] / n_samples >= threshold else "UNRELIABLE"
```

3. **人机协作的形式化工作流**：AI 负责提出引理、探索证明路径，Lean/Coq 验证器负责把关，人类负责全局策略——各司其职，错位最小化。

## 实践建议

对于正在使用 AI 辅助数学工作的开发者与研究者，以下建议值得参考：

- **把 AI 当"草稿生成器"，而非"证明终结者"**。关键步骤必须人工复核，尤其是模型使用"显然""易知"等词跳步的地方——那里往往是最危险的地方。
- **优先采用带验证器的工具链**。如果工作涉及定理证明，尽量引入 Lean 等形式化系统，让机器替你把住最后一道关。
- **警惕评测分数的误导**。在选择数学 AI 工具时，不要只看基准分数，用你自己领域的真实难题做小规模"压力测试"，观察其在题面变形后的稳定性。
- **建立输出溯源机制**。在教育或出版场景中，对 AI 生成的数学内容强制标注来源，并保留人工审核流程，避免错误内容流入公开语料。
- **保持并锻炼"人工证伪"能力**。主动尝试构造反例、寻找 AI 证明中的漏洞，是防止能力退化的最好方式。

## 总结

"A misalignment of AI in mathematics"这个命题之所以引发广泛关注，是因为它揭示了一个普遍规律：**AI 的目标函数决定了它的行为边界**。在模糊容忍度高的领域，概率式生成是优势；但在数学这样对严谨性零容忍的领域，"像"与"是"之间的差距就成了致命伤。这个话题的价值不在于否定 AI 在数学中的潜力——形式化验证与人机协作已经展现出光明的路径——而在于提醒我们：拥抱 AI 的同时，必须让验证机制和人类判断力跟上生成能力的扩张速度。错位不可怕，可怕的是对错位视而不见。