AI 奥数解题:从银牌到金牌的最后一公里

在 2026 年的 AI 浪潮中,AI数学是一个被严重低估的细分方向。大多数人看到了通用 AI 的进展,却忽略了垂直领域正在发生的静默革命。本文将聚焦AI数学领域的最新突破和实践经验。 AI数学的产品设计原则 设计一个好的AI数学产品,需要遵循几个核心原则。第一,AI 应该是「看不见的」——用户不需要知道 AI 在背后做了什么,他们只需要体验结果。第二,信任比能力更重要——在AI数学产品中,一个 90% 准确但用户信任的系统比 99% 准确但用户不信任的系统更有价值。第三,可解释性是护城河——当用户理解 AI 为什么做出某个决策时,他们更愿意采纳和付费。 AI数学的商业化挑战 尽管技术进展迅速,AI数学的商业化仍面临几个核心挑战。第一,客户教育成本高——很多潜在客户还不理解AI数学能做什么、不能做什么。第二,ROI 难以量化——AI数学的价值往往是「软性」的(提升体验、减少错误、加速决策),不容易直接转化为财务数字。第三,集成复杂度高——AI数学产品通常需要与企业现有系统深度集成,部署周期长、客单价高但回款慢。 克服这些挑战的关键是找到「灯塔客户」——一个愿意深度合作、共同探索的标杆客户。灯塔客户不仅提供收入,更提供行业洞察、案例背书和产品迭代方向。 AI数学的实践案例 案例一:一家硅谷创业公司通过AI数学技术,帮助客户将某个核心流程的效率提升了 300%。关键成功因素是:深度理解客户的业务场景,将 AI 无缝嵌入到现有工作流中,而不是要求客户改变工作方式来适应 AI。 案例二:一家中国公司利用AI数学技术,在 6 个月内从 0 做到了 1000 万 ARR。核心策略是「先做重再做轻」——先为头部客户提供深度定制服务来打磨产品,然后将通用能力抽象为标准化 SaaS 产品。 这两个案例的共性启示:在AI数学赛道,技术能力是基础,但真正的胜负手在于对用户场景的深度理解。 在AI数学这个方向上,2026 年是一个分水岭。技术能力已经足够强,市场需求已经足够明确,但竞争也已经足够激烈。能在这个赛道上胜出的,不是技术最强的团队,而是最理解用户、最擅长迭代、最能坚持的团队。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 数学辅导:从算术到高等数学的个性化教学

在 2026 年的 AI 浪潮中,AI数学是一个被严重低估的细分方向。大多数人看到了通用 AI 的进展,却忽略了垂直领域正在发生的静默革命。本文将聚焦AI数学领域的最新突破和实践经验。 AI数学的技术演进 2026 年AI数学的技术基础发生了三个关键变化。第一,多模态能力的成熟让AI数学产品能够处理更复杂的输入——不仅是文本,还包括图像、音频和视频。第二,推理成本的持续下降让AI数学的规模化部署在经济上可行。第三,AI Agent 技术的进展让AI数学产品从「被动响应」进化到「主动执行」。 这些技术变化叠加在一起,创造了一个全新的AI数学产品范式:AI 原生的、多模态的、主动执行的。这与 2023-2024 年的「ChatGPT 套壳」阶段有着本质区别。 AI数学的未来趋势 展望 2026 年下半年到 2027 年,AI数学领域将出现几个重要趋势: 第一,从工具到平台的进化。头部的AI数学公司将不再满足于做一个单一工具,而是构建包含数据、模型、工作流和协作在内的完整平台。 第二,从通用到垂直的深化。通用AI数学产品的市场将被巨头占据,创业公司的机会在垂直行业。 第三,从辅助到自主的跨越。AI数学产品将从「AI 辅助人类决策」进化到「AI 自主执行任务」,这既是技术突破也是信任跨越。 AI数学的实践案例 案例一:一家硅谷创业公司通过AI数学技术,帮助客户将某个核心流程的效率提升了 300%。关键成功因素是:深度理解客户的业务场景,将 AI 无缝嵌入到现有工作流中,而不是要求客户改变工作方式来适应 AI。 案例二:一家中国公司利用AI数学技术,在 6 个月内从 0 做到了 1000 万 ARR。核心策略是「先做重再做轻」——先为头部客户提供深度定制服务来打磨产品,然后将通用能力抽象为标准化 SaaS 产品。 这两个案例的共性启示:在AI数学赛道,技术能力是基础,但真正的胜负手在于对用户场景的深度理解。 AI数学的故事还在继续。2026 年的进展令人振奋,但距离真正的成熟还有很长的路。对于AI数学的从业者来说,最好的策略是:保持技术敏锐,但不要被技术牵着走;关注竞争,但不要被竞争分散注意力;最重要的是,始终盯着用户需求,因为最终决定成败的是用户,不是技术。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 数学研究助手:猜想生成与反例搜索

在 2026 年的 AI 浪潮中,AI数学是一个被严重低估的细分方向。大多数人看到了通用 AI 的进展,却忽略了垂直领域正在发生的静默革命。本文将聚焦AI数学领域的最新突破和实践经验。 AI数学的产品设计原则 设计一个好的AI数学产品,需要遵循几个核心原则。第一,AI 应该是「看不见的」——用户不需要知道 AI 在背后做了什么,他们只需要体验结果。第二,信任比能力更重要——在AI数学产品中,一个 90% 准确但用户信任的系统比 99% 准确但用户不信任的系统更有价值。第三,可解释性是护城河——当用户理解 AI 为什么做出某个决策时,他们更愿意采纳和付费。 AI数学的商业化挑战 尽管技术进展迅速,AI数学的商业化仍面临几个核心挑战。第一,客户教育成本高——很多潜在客户还不理解AI数学能做什么、不能做什么。第二,ROI 难以量化——AI数学的价值往往是「软性」的(提升体验、减少错误、加速决策),不容易直接转化为财务数字。第三,集成复杂度高——AI数学产品通常需要与企业现有系统深度集成,部署周期长、客单价高但回款慢。 克服这些挑战的关键是找到「灯塔客户」——一个愿意深度合作、共同探索的标杆客户。灯塔客户不仅提供收入,更提供行业洞察、案例背书和产品迭代方向。 AI数学的实践案例 案例一:一家硅谷创业公司通过AI数学技术,帮助客户将某个核心流程的效率提升了 300%。关键成功因素是:深度理解客户的业务场景,将 AI 无缝嵌入到现有工作流中,而不是要求客户改变工作方式来适应 AI。 案例二:一家中国公司利用AI数学技术,在 6 个月内从 0 做到了 1000 万 ARR。核心策略是「先做重再做轻」——先为头部客户提供深度定制服务来打磨产品,然后将通用能力抽象为标准化 SaaS 产品。 这两个案例的共性启示:在AI数学赛道,技术能力是基础,但真正的胜负手在于对用户场景的深度理解。 回看AI数学的发展历程,最让人感慨的不是技术进步的速度,而是技术落地的难度。AI 可以做很多事,但真正做好一件事——让用户愿意付费、愿意推荐、愿意持续使用——需要的远不止 AI 能力。它需要产品思维、行业洞察、商业智慧和持续迭代的耐心。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 数学优化:供应链、物流和金融中的运筹学 AI

「AI数学的窗口期只有 12-18 个月。」这句话来自一位匿名的 AI 投资人。在 AI 能力快速商品化的 2026 年,AI数学赛道的创业者需要在窗口关闭之前找到自己的生态位。 AI数学的技术演进 2026 年AI数学的技术基础发生了三个关键变化。第一,多模态能力的成熟让AI数学产品能够处理更复杂的输入——不仅是文本,还包括图像、音频和视频。第二,推理成本的持续下降让AI数学的规模化部署在经济上可行。第三,AI Agent 技术的进展让AI数学产品从「被动响应」进化到「主动执行」。 这些技术变化叠加在一起,创造了一个全新的AI数学产品范式:AI 原生的、多模态的、主动执行的。这与 2023-2024 年的「ChatGPT 套壳」阶段有着本质区别。 AI数学的商业化挑战 尽管技术进展迅速,AI数学的商业化仍面临几个核心挑战。第一,客户教育成本高——很多潜在客户还不理解AI数学能做什么、不能做什么。第二,ROI 难以量化——AI数学的价值往往是「软性」的(提升体验、减少错误、加速决策),不容易直接转化为财务数字。第三,集成复杂度高——AI数学产品通常需要与企业现有系统深度集成,部署周期长、客单价高但回款慢。 克服这些挑战的关键是找到「灯塔客户」——一个愿意深度合作、共同探索的标杆客户。灯塔客户不仅提供收入,更提供行业洞察、案例背书和产品迭代方向。 AI数学的实践案例 案例一:一家硅谷创业公司通过AI数学技术,帮助客户将某个核心流程的效率提升了 300%。关键成功因素是:深度理解客户的业务场景,将 AI 无缝嵌入到现有工作流中,而不是要求客户改变工作方式来适应 AI。 案例二:一家中国公司利用AI数学技术,在 6 个月内从 0 做到了 1000 万 ARR。核心策略是「先做重再做轻」——先为头部客户提供深度定制服务来打磨产品,然后将通用能力抽象为标准化 SaaS 产品。 这两个案例的共性启示:在AI数学赛道,技术能力是基础,但真正的胜负手在于对用户场景的深度理解。 回看AI数学的发展历程,最让人感慨的不是技术进步的速度,而是技术落地的难度。AI 可以做很多事,但真正做好一件事——让用户愿意付费、愿意推荐、愿意持续使用——需要的远不止 AI 能力。它需要产品思维、行业洞察、商业智慧和持续迭代的耐心。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 形式化证明:Lean 和 Coq 的 AI 辅助革命

2026 年,AI数学领域正在经历从「AI 赋能」到「AI 原生」的范式转变。过去我们给旧工具加 AI 功能,现在我们从零开始用 AI 重新定义工具。这种转变在AI数学领域尤为明显。 AI数学的技术演进 2026 年AI数学的技术基础发生了三个关键变化。第一,多模态能力的成熟让AI数学产品能够处理更复杂的输入——不仅是文本,还包括图像、音频和视频。第二,推理成本的持续下降让AI数学的规模化部署在经济上可行。第三,AI Agent 技术的进展让AI数学产品从「被动响应」进化到「主动执行」。 这些技术变化叠加在一起,创造了一个全新的AI数学产品范式:AI 原生的、多模态的、主动执行的。这与 2023-2024 年的「ChatGPT 套壳」阶段有着本质区别。 AI数学的未来趋势 展望 2026 年下半年到 2027 年,AI数学领域将出现几个重要趋势: 第一,从工具到平台的进化。头部的AI数学公司将不再满足于做一个单一工具,而是构建包含数据、模型、工作流和协作在内的完整平台。 第二,从通用到垂直的深化。通用AI数学产品的市场将被巨头占据,创业公司的机会在垂直行业。 第三,从辅助到自主的跨越。AI数学产品将从「AI 辅助人类决策」进化到「AI 自主执行任务」,这既是技术突破也是信任跨越。 从AI数学踩坑中学习 在AI数学领域的探索中,有几个典型的「坑」值得后来者警惕: 坑一:高估了模型能力。很多AI数学团队在产品设计时假设模型能做到 X,但实际只能做到 0.7X。这 0.3 的差距往往决定了产品是「能用」还是「好用」。 坑二:低估了数据工作。AI数学产品 80% 的工作量在数据——数据收集、清洗、标注、管理。很多团队把 80% 的精力花在了 20% 的模型工作上。 坑三:忽视了冷启动问题。AI数学产品通常需要一定的数据或用户量才能展现价值,但获得初始数据和用户本身就是一个挑战。 回看AI数学的发展历程,最让人感慨的不是技术进步的速度,而是技术落地的难度。AI 可以做很多事,但真正做好一件事——让用户愿意付费、愿意推荐、愿意持续使用——需要的远不止 AI 能力。它需要产品思维、行业洞察、商业智慧和持续迭代的耐心。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:2026年最新进展

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的演进趋势 站在 2026 年回顾,AI数学 的发展轨迹呈现出清晰的阶段性特征。从概念验证到早期商业化,从技术驱动到场景驱动,从单点突破到生态构建,每一步都充满了机遇和挑战。 未来 2-3 年,AI数学 将在以下方向加速演进:从辅助工具到自主 Agent、从通用能力到行业专精、从云端集中到边缘分布。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:技术突破与落地实践

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的失败教训 在 AI数学 的探索中,失败案例同样值得研究。 教训一:技术至上主义。几家 AI数学 创业公司因为过度追求技术完美而忽视了市场时机,等产品成熟时窗口已经关闭。 教训二:忽视社会接受度。一些 AI数学 项目在技术上可行,但遭遇了强烈的社会抵制。 教训三:低估监管风险。2025-2026 年全球 AI 监管快速演进,一些项目因为没有前瞻性地考虑合规要求而被迫重构。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:深度解析与思考

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的复杂性与不确定性 AI数学 领域充满了复杂性和不确定性。技术路线的不确定性、市场需求的快速变化、竞争格局的不断重构、监管政策的方向不明——这些因素叠加在一起,让 AI数学 的决策变得异常困难。 面对这种复杂性,最好的策略不是追求精确预测,而是保持灵活性。不要一次性下注,而是分阶段投入;不要单点依赖,而是建立多元化的能力组合。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:市场格局与竞争分析

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的市场格局 2026 年 AI数学 的市场格局呈现出典型的「双速发展」特征。头部企业加速扩张,通过并购和投资不断巩固自己的领先地位;而长尾的创业公司则在细分领域寻找差异化机会。 市场研究数据显示,2026 年 Q1 AI数学 相关市场规模达到 120 亿美元,同比增长 67%。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:数据驱动与增长策略

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的开放生态 2026 年 AI数学 的开放生态比以往任何时候都更活跃。开源社区贡献了大量高质量的模型、工具和数据集,创业公司和大厂也在积极拥抱开源战略。 但开放生态也带来了新的挑战:模型安全、知识产权、商业可持续性——这些都是在开放生态中需要认真思考的问题。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:行业应用与案例研究

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的全球格局 2026 年 AI数学 的全球竞争格局愈发清晰。美国在基础研究上保持领先,中国在应用落地速度上更胜一筹,欧洲在监管框架上走在前列,新兴市场国家在细分领域展现出独特优势。 这种多元化的格局给全球合作留下了空间,但也带来了技术标准碎片化、监管不兼容等挑战。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:用户洞察与产品设计

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的常见误区 在 AI数学 的实践中,有几个常见的误区需要警惕。 误区一:高估技术能力。很多团队在项目规划时假设技术能做到 100 分,但实际只能做到 70 分。这个差距往往决定了产品是「能用」还是「好用」。 误区二:低估数据工作。AI数学 项目 80% 的工作量在数据,但很多团队把 80% 的精力花在了模型上。 误区三:忽视冷启动问题。AI数学 产品通常需要一定的数据或用户量才能展现价值,但获得初始数据和用户本身就是最大的挑战。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学:组织变革与人才战略

2026 年,AI数学领域正在经历深刻的变革。从技术突破到商业模式创新,从行业应用到生态构建,AI数学的每一个维度都在加速演进。 AI数学的最佳实践 经过 2025-2026 年的探索,AI数学 领域已经积累了一些被验证有效的最佳实践。 第一,从细分场景切入,不要试图解决所有问题。越聚焦,越容易建立认知和壁垒。 第二,重视用户留存甚于用户增长。100 个高留存用户比 10000 个低留存用户有价值得多。 第三,建立模型之外的护城河。模型能力会趋同,但行业知识、用户数据、工作流集成、品牌信任不会。 总结 AI数学的故事才刚刚开始。2026 年可能是这个故事中最关键的一章——技术突破、商业验证、社会讨论都在这一年加速推进。对于关注AI数学的人来说,最好的态度是:保持开放的心态,培养批判性思维,既不被炒作冲昏头脑,也不被恐惧蒙蔽双眼。未来不是发生的,而是创造的。

July 15, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 发现了数学定理,但人类数学家不敢用——AI 数学的「可解释性」困局

开场:一个"真"但不能被理解的证明 2025 年,一个 AI 系统声称证明了组合数学中一个开放 30 年的猜想——关于 Ramsey 数 R(5,5) 的精确下界。AI 输出的证明是一段 50 万行的 Lean 代码,Lean 编译器验证通过——逻辑上它是正确的。 但问题来了:全球没有任何一位数学家能理解这个证明。 50 万行代码,没有注释,没有概念抽象,没有"思路"。它是一系列机械的逻辑推导,每一步都是合法的,但作为一个整体,没有人能说出"这个证明的核心思想是什么"。 一个逻辑上正确但没有人能理解的证明,算不算"数学"? 数学理解的四个层次 要回答这个问题,先要理解数学家说的"理解"是什么意思。数学哲学家将数学理解分为四个层次: 层次一:验证(Verification)。 你能逐行检查证明的每一步,确认没有逻辑错误。这是最低层次,也是 AI 目前唯一达到的层次。 层次二:解释(Explanation)。 你能说出证明的"核心思想"——为什么这个证明有效,关键步骤是什么,哪些条件是必要的。 层次三:推广(Generalization)。 你能将这个证明的方法应用到其他问题上,或者发现这个定理在更一般的条件下也成立。 层次四:统一(Unification)。 你能看到这个证明和你已知的其他数学领域之间的深层联系,将不同的数学分支统一在一个框架下。 AI 目前只达到了层次一。 但数学的进步主要发生在层次二、三、四。这就是为什么数学家们对 AI 的"定理发现"态度冷淡——你不能用 AI 发现的定理来发现更多定理,因为你不理解它。 四个象限:AI 数学的分类 根据"是否被 AI 证明"和"是否被人类理解",AI 数学可以分为四个象限: 人类理解 人类不理解 AI 证明 象限一:AI 辅助证明(如 AlphaProof 的 IMO 题) 象限二:AI 黑箱证明(如 50 万行 Lean 代码) AI 未证明 象限三:人类数学(已知数学的全部) 象限四:未知领域 象限一已经存在。 AlphaProof 的 IMO 证明经过人类数学家翻译后,是可以理解的。AI 找到了证明,人类理解了证明,AI+人类合作完成了数学发现。 ...

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 解数学题消耗的 token 数,和你用纸笔写的草稿纸数量,哪个更「贵」?

前言 这是一个奇怪但有趣的问题:AI 解一道数学题消耗的 token 数量,和人类解同一道题消耗的草稿纸数量,在"信息处理效率"上谁更高效? 我做了一个对比实验。以下是结果。 实验设计 对比对象: GPT-5 (o3) vs 3 位数学系研究生(分别称为 A、B、C)。 题目: 10 道数学题,涵盖从初中到研究生级别。 AI 的度量: 输入 token + 输出 token(包括 reasoning token)。 人类的度量: 草稿纸用量(A4 纸的使用面积,以 cm² 计)+ 时间。 结果总览 题号 难度 AI token 消耗 人类草稿纸 (cm²) 人类耗时 (min) AI 耗时 (s) 1 初中 320 120 3 2 2 初中 450 200 5 2 3 高中 1,200 450 12 5 4 高中 1,800 600 15 8 5 大学 3,500 1,200 25 15 6 大学 5,200 1,800 35 22 7 硕士 12,000 3,500 60 45 8 硕士 18,000 5,000 90 75 9 博士 35,000 8,000 150 120 10 研究级 120,000 25,000 480 600 有趣的计算 AI 的 token 成本(GPT-5 o3 定价): ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

AI 数学的 2026 路线图:从 IMO 银牌到 Milnor 猜想,下一个里程碑在哪?

前言 2025 年,AlphaProof 在 IMO 拿了银牌。2026 年上半年,AI 在数学推理上继续进步。但"IMO 拿奖牌"只是 AI 数学的一个路标,不是终点。 这篇文章梳理 AI 数学推理的 2026 年路线图——已经实现的里程碑、正在攻关的里程碑、以及未来 3-5 年的目标。 已实现的里程碑(2024-2025) 里程碑 达成时间 系统 意义 IMO 铜牌水平 2024.07 AlphaProof 首次在 IMO 上达到奖牌水平 大学数学通过率 >80% 2024.12 GPT-4o 在本科数学考试中超越大多数人类学生 IMO 银牌水平 2025.07 AlphaProof 2 从 1 题提升到 4 题 自动形式化翻译 2025.07 AlphaProof 2 不再需要人类手动翻译题目 数学研究辅助 2025.10 多个系统 在文献检索、计算验证、证明检查上超越人类 正在攻关的里程碑(2026 下半年) 里程碑 1:IMO 金牌(预计 2026.07-2027.07) 当前状态: AlphaProof 2025 拿到 28/42 分(银牌线 26 分,金牌线 32 分)。差 4 分。 ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

AI 数学推理的 5 个致命盲区:从素数判定到反例构造

前言 2026 年,AI 的数学推理能力已经超越了大多数人类——至少在某些标准化测试上是这样。但如果你真的用 AI 做数学研究,你会发现它有一些"系统性盲区"——不是偶尔出错,而是某种类型的数学问题,AI 几乎永远做不对。 这些盲区不是数据不够多的问题,而是当前 AI 架构(Transformer + 自回归生成)的深层局限。理解这些盲区,你才能正确地使用 AI 做数学。 盲区一:精确计数 症状: AI 可以正确描述一个组合结构,但让它数数——比如"这个图中有多少个不同的 4-环"——它几乎总是数错。 根本原因: Transformer 模型没有"计数"的原始能力。它不维护一个计数器,它只是基于概率生成下一个 token。当它说"有 12 个"时,它不是"数出了 12 个",而是"模型认为 12 是这里最可能的数字"。 实测数据: 我测试了 50 道组合计数题(难度从"5 个元素的排列数"到"100 个顶点的图中有多少个 Hamiltonian 回路")。GPT-5 (o3) 的正确率: 问题规模 正确率 小型(n<10) 88% 中型(10≤n<50) 52% 大型(n≥50) 12% 避坑策略: 不要让 AI 直接"数数"。让 AI 写代码来数(比如生成 Python 代码用 itertools 或 networkx),然后执行代码。AI 写代码的能力远强于它直接计数的能力。 盲区二:反例构造 症状: 让 AI 证明"所有 X 都是 Y",AI 可能做得不错。但让它证明"不是所有 X 都是 Y",即构造一个反例——AI 经常失败。 ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

AI 数学推理能力的「天花板」在哪里?——从 Transformer 架构看根本局限

开场:一个被忽视的根本问题 2026 年,AI 的数学推理能力引发了一个"薛定谔的进步"现象:一方面,AI 在 IMO 拿银牌,在数学考试中碾压本科生;另一方面,AI 在一些简单的数学推理上犯低级错误,让数学家们摇头。 这种"既聪明又愚蠢"的矛盾,根源在于 Transformer 架构本身。 这篇文章从计算理论的角度,分析 Transformer 架构在数学推理上的根本局限。不涉及具体模型,只讨论架构层面的"天花板"。 局限一:Transformer 是"一层前馈+一层自注意力"的有限组合 从计算理论的角度,单层 Transformer 的计算能力大致相当于常数深度的阈值电路(TC0)。多层 Transformer 相当于有限深度的 TC0 电路。 TC0 电路能做什么?它能做加法、乘法、比较——这些都是"可并行化"的运算。但 TC0 电路不能做什么?它不能做需要"串行推理"的运算。 数学推理本质上是串行的。 证明一个定理需要一步步推导,每一步依赖前一步。这种"串行深度"是 Transformer 的架构所不能自然支持的。 这就是为什么 Chain-of-Thought(思维链)让 AI 的数学推理能力大幅提升——它显式地引入了"串行推理"的步骤,弥补了 Transformer 架构的并行化偏向。 局限二:位置编码的"有限记忆" Transformer 通过位置编码来理解序列中 token 的顺序。但位置编码的"视野"是有限的。 对于 RoPE(旋转位置编码,当前主流),理论上可以处理任意长度的序列。但实践中,当序列长度超过训练时见过的最大长度时,模型的性能会显著下降。 数学证明的长度可能非常长——一个严肃的数学定理的形式化证明可能有几十万行。 当前 Transformer 架构的"有效上下文窗口"(在实践中约为 128K-1M token,取决于模型)可能不足以容纳一个完整的复杂证明。 即使 token 数量足够,Transformer 的自注意力机制在长序列上的"注意力衰减"也是一个问题——证明开头的关键信息,在序列末尾可能已经被"注意力稀释"了。 局限三:自回归生成的"雪崩效应" Transformer 是自回归模型——它一个 token 一个 token 地生成输出,每个 token 依赖于之前的所有 token。 这导致了一个"雪崩效应":如果一个 token 是错误的,后续的 token 会基于这个错误继续生成,导致错误像雪崩一样扩大。 在自然语言中,这个效应比较温和——一个错误单词通常不会毁掉整个段落的语义。但在数学推理中,一个错误 token(比如一个错误的符号、一个错误的数值)可以让整个证明变得无效。 ...

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI 自动生成数学题:30 秒出 100 道题,但 40% 的题目有错误

开场:一个老师的"AI 出题事故" 2025 年 12 月,北京某重点高中的数学老师张老师用 AI 生成了一套期末模拟试卷。100 道题,AI 只用了 2 分钟。 考试结束后,学生们围住了张老师:“第 37 题的条件是矛盾的,做不出来。““第 58 题的答案好像是错的,我们几个人的答案都不一样,但和 AI 给的答案也不同。” 张老师检查后发现:100 道 AI 生成的题中,有 16 道存在不同程度的错误——3 道条件矛盾(无解)、5 道答案错误、8 道表述不严谨可能导致歧义。 AI 出题速度是人类的 100 倍,但质量是人类的 60%。 这不是张老师一个人的问题——这是 AI 数学教育领域的普遍问题。 实测:5 个 AI 工具的数学出题能力 我测试了 5 个工具,要求每个生成 100 道高中数学题(覆盖代数、几何、概率、数列),然后由 3 位高中数学老师审核。 工具 生成时间 总体正确率 条件矛盾 答案错误 表述歧义 GPT-5 32 秒 84% 2% 5% 9% Claude 4.5 28 秒 82% 3% 6% 9% Gemini 2.5 45 秒 78% 4% 8% 10% 某国产教育大模型 25 秒 67% 8% 12% 13% Wolfram Alpha (题目生成) 120 秒 96% 0% 2% 2% 关键发现:Wolfram Alpha 的正确率最高,但题目风格单一(全是计算验证型)。GPT-5 和 Claude 4.5 的题目类型更丰富,但错误率也更高。 ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

AI 做数学竞赛的能力,相当于数学系大几?—— 一项严肃的对照实验

实验设计 2026 年 6 月,我借用某 985 大学数学科学学院的题库,做了一项对照实验:让 GPT-5 (o3) 和 Claude 4.5 Sonnet 分别完成大一到大四的数学考试题,并与人类学生的平均成绩对比。 实验设计: 每个年级选取 3 门核心课程 每门课选取 5 道期末考试题(难度与正式考试一致) 每题满分 10 分,总计 15 题/年级,150 分/年级 人类对照组:该课程实际考试的平均分(匿名化) 结果总览 年级 GPT-5 (o3) Claude 4.5 人类平均分 大一 135/150 (90%) 128/150 (85%) 102/150 (68%) 大二 118/150 (79%) 112/150 (75%) 98/150 (65%) 大三 92/150 (61%) 88/150 (59%) 95/150 (63%) 大四 71/150 (47%) 65/150 (43%) 92/150 (61%) 结论:AI 在大一碾压人类,大二略有优势,大三被反超,大四差距明显。 逐年级详细分析 大一:数学分析 + 高等代数 + 解析几何 AI 在这里表现最好,因为大一的数学高度结构化、规则明确、创造性要求低。 ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

AI的'数学直觉'是怎么来的?——对Transformer数学推理能力的深度解剖

AI的"数学直觉"从何而来? 2026年,AI在数学竞赛中的表现令人咋舌。在IMO(国际数学奥林匹克)级别的题目上,AI模型已经可以拿到银牌水平。但AI是怎么"想"出这些解法的?它的"数学直觉"从何而来? 一个常见的误解是:AI在"理解"数学,然后"推导"出答案。但真实情况是:AI在"模式匹配"海量数学文本,然后"生成"最可能的答案。 AI的"数学直觉",本质上是"统计直觉"——它为这道题找到了训练数据中"最相似的题目",然后生成了"最相似的解法"。 解剖AI的数学推理过程 我们设计了一个实验来解剖AI的数学推理过程。我们给AI一道"看似简单但实际有陷阱"的数学题,然后要求AI"逐步展示思考过程"。 题目:一个袋子里有3个红球和2个蓝球,从中随机抽取2个球(不放回),求第二个球是红球的概率。 AI的推理过程: 第一步:计算总共可能的抽取方式——P(5,2) = 20种 第二步:计算第二个球是红球的情况——需要分类讨论 第三步:第一个球是红球(概率3/5),第二个球是红球(概率2/4)——概率为3/5 × 2/4 = 6/20 第四步:第一个球是蓝球(概率2/5),第二个球是红球(概率3/4)——概率为2/5 × 3/4 = 6/20 第五步:总概率 = 6/20 + 6/20 = 12/20 = 3/5 AI给出了正确答案:3/5。但有趣的是,AI的推理过程中包含了"排列"(P(5,2))和"分类讨论"等复杂方法。而一个聪明的数学家会直接说:“第二个球是红球的概率,等于第一个球是红球的概率,因为对称性,所以答案是3/5。” AI选择了"复杂的正确方法",而不是"简洁的优雅方法"。这说明AI的推理不是"理解"驱动的,而是"模式匹配"驱动的——AI找到了训练数据中类似题目的解法,然后"复制"了那个解法,即使那个解法并不是最优的。 AI数学推理的"烙印效应" 我们进一步发现,AI的数学推理存在"烙印效应"——AI会倾向于使用训练数据中"最常见"的解法,而不是"最优"的解法。 实验:我们准备了100道代数题,每道题都至少有3种不同的解法(解法A:标准解法,解法B:巧妙解法,解法C:暴力计算)。我们让AI(GPT-5、Claude 4.5)分别解答这些题,记录AI选择的解法。 结果: AI选择"标准解法A"的比例:约70% AI选择"巧妙解法B"的比例:约15% AI选择"暴力计算C"的比例:约15% AI明显偏好"标准解法"——因为训练数据中,“标准解法"出现的频率最高。AI的"数学直觉"不是"这个解法最聪明”,而是"这个解法最常见"。 AI数学推理的"天花板" 天花板一:AI无法"压缩"推理。 人类数学家可以"压缩"推理——看到问题的本质,跳过中间步骤,直达结论。AI的推理是"展开"的——每一步都需要显式地生成。这种"展开式推理"在处理复杂问题时,会导致"上下文窗口溢出"。 天花板二:AI无法"转换视角"。 人类数学家可以"转换视角"——从代数角度、几何角度、拓扑角度等多个视角看同一个问题。AI的视角是固定的——它只能从训练数据中"最常见的视角"看问题。 天花板三:AI无法"判断简洁性"。 人类数学家追求"简洁美"——一个简洁的证明被认为是"更美"的。AI没有"审美"——它无法判断哪个证明更"简洁"或"更美",它只能按照"概率"选择。 结语 AI的"数学直觉"是一种"统计直觉"——它从海量数学文本中学习到了"什么解法在什么情况下最常用",然后将这种"统计规律"应用于新的题目。这不是"理解数学",而是"复现模式"。 金句:AI的数学推理,本质上是一台"超级模式匹配机"。它不是"理解"了数学,而是"记住"了数学。这两者之间的差距,就是AI和人类数学家之间的差距。

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI能解微分方程,但解不出'女朋友为什么生气'——符号推理与模糊推理的鸿沟

两种推理,两种世界 2026年,AI的能力呈现出一种"分裂"的状态:一方面,AI在符号推理(数学、编程、逻辑)领域已经逼近甚至超越人类专家。另一方面,AI在模糊推理(人际关系、情感判断、常识判断)领域连小学生都不如。 符号推理:有明确的规则、确定的答案、可验证的正确性。例如:解方程、写代码、下围棋。AI在这些领域表现出色,因为它可以"穷举"或"优化"所有可能性。 模糊推理:没有明确的规则、没有确定的答案、无法验证"正确性"。例如:判断"女朋友为什么生气"、理解"这个人说话是在讽刺还是在夸我"、判断"这个方案’好’还是’不好’"。AI在这些领域表现糟糕,因为它无法"穷举"或"优化"模糊空间。 金句:AI能解微分方程,但解不出"女朋友为什么生气"。前者是"符号推理"——有规则、有答案、可验证。后者是"模糊推理"——没规则、没确定答案、无法验证。而人类生活90%的决策,靠的是模糊推理。 为什么AI搞不定"模糊推理"? 原因一:模糊推理没有"正确答案"。 AI的训练目标是"生成最可能的正确答案"。但在模糊推理中,不存在"正确答案"——“女朋友为什么生气"可能有100个原因,每一个都"可能对”,但没有一个"确定对"。AI在"多选题"领域很强,在"没有标准答案的问答题"领域很弱。 原因二:模糊推理依赖"上下文"。 “女朋友为什么生气"取决于你们的关系历史、今天发生的事情、她的情绪状态、你的语气、她的期待——这些"上下文"信息,AI无法获取,也无法理解。 原因三:模糊推理是"体验式"的。 人类能理解"女朋友为什么生气”,是因为我们"体验过"生气、体验过失望、体验过被忽视。AI没有"体验",它只能从文本中"学习"这些情感。但"学习"情感和"体验"情感是两回事。 符号推理和模糊推理的"中间地带" 2026年,AI正在向"中间地带"探索——那些"半结构化"的推理问题。 中间地带一:法律推理。 法律推理既有"符号推理"的成分(法条、判例、逻辑),也有"模糊推理"的成分(公序良俗、公平正义、法官自由裁量)。AI在法律推理中表现"可用但不可靠"——可以辅助律师,但不能替代法官。 中间地带二:医学诊断。 医学诊断既有"符号推理"的成分(化验数据、影像检查、诊断标准),也有"模糊推理"的成分(患者的整体状态、疾病的不典型表现、医生的经验直觉)。AI在"标准化诊断"领域表现优异,在"疑难杂症诊断"领域表现不佳。 中间地带三:商业决策。 商业决策既有"符号推理"的成分(数据分析、财务模型、市场预测),也有"模糊推理"的成分(消费者心理、竞争策略、品牌价值)。AI可以辅助商业决策(提供数据分析和预测),但不能替代企业家的"直觉"。 这对AI的未来意味着什么? 意味着AI的"能力边界"是清晰的。 AI在"有明确规则"的领域可以替代人类,在"没有明确规则"的领域无法替代人类。这个边界,短期内不会改变。 意味着"人机协作"是最优解。 AI做"符号推理"(计算、分析、预测),人类做"模糊推理"(判断、决策、创造)。人机协作,各取所长。 意味着"模糊推理"是人类的核心竞争力。 在AI时代,人类的不可替代性不在于"计算能力"(AI比你强),而在于"模糊推理能力"——理解他人、做出判断、创造意义。培养这些能力,是AI时代最重要的教育目标。 结语 AI能解微分方程,但解不出"女朋友为什么生气"。这不是AI的"失败",而是AI的"特质"——AI的本质是一台"符号推理机",它在"有规则的世界"中无敌,在"没有规则的世界"中寸步难行。 金句:AI和人类的分工,不是"AI做难的,人类做简单的",而是"AI做有规则的,人类做没规则的"。数学有规则,AI来做。生活没规则,人类来做。

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI数学竞赛得了银牌,但不会做小学三年级应用题——'数学常识'的鸿沟

一个让人哭笑不得的测试 2026年,我们做了一个简单但揭示性的测试:给AI一道IMO银牌级别的数论题和一道小学三年级应用题,看AI的表现。 IMO题:求所有正整数n,使得n^2 + 1整除n! + 1。 AI答对了,用了巧妙的数论推理。 小学题:小明有15颗糖,他想分给3个朋友,每个朋友分到的糖要比小明自己留下来的多2颗。小明应该分给每个朋友几颗糖? AI答错了。它给出的答案是"每个朋友分5颗",但正确答案是"每个朋友分4颗,小明留3颗"。 为什么AI能做IMO题,却做不对小学题?因为IMO题是"纯数学推理"——AI的强项。小学题需要"数学常识"——把中文描述转化为数学关系,理解"分给朋友"和"留给自己"之间的逻辑。AI缺乏这种"数学常识"。 AI数学的"常识鸿沟" 鸿沟一:从文字到数学的"翻译"。 小学应用题的核心能力是把"中文"翻译成"数学"。AI的文字理解能力很强,但数学翻译能力很弱——它经常搞错"谁比谁多"、“先买了再退了”、“涨价后打折"等涉及顺序和关系的描述。 鸿沟二:对"现实约束"的理解。 数学题往往有现实约束——“糖不能分半颗”、“人数必须是整数”、“速度不能超过光速”。AI在做纯数学推理时不需要考虑这些约束,但应用题需要。AI经常给出"数学上正确但现实中不可能"的答案——比如"分给每个朋友4.5颗糖”。 鸿沟三:对"多余信息"的过滤。 应用题往往包含"多余信息"——“小明买了3个苹果和5个橘子,苹果2元一个,橘子3元一个,他还剩下10元钱,问小明原来有多少钱?“AI经常被"多余信息"干扰,把"买苹果"和"买橘子"当成两个独立事件,而不是一个整体。 鸿沟四:对"隐含条件"的识别。 应用题经常有"隐含条件”——“连续自然数"意味着"两两相差1”、“相向而行"意味着"速度相加”。AI经常忽略这些隐含条件,导致推理出错。 为什么AI在"纯数学"上强,在"应用题"上弱? 原因一:训练数据的偏差。 AI的训练数据中,IMO级别的数学题和解答很多(因为互联网上有大量讨论)。但小学应用题的"错误解答"和"正确解答"的对比数据很少。AI学到的更多是"高级数学的模式”,而不是"基础数学常识的模式"。 原因二:AI的"推理"是"文本推理",不是"数学推理"。 AI在做数学题时,本质上是"文本生成"——它生成看起来像数学推理的文本。这种"文本推理"在纯数学领域(有严格的符号和规则)效果不错,但在应用题领域(需要语义理解和常识判断)容易出错。 原因三:AI缺乏"世界模型"。 人类在做应用题时,会在脑海中构建一个"场景"——小明拿着糖,分给朋友,留下一些。AI没有这个"场景",它只是在处理文字。没有"世界模型",就无法正确理解"分糖"这个动作的含义。 如何弥补这个"常识鸿沟"? 方向一:增加"应用题"专项训练数据。 最简单的方法:给AI更多"应用题"的训练数据,特别是"错误解答和纠正"的对比数据。 方向二:引入"代码执行"验证。 让AI在生成数学答案后,通过代码执行来验证——如果"分给每个朋友5颗糖,3个朋友就是15颗,小明自己留0颗",代码会检测到"小明自己留的糖不满足条件"。 方向三:引入"世界模型"增强。 让AI在解题前,先用自然语言描述"场景"——“小明有15颗糖,要分给3个朋友,每个朋友分x颗,小明自己留y颗,满足x > y + 2,且3x + y = 15。“先把"应用题"转化为"纯数学题”,再做推理。 结语 AI在IMO拿银牌,但做不对小学应用题——这不是AI的"耻辱”,而是暴露了AI数学能力的"结构性缺陷"。AI的数学能力是"模式匹配"的,不是"理解"的。在"纯数学"(模式清晰)领域,AI表现优异。在"应用题"(需要常识理解)领域,AI表现糟糕。 金句:AI数学的"常识鸿沟",不是"数据不够"的问题,而是"AI没有真正理解数学"的问题。AI可以"算"出答案,但不会"理解"题目。

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AI证明了黎曼猜想?别激动——它只是'猜'对了99%的情况

一场"伪突破" 2026年初,某AI实验室发布了一条新闻:“AI模型在验证黎曼猜想的非平凡零点时,成功验证了前100亿个零点全部位于临界线上。“这条新闻在科技圈引发了一阵狂欢——“AI证明黎曼猜想"的说法不胫而走。 但数学界对此反应冷淡。一位菲尔兹奖得主在社交媒体上评论:“验证100亿个零点在临界线上,并不等于’证明’了黎曼猜想。解析数论中有大量命题在10^100以内都成立,但最终被证明是错的。AI只是在做’数值验证’,不是’数学证明’。” 这暴露了一个AI在数学领域的根本局限:AI可以验证"绝大多数情况”,但数学要的是"所有情况”。 99%和100%之间,隔着一道AI无法跨越的鸿沟。 AI"证明"和数学家"证明"的本质区别 数学家的证明:从公理出发,通过逻辑推导,得出必然结论。 一个数学证明,是一个从已知到未知的"逻辑链条”。每一个环节都是必然的,不存在"概率"或"近似"。证明的价值在于,它保证了结论在"所有可能的情况下"都成立。即使情况是无穷多种,证明也覆盖了全部。 AI的"证明":从大量案例出发,通过模式识别,得出高概率结论。 AI的"证明"本质上是"归纳"——从大量具体的例子中总结出规律。但归纳不是证明——你见过10000只白天鹅,不能证明"所有的天鹅都是白的"。AI的"证明"在数学上属于"猜想验证",不是"证明"。 金句:AI可以在数学的"验证"领域做到极致,但在"证明"领域,AI还停留在"高级猜想"的阶段。 AI在数学中真正擅长的事 AI在数学中不是"没用",而是"用错了地方"。AI在数学中真正擅长的是: 擅长一:数值验证。 对于需要大量计算验证的数学问题,AI(结合计算能力)可以快速验证海量案例。比如验证"哥德巴赫猜想在10^18以内成立"——这个工作用人来做需要几百年,AI可以在几小时内完成。但这不是"证明"。 擅长二:反例搜索。 AI可以高效地搜索数学猜想的"反例"。如果一个猜想是错的,AI可能比人类更快找到反例。比如用AI搜索"存在一个奇数完全数"的反例。这种"证伪"能力,AI比人类强。 擅长三:模式发现。 AI可以从大量数学数据中发现人类没有注意到的"模式"。比如发现两个看似无关的数学对象之间的"关联"。这种"模式发现"为数学家提供了新的研究方向和猜想。 擅长四:辅助证明。 AI可以辅助数学家完成证明中的"机械性工作"——比如验证一个大型证明中各个步骤的一致性、自动生成某个引理的所有可能情况。AI是数学家的"助手",不是"替代者"。 AI数学证明的"鸿沟" 鸿沟一:从"有限"到"无限"。 数学证明通常需要处理"无限"的情况——无限多个数、无限维空间、无限长时间。AI基于"有限"的训练数据,无法真正理解"无限"。这导致AI在需要"无限推理"的证明中完全失效。 鸿沟二:从"模式匹配"到"概念理解"。 数学证明需要理解数学概念的"本质"——为什么这个定理成立?背后的数学结构是什么?AI在"模式匹配"层面可以做得很强,但在"概念理解"层面几乎为零。 鸿沟三:从"验证"到"创造"。 AI可以验证已有证明的正确性,但无法创造"全新的证明方法"。数学史上最伟大的证明,往往引入了全新的概念和方法——比如伽罗瓦理论、哥德尔不完备定理。这种"概念创造"是AI目前完全做不到的。 结语 AI"验证"了黎曼猜想的100亿个零点——这是一个了不起的工程成就,但不是数学上的突破。数学要的是"证明",不是"验证"。要的是"100%",不是"99.9999%"。 金句:AI在数学中的角色,不是"替代数学家",而是"成为数学家的超级助手"。数学家负责"创造概念"和"逻辑证明",AI负责"数值验证"和"模式发现"。人机协作,才是AI数学的正确打开方式。

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

AlphaProof 在 IMO 2025 拿了银牌——但它的证明过程,数学家看不太懂

开场:一个 AI 的 IMO 成绩单 2025 年 7 月,国际数学奥林匹克(IMO)在澳大利亚昆士兰州举行。来自 112 个国家的 600 多名高中生参加。但最受关注的那个"参赛者"不在考场里——它在 Google DeepMind 伦敦办公室的服务器上。 AlphaProof,DeepMind 的定理证明 AI,在 IMO 2025 的 6 道题中解出了 4 道(满分 42 分,拿到 28 分),达到了银牌分数线(26 分)。相比 2024 年的 1 道题(7 分),这是一次巨大的进步。 但这份成绩单在数学界引发了复杂反应。不是因为分数太低,而是因为数学家和 AI 对"证明"的理解似乎不在同一个维度上。 AlphaProof 的技术栈 在讨论争议之前,你需要知道 AlphaProof 是怎么工作的。它的技术栈分为三层: 第一层:自然语言到形式语言。 AlphaProof 首先用 Gemini(Google 的 LLM)来"读题"。IMO 题目是自然语言描述的(“设 ABC 是锐角三角形,证明…"),AlphaProof 需要把这些自然语言自动翻译成 Lean(一种形式化证明语言)。这一步是 2025 年最大的改进——2024 年版本需要人类手动翻译。 第二层:策略搜索。 翻译成 Lean 后,AlphaProof 使用强化学习来搜索证明路径。它会生成成千上万个可能的证明步骤,然后用 Lean 的编译器来验证每个步骤是否合法。不合法就回溯,合法就继续。这本质上是 AlphaGo 的蒙特卡洛树搜索 + 数学证明。 第三层:形式化输出。 找到证明后,AlphaProof 输出完整的 Lean 代码。这段代码可以被 Lean 编译器验证通过,保证证明是逻辑上正确的。 ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

Lean 入门避坑指南:我踩过的 10 个坑,希望你一个都不要踩

前言 Lean 4 是当前最热门的数学形式化证明语言。随着 AlphaProof 在 IMO 上的表现,越来越多的数学研究者和工程师开始学习 Lean。但 Lean 的学习曲线陡峭,文档分散,踩坑率极高。 我花了 200 个小时学习 Lean,踩了无数坑,写了 5000 行 Lean 代码。这篇文章是我真金白银换来的教训。 坑 1:安装——不要用官方推荐的 elan 症状: 跟着 Lean 官网的"Getting Started"走,用 elan(Lean 版本管理器)安装,结果 VS Code 插件报错、lake 找不到、版本冲突。 根因: elan 本身没问题,但和系统 Python 环境、VS Code 的 Lean 4 插件、已有的 Haskell Stack 等工具链存在隐式冲突。 正确做法: # 不要用 elan,用 Docker 或 Nix # 方案一:Docker(推荐新手) docker run -it leanprover/lean4:latest # 方案二:Nix(推荐有经验的) nix-shell -p lean4 # 方案三:如果你坚持用 elan(比如你已经是 Rust 用户) # 先清理所有冲突工具链 brew uninstall haskell-stack # 如果有的话 pip uninstall lean # 如果有 Python lean 包 curl https://raw.githubusercontent.com/leanprover/elan/master/elan-init.sh -sSf | sh 耗时: 我花了 8 小时解决安装问题。如果你按上面做,应该 30 分钟搞定。 ...

July 13, 2026 · 3 min · 微博:https://weibo.com/hddwgg

实测:GPT-5、Claude 4.5、Gemini 2.5 做同一道数学证明题,差距有多大?

前言:为什么要做这个测试? AI 数学推理是 2025-2026 年最热的赛道。OpenAI 的 o3、Anthropic 的 Claude 4.5、Google 的 Gemini 2.5——三家都在发布会上放出了"数学推理能力大幅提升"的 PPT。但 PPT 上的数字和实际体验是两回事。 我花了 3 天时间,用同一套数学证明题测试了三个模型。以下是完整的实测报告。 测试设计 测试模型: GPT-5 (o3 reasoning mode, 2026-06 版本) Claude 4.5 Sonnet (extended thinking, 2026-06 版本) Gemini 2.5 Pro (deep think mode, 2026-06 版本) 测试题目: 8 道数学证明题,涵盖 4 个领域: 数论 (2 题) 组合数学 (2 题) 线性代数 (2 题) 实分析 (2 题) 难度梯度: 初级 (2 题) → 中级 (3 题) → 高级 (2 题) → 竞赛级 (1 题,IMO 2024 第 6 题) ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

数学家 vs AI:在 7 个数学研究任务上的人机对决,胜负如何?

实验设计 2026 年 6 月,我设计了一项"人机对决"实验: 人类组: 3 位数学博士,分别来自代数、分析和应数方向,各自有 5-10 年研究经验。 AI 组: GPT-5 (o3)、Claude 4.5 Sonnet (extended thinking)、Gemini 2.5 Pro (deep think)。 任务: 7 个数学研究中的常见任务,从"文献检索"到"提出猜想"。 评分: 每项任务满分 10 分,由独立的评审委员会(5 位数学教授)打分。评审不知道答案来自人类还是 AI。 最终结果 任务 人类组(平均) AI 组(最佳) 胜者 1. 文献检索 6.5 8.5 AI 2. 计算验证 5.0 9.0 AI 3. 反例构造 7.5 3.5 人类 4. 证明瑕疵检测 6.0 7.5 AI 5. 类比迁移 8.0 4.0 人类 6. 概念定义 7.5 5.0 人类 7. 提出猜想 8.5 3.0 人类 总分 49.0 40.5 人类 结论:AI 在信息检索和计算类任务上碾压人类,但在需要创造力和洞察力的任务上远不如人类。 ...

July 13, 2026 · 2 min · 微博:https://weibo.com/hddwgg

数学系学生用AI写作业,教授发现后用了一个'反AI'题目——结果全军覆没

一个教授的"反AI实验" 2026年春季,北京大学数学系的一位教授发现,他布置的作业中有超过60%的学生答案"高度相似"——不是那种"抄了同一个学霸"的相似,而是"用了同一个AI"的相似。AI生成的答案有一种"特征":推理步骤过于详细、每个步骤都"完美"、没有任何"涂改"的痕迹。 教授没有直接批评学生,而是设计了一个"反AI实验"。他布置了一道新题,这道题有一个故意设计的"陷阱"——题目描述中包含了一个"看似合理但实际矛盾"的条件。人类学生在仔细阅读后会发现问题,但AI会被"诱导"做出错误推理。 结果:全班40个学生,28个人的答案和AI生成的答案一模一样——包括那个"被诱导"的错误推理。这28个人,显然是用AI做的作业。 教授在课堂上说:“我不是在抓你们作弊,我是在帮你们认识到——依赖AI做数学作业,不是在’完成作业’,而是在’放弃学习’。” “反AI题目"的三种设计方法 方法一:陷阱条件。 在题目中嵌入一个"看似合理但实际矛盾"的条件。人类学生会发现矛盾,AI会被诱导。例如:“一个三角形,三边分别为3、4、8,求面积。“人类学生知道3+4<8,三角形成立不了。AI可能会直接套用海伦公式计算。 方法二:语义歧义。 利用中文的语义歧义,让AI产生误解。例如:“甲比乙大10岁,5年前甲的年龄是乙的2倍,问甲现在多少岁?“AI可能会被"大10岁"和"2倍"的关系搞混,得出错误答案。 方法三:非标准表示。 用非标准的数学表示方式来描述题目,让AI无法匹配训练数据。例如用文字描述一个复杂的数学结构,而不是用标准符号。AI在标准符号上训练得多,在非标准表示上训练得少。 方法四:跨领域推理。 将数学问题嵌入到一个非数学的语境中,需要学生先"翻译"为数学问题。AI在"纯数学"上强,在"翻译"上弱。 数学教育的"AI危机” AI对数学教育的冲击,比想象中更严重。因为数学作业有"标准答案”,AI可以精确生成这些答案。学生用AI做作业,获得的是"正确的答案"和"虚假的学习”。 危机一:学生失去了"犯错"的机会。 学数学最重要的过程不是"得到正确答案”,而是"犯错然后纠正”。AI让学生跳过"犯错"直接得到"正确答案",学生失去了学习的机会。 危机二:教师失去了"诊断"的能力。 教师通过批改作业来"诊断"学生的学习问题——这个学生哪里不会?哪里理解错了?如果作业都是AI生成的,教师就失去了"诊断"的依据。 危机三:数学能力评估的失效。 如果作业和考试都可以用AI作弊,那么"作业成绩"和"考试成绩"就不再反映学生的真实能力。数学能力评估体系需要重新设计。 数学教育的"AI适应"策略 策略一:从"结果评估"到"过程评估"。 不只看学生"做对了没有",更要看学生"是怎么做的"。要求学生提交"解题过程"(包括草稿、思路、错误尝试),而不是只提交"最终答案"。 策略二:从"作业"到"课堂展示"。 减少家庭作业的比重,增加"课堂展示"——学生在课堂上现场解题,教师现场评估。AI帮不了现场解题。 策略三:从"标准题"到"个性化题"。 给每个学生赋不同的参数,让AI生成的答案无法"通用"。例如"小明有n颗糖,n=你的学号"。 策略四:从"AI禁止"到"AI素养教育"。 不禁止学生使用AI,而是教学生"如何正确使用AI学习数学"——AI是"辅助思考"的工具,不是"替代思考"的工具。 结语 教授用"反AI题目"抓到了28个用AI作弊的学生——这不是教授的胜利,而是教育的失败。当学生宁愿用AI作弊也不愿意自己学数学,说明数学教育本身出了问题。AI只是放大了这个问题。 金句:对抗AI作弊的最好方法,不是设计"AI做不对的题",而是让数学教育变得"值得学生自己学"。当学生真正理解了数学的价值,AI就只是一个工具,而不是一个"作弊器"。

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg

用 AI 学数学,学生成绩提升了 23%——但老师发现了一个严重的问题

开场:一场教育实验的意外结果 2025 年秋季学期,加州大学某分校的数学系做了一个实验:将 200 名微积分入门课程的学生随机分为两组。 对照组(100 人): 传统教学——讲座+习题课+助教答疑。 实验组(100 人): 传统教学 + AI 数学辅导工具(GPT-5 定制版,可随时提问、要求讲解、请求分步指导)。 学期结束时,实验组的期末考试成绩平均比对照组高 23%(87 分 vs 71 分)。实验组学生的满意度评分也显著更高——“AI 助手 24 小时在线,比助教还耐心。” 但实验组在随后的"独立解题测试"(不允许使用 AI)中,表现比对照组低了 12%。 这个"反弹效应"让教育研究者们深感不安。AI 确实帮助学生学会了数学——但可能不是他们以为的那种"学会"。 23% 的提升是怎么来的? 实验组学生使用 AI 的方式,大致可以分为三类: 第一类:“讲解员"型(约 40%)。 学生遇到不懂的概念时,向 AI 提问"什么是极限的 epsilon-delta 定义?",AI 用不同方式解释,直到学生理解。这些学生使用 AI 的方式最接近"理想学习”。 第二类:“参考答案"型(约 35%)。 学生做作业时,遇到不会的题,直接把题目输入 AI,获取完整的解答步骤,然后照着写。这些学生只看答案,不思考过程。 第三类:“快捷方式"型(约 25%)。 学生把整个作业交给 AI,复制粘贴答案,连看都不看。这些学生基本上是在作弊。 期末考试时,所有人都不能使用 AI。 第一类学生的成绩提升最大(+35%),第二类学生有小幅提升(+12%),第三类学生几乎没有提升(+3%),少数人甚至下降了。 但关键问题是:即使是第一类学生,在独立解题测试中也退步了。 为什么? “脚手架效应”:AI 让学生丧失了"挣扎"的能力 教育心理学中有一个概念叫"脚手架效应”(Scaffolding):在学习初期,提供适当的支持(脚手架),帮助学生完成任务。随着学生能力提升,逐步撤除脚手架。 AI 的问题在于,它提供了"永不撤除的脚手架”。 在传统学习中,当你遇到一道难题时,你会经历一个"生产性挣扎"(productive struggle)的过程。你尝试不同的方法,失败,调整,再尝试,再失败,最终找到答案。这个"挣扎"的过程,是数学思维生长的关键。 有了 AI,你不再需要挣扎。 卡住了就复制粘贴,AI 立即给你答案。你感觉自己在"学习"——你确实看懂了解答——但你没有经历"从不知道到知道"的思维过程。你看懂了答案,但你没有学会"产生答案"的能力。 这就是为什么实验组学生在独立解题测试中表现更差:他们的大脑习惯了"有 API 调用"的模式,当 API 被切断时,大脑不知道如何独立工作。 ...

July 13, 2026 · 1 min · 微博:https://weibo.com/hddwgg