page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

当AI替你跨过难题,怎样把能力留在自己身上?

mogoec 2026-09-15 5

AI算对了,人类就进步了吗?陶哲轩联署背后,藏着一个学习难题

AI给出正确答案,当然值得高兴。但如果问题已经解决,我们却解释不清它为什么成立,也不知道换个条件该怎么办,那么,工具的进步和使用者的进步之间,仍然隔着一段距离。

最近,陶哲轩等数学家签署的一份声明,把这段距离摆到了公众面前。

我读完原文后,最在意的是一个与普通人也有关的问题:当AI越来越擅长完成学习任务,我们怎样确认,自己确实学到了东西?

2026年9月11日,陶哲轩在个人博客发布《A Severe Misalignment of AI in Mathematics》,可以译为《人工智能在数学中的严重错位》。他明确说明,首批25位签署人均为菲尔兹奖得主。声明承认大语言模型数学能力的显著进步,同时批评AI公司把攻克数学问题作为基准测试的做法,担忧其与数学研究追求理解、发展方法和培养人才的目标发生冲突。

把这件事概括成“数学家联合抵制AI”,会漏掉一个关键事实。

同一天,陶哲轩的博客还刊登了Lucas Fagan撰写的Andrews–Curtis猜想挑战赛通知。陶哲轩是组织者之一,通知明确欢迎使用AI工具。

这两件事放在一起,更接近实际的理解是:他们愿意推动AI参与数学,也在追问,这种参与最终留下了什么。

一份正确的结果,可以增加人类已经确认的知识。但人能否理解其中的方法、把方法用到别处,以及在过程中获得独立研究的能力,需要另外考察。

我习惯把它们分开看:

观察层面要确认的问题可以检查的证据
结果这次是否做对了?证明、测试、独立复核
方法为什么成立,能用到哪里?关键步骤、适用条件、推广案例
学习使用者是否掌握了?独立解释、改错、解决新问题

这张表也适用于写代码、读论文、学英语和做数据分析。

AI帮你写出一段能运行的程序,说明这次任务取得了结果。你能解释程序为什么这样组织,说明你开始理解它。换一份数据、出现一种新错误,你仍然能定位问题,才有更充分的证据说明,这项能力正在变成你的。

三个层面可以一起进步,却不会自动一起进步。

数学里的形式化验证,恰好能帮助我们看清这种区别。所谓形式化验证,可以粗略理解为:把数学陈述与证明写成严格的形式语言,再由程序检查推导是否符合规则。

但“检查通过”也有明确边界。陶哲轩在介绍Lean证明登记项目Palomar时提醒,除了检查证明本身,还要核对有没有加入不当假设,以及代码里证明的命题是否对应对外宣称的那个问题。他也明确指出,登记检查不能代替对新颖性、价值和准确性的完整同行评审。

对普通读者来说,这意味着:看到“机器验证通过”,可以认真看待它提供的证据,同时继续追问,它到底验证了什么。

原材料中还有一个容易被传播成新闻的例子:AI交出“一千万行、经过机器验证的孪生素数猜想证明”。

这个说法来自声明评论区的一则讨论,是用于表达观点的假设场景,不能当作AI已经完成这项证明的成果报道。评论者想说明的是,一份极长的形式证明,对他理解问题机制的帮助可能十分有限。

我赞同这里对理解的重视,但也不愿意把它推成“看不懂的证明就没有价值”。

如果一份证明确实可靠,并且证明了原本没有证明的命题,它当然增加了知识。即使暂时难以理解,也可能帮助后续研究确定方向。

更准确的说法应该是:正确性带来的价值已经产生,解释、简化和推广能够带来的价值,还需要继续开发。

人类自己取得的成果,也经历过这个过程。

2002年至2003年,佩雷尔曼发布三篇预印本,利用里奇流等方法解决庞加莱猜想。此后,其他数学家继续研究、核验并详细整理他的论证。克雷数学研究所收录的John Morgan与Gang Tian专著,正是沿着这三篇预印本,提供完整细节和系统讲解的工作。

这说明,发现结果之后,仍然存在大量有价值的工作。把一个突破变成别人可以学习、检查和继续使用的知识,本身就需要投入。

AI加快了发现和生成的速度,我们也需要提高消化成果的能力。否则,文件可以越来越多,真正被掌握的方法却未必同步增加。

这种差距,在学习研究中已经有了具体证据。

2025年发表于《美国国家科学院院刊》(PNAS)的一项研究,在土耳其一所高中对近千名学生进行了数学学习实验,比较普通AI助手、带有教学引导设计的AI导师,以及对照组的表现。

结果出现了明显反差:

使用方式有工具辅助时的练习表现撤去工具后的独立考试表现
普通AI助手(GPT Base)相对对照组提高约48%相对对照组降低约17%
教学引导版(GPT Tutor)相对对照组提高约127%与对照组没有统计显著差异

这些是研究报告的相对变化,不能理解为提高或降低相同数量的分数、百分点。

这项实验研究的是特定学校、课程和工具设计,不能据此判断所有AI产品的学习效果;它也没有单独证明“只要AI答案全对,人就会学得更差”。

它支持的一个重要判断是:有AI帮助时表现得更好,不能直接作为独立能力提高的证据。

尤其值得注意的是,教学引导版基本消除了普通助手组观察到的负面影响,却没有在独立考试中显示出显著优势。这提醒我们,评价AI学习工具,不能只看使用当下有多顺畅,还要检查学习之后留下了什么。

对于每天使用AI的人,这个问题很具体。

假设你让AI解释一个陌生概念。它给出定义、例子和类比,语言非常顺。你一路读下来,几乎每句话都能接受。

但“读的时候没有疑问”和“自己能够解释”,是不同的状态。

要检查差距,可以先关掉回答,用自己的话写三句话:它是什么,什么时候有用,什么时候不适用。写到一半卡住的地方,往往比一整页流畅解释更能暴露真正的学习需求。

我认为,AI学习需要在流程里保留几个由使用者完成的环节:

  • 先暴露自己的理解。 把当前思路写出来,再问AI:“我哪一步的依据不够?请先指出问题。”
  • 按需要索取提示。 卡在一个步骤时,只请求这一处的帮助,完成后再继续。
  • 检查适用边界。 追问:“如果改变这个条件,原来的结论还成立吗?请给出例子或反例。”
  • 做一次独立迁移。 换一道题、一份数据或一个表达场景,不看原回答再完成一次。

例如,学习一个数据分析方法,可以这样提问:

我正在学习这个方法。请先让我说明自己的理解,再检查概念、前提和推理上的问题。每次只给一个提示,等我回答后继续。最后给我一个条件有所变化的新案例,让我独立完成。

这是一种组织练习的办法,效果仍然需要通过独立表现来检验。把提示词写得再完善,也不能代替那次实际尝试。

当然,每件工作都没有必要变成一堂课。

如果只是整理格式、转换文件或完成已经熟悉的重复操作,让AI直接执行很合理。真正需要事先想清楚的是:这次任务的目标里,是否包括训练自己?

如果包括,就应该为自己的判断、解释和练习留出位置。否则,我们很容易把“任务交付了”,顺手记成“技能掌握了”。

同样的道理也适用于学校、研究机构和企业。

如果评价只记录交了多少份作业、生成多少份报告、解决多少道题,人们自然会优先优化这些数字。理解、核验和知识传递耗费时间,却可能在评价表里没有位置。

我的看法是,既然AI改变了成果的生产方式,评价方式也应该跟着调整。研究成果可以同时考察可复核性、方法说明和后续复用;课程可以增加独立解释与变化题;企业培训可以检查员工能否处理模板之外的情况。

这比单纯讨论“该不该用AI”更接近实际问题。

读完这次争论,我更愿意给自己的AI学习增加一个检查动作:每完成一次辅助任务,就找出一个自己现在能够独立完成、此前还不会的步骤。

它可能很小:看懂一个报错,识别一个错误假设,或者提出一个比原来更准确的问题。

这些变化,才让“AI又进步了”与“我也进步了”之间,有了可以检查的联系。

关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部