page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

AI回答越专业,我为什么反而更喜欢追问这一句话?

mogoec 2026-09-07 5

AI回答“都对”,为啥还是会翻车?真正危险的,是它替你默认了前提

最近我越来越觉得,我们可能把AI最危险的一类错误,简单归到了“幻觉”这个筐里。

AI捏造论文、编一个不存在的专家、把日期说错,这当然是幻觉。这种错误反而比较好防,因为只要愿意查资料,很多时候能查出来。

真正麻烦的是另一种情况:

AI说的每一句话单独看都可能是对的,组合到你身上,却变成了一份错误的答案。

这两天发生在美国沙斯塔山的一次救援,就是很典型的例子。

三个年轻人问了AI,查了YouTube,还用了专业户外App

2026年8月底,三名来自美国加州罗斯维尔的年轻人准备攀登沙斯塔山。

这不是一座随便走走的小山。沙斯塔山海拔超过1.4万英尺,也就是4300多米。

按照当地警方披露的信息,这三名登山者经验有限。他们在大约8400英尺处扎营,第二天凌晨3点出发冲顶。

问题是,他们直到晚上7点才登顶。

而当地建议的折返时间,是中午12点。

随后三个人只能摸黑下山,大约一个小时后开始迷失方向,最终偏离正常路线进入Mud Creek Canyon。其中一人摔伤膝盖,三个人被迫在山中过夜,直到第二天才被美国林务局登山巡护员和搜救人员找到。

事情到这里还只是一次普通的户外事故。

真正引起讨论的是,他们后来告诉警方,行程规划过程中大量使用了Google Gemini。

而且他们并不是“只信AI”。

他们还看了YouTube,也使用了AllTrails这样的专业户外平台。警方披露的信息显示,Gemini参与了路线、装备以及食物和水的规划,而他们最终携带的食物和水远少于实际行程所需。原本预计大约8小时的活动,最后演变成了跨夜救援。

看到这里,第一反应很容易是:

又是AI胡说八道。

但我仔细看了一下之后,反而觉得事情没这么简单。

AI最危险的时候,未必是它说错了

有报道提到,他们得到过这样一种营养建议:长时间运动应该优先携带容易利用的碳水化合物,而不是依赖脂肪补充能量。

这句话本身荒唐吗?

并不荒唐。

美国运动医学会、营养与饮食学会和加拿大营养师协会联合发布的运动营养立场文件明确提出,运动营养需要根据运动项目、持续时间、强度和个体情况设计。对于长时间运动,碳水化合物摄入本来就是一个重要组成部分。早期ACSM运动补液指南也曾建议,在持续超过1小时的高强度运动中补充碳水化合物。

所以真正的问题不是:

“碳水有没有用?”

而是:

“你到底要在山里待多久?”

如果这是一场8小时、路线明确、天气稳定、由经验丰富的人完成的活动,那么一种补给方案可能完全合理。

可如果站在山脚下的是三个经验不足的人,实际耗时可能是预估时间的两倍,途中还可能迷路、受伤甚至被迫过夜,那么问题马上就变了。

你需要考虑的不再只是运动营养学。

还包括体能、海拔、速度、路线识别能力、天气变化、日落时间、备用水量、紧急食物、保温装备、通信、电池,以及最坏情况下在山里过一夜的能力。

于是一个非常重要的区别出现了:

知识正确,不等于建议正确。

因为建议其实是一个条件表达式。

更准确地说应该是:

如果A、B、C这些条件成立,那么建议X成立。

可是大模型在很多时候,会直接把前面的“如果”省略掉,只把X流畅地告诉你。

我更愿意把这种风险叫作:

前提错配。

它不是一个严格的学术术语,而是我自己用来描述这类AI错误的方法——模型掌握了正确知识,却把正确知识套进了错误的人、错误的时间或者错误的环境。

为什么“多查几个来源”仍然可能失败?

说到这里,很多人的解决方案可能是:

那以后别只问一个AI,多查几个来源不就好了?

这个方法当然有价值。

问题是,沙斯塔山这三个人其实已经这么做了。

Gemini、YouTube、AllTrails,他们至少用了三类信息源。

为什么还是失败?

因为他们验证的,很可能是:

“八小时这个数字看起来正常吗?”

而不是:

“八小时对我们三个人正常吗?”

这两个问题完全不同。

一个YouTube登山博主可能已经爬了十几年山。

AllTrails上的时间也可能来自大量已有用户。

AI则可能综合公开资料,给出一个看起来非常合理的典型时间。

三个来源甚至可能互相印证。

可它们共同缺失了一条最重要的信息:

你是谁。

如果三个信息源都建立在“具备一般登山能力的人”这一隐含前提上,那么找三个来源并不会消除误差。

你得到的只是三个方向相同的答案。

这也是为什么,交叉验证不仅要验证信息,还要验证信息成立的条件。

更有意思的是,有经验的人一样可能被AI带偏

2026年8月30日,宁波鄞州也发生了一件很相似的事情。

当地媒体报道,一名57岁的杨师傅平时长期运动,体能不错。当天他沿步道登顶后,想换一条陌生路线下山,于是顺着小溪往下走。

走了一段后发现越来越难,他把自己的位置发给AI询问方向。

AI给出的建议大意是:沿溪沟下行方向不对,应该绕开溪床,往较高的山坡方向走。

杨师傅按照建议上坡。

问题是,现场山坡灌木非常密,坡陡路滑。他在山里反复上下寻找路线,最终体力耗尽,只能报警。

消防救援人员第一次按照他发送的位置赶过去时,甚至没有找到人。后来双方开启实时位置共享,救援人员重新判断方向,通过搜索和喊话才最终将其找到。

这里有一个细节我觉得特别值得注意。

杨师傅并不是完全没有户外经验的人。

这反而解释了为什么AI的建议会显得那么可信。

溪沟确实可能存在湿滑、断崖、落石、山洪等风险,“不要盲目沿着溪沟下山”作为一般性户外安全原则,本身并不离谱。

但问题仍然一样:

一般原则不是现场地图。

AI知道“溪沟可能危险”,却不知道眼前那片山坡到底有多陡、植被有多密、有没有可以通行的路径。

那句话对上了户外常识,却没有对上真实地形。

某种意义上,这甚至比一个明显错误的回答更麻烦。

因为当AI告诉你一个完全违反常识的东西时,你会警惕。

当AI告诉你的东西恰好符合你已有经验时,你反而最容易停止检查。

其实,“跟着机器走错路”远远早于ChatGPT

如果把AI换成GPS,这种故事至少已经发生了很多年。

2022年9月30日晚,美国北卡罗来纳州男子Philip Paxson参加完女儿的生日聚会后驾车回家。根据后来家属提起的诉讼,他按照Google Maps导航进入一座桥,但那座桥早在9年前就已经坍塌。

车辆最终坠入溪中,Paxson死亡。

美联社报道还提到,当地居民此前曾向Google Maps反馈过桥梁已经坍塌的问题。

再往前看。

2012年,三名日本游客在澳大利亚开车前往North Stradbroke Island,GPS显示前方存在路线。因为当时正值低潮,眼前的滩涂看起来似乎也能开过去。

他们最终把租来的汽车开进泥滩,汽车被不断上涨的潮水淹没。

同一年,美国阿拉斯加Whittier还有一名司机按照GPS提示右转,结果那个“右转”直接把他带上了小船下水使用的坡道。

汽车一路开进港口。

人和两条狗最终获救,但车里的一只猫没有活下来。

今天看这些故事会觉得荒诞。

可它们和现在的AI问题,本质上非常接近:

机器给出了一个抽象世界里的正确方向,人却必须在真实世界里承担后果。

40多年前,人因工程已经提醒过这件事

1983年,人因工程学者Lisanne Bainbridge发表了一篇后来被反复引用的论文,《Ironies of Automation》,中文通常翻译成《自动化的讽刺》。

她讨论的是工业控制系统。

其中一个核心矛盾是:自动化程度提高之后,人类不再负责大量日常操作,但系统一旦出现异常,人却仍然必须接管。

问题在于,长期脱离具体操作,本身又会削弱人处理异常状况所需要的技能和情境感知能力。

到了1997年,Raja Parasuraman和Victor Riley进一步总结了人类使用自动化系统时的“误用、弃用”等问题。其中所谓misuse,一个重要表现就是对自动化系统过度依赖,从而减少监督和独立判断。

2010年,Parasuraman和Dietrich Manzey重新梳理自动化偏见研究时又得出了一个很值得今天AI用户注意的结论:

自动化偏见不只是新手的问题。

研究综述发现,它既会发生在经验不足的人身上,也会发生在专家身上,而且简单训练或提醒并不能彻底消除。

所以今天我们面对ChatGPT、Gemini、Claude或者各种Agent,本质上并没有突然碰到一个完全陌生的人机问题。

只是过去自动化系统给你的通常是一个按钮、一条航线或者一个导航箭头。

现在,它变成了一个会解释、会举例、会引用术语,而且语言非常流畅的“顾问”。

这会让信任问题更加复杂。

AI越会解释,人有时反而越容易相信

美国国家标准与技术研究院NIST在生成式AI风险管理框架中专门讨论了“confabulation”,也就是通常所谓的幻觉。

NIST提醒,生成式AI不只是可能生成错误事实,还可能生成看起来合理的逻辑和解释,而这些解释可能进一步增强用户对错误输出的信任。在医疗等高后果场景,这种问题尤其需要警惕。

但事情还有下一层。

2025年,微软研究院与卡内基梅隆大学等研究者在CHI会议发表了一项研究。他们调查了319名在工作中使用生成式AI的知识工作者,收集936个实际使用案例。

研究发现一个明显趋势:

用户越相信生成式AI能够完成某项任务,投入的批判性思考努力往往越少。

研究者同时发现,AI并没有让批判性思考消失,而是改变了它的位置:过去人主要负责寻找信息和解决问题,现在越来越需要负责验证信息、整合AI答案,以及监督最终任务。

这其实把AI时代真正需要学习的能力说得很清楚。

未来最重要的能力之一,可能不是“会不会问AI”。

而是:

你能不能发现AI到底默认了什么。

所以,我现在问AI,会多问一轮“前提”

比如AI给我一项重要建议之后,我现在很喜欢追问:

“你这个结论依赖哪些前提?”

然后再问:

“这些前提里,哪些是我明确告诉你的,哪些是你自己推断的?”

再进一步:

“如果你的时间、成本、能力、环境这些假设偏差50%,结论会发生什么变化?”

最后再问一句:

“有哪些信息你现在并不知道,但知道之后可能改变答案?”

我发现,这几句话的价值,经常比“再给我一个更详细的方案”大得多。

因为它逼着我们把一个漂亮答案重新拆回条件。

而真正影响决策的,往往就藏在那里。

沙斯塔山的问题不是“碳水有没有用”。

是八小时到底是不是你的八小时。

宁波山里的问题不是“溪沟危险不危险”。

是眼前这片山坡到底能不能走。

地图的问题也从来不是“这条路在数据库里存不存在”。

是你开到路口的时候,那座桥还在不在。

AI时代真正需要学会的,不是怀疑一切,而是校准信任

当然,这并不意味着以后AI什么都不能信。

恰恰相反。

AI越强,我们越需要学会一种过去只有飞行员、医生、工程师和复杂系统操作者经常面对的能力:

校准信任。

微软研究团队把这种目标称为“appropriate reliance”,也就是适当依赖:AI正确的时候接受它,AI错误的时候能够拒绝它,而不是走向两个极端——什么都相信,或者什么都不相信。

所以我现在判断一个AI建议,越来越少只问:

“它说得对不对?”

我会再加一个问题:

“它说的这个‘对’,是在什么条件下成立?”

事实错误当然需要查。

但事实正确之后,还有第二层验证:

这个事实适不适合我?

再往后还有第三层:

现实条件变化之后,它还成立吗?

这大概也是大模型越来越强之后,我们必须重新补回来的一门基本功。

因为未来真正容易让人翻车的AI答案,可能不会长得像错误答案。

它甚至会数据正确、逻辑完整、表达清楚。

所有话听起来都对。

只是那个回答从头到尾,都在回答另一个人的问题。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部