page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

AI越会回答问题,“会判断答案的人”为什么反而越来越贵?

mogoec 2026-09-05 20

把老师傅的“这儿不太对”,变成AI能打分的信号:AfterQuery到底卖什么?

9月1日,我看到一条很容易让人先盯着数字看的AI新闻。

美国《福布斯》报道,成立于2025年的旧金山AI数据公司AfterQuery,正在以大约32亿美元估值进行新一轮融资。这个数字来自两名知情人士,AfterQuery自己拒绝评论。如果最终按这个条件完成融资,YC合伙人Gustaf Alströmer称,它可能成为YC历史上从成立到独角兽速度最快的公司。

五个月前,这家公司的公开估值还只有3亿美元。

当然,32亿美元听上去很刺激。

但我真正好奇的并不是,一家二十多岁年轻人创办的公司为什么突然值这么多钱,而是另外一个问题:

它到底在卖什么?

研究了一圈之后,我发现,这家公司最值得研究的地方,并不是“找了一大群专家帮AI标数据”。

如果只是这样,那它和传统数据标注公司的差别并没有那么大。

AfterQuery真正试图出售的,是另外一种东西:

把一个专家脑子里模模糊糊的“这儿不太对”,转换成机器能够重复打分的训练信号。

这件事,可能比今天大部分人理解的“AI训练数据”重要得多。


一、AI读完了全世界的资料,为什么还是不会真正干活?

我们先从一个看起来有点矛盾的问题开始。

今天的大模型缺资料吗?

其实已经没有以前那么缺了。

金融教材、上市公司公告、法律条文、医学论文、编程文档、行业报告,大量专业资料都已经数字化。一个模型可以在极短时间内处理普通人一辈子都读不完的信息。

但“读过很多资料”和“能像一个专业人士一样工作”,完全是两回事。

比如并购。

假设把过去几十年的并购案例、财务教材、证券法规、上市公司公告全部喂给模型,它当然可以告诉你EBITDA是什么、商誉怎么形成、现金流怎么看。

可真把一家公司的数据室扔给它,让它判断:

这笔交易哪里危险?

管理层有没有故意模糊某个指标?

哪个假设在行业里虽然数学上成立,但实际上根本不可能?

它依然很容易出问题。

原因在于,大量真正决定专业水平的东西,本来就没有出现在文档里。

它存在于一个从业十五年的人的脑子里。

一个资深投资人看创业者十分钟,觉得这个人“不靠谱”。

一个老工程师听机器响两声,就觉得轴承可能有问题。

一个编辑扫一眼选题,就知道“这个题立不住”。

一个医生看到某些指标组合,会下意识觉得“这个患者情况不太正常”。

你继续追问:

为什么?

对方有时候反而解释不清。

不是因为他故弄玄虚。

而是因为这些判断经过上千次真实工作以后,已经从一条条显性的规则,压缩成了直觉。


二、这种东西有一个正式名字:隐性知识

管理学和认知科学里,这类知识通常被称为Tacit Knowledge,隐性知识

英国哲学家迈克尔·波兰尼(Michael Polanyi)提出过一句后来被大量引用的话:

“We can know more than we can tell.”

也就是,我们知道的东西,往往比我们能够说出来的更多。

剑桥大学有关隐性知识的研究将它概括为一种依赖情境、个人经验和实践技能形成的知识。认知心理学家Gerd Gigerenzer也曾以经验丰富的医生为例:一个医生可能在非常短的时间内感觉病人“哪里不对”,随后才开始有意识地寻找原因。

这也是我理解AfterQuery最关键的一把钥匙。

过去训练AI,最容易数字化的是显性知识

什么是显性知识?

题目是什么。

答案是什么。

这句话是什么情绪。

图片里有没有猫。

代码能不能通过测试。

但现在模型越来越强以后,一个新的问题出现了:

很多真正有价值的工作,没有一个简单的标准答案。

一个律师写出来的合同,在法律上没有明显错误,不代表一个真正做过十年交易的律师会接受。

一个程序通过所有单元测试,也不代表代码库的维护者愿意把它合并进生产系统。

这一点甚至已经有研究证据。

2026年3月,AI评测研究机构METR让真实开源项目维护者复核296个AI生成的代码PR。他们发现,在已经通过SWE-bench Verified自动测试的AI代码里,大约一半仍然不会被项目维护者接受。

原因包括代码质量、破坏其他代码、核心功能实际上没有完全解决,以及一些自动测试无法识别的问题。

这个结果非常有意思。

机器认为“通过”,和老师傅认为“能用”,中间还有一层东西。

而AfterQuery瞄准的,恰恰就是这一层。


三、这家公司一开始其实也想直接做AI Agent,结果失败了

AfterQuery并不是一开始就想卖训练数据。

《福布斯》和YC公开资料显示,Spencer Mateega、Carlos Georgescu等核心团队成员最早想做的是金融和专业服务领域的AI Agent。

两人的背景其实也不算完全不懂金融。

Mateega曾在宾夕法尼亚大学沃顿商学院学习金融和统计,同时学习计算机,实习经历包括Morgan Stanley和科技投资机构Silver Lake;Georgescu则有Citadel Securities的软件工程经历。YC的官方介绍还显示,团队另一位联合创始人Danny Tang与Mateega高中时期就一起创业。

但Agent并没有跑通。

Mateega后来自己回顾,当时的问题包括模型幻觉、专业细节缺失以及输出错误。仅仅继续堆Prompt并不能解决底层准确性问题。

这段经历我觉得很有代表性。

因为现在企业落地AI,经常会经历同样的过程:

Demo非常漂亮。

让模型总结一份财报,也不错。

让Agent模拟一个投资分析师,好像也能干活。

但真正把它塞进一个持续运行的工作流程,就开始暴露各种细节问题。

为什么?

因为Demo考的是:

“这个模型会不会?”

真实工作考的是:

“这个模型能不能连续一百次按照行业标准完成?”

这是完全不同的两套要求。

AfterQuery后来没有继续往Agent外壳上堆功能,而是掉过头来研究:

模型到底为什么失败?

于是,一个新的生意出现了。


四、AfterQuery真正卖的,不是答案,而是“评分标准”

AfterQuery现在的公开产品已经很能说明问题。

它提供的并不只是传统意义上的问答数据,而包括:

SFT监督微调数据、偏好训练和RLHF数据、代码任务、Agent操作轨迹、真实软件环境、自定义评测集,以及一个很重要的东西——

Rubric and Verifier-based RL。

Rubric可以理解成评分细则。

Verifier则是验证器。

官方对这项产品的描述就是:由专家设计评分规则,再用自动验证器判断模型输出,使原本带有主观性的专业判断能够变成强化学习中的奖励信号。

如果把AfterQuery公开披露的产品和研究流程拆开看,我认为大致可以理解成五个环节。

第一步:先找模型到底死在哪里

不是泛泛地说:

“AI不会做金融。”

而是找到一个足够具体的失败动作。

例如:

模型能做DCF,但对一个异常营运资金假设无法识别。

模型能写程序,但虽然通过测试,却破坏了整个项目的架构习惯。

模型能分析合同,但没有识别某个行业惯例带来的真实风险。

问题一定要足够具体。

因为只有具体,才能训练。


第二步:把真实工作压缩成可重复任务

真实工作是非常混乱的。

如果直接让一个资深律师告诉AI:

“你以后像我一样做事。”

这句话没有任何训练价值。

必须把工作拆成一个个任务:

输入是什么?

允许使用什么工具?

最终应该交付什么?

哪些错误不可接受?

哪些结果虽然看起来合理,但实际上不能过关?

AfterQuery把这种过程称为围绕模型failure和真实工作流构建训练任务与evaluation。


第三步:最关键,把“手感”写成Rubric和Verifier

这一步在我看来才是AfterQuery真正值钱的地方。

老师傅说:

“这个方案不行。”

没价值。

继续追问:

“为什么不行?”

然后把答案拆出来:

财务假设是否符合行业历史区间;

是否遗漏某种风险;

计算结果是否与输入一致;

是否按照行业要求给出引用;

某个字段是否必须出现;

代码是否只是通过测试,还是还满足架构规范。

直到最后,这种判断能够被写成一个评分体系。

一部分可以由程序直接检查。

另一部分则可以由模型裁判或专家复核。

这时候,经验才第一次从“个人能力”变成了“机器可以学习的信号”。

这也解释了为什么今天AI数据行业里一个越来越重要的词叫:

Verifier。

过去我们主要教AI“正确答案是什么”。

现在开始教AI:

“什么样才叫正确。”

这是两回事。


五、为什么说这一步可能比生产答案更值钱?

因为答案正在迅速贬值。

假设我今天让一个金融专家出一道题:

“某公司收入100亿元,利润率10%,利润是多少?”

这种数据几乎没有训练价值。

模型早就会了。

哪怕把题目做复杂一点,只要网上存在标准方法,模型也可以批量合成大量类似训练数据。

真正难以合成的是:

一个专家为什么会判定某个答案虽然计算没错,但不能用于真实决策。

这就是所谓的expert judgment。

因此,AI训练正在发生一个很重要的变化。

早期的数据价值在:

有没有答案。

后来变成:

有没有高质量答案。

再往后,则是:

有没有高质量的判断标准。

这也是AfterQuery为什么特别强调Loss Analysis、Rubric、Verifier和真实工作环境。

他们不是单纯生产“内容”。

而是在生产一个模型未来可以不断练习的考场和裁判体系


六、NVIDIA已经把这种数据放进了真实训练流程

判断一家AI数据公司到底是不是讲故事,有一个很简单的方法:

看它的数据有没有真的进入模型训练。

目前AfterQuery至少有一个公开案例比较扎实。

2026年6月,NVIDIA发布Nemotron 3 Ultra。这是一个总参数5500亿、激活参数550亿的Mixture-of-Experts模型,后训练流程包括SFT、强化学习以及Multi-teacher On-Policy Distillation。

更关键的是,NVIDIA自己的Nemotron 3 Ultra技术报告明确写到了AfterQuery。

在训练Office & Workplace Task Teacher时,NVIDIA使用了一批AfterQuery任务。这些任务包含:

文件支撑的推理、专业交付物、多步骤分析,以及需要被评判的最终结果。

NVIDIA先利用这些任务生成完整Agent轨迹,并进行轻量SFT,再把轨迹中的关键决策节点用于后续强化学习和蒸馏。

这件事的重要性不在于AfterQuery贡献了多少比例的数据。

公开资料根本无法证明具体占比,我们也不应该脑补。

真正重要的是:

这种“专家工作任务+评分机制”的数据,已经不是一个PPT概念,而进入了前沿模型真实的post-training pipeline。


七、OpenAI自己的GDPval,也说明行业正在往同一个方向走

再看另一个变化。

2025年OpenAI推出GDPval,用来测试AI完成真实经济工作任务的能力。

它没有继续让模型做选择题,而是直接找真实从业者设计任务。

GDPval覆盖美国9个主要经济行业中的44种职业,总计1320个专业任务。参与设计任务的专家平均拥有超过14年的工作经验。

任务也不只是“回答一句话”。

模型可能需要完成一份Excel、法律文件、工程图、报告、幻灯片或者其他真实工作交付物。每个任务平均还经历5轮专家审核。

我觉得这个趋势很值得注意。

过去AI考试像学校考试:

题目是什么?

答案是什么?

现在越来越像公司里的真实工作:

材料都在这里。

工具也给你。

请把东西做出来。

然后交给真正懂这个行业的人看看:

这玩意到底能不能用。

一旦评测方式发生变化,训练数据自然也必须发生变化。

于是,专家经验的价格就会上升。


八、所以,真正稀缺的数据开始从“互联网”转移到“人的脑子”

这可能是AfterQuery背后更值得注意的一层。

过去十几年,大模型最重要的数据矿山是互联网。

网页、书籍、代码、论坛、论文。

可是这些东西有一个共同特征:

它们都已经被写下来了。

而专业世界里,还有巨大一部分知识从来没有真正写下来。

公司采购部门怎么判断一个供应商靠不靠谱。

老销售什么时候知道客户其实不会买。

编辑为什么觉得一篇文章开头“没有抓力”。

产品经理为什么看到一个功能就知道用户不会用。

工程师为什么听见某种声音就知道设备可能有问题。

这些判断过去不叫“数据”。

甚至当事人自己都不会认为它们是一种资产。

它们只是:

“经验。”

“感觉。”

“手感。”

但从AI训练角度看,这可能恰好是下一批极高价值数据。


九、这也解释了为什么“数字分身”还远远不是专家复制

现在很流行做名人智能体、专家数字人。

做法通常是:

把一个人过去的文章、课程、视频、访谈全部扔进去。

然后训练出一个语气很像他的AI。

这确实可以复制表达方式。

但它未必复制了真正的专业能力。

因为内容是专业判断已经发生之后留下来的结果。

而真正值钱的,可能是判断发生的过程。

为什么删掉这个选题?

为什么这句话不能这么写?

为什么这个合同条件不能接受?

为什么两个数据单独看都正常,放在一起就奇怪?

如果这些过程没有记录下来,AI只能学习结果,看不到专家当时的决策边界。

所以我现在越来越觉得:

未来真正有价值的“专家数字化”,不是把一个人过去说过的话全部存下来。

而是把他每天工作时:

怎么判断、怎么犯错、怎么修改、什么情况下拒绝一个答案

持续记录下来。

也就是说,真正需要被数字化的不是人的“表达”。

而是人的判断系统


十、那老师傅为什么愿意把自己的经验交出来?

说到这里会出现一个非常现实的问题。

假设你就是那个老师傅。

工作二十年。

别人不会的东西,你会。

这正是你在公司的价值。

现在突然有人跑过来说:

我们能不能把你的判断整理成流程?

再把流程交给AI?

正常人的第一反应一定是:

那我教会AI以后,还要我干什么?

这种担心并不荒唐。

事实上,隐性知识过去就是很多人在组织中的护城河。

但这里还有一个区别。

能够被沉淀下来的,是你已经拥有的经验。

真正决定你未来价值的,是:

你还能不能继续产生新的经验。

这一点,我前几天看到绍兴一个新闻时感触特别明显。

浙江绍兴西湖社区有一批八九十岁的老人编传统兜篮。一只篮子需要五六个小时,过去只能卖6元,还经常滞销。

后来社区联合高校学生重新设计产品,改变配色和版型,做成托特包、水桶包等新形态。

新华社报道,现在这些兜篮售价大约60元,仍然供不应求,80%的收益直接给编织老人。

老人手里的编织技术并没有突然提高十倍。

真正变化的是:

旧经验接上了新问题。

这大概也是未来很多专业人士会面临的处境。

经验本身不是护城河。

持续产生新经验的能力,才是。


十一、AfterQuery给普通人的启发,并不是“赶紧去卖数据”

所以,我并不觉得看完AfterQuery以后,普通人应该得出一个结论:

“专家数据要火了,我也去接标注任务。”

这可能把事情看小了。

它更值得我们思考的是另外几个问题。

第一,你现在工作里有哪些东西,是AI已经能够完全完成的?

第二,有哪些事情AI虽然能做,但你一眼就知道它做得“不对”?

第三,你究竟是凭什么知道它不对?

第四,你能不能把这种判断拆成明确标准?

第五,如果今天让一个新人接替你,你到底会检查他哪些东西?

这些问题,其实就是在做一种很朴素的“隐性知识提取”。

很多人会发现:

真正有价值的专业能力,并不是“我知道很多知识”。

而是:

我知道什么时候一个看起来正确的答案,其实不能用。


十二、AI下一阶段真正缺的,也许不是更多答案,而是更多“好裁判”

过去几年,我们一直在讨论:

AI会不会变成专家?

但AfterQuery让我想到,也许应该把这个问题反过来。

当模型已经能够高速生产答案之后,人类真正稀缺的角色,可能会越来越像:

定义什么叫好答案的人。

这就是为什么Rubric、Verifier、Eval、Reward Model这些以前只有AI研究人员才关心的词,现在开始不断走进商业世界。

AI越强,“生产答案”越便宜。

但判断一个复杂答案到底靠不靠谱,反而越贵。

所以AfterQuery真正卖的,我认为不是十万名医生、律师、工程师和金融分析师的时间。

也不是一批训练文本。

它在试图工业化一种过去几乎没有被工业化过的资源:

专家的判断。

把一句:

“这儿感觉不太对。”

一步一步拆成:

哪里不对。

为什么不对。

什么条件下算对。

如何稳定验证。

最后再变成一条AI能够读取的奖励信号。

如果这条路线继续成立,那么未来很多行业最值得数字化的东西,可能并不是公司的文档库。

而是那些老师傅每天工作时,脑子里闪过去、却从来没有写下来的那一瞬间。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

参考资料

  1. 《福布斯》2026年9月1日报道AfterQuery拟以约32亿美元估值融资;该估值来自两名知情人士,AfterQuery拒绝评论,因此本文将其视为“报道中的融资估值”,而非已经完成的确定交易。
  2. AfterQuery官方资料显示,公司成立于2025年,入选YC Winter 2025。其2026年4月官方公告称拥有近10万名经过验证的在职专业人士。当前不同官网页面对专家规模口径存在差异,因此本文不把更新、更大的宣传数字作为已被独立验证的数据。
  3. AfterQuery官方产品页面明确列出SFT、RLHF、Rubric/Verifier-based RL、Agent Environment、Computer Use和Custom Eval等业务。
  4. NVIDIA《Nemotron 3 Ultra Technical Report》明确说明其Office & Workplace Task Teacher使用AfterQuery任务构建训练分布,并用于SFT与后续Pivot RL/MOPD过程。
  5. OpenAI GDPval覆盖44个职业、1320项真实工作任务,任务设计专家平均拥有14年以上行业经验。
  6. METR 2026年的真实代码维护者研究显示,大约一半已经通过SWE-bench自动测试的AI PR仍不会被维护者接受,说明自动验证与专业判断之间仍存在显著差距。

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部