page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

为什么谷歌愿意花1000万美元,买下一家倒闭公司的数字遗产?

mogoec 2026-08-21 12

AI时代,真正值钱的数据,不是更多,而是别人没有的“决策过程”

这几天我看到一笔很有意思的交易。

一家已经停飞的廉价航空公司,最后剩下的一堆邮件、聊天记录、代码、运营表格,居然引来了谷歌和多家AI公司的竞价。

买的不是飞机,不是航线,也不是机场时刻。

买的是数据。

事情发生在Spirit Airlines身上。

Spirit是美国一家老牌超低成本航空公司,最容易辨认的就是那一身亮黄色涂装。2024年11月,它第一次申请Chapter 11破产保护;2025年8月29日再次进入Chapter 11重组;最终没能撑过去,2026年5月2日正式开始有序停止运营,所有航班取消。

飞机可以卖,机场起降时刻可以卖,其他固定资产也可以拆掉变现。

但公司经营了30多年以后,还有一种资产不会跟着飞机一起消失。

那就是它留下来的数字世界。

8月14日,美国纽约南区破产法院的一份文件披露,谷歌在Spirit企业数据资产拍卖中,以1000万美元的价格成为中标方。

先强调一个截至2026年8月21日的最新进展:这笔交易目前还没有最终完成司法批准。原定8月19日举行的出售听证会,因为代表Spirit前空乘人员的工会提出隐私异议,被推迟到了9月9日。与此同时,AI数据公司Micro1又提出了一份1250万美元的迟到报价,希望法院重新考虑结果。也就是说,这包数据究竟最终归谁,目前仍然存在变量。

但这反而让事情更有意思了。

因为已经有不止一家AI公司愿意拿出几百万甚至上千万美元,争夺一家倒闭航空公司的“数字遗产”。

这到底说明了什么?

我认为,它可能把AI时代的数据价值讲得比很多行业报告都清楚。

谷歌到底看上了什么?

先看看Spirit的数据仓库里有什么。

根据破产法院材料以及Bloomberg Law披露的信息,这个数据包包括大约:

1亿封电子邮件。

5亿条Microsoft Teams聊天及协作记录。

约3000万行源代码,以及相关开发元数据、软件模型、算法、API和内部工具。

还有航空公司经营过程中产生的大量营收、市场营销、人力资源、飞机运营、员工生产率、审计、欺诈识别、项目管理以及定价数据。

更夸张的是,其中包括约72亿条竞争对手航班价格记录,以及自2008年以来约75亿条乘客交易记录。

这已经不是简单的“一个数据库”了。

它实际上接近于一家公司几十年经营活动留下来的数字化切片。

什么时候涨价?

什么时候降价?

航班临近起飞时价格怎么变化?

竞争对手价格变化后Spirit怎么回应?

某条航线预订速度变慢以后内部发生了什么讨论?

某个营销活动为什么被取消?

一个软件功能为什么这样设计?

一次运营事故发生以后,员工之间怎么沟通?

一个项目第一次提出时是什么样,最后上线以后为什么变成了另外一个样子?

传统企业数据库通常保存的是最后发生了什么。

但邮件、会议记录、聊天、代码版本、审批流程保存的,是事情为什么会变成这样。

这两者的价值完全不一样。

但有一个细节很容易被误读:谷歌并不是“完全不要乘客数据”

这次交易里有一个很值得观察的边界。

约9750万份乘客个人档案,以及约5020万条Free Spirit常旅客计划记录没有包含在出售范围内;谷歌也表示,最终获得的数据必须经过第三方处理,去除能够识别个人身份的信息。

但是,这并不等于谷歌完全不要消费者行为数据。

前面提到的约75亿条乘客交易记录仍然属于资产包的一部分,只不过需要经过匿名化和去标识化处理。

所以这件事真正值得理解的,不是:

“用户数据已经不值钱了。”

而是:

个人身份本身,并不是AI训练中唯一有价值的部分。

很多时候,一个AI系统并不需要知道“张三是谁”。

它真正想学习的是:

某种需求出现以后,价格如何变化;

用户在什么条件下改变购买行为;

企业看到异常以后采取了什么措施;

这些措施又造成了什么结果。

也就是:

状态 → 判断 → 行动 → 反馈。

从机器学习的角度看,这种连续关系的价值,可能远远高于一个孤立的“用户画像”。

而且法律边界同样重要。

美国破产法并不是简单规定“破产公司不能出售用户数据”。2005年之后的相关规则,对与企业原有隐私政策不一致的个人信息出售增加了额外限制,包括消费者隐私监察人以及法院审查等机制。Spirit这次交易引发员工工会异议,也恰恰说明:未来专有数据越值钱,围绕数据权利、隐私和使用边界的争议只会越来越多。

我越来越觉得,AI正在改变“好数据”的定义

过去谈企业数据资产,有一个特别容易出现的思路:

先看多少TB。

十个TB听起来比一个TB厉害。

十亿条记录听起来比一百万条厉害。

数据中心越大,好像数据资产越值钱。

但AI正在让这个逻辑发生变化。

如果让我现在给“AI时代的高价值数据”写一个非常粗略的公式,我会这样写:

专有数据价值 ≈ 稀缺性 × 真实性 × 过程性 × 专业密度 × 合规可用性

这当然不是一个可以直接拿去做财务估值的数学公式。

它更像一个判断框架。

因为这五个变量里,只要有一个接近零,数据价值都可能迅速下降。

网上随便能爬到的数据,稀缺性很低。

大量AI批量生成的文章,真实性和来源可追溯性可能不足。

只有最终结果、没有上下文的表格,过程性不足。

大量重复性的聊天,专业密度很低。

包含高度敏感个人信息、没有明确授权的数据,哪怕内容再珍贵,合规可用性也可能接近零。

反过来,那些真正稀缺的数据往往具备几个特点:

别人没有。

真实发生过。

存在完整上下文。

包含专业人员的判断。

而且有权合法使用。

Spirit恰好同时命中了其中很多条件。

为什么AI公司又开始抢实体书?

把Spirit这件事和Anthropic最近曝光出来的“Project Panama”放在一起看,会更加明显。

根据《华盛顿邮报》对诉讼材料的调查,Anthropic从2024年开始推动一个内部项目,大量购买实体书,将书脊切掉,用工业扫描设备进行数字化,然后处理掉纸质书。

公开法庭材料显示,Anthropic为此投入了数千万美元,处理的实体书规模达到数百万册。

这里我不想把Project Panama简单解释成“Anthropic专门寻找2022年前、没有被AI污染的文字”。

目前公开证据能够明确确认的是:Anthropic确实大量购买并破坏性扫描实体书;至于具体的选书策略,最好不要越过证据本身。

但实体出版物确实拥有一个互联网语料越来越珍贵的属性:

来源明确。

一本2003年出版的专业书,你至少知道它什么时候写成、谁写的、由谁出版。

它不会突然在昨天被一个AI内容农场批量生成出来。

对于训练数据来说,这叫provenance,也就是数据来源和血统。

当互联网开始大量混入机器生成内容以后,可验证来源本身,就会成为数据质量的一部分。

Nature在2024年发表的一项研究已经展示过一个相关风险:如果生成模型不断使用上一代模型生成的数据进行递归训练,真实数据分布中的低概率信息会逐渐丢失,最终可能出现所谓的“model collapse”。当然,这并不意味着“所有合成数据都有害”,后续研究也显示,只要保留真实数据、合理混合合成数据,模型退化并非不可避免。

但至少说明了一件事情:

真实世界产生的数据,是有锚点价值的。

公开互联网的数据红利,可能真的快进入另一个阶段了

研究机构Epoch AI曾经估算,经过质量和重复训练调整后,全世界可用于AI训练的高质量公开人类文本大约相当于300万亿token。

按照不同的训练规模增长假设,这部分数据可能在2026年至2032年之间被充分利用。

注意,这并不是说2032年互联网就没有文字了。

每天仍然会有海量内容产生。

真正的问题是:

新增的、高质量的、来源可信的、适合训练的、人类原创的数据,增长速度能不能跟得上模型对于数据的需求?

这就解释了为什么数据竞争正在从“爬公开网页”转向另外几个方向。

购买版权内容。

采购专家数据。

构建强化学习环境。

获取企业内部数据。

记录真实世界里的Agent执行轨迹。

收集机器人、汽车、工业设备与人类交互产生的数据。

Spirit这笔交易,本质上只是把这种变化第一次非常戏剧化地展示在普通人面前。

更值得注意的是,跟谷歌竞价的公司为什么也是AI公司?

谷歌最开始并不是唯一竞标者。

Mercor最终报价750万美元,被列为备用买家。

如果以前认识Mercor的人,可能会把它理解成一家AI招聘公司。

但Mercor现在给自己的定位已经很明确:它正在建设连接人类专家和前沿模型的数据层。

它公开介绍自己的业务时强调,真正制约前沿模型进步的不只是算力,还有人类专业知识。它通过医生、律师、工程师、金融从业者等专家生产专业训练数据,同时构建让Agent完成长周期真实任务的强化学习环境。

这就很容易理解它为什么会对Spirit的数据感兴趣了。

如果我要训练一个企业Agent,让它真正处理航空公司的收入管理、客服、运营或者财务工作,我不能只给它看一本《航空公司管理学》。

因为教材告诉AI:

理论上应该怎么工作。

Spirit几十年的内部数据却告诉AI:

一家真实企业实际上是怎么工作的。

两者不是一个级别的数据。

这也是为什么“专家怎么判断”越来越值钱

去年我在世界人工智能大会交流时,曾经和上海库帕思科技的人聊过医疗语料。

库帕思本身就在做AI语料基础设施,也参与医疗语料相关建设。公开资料显示,他们参与主办过世界人工智能大会语料创新发展论坛,也在探索医疗语料库与基层医疗AI应用。

当时有一个问题给我留下的印象特别深。

医院已经信息化很多年了。

电子病历、检查结果、用药记录、影像报告、诊断代码,都非常丰富。

按传统数据库标准看,这应该已经是一座巨大的数据金矿。

问题是:

一个主任医师真正有价值的能力是什么?

往往不是最后写下“诊断A”。

而是病人刚进来的时候,他先怀疑A、B、C。

随后因为某项指标排除了C。

又因为一项检查降低了B的可能性。

用药以后效果不明显,于是重新考虑A的一个亚型。

最后才形成治疗方案。

最终写入数据库的可能只有:

诊断:A。

处置:B。

但真正稀缺的专业能力,藏在前面那几十分钟里。

这也是为什么医疗AI正在越来越重视病例叙事、鉴别诊断、处置依据、随访变化等过程性语料。

不过这里同样需要注意一个边界:

把结构化数据重新组织成叙事文本,可以帮助模型理解上下文,却不能凭空“还原”医生当时没有记录下来的真实思维。

真正高价值的数据,还是需要在工作过程中主动记录。

这一点非常重要。

所以,未来企业真正应该建设的,可能不是“数据库”,而是“决策数据库”

这也是我看完Spirit交易以后最大的感触。

企业过去的信息化,主要解决的是:

把业务结果记录下来。

订单是多少。

客户是谁。

库存多少。

合同多少钱。

员工绩效是多少。

这些当然很重要。

但进入Agent时代以后,企业可能必须再记录另外一种东西:

为什么这样决定。

当时有哪些候选方案。

谁提出了反对意见。

用了哪些信息。

最终选择了什么。

结果怎样。

后来有没有修正。

因为未来的企业AI如果想真正承担工作,它需要学习的不只是企业的知识。

它还需要学习:

这家企业判断事情的方法。

所以我甚至认为,企业知识库这个概念都会慢慢显得太窄。

真正有竞争力的企业未来可能拥有三层资产:

最下面是知识。

中间是流程。

最上面是决策轨迹。

知识告诉AI“知道什么”。

流程告诉AI“下一步做什么”。

决策轨迹告诉AI:

遇到没有标准答案的问题,这家公司通常怎么判断。

最后这一层,很可能才是最难复制的。

对普通人也是一样

这件事情并不只属于谷歌。

如果你每天都在工作,你其实每天都在生产数据。

只是绝大多数数据没有被保存下来。

一个销售谈成客户以后,只在CRM里留下:

“已成交。”

真正有价值的信息却消失了:

客户最开始反对什么?

哪一句话改变了他的态度?

竞争对手开了什么条件?

为什么最后没有继续降价?

一个程序员解决线上故障以后,系统里只留下:

“Bug fixed。”

但真正值钱的可能是:

最开始怀疑了哪三个问题?

为什么排除了前两个?

最后从哪一个异常日志发现根因?

一个运营做爆一条内容以后,后台留下:

播放量100万。

真正有价值的却是:

为什么选这个角度?

之前测试过什么?

哪个版本失败了?

标题为什么最终改成这一版?

这些东西以前看起来都是工作过程中的“废气”。

今天再看,它们越来越像数据资产。

AI时代最稀缺的东西,可能正在从“答案”变成“过程”

所以,如果让我用一句话总结Spirit这笔交易,我不会说:

数据越来越值钱了。

这句话太宽泛。

真正发生的变化应该是:

公开答案越来越便宜,真实世界的过程越来越贵。

互联网有无数文章告诉模型“什么是航空收益管理”。

但只有Spirit自己的系统知道:

某一天,某一条航线,在竞争对手突然降价、燃油价格上涨、航班上座率变化、节假日临近的情况下,公司内部到底讨论了什么,最后又怎么调整价格。

这才是专有数据。

它不是“更多的数据”。

它是:

别人没有的数据。

再进一步说,它还是别人很难重新制造的数据。

你可以重新写一篇航空公司的案例分析。

但你很难重新创造一家航空公司30多年真实经营留下来的5亿条聊天、1亿封邮件、几十亿次交易和无数次成功与失败。

时间本身,已经成为这套数据的一部分。

这可能也是为什么一家已经死掉的公司,最后留下来的服务器,还能让全球最强的AI公司愿意出1000万美元。

企业消失了。

但它曾经如何思考、如何行动、如何犯错的痕迹,反而变成了新的资产。

而这件事给普通企业甚至普通人的提醒可能更加重要:

以后做一件工作,不妨多问一个问题——这件事情完成以后,我到底只留下了一个结果,还是顺便积累了一套别人无法轻易复制的数据?

几年以后,两者之间的差距,可能比我们今天想象的大得多。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

主要事实来源说明: Spirit破产及停止运营时间参考Spirit官方公告、SEC文件与Reuters;谷歌竞拍的数据范围、报价及排除项目参考美国破产法院材料的媒体披露、Bloomberg Law、Reuters及《华尔街日报》;Anthropic Project Panama参考《华盛顿邮报》对公开诉讼材料的调查以及Bartz v. Anthropic相关判决报道;公开训练数据供给估算参考Epoch AI;递归使用生成数据造成模型退化的研究参考Nature论文;Mercor业务定位参考其官方Research与Mission页面。

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部