page contents
跨境关条
Ctrl + D 收藏本站
当前位置:首页 » AI学习圈 » AI通识

当AI开始管理AI,人类还能干什么?

mogoec 2026-08-16 8

当1000个智能体开始工作,人类真正值钱的能力反而暴露了

最近我连续听了两场关于 AI Agent 的深度讨论。

一场谈的是:当1000个智能体同时进入一个世界,它们会怎么协作?

另一场更激进:如果AI不再只是员工的助手,而是让AI管理AI,人类只在关键节点出现,一家公司会变成什么样?

听完以后,我最大的感受不是“AI又变强了”。

而是一个更现实的问题:

当执行能力越来越便宜,我们过去赖以证明自己价值的很多东西,可能正在迅速贬值。

写代码、做PPT、搜资料、剪视频、写营销文案、整理数据、做竞品分析……

过去这些事情贵,是因为它们都需要人的时间。

但如果未来100个、1000个Agent可以同时干活,而且24小时不休息,那么企业真正缺的还会是“多干一点”吗?

我越来越觉得,不是。

未来真正稀缺的,可能会是另外几样东西:

决定做什么,判断什么算好,找到真实反馈,以及在所有人都能调用同一种智能之后,仍然拥有自己的判断。


一、1000个Agent最先让我看到的,不是效率,而是“组织”

这次交流里,其中一位嘉宾是杨光宇(Guangyu Robert Yang)。

他的经历很特别。

他原本是一名计算神经科学家。MIT公开资料显示,他曾同时任职于脑与认知科学系以及电气工程与计算机科学相关项目,研究方向之一就是利用人工神经网络理解认知与大脑。

后来他离开学术界创业。

真正让很多AI从业者记住他的,是一个叫 Project Sid 的项目。

它做了一件听上去非常像科幻小说的事情:

把大量由大模型驱动的智能体放进《Minecraft》世界,让它们长期生活在一起。

Project Sid公开论文显示,实验规模覆盖了从10个到1000多个智能体。研究人员观察到,它们可以逐渐形成角色分工、共同规则,并出现文化传播等群体行为。

这件事情的重要性,并不是“AI会玩《我的世界》”。

真正值得注意的是:

过去我们主要研究的是一个AI能干什么

现在研究者开始研究:

很多AI放在一起以后,会形成什么样的组织能力?

这其实是两个完全不同的问题。

一个聪明的程序员,并不等于一家优秀的软件公司。

一个优秀的销售,也不等于一支高效的销售团队。

同样,一个能力很强的Agent,也不意味着1000个Agent放在一起以后,就自然拥有1000倍生产力。

它们之间需要分工、通信、上下文、权限、评价机制、冲突处理以及目标协调。

换句话说:

Agent变多以后,真正困难的东西开始从“智能问题”变成“组织问题”。


二、但用得越多,有时候人反而越忙

杨光宇在交流里讲了一个让我印象特别深的经历。

今年OpenClaw火起来的时候,他也进入了一段非常重度的Agent使用期。

OpenClaw本身是一套开源的自主AI助手系统,可以运行在用户自己的机器上,通过聊天工具、模型和各种外部工具执行任务。2026年它迅速走红,甚至因为龙虾图标和名称,在中文互联网里被很多用户叫作“小龙虾”。

杨光宇当时为了同时操作更多Agent,摆了三张桌子、九块屏幕。

这个Agent跑完了,等下一步指令。

那个Agent遇到问题,又回来找人。

另外几个窗口正在生成代码。

表面看,他像突然拥有了一支不知疲倦的数字军队。

但一个很有意思的问题出现了:

Agent越多,他越忙。

因为每一个Agent都在制造新的决策请求。

这其实是今天很多AI重度用户正在碰到的问题。

我们原以为AI会消灭工作。

结果第一阶段往往是:

AI消灭了一部分执行工作,同时制造了更多审核、判断、协调和选择工作。

你以前一天写一个方案。

现在AI一天可以给你20个方案。

看起来效率提高20倍。

但你最终还是得回答:

哪个值得做?

哪个观点是错的?

哪个需要继续投入?

哪一个只是看上去很好?

于是,瓶颈从“生产”移动到了“判断”。


三、AI正在进入一个危险又迷人的阶段:让AI改进AI

杨光宇还提到了一个现在非常前沿的研究方向:

Recursive Self-Improvement,递归自我改进,简称RSI。

简单理解,就是:

一个会写代码的Agent,不只是继续写业务代码,而是开始修改“自己这个Agent怎么写代码”。

然后改进后的Agent,再去改进下一版Agent。

这件事今天已经不只是理论。

2025年提出的 Darwin Gödel Machine,就让编码Agent修改自己的代码,再通过程序设计基准测试验证改动是不是有效。论文报告称,其系统在实验中把 SWE-bench 表现从20%提高到了50%,并通过保留不同版本形成持续探索的“进化树”。

另一项自改进编码Agent研究,则报告在其选取的 SWE-bench Verified 子集上,Agent通过修改自身实现把成功率从17%提高到了53%。

Google DeepMind发布的 AlphaEvolve 走的是类似的方向:让大模型不断产生算法候选方案,再通过自动评价器验证结果,然后保留表现更好的方案继续演化。

这里其实藏着一个非常重要的规律。

为什么RSI首先容易在代码、算法、数学这些领域出现?

因为这些领域有一个巨大的优势:

结果比较容易验证。

代码能不能运行?

测试有没有通过?

算法速度有没有提高?

数学证明是否成立?

这些问题至少在很多场景里可以构造明确的评价函数。

于是AI可以形成一个闭环:

生成 → 测试 → 评价 → 修改 → 再生成。

一旦这个循环可以机器化,速度就会非常惊人。

真正的问题反而变成:

如果结果没办法自动判断怎么办?


四、这可能是AI时代最容易被忽略的“木桶效应”

杨光宇在交流里用了一个特别形象的比喻。

假设一个产品从产生想法到真正给客户创造价值,一共需要10个环节。

现在AI突然把其中8个环节加速了100倍。

听起来公司效率应该提高100倍。

实际上并不会。

因为剩下那两个没有加速的环节,会立刻成为新的瓶颈。

这就是我认为今天讨论AI生产力时最容易犯的错误:

把局部速度,当成系统速度。

例如写代码。

Anthropic在2026年公开的一组内部数据非常夸张:截至2026年5月,Anthropic称其合并进入代码库的代码中,超过80%由Claude编写;2026年第二季度,其工程师平均每天合并的代码量约为2024年的8倍。

但Anthropic自己也专门提醒:

代码行数并不是生产力。

8倍代码量,几乎肯定高估了真实生产率提升。

这个提醒非常重要。

因为在真实世界里:

代码不是最终产品。

用户愿不愿意用才是。

文章不是最终产品。

有没有人看才是。

广告素材不是最终产品。

有没有转化才是。

研究报告也不是最终产品。

它有没有帮助决策才是。

AI最容易制造的错觉就是:

产出数量暴涨以后,我们误以为价值也同比增长了。


五、甚至连“AI一定让程序员更快”这件事,都没有想象中简单

还有一个数据特别值得放在这里。

2025年,研究机构METR做过一项随机对照实验,让经验丰富的开源开发者在自己熟悉的代码库中完成真实任务。

结果出乎很多人的预期:

使用当时的AI工具后,这些开发者完成任务的时间平均反而增加了19%。

当然,这并不能说明“AI让程序员变慢”。

这是2025年特定模型、特定开发者、特定任务下的实验结果。

事实上,METR在2026年的后续实验中已经观察到速度改善的迹象,只是统计不确定性仍然较大。

真正值得注意的,是另一个结论:

生成代码的速度,与完成真实工作的速度,并不是一回事。

METR后来进一步分析发现,一些Agent生成的代码虽然可以通过功能测试,但仍可能因为测试覆盖、格式、代码质量等问题,无法直接进入真实项目。

这和杨光宇说的“木桶”几乎是同一件事。

AI把“写”变便宜以后,

检查、集成、验证、需求判断和用户反馈,就开始变贵。


六、真正稀缺的,可能不是Token,而是反馈

这里还有一个我觉得特别值得做内容的人思考的问题。

假设你只有100份高质量用户反馈。

过去一个月只能开发一个功能。

那么这个功能可以吸收100份反馈。

现在Agent让团队一天就能开发100个功能。

听起来产能暴涨。

但问题来了:

用户数量没有突然增加100倍。

用户注意力也没有增加100倍。

于是平均下来,每个功能可能只剩下一份反馈。

这时候生产能力越强,反而越危险。

因为你拥有了巨大的制造能力,却没有同比增加认知能力

内容行业其实更加明显。

现在有人可以用Agent搭建流水线:

一天自动生成100篇文章。

200篇。

甚至1000篇。

技术上当然越来越容易。

但真正的问题从来不是:

“一天能写多少篇?”

而应该是:

“其中有多少篇值得被人读?”

如果没人阅读、没人搜索、没人引用、没人转发,也没有帮助任何一个人解决问题,那么每天自动制造1000篇文章,并不是生产力革命。

只是把Token、电和服务器资源变成了互联网库存。

AI让供给无限增加以后,

需求反而成为最稀缺的资源。


七、然后我又看到了另一场更激进的实验:AI开始管理AI

第二场讨论来自曲晓音(Xiaoyin Qu)。

她过去做过Facebook产品经理,也连续创办过多家公司。公开履历显示,她曾负责Facebook视频创作者、音乐及版权管理相关产品。

2025年,她做了一件非常具有传播性的事情:

宣布自己不再担任HeyBoss的CEO,让名为Astra的AI接管一部分CEO工作,自己转任董事长角色。

需要说明的是,这里的“AI CEO”当然不是法律意义上的公司法定负责人。

它本质上是一次AI管理系统实验

2026年,这套思路进一步变成了Tycoon。

Tycoon官方对产品的描述很直接:

它提供一个AI管理者,再配合工程、营销、研究、数据、内容、法务等不同专业Agent,由上层AI负责拆解任务、分配工作、跟踪进度和汇报结果。

我觉得它真正有意思的地方,不是“AI CEO”这个标题。

而是它改变了一个默认设置。

过去企业做AI改造通常是:

人负责工作,AI辅助人。

而这类组织实验想尝试的是:

AI默认工作,人类处理例外。

这两个结构看起来只换了一句话,背后的组织逻辑却完全不同。


八、未来可能不是“每个人一个AI助手”,而是“一个人管理一条AI生产线”

过去做一个功能,可能需要:

产品经理、设计师、前端工程师、后端工程师、测试、运营、市场……

大家开会、写文档、排期、开发、测试、上线。

新的Agent组织想做的,是把它变成一条流水线。

需求Agent负责拆需求。

设计Agent生成方案。

开发Agent写代码。

测试Agent检查。

内容Agent准备发布材料。

数据Agent监控上线表现。

如果某个环节经常犯错怎么办?

再加一个评估Agent。

如果一种文案经常转化不好怎么办?

把转化数据重新反馈给内容Agent。

这就开始从“使用AI工具”,变成了:

设计AI生产系统。

Tycoon自己对未来组织的描述也是类似的:人类保留愿景、品味和判断,Agent负责计划、委派、执行和反馈。

当然,这些仍然属于非常前沿的创业实验,而不是已经被大规模验证的企业管理范式。

曲晓音在这次交流中提到,她自己的团队规模已经从过去20多人缩减到目前3人,同时产出并没有下降。

这一数字属于创始人在访谈中的自述,目前并不存在独立审计数据。

所以我不会把它写成“AI能让所有公司裁掉90%员工”。

真正值得看的其实是:

如果执行越来越自动化,那么留下来的那几个人,到底需要会什么?


九、我越来越确定,未来公司真正缺的是这五种能力

两场讨论听下来,我把它归纳成五件事情。

第一,选问题

AI特别擅长回答问题。

但企业最值钱的人,往往不是回答问题最快的人。

而是知道:

什么问题值得回答。

优秀科学家真正稀缺的地方,从来不仅仅是解题能力。

而是知道下一步该研究什么。

创业也是一样。

做错方向,1000个Agent只会让你以1000倍速度冲向错误方向。


第二,定义“什么叫好”

AI可以生成100个Logo。

真正困难的是:

哪个Logo代表我们?

AI可以写100个产品方案。

真正困难的是:

哪个方案符合我们的战略?

AI可以剪出100种视频节奏。

真正困难的是:

什么样的视频虽然流量高,但会伤害我的品牌?

这就是评价函数。

代码世界里可以用测试。

真实世界却经常没有标准答案。

于是一个人的经验、审美、价值观和品味,就变成了评价系统的一部分。


第三,建立真实反馈

AI可以无限生成。

用户反馈不能无限生成。

所以未来最厉害的公司,未必是Agent最多的公司。

而可能是:

最早听见真实世界反馈,并最快把反馈送回系统的公司。

谁离用户更近,

谁就拥有训练自己组织的“私有数据”。


第四,拥有非共识判断

这是我觉得未来特别值钱的一件东西。

当所有人都可以调用相似的大模型,

所有人突然拥有了一部分相似的知识、表达能力和分析框架。

这时候,真正稀缺的反而是:

你和别人不一样的地方。

你做过什么行业。

失败过什么项目。

见过什么样的人。

为什么讨厌某种产品。

为什么特别相信某个方向。

这些过去经常被称作“偏见”。

但如果一种偏见经过十年真实世界验证仍然有效,

它会慢慢变成:

判断力。

再稳定一点,

它就叫:

品牌。


第五,承担责任

还有一点经常被AI讨论忽略。

AI可以建议。

Agent可以执行。

但商业世界最终仍然需要有人承担结果。

客户被骗了怎么办?

产品伤害用户怎么办?

投资错了怎么办?

一个决策违反法律怎么办?

品牌被毁掉怎么办?

因此,在可预见的未来,人类还有一个非常难被“自动化掉”的角色:

责任主体。

这也是为什么AI管理AI,并不等于人从组织里消失。

它更可能意味着:

人从流水线里退出,

站到流水线之上。


十、1000个智能体真正带来的问题,不是“人还有没有工作”

写到这里,我反而越来越不喜欢讨论那个已经被问烂的问题:

AI到底会不会取代人?

这个问题太粗了。

更准确的问题应该是:

当执行能力大幅贬值以后,哪些能力会重新被定价?

过去,一个人值钱,可能因为他写代码快。

以后代码越来越便宜。

他真正值钱的,可能变成:

知道应该写什么。

过去,一个团队值钱,因为它一天可以生产10条视频。

以后Agent一天可以生产1000条。

真正值钱的变成:

知道哪一条值得发布。

过去管理者最大的工作,是协调几十个人。

以后AI可能承担大量协调工作。

管理者真正留下来的任务反而变成:

确定方向、设置边界、配置反馈、制定评价函数。

这其实是一场生产要素重新定价。


十一、所以我不准备马上去管理1000个Agent

杨光宇和曲晓音做的事情,我更愿意把它看成F1赛车。

F1赛车不会直接拿来买菜。

但赛车里最先成熟的空气动力学、材料、控制系统,最后常常会慢慢进入普通汽车。

AI原生组织也可能一样。

今天绝大多数公司没必要马上裁掉部门。

普通人更没有必要一口气部署100个Agent。

真正值得现在开始练习的是:

每次准备让AI干一件事情之前,先问自己四个问题:

为什么做?

什么叫做好?

怎么知道它真的做好了?

如果AI一分钟能做100份,我真的需要100份吗?

这四个问题,看起来没有任何技术含量。

但我越来越觉得,

它们可能比学习第101个Prompt技巧重要得多。

因为Prompt解决的是:

怎么让AI跑得更快。

而这些问题解决的是:

到底往哪里跑。

当1000个智能体可以24小时不停工作,当越来越多Agent开始参与改进Agent,当公司开始实验让AI管理AI,人类最重要的工作也许正在发生一次迁移。

不是继续和机器比执行速度。

而是站到执行的上游。

去决定目标。

去定义好坏。

去寻找反馈。

去形成自己的审美和非共识。

然后,为最终结果负责。

机器越会执行,人越需要知道为什么执行。

这可能才是AI原生组织真正开始之后,人类重新找到的位置。


关注本站,每天分享跨境电商前沿资讯( Ctrl + D 收藏本站/收藏为书签 )

参考资料

  1. Altera / Project Sid,《Project Sid: Many-agent simulations toward AI civilization》,2024。研究展示10—1000+智能体的大规模社会模拟。
  2. Google DeepMind,《AlphaEvolve: A Gemini-powered coding agent for designing advanced algorithms》,2025。
  3. Zhang等,《Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents》,2025。
  4. Robeyns等,《A Self-Improving Coding Agent》,2025。
  5. Anthropic Institute,《When AI builds itself》,2026。
  6. METR,《Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity》,2025及2026后续研究。
  7. Tycoon官方Press Room、About及产品资料,2026。
  8. MIT McGovern Institute / MIT相关公开资料:Guangyu Robert Yang学术履历及研究方向。

相关推荐

评论 ( 0 )

扫码关注

qrcode

联系我们

qrcode

回顶部