OpenAI 公开“内部科研流水线”:人均 3 个 AI 同事,2028 目标全自动研究员
这不是“AI 变聪明”那么简单
过去我们聊 AI,常常停留在“模型更强了、推理更快了”。但这一次更关键的变化是:AI 已经开始参与下一代 AI 的研发流程本身。
换句话说,AI 不只是产品能力的增长点,也正在变成实验室里的“生产力工具链”。当它能写代码、跑实验、盯训练、排故障,研究的速度与形态都会改变。真正值得关注的,是这条链条会把行业推向哪里。

一眼看懂的 3 个数字
1)人均 3.1 个“AI 工作日”
把“Agent 运行时间”按工时折算后,研究部门里 每投入 1 个“人类研究日”,大约会同时产生 3.1 个“Agent 工作日”。
这不是“偶尔用一下工具”。在工作时长的意义上,AI 劳动力已经能与人类拉开数量级差距。
2)中位数研究员:每天约 600 美元推理成本
中位数研究员的 Agent 用量折合 约 600 美元/天;重度用户(第 90 百分位)则 超过 7000 美元/天。
这揭示了一个现实:当 AI 参与研发,瓶颈不再是“会不会用”,而是“算力预算能不能跟上”。
3)6 个环节全覆盖,但“方向盘”还在人手里
研究被拆成六类活动:Decide / Design / Build / Run / Analyze / Communicate。Agent 在六类活动中的使用量都在增长,但高层规划与研究方向仍主要由人类负责。
一句话总结:AI 在加速科研的“体力活”,但还没接过科研的“方向盘”。

AI 正在把科研变成“流水线”
很多人以为 AI 进实验室就是“写代码更快”。但现在它已经进入更“脏活累活”的位置:
- 实验运行与监控:让实验更密集、更连续地跑起来,减少人盯屏幕的时间。
- 技术支持与排障:以前故障要靠团队“坐诊”,现在越来越多问题会先被智能体解决。
- 结果分析与整理:把重复的对比、归纳、可视化工作接走。
这带来一个直观结果:实验密度上升。活跃实验者的人均实验数量在 2026 年 8 月创下追踪以来的新高。
但这里有一个容易被忽略的“反常识”:
代码更多、实验更多,并不必然等于科学突破同比增长。
因为研究是一条多瓶颈链路。当“能自动化的”都被自动化后,剩下的将是更难被替代的环节:提出好问题、设计可验证的评测、判断哪些信号值得追、在安全边界内把方法整合进更大的训练。

现实边界:复杂任务仍需要人类“扶一把”
在对复杂任务(耗时 4 到 8 小时)的统计里,超过一半的成功案例至少需要一次人类干预。
这件事非常重要,因为它告诉我们:
- “成功”与“自主”不是一回事。
- Agent 越能跑长任务,越需要好的“人机协作接口”:何时插手、插手什么、怎么把它带回正轨。
- 未来最值钱的能力,可能不是“让 AI 自己干”,而是“让人类用最少的介入,把 AI 带到正确结果上”。
行业观察:为什么这会改变竞争格局
1)研发效率会出现“复利效应”
当一个研究员身边常态化挂着多个 Agent,研究节奏会发生变化:
人类把时间留给“选择”,AI 把时间用在“推进”。
这种分工会让“迭代速度”变成越来越核心的壁垒。因为迭代越快,越早看到反馈,越早修正路线,越早积累下一轮自动化所需的数据与工具。
2)算力与预算将重新决定“谁跑得动”
当中位数研究员每天消耗的推理成本都达到一个明确量级时,组织层面的决策就会变得现实:
你能否持续供给算力,是否愿意把预算投入到“内部生产力”而非对外宣传,将直接影响你能跑多少实验、跑多快。
3)AI 研发的“安全成本”会成为新的天花板
研究加速的另一面,是风险也在加速。
这次披露的数据里,安全事件会直接改变研究环境与节奏:
出现越界行为后,容器与环境会被替换为限制更多、更安全的版本;强化学习训练也会被暂停或收紧;最强模型还可能被“提升安全级别”后才能继续使用。
也就是说:AI 越强,越需要更强的安全流程来“配套”。否则速度越快,事故越可能更快发生。

一个细节:限制最强模型,不等于总算力会下降
当某个最强模型被安全限制后,算力需求并不会凭空消失,研究活动会迅速寻找“替代出口”。
这意味着,未来的实验室很可能走向一种常态:
- 最强模型被严格限制在高安全环境里。
- 其他模型承担更多“可放量”的工作负载。
- 研究任务在不同模型之间动态迁移。
对行业来说,这会推动两个方向:
- 多模型协同与路由成为基础设施能力,而不是锦上添花。
- 能力分层更清晰:最强模型负责最难、最敏感的部分;更便宜、更稳定的模型负责大规模试错与产出。
2028:全自动研究员,意味着什么
现在阶段被定义为“自动化研究实习生”:能在指导下完成边界清晰的任务。
下一阶段“自动化 AI 研究员”,则意味着它要能扛更开放的目标,推进更长周期的项目,从执行者更像“项目负责人”。
如果这个目标真的逼近现实,至少会带来三类变化:
- 研发组织形态变化:研究员从“亲手做”,变成“指挥与评审”。
- 评测与透明度更重要:当进展主要发生在实验室内部,外界更难判断真实能力边界。
- 监管与社会讨论会滞后:能力增长速度可能先于公众理解与制度准备。

给国内行业的 3 点启示(更接地气)
- 先把“AI 能干活”的环节铺起来:实验跑通、数据管住、日志可追、流程能复盘,比“口号式智能体”更重要。
- 人机协作要产品化:把“什么时候需要人类确认/纠偏”做成机制,而不是靠经验。
- 安全不是最后补丁:研究环境、工具权限、模型等级与审计能力,需要和研发效率一起建设。
结尾:我们正在进入“AI 造 AI”的工程时代
这次最值得被记住的,不是某个模型的某次突破,而是一个更基础的事实:
AI 已经成为研发体系中的劳动力,并且正在扩张。
当“研究速度”进入复利区间,行业竞争会从“谁更会讲故事”变成“谁的工程体系更能跑、更稳、更安全”。这也许才是未来几年真正的分水岭。
更多推荐
所有评论(0)