OpenAI内部开卷!AI实习生正式上岗, 头部员工一天烧掉5万元

  出品 | 网易智能

  作者 | 辰辰

  编辑 | 王凤枝

  AI 在 OpenAI 内部,已经开始"卷"造它的人了。

  美国时间 9 月 6 日,OpenAI 宣布,按照内部测量,公司已实现"自动化研究实习生"的目标:在人的指导下完成明确的研究任务,其中包括熟练研究员需要数天才能做完的工作。所谓"研究实习生",指的是能承担具有一定复杂度的任务、但仍需要人在过程中介入指导和复核的智能体。

  随之公开的内部数据表现突出。到 8 月中旬,研究部门智能体的总运行时长已达到人类工时的 3. 1 倍。用量进入前 10% 的研究员,每人每天调用的 AI 服务,按公开 API 价格折算超过 7000 美元。

  研究员同时运行多个智能体,让它们写代码、跑实验、排查故障。有团队甚至因为求助人数减少,取消了专门的答疑时间。

  不过研究员并没有完全放手。任务一旦拉长,人工指导仍然不可或缺;研究什么、分配多少算力、结果值不值得继续推进,还是研究员说了算。

  一、一个人类工作日,对应3. 1个智能体运行日

  今年年初,OpenAI 研究部门按用量排在中间的研究员,还只是少量使用编码智能体。到 8 月中旬,这个中位数用户每天的推理用量,按公开 API 价格折算已超过 600 美元;排到第 90 百分位的用户,则超过 7000 美元。

  这不是单个智能体的实际成本,也不是OpenAI内部核算的账单,而是一名研究员的总调用量按对外API单价折算出的名义值。

  运行时长的变化更明确。6 月之前,研究部门智能体的总运行时长还低于人类工时;到 8 月中旬,按 8 小时工作日折算,每 1 个人类工作日已对应 3.1 个智能体运行日。这里累计的是智能体运行时长,不等于完成了 3.1 倍的有效工作。。

  在 OpenAI 公布的数据中,研究部门中位数员工的智能体输出 Token 用量已增至基准期的 124 倍,增幅高于其他部门。与此同时,越来越多研究员在一天中并发运行 4 个或更多智能体。统计既包括人直接启动的智能体,也包括系统继续派生的子智能体。研究员交付的任务,正从单次问答转向多项可同时推进的工作。

  SemiAnalysis 创始人迪伦·帕特尔(DylanPatel)注意到这些数据后表示,OpenAI 员工当前的 AI 使用量已接近 SemiAnalysis 团队水平,而在今年年初,两边的用量差距依然明显。

  二、代码与实验次数增加,研究能快多少?

  OpenAI 披露了两项量化指标:代码修改量和实验次数。

  以 2025 年之前的平均水平为基准,全公司每名活跃代码贡献者的代码修改量如今达到约 7 倍。

  以 2025 年为基准,每名活跃实验者的实验数在今年 8 月达到约 1.6 倍,为记录以来的最高水平。OpenAI 表示,这与 Codex 采用率上升有关,同时也指出公司的可用算力在此期间有所增加。

  两项指标的基准期和统计人群不同,加起来无法直接换算成"研究进展快了多少倍"。AI 研发也不只是写代码和启动实验:研究员还要设计改进方案、编写评测、检查训练异常、判断哪些结果值得合入核心模型。任何一环受限,周期都会拉长。

  OpenAI的解释是:随着自动化推进,最难自动化的任务会占据研究员越来越多的精力;当其他制约缓解,算力可能成为主要限制。写代码提速后,实验设计、结果判断和算力分配,可能成为更突出的限制。

  三、写代码之外,AI接过了部分排障工作

  OpenAI 借用 EpochAI 的分类,把 AI 研发拆成六个环节:决定目标、设计方案、构建代码和数据、运行任务、分析结果,以及沟通协作。

  从今年 1 月到 8 月,按每名研究员每天的智能体输出 Token 统计,增幅最大的三类工作是:研究与基础设施代码(增加约 19.8 万 Token)、技术支持与评审(增加约 15.9 万 Token)、启动监控与调试(增加约 13.3 万 Token)。

  实验结果分析的输出也增加了约 4 万 Token。智能体的调用并未停留在单一代写,代码、排障和运行相关的工作仍占主要部分。

  这种变化在内部支持团队中更明显。过去,一些团队会固定安排时间协助研究员排查实验和基础设施问题。今年,多支团队发现前来求助的人数持续减少,其中一支干脆取消了专门的答疑支持,把精力转向其他系统改进。

  一个由人工值守的内部技术支持频道,每天的新帖子数量同样在减少。OpenAI 称,目前未见这些请求转向其他人工支持渠道。

  四、长任务能够处理,但仍需人工介入

  用量涨得快,不代表每项任务都能脱离人工独立完成。

  OpenAI 用智能体分类器整理内部任务,按照"估计人类需要多久完成"分档,观察成功率与人工介入情况。此处的时长是任务难度的参考,不是 AI 实际运行的时间;结果不确定的样本未纳入统计。

  在公司公布的统计中,估计人类15分钟内能完成的任务,86%可以由智能体独立完成。在 4 至 8 小时这一档,43% 可以独立完成,另有 45% 在经历至少一次人工介入后交付。

  智能体已经能够处理一部分长周期任务,结合人工指导后成功率还能提升。但在较长流程中,研究员无法完全免除跟进:过去六个月里,成功完成的48小时任务中,超过一半经历了至少一次人工介入。

  "研究实习生"的定位正对应这一状态:系统能承担具有一定复杂度的任务,但仍需要人在过程中介入指导、交付时复核。

  五、哪些实验值得继续,仍由研究员决定

  从输出 Token 的分布来看,高层决策是智能体参与较少的部分。

  从 1 月到 8 月,"决定做什么"这一项,每名研究员每天的智能体输出增加约 2300Token;"继续还是停止"增加约 200Token,规模远低于编写代码、排障和运行监控。

  不过 Token 反映的是文本输出量,不是决策本身的比重。单次决定的表述可能简短,而一段排障往往包含大量日志:不能单纯因为输出 Token 少,就说 AI 没参与过相关讨论。

  更明确的依据来自OpenAI对当前分工的界定:人类依然负责设定研究优先级、评估方案与结果的推进价值,并决定系统是否扩张、暂停或部署。智能体能协助完善方案、运行实验并整理结果,但资源的后续配置权仍在研究员手中。

  社交平台用户 Chinmay 也注意到这一分工:代码生成在提速,但评估哪些实验值得分配算力,仍需要研究员。产出增加不等同于研究决策质量的提升。

  研究员还牢牢握着方向盘。

  六、同一天,首席科学家发出了不同调门的声音

  在报告公布的同一天,OpenAI 首席科学家雅库布·帕乔基(JakubPachocki)发表了长文《一个异类心智》(An Alien Mind)。

  他在文中写道:"我担心,没有人准备好面对机器智能持续快速上升的后果。"

  他主张建立由第三方审计机构、政府或国际组织执行的强制性安全门槛。山姆·奥特曼(Sam Altman)随后转发了该文,称其为一篇"重要的帖子"。

  前面的数据显示研究方向还在人类手里,帕乔基关心的是:这种状态能否持续。

  此前,OpenAI 曾因智能体越过测试边界访问 HuggingFace 生产系统的事件,暂停了部分前沿强化学习训练,并强化了开发环境的隔离与监控。报告同时披露了这类限制措施对算力分配的实际影响。

  8 月 7 日,初步评估显示 Astra 可能达到其安全框架定义的“关键”网络安全能力门槛,OpenAI 对其施加了额外限制。随后一周内,Astra 的 GPU 配额减少 59.2%,而其他模型类别的配额增加 17.2%,抵消了 Astra 约 85% 的降幅。在受监测的强化学习工作负载中,总算力分配因此保持相对稳定。对单一模型的限制没有让计算资源闲置,其他获准运行的实验填补了空缺。

  帕乔基还指出了模型可解释性层面的障碍。思维链监控通常通过追踪中间推理过程来识别潜在风险。但随着模型能力提升,系统可能在不完整输出推理过程的情况下解决问题,也更善于调整其展现方式:人类可见的文本,未必足以完全解释其决策逻辑。

  他在文章最后表示,推进自动化AI研究的核心挑战,不仅在于达成这一技术节点,更在于确保人类能持续参与其改进过程并保持控制权。

  七、实习生之后,下一步的边界

  OpenAI 给出的下一个目标,是在 2028 年 3 月实现"自动化 AI 研究员",在人类监督下推进深度学习与对齐研究。

  从实习生到独立研究员,跨越的不只是代码产出量或实验运行规模。当前研究员已能并发调动多个智能体,但选题、验证和后续投入的权衡,决定权还在人手里。

  AI 让更多实验跑了起来,也让研究员更需要判断:哪些值得继续。