AI开始替人类调用AI!token用量已是人类5.2倍

  新智元报道

  2026 年 2 月 6 日,人类最后一次跑赢 AI。

  那天,人类在 OpenRouter 上用掉的 token,第一次被智能体追平。

  才半年时间,两条线已经拉开了 5 倍差距。

  据 OpenRouter 统计,截至 8 月 10 日,Agent 类 token 用量从约 0.51 万亿涨到 7.3 万亿,14 倍;人类那条线也涨到了 1.4 万亿,但只有 2.8 倍。

  如此大的落差,让 Peter 都有点恍惚:像是隔了 10 年,可 2 月 6 日,其实只是半年前。

  不不看你是谁

  只看你怎么用

  先说清楚,这组数据打哪儿来、怎么算的。

  OpenRouter 是全球最大的模型网关之一,一头接着约 70 家模型供应商,一头接着开发者,一周要处理 28 万亿 token。

  按它的联合创始人兼 COO Chris Clark 估算,这大约是全球推理量的1%,其中一半来自美国。

  这1% 的 token,又是怎么分出哪些是人、哪些是 Agent 的?

  OpenRouter 不看你是谁,只看你怎么用,具体办法是按 API key 追踪行为:

  工具调用得勤不勤,两次响应之间隔几秒,一轮对话来回几次,这样的信号一共 7 项,加权打个分,再把流量分成 Agentic、Mixed、Human 三档。

  为什么看行为就能分出来?

  道理很简单,人类用 AI 是问一句歇一会儿,中间要读、要想、要打字;Agent 则是一刻不停,工具连着调,回合循环跑,这节奏一看就不是碳基生物。

  所以它是一套估算模型,但方向不会错。

  一个人类目标,如今可能触发几十轮模型调用和工具调用。token 统计的不是有多少人在用 AI,而是 AI 替人干了多深的活。

  一个 Agent 任务

  顶一百次聊天

  真正拉开人和 Agent 差距的,是双方用法的不同。

  人类的请求长什么样?

  打开对话框,敲一段提示词,等一段回答,复制走,关掉。

  从头到尾,你和模型总共说了不到十句话,账面上撑死几千个 token。

  但智能体的请求,完全是另一副样子。

  你给它一个目标,它就自己往下走了:读文件、调工具、写结果、再读、再改,一圈一圈磨到任务收尾。

  人类在起手那段提示词里塞满了目标、规范和上下文,之后模型就在这份上下文上不断增量读写。

  当你还在一问一答时,Agent 已经能靠一句话跑一整天!

  所以,同一个人,上午还在对话框里手动复制粘贴,下午挂上一个智能体去跑,token 账面立马就会换一个数量级。

  Peter 的话一针见血:真正解锁量级的行为变化,是人们开始让智能体长时间自主运行。

  再便宜的 token

  也能烧穿预算

  看到 14 倍,你的第一反应可能是烧钱。

  确实是烧钱,但不是你想的那种烧法。

  Peter 补充了一条:因为智能体天然是多轮的,平均一次智能体请求里,近 70% 的 token 来自缓存提示,而缓存的计价通常低得多。

  道理不难懂。

  Agent 做的是围绕同一个目标反复读写:第一次把那一大堆上下文(代码规范、操作手册、工具清单)灌进去,付一次全价;之后每一轮只做增量更新,命中缓存的部分只按正常输入价的一小部分收。

  换句话说,那条陡峭的曲线里,有近七成是被反复复用的同一段上下文。

  Agent 与人类的 token 构成对比,缓存 token 几乎贡献了全部增量。a16z 按总量口径写作 85% 以上,Peter 原帖按单次请求平均为近 70%。

  这样单价确实降下来了,但架不住用量狂飙。

  Uber CTO Praveen Neppalli Naga 今年早些时候透露,公司工程师只用四个月就烧完了全年的 Claude Code 预算。

  据媒体转述,他本人一场两小时的演示,就花掉了 1200 美元。

  单价打三折,用量涨 14 倍,这道乘法的结果并不难算。

  EY 算过一笔更直观的账:同样一次客服交互,2023 年成本约 0.04 美元,到 2026 年涨到约 1.20 美元,30 倍。

  不是模型变贵了。

  以前是客户问一句、系统答一句,一条线走到底。

  现在客户还是问那一句,但背后已经是查工单、调库存、翻记录,想一轮改一轮,折腾十几个回合才吐出一句回复。

  相同的事,干法变了,价钱就变了。

  高盛则估算,智能体 AI 可能把 2030 年的 token 消耗推高 24 倍。

  任何一项成本半年涨 14 倍,人们都会开始细抠。Peter 说,这正是开放权重模型和低价 token 服务突然被人盯上的原因。

  而且,缓存 token 虽然便宜,它可是要吃内存的。

  智能体一跑好几个钟头,从头到尾不必重来一遍,靠的就是内存把那一整摊上下文托着。

  高带宽内存最近为什么这么紧俏,这里也能找到一半答案。

  分水岭不在你用哪个模型

  那省钱的办法,是不是换个便宜点的模型?

  真正的分水岭,不在你用哪个模型。

  同一个模型,你拿它当搜索框用,一天几千 token;你把它接上自己的文件、工具和一条能连续跑下去的流程,一天几千万 token 也不稀奇。

  差距不在模型,而在你有没有把它放进真正的活里。

  这个鸿沟有多大,OpenAI 给出的一组可以当参照:

  用得最深的 10% 的公司,每名活跃用户输出的 token,是典型公司的 8.3 倍。1 月份这个差距还只有 2.6 倍。

  半年时间,差距扩大到原来的三倍以上。

  拉开差距的不是模型,是配套。

  同一批统计里,头部公司的活跃用户每周有 21% 在用插件,典型公司只有9%;技能的采用率是 19% 对3%。OpenAI 自己内部,这个数字是 95%。

  把你常做的那几件事打包成一套可复用的技能,智能体就不必每次都从头摸索一遍。

  少搜几次、少返工几次,省下的都是钱。

  token 花了

  谁来验收

  不过,账算得再精,也不等于这活干得放心。

  智能体流量暴涨,并不等于 AI 全在自主行动。大量任务仍然是人发起的,中间常常还卡着人工审批。

  Peter 原帖评论区一位做服务业客户的开发者提到,他服务的那些老板,从来没想过撒手不管,采购、发送、签字,每一步都要绕回人。

  但问题是,绕回来未必真的能找到人。

  另一位从业者说,他们的智能体删掉了广告账户里的 18 个视频,整整一天之后才被人发现。

  这不是模型犯了多离谱的错,而是根本没人去看那一步。

  token 花销可以在半年里翻 14 倍,验收的人手却翻不了这么多。这大概是这轮增长里最容易被忽略、也最昂贵的一笔账。

  分析、调研、初稿、方案,重复的执行动作往后都会过剩。

  真正稀缺的,是验证、判断,以及决定什么才值得被做。

  AI 已经成了 token 的主要消费方,可到今天为止,它还不能替你签字。

  未来,真正的问题不再是你用不用 AI。

  而是 AI 替你干完的那些活,谁来验收,谁来拍板下一步。

  参考资料:

  https://www.linkedin.com/posts/peterjameswalker_february-6th-2026-potentially-the-last-share-7493029881841344512-IK89/

  https://the-decoder.com/ai-is-becoming-ais-biggest-customer-as-agentic-token-usage-jumps-14x-on-openrouter/

  https://openai.com/signals/enterprise-data/

  https://www.a16z.news/p/charts-of-the-week-winds-of-thematic

  https://www.ey.com/en_us/insights/ai/agentic-ai-token-costs

  编辑:元宇