DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?

  来源| Tech 星球

  文| 华卫任雪芸

  大模型圈里,几乎没有哪家像 DeepSeek 这样,把“调价”做成了连续剧。

  2026 年 4 月,DeepSeek V4-Pro 打到 2.5 折;5 月砍到原价的四分之一,靠极致性价比把周调用量顶到全球第一。可到了 8 月,剧本反转,8 月 17 日峰谷定价正式生效,高峰时段 V4-Pro 输出价从 6 元/百万 Tokens 跳到 27 元,刷新 DeepSeek 史上最大提价纪录;8 月 23 日又开始回调,把周末拉成全天低谷收费模式。

  半年之间,DeepSeek 从全网最便宜变成了“收割者”,价格改了四五轮。

  就在这波价格调整震荡里,DeepSeek 那只憋了许久的多模态“眼睛”也终于睁开了。8 月 21 日,V4-Flash-Vision-Exp 上线,把视觉能力塞进强调低成本的 Flash 系列。只是,这只眼睛视力还不够好:Tech 星球实测,它把三位同框演员当成同一个人,把王兴兴错认成马化腾,直到风景图才勉强给出可能方位;而同样的问题,豆包几乎“一击即中”给出正确答案。

  现实的矛盾在用户中被激化,一边是“价格屠夫”主动收窄低价优势,另一边是能力短板刚补就被实测打脸。

  当豆包、千问、Kimi 们把推理、代码、Agent、多模态的短板一块块补上,DeepSeek 必须回答一个新问题:如果价格趋同,但别的产品功能够全面,凭什么还能让用户一直选择?

  DeepSeek 睁眼了,但“视力”不太好?

  按照 DeepSeek 公布的基准测试,在需要视觉理解的 Agent Benchmark 上,

  DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态能力已经接近 Claude Opus-4.8。

  Tech 星球实测了一波,看看 DeepSeek 更新的多模态能力到底如何?

  首先是人物识别能力的对比,我们稍微上了点儿强度,发了一张三位长相气质相似的演员同框的照片。结果,DeepSeek 不仅认不出来,还把三个人都当成了同一个人。

  然而,同样的问题丢给豆包,得到了清晰准确的答案,并给出了三位演员的照片,甚至连演员的曾用名都标出来了。

  于是,我们决定再给 DeepSeek 一次机会,发送了一张同一个人物做出不同表情的图。可惜的是,DeepSeek 再次“出错”,把王兴兴认成了马化腾。

  反观豆包,依然给出了准确的答案,还认真分析了人物身份以及表情背后可能的原因,比如它指出王兴兴本身性格专注技术,不热衷资本仪式,甚至指出可能仅仅是抓拍角度问题。

  接下来,我们决定把识别对象切换到风景,选了新疆伊犁那拉提草原网红桥一张实拍照片,看模型是否能识别出对应的景点。这次,DeepSeek 虽然将正确答案说了出来,但只把其当作了可能区域之一,并未给出确定性的回答。

  豆包就“一击即中”,直接给出了确定性的答案。

  虽然说目前任何 AI 大模型都存在幻觉,但豆包一直被公认为属于幻觉率较高的一个。然而,在这次视觉理解能力的测试中,DeepSeek 的幻觉也十分明显。

  Tech 星球先用豆包生成了一张“猫咪趴在笔记本电脑上”的图片,接着将这张明确标注“豆包 AI”的图分别发给了 DeepSeek 和豆包,假装询问猫咪写代码的逻辑。

  DeepSeek 的回答虽然有趣,但显然没有发现“猫咪并不能写代码”这个事实 Bug,还对着实际并不能看清的一段模糊代码屏幕,自行描绘了一套猫系程序员版的伪代码逻辑。

  豆包也是一样,存在严重幻觉。它并没有区别出在现实生活中,猫咪是根本不能写代码的,还自创了一段代码。

  更离谱的是,无论豆包还是 DeepSeek 都没有发现这张 AI 生成的图,电脑只有五行键盘,明显缺少一行,还完全按照指令去分析“猫咪到底压住了哪个键盘”。在反幻觉上,豆包和 DeepSeek 都存在明显不足,水平大致相当。

  到了图表识别环节,DeepSeek 就比较得心应手了,能够读懂收到的折线图,并能明确粉丝增长的正负,也可以通过图表进行二次计算。

  不过,豆包的表现也不差,答案亦准确无疑。

  对比下来,我们发现豆包在识别人物上有明显的优势,这可能因为背后抖音的数据优势有关。其他场景下,诸如图表识别,反幻觉,豆包和 DeepSeek 几乎处于水平相当。

  在外网,DeepSeek-V4-Flash-Vision-Exp 倒是收获了一些不错的评价。有开发者表示,“DeepSeek-V4-Flash-Vision-Exp 搭配 DeepSeek harness 框架,简直逆天了。它碾压的那些测试,我甚至之前从没跑过。”

  还有开发者将其与最近的神秘模型“牛来”(OX-Alpha)做了代码能力对比测试,结论是:从测试体验来看,OX-Alpha 的参数规模应该很大,性能优势明显。

  此外,有细心的网友发现,V4-Flash-Vision-Exp 只在 DeepSWE 和 Agents' Last Exam 上略胜 Opus 4.8 一筹,差距很小,且在 Terminal Bench、NL2Repo 和 Cybergym 等 Benchmark 上仍然落后。

  性价比还是“王”,图片 Token 上限拉出 40 倍差距?

  DeepSeek 最传奇之处,是它证明了一件此前很多人不太相信的事情:大模型可以用更低的成本做到非常高的能力水平。从 R1 到 V4,其“便宜又能打”的标签一步步被强化。百万 Token 级上下文、Agent 能力、代码和推理能力,再加上极低的 API 价格,DeepSeek 一度成了开发者眼里的“性价比之王”。

  然而,国内模型厂商越来越多,能力间的绝对差距正在缩小。豆包可以在内容、交互和产品体验上做得更好,千问、Kimi、元宝等都在快速补齐推理、代码、Agent、多模态等能力,海外模型则在复杂推理、工具调用和 Agent 等等方向持续进化。而 DeepSeek 还依然只是个大语音模型,和用户需求存在明显 gap。

  到了今天,一个正在变化的现实是:DeepSeek 可能依然很强,但它已经越来越难被直接称为“老大”了。此前,DeepSeek 是在向所有模型厂商发问:“你凭什么比我贵?”现在,它必须开始面对的挑战是:“如果其他家够值够全面,我为什么一定要一直选你?”

  曾经靠一个模型就能横扫市场的 DeepSeek,现在显然需要适应一个更新的大模型竞争时代。DeepSeek 或许也意识到了这一局面,这几天,用刚刚上线的 V4-Flash-Vision-Exp 新补齐了多模态能力这张牌,并且坚守“性价比”。

  定价上,DeepSeek-v4-flash-vision-exp 的价格与 V4 Flash 持平,并同样采用高峰、空闲两档计费。计费方面,图片会先按尺寸转换为 token 再计入用量,并没有额外增加一个明显的多模态溢价。

  对比国内其他厂商,即使在高峰时段,DeepSeek 依然很有“诚意”,缓存命中与否及输入输出各维度定价均显著低于豆包 Seed 2.1 Pro、小米 MiMo-V2-Omni、Kimi K3 和阿里云的主力视觉模型 Qwen-VL-Plus,尤其输出端和缓存未命中场景优势更大。

  实际测试中,同样的图片,在不同厂商那里可能会被折算成完全不同的 Token 数量,而这直接决定了最终的账单会膨胀多少。根据 Tech 星球的统计,各厂商之间的差异巨大,单张图片的 Token 上限甚至相差超过 40 倍。

  首先是 DeepSeek V4-Flash-Vision-Exp,给出了一个极具攻击性的数字:单张图片消耗最高为 384Token。即使在高峰时段的缓存未命中情况下,单张图片最高仅 0.001152 元,1000 张图大约只需 1.15 元。

  对比来看,虽然豆包的视觉模型未公开具体的图片转 Token 算法,但此前官方给出了一个直观示例:“1 元钱可处理 284 张 720P 的图片”。Kimi 则采取完全不同的策略:固定计费。根据其官方文档,视觉模型每张图片的计费标准固定为 1024 个 Token,与图片大小或分辨率无关。

  相较来说,阿里云通义千问的视觉模型采用了最为精细的折算逻辑。根据阿里云官方文档,大多数模型支持每张图片最高 1600 万像素,更高的分辨率会消耗更多 Token:每张图片的 Token 数计算公式为 h x w / (32 x 32) + 2。但真正值得关注的是其 Token 上限,按公式推算出的理论值,单张图片最多能消耗约 15624 个 Token。在 qwen-vl-plus-0710 模型的规格中,还明确标注了“单图最大 16384Token 数”。

  此外,DeepSeek 还同步上线了免费的 Files API,开发者可以先把图片上传到平台,后续请求中凭 file_id 直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大支持 64 MiB,单用户最大存储空间为 25 GiB,最多可以保存 10000 个文件。

  尽管涨了一波价,但如果把整个市场拉进来比较,DeepSeek 仍然具有明显的成本优势。用户如果能够错峰,还可以获得更低的成本。

  DeepSeek 可能已经不再是那个遥遥领先的“老大”,但它显然还是牌桌上的大腕儿。从主打高频、低成本调用的 V4 Flash,到面向复杂推理和高规格任务的 V4 Pro,再到如今补上图像、截图和界面理解能力的 V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整。

  DeepSeek 被“教育”后,战略变了

  多模态模型和 DeepSeek V4 Pro 发布后,DeepSeek 被“教育”了。所谓“教育”,一半来自外部,一半来自自己。

  外部的测评放大了 DeepSeek 的多模态短板,根据 Tech 星球实际测评,眼下 DeepSeek 的视力显然还没追上它的脑力。而 V4 Pro,则需要在 Harness 框架上才能用更好的表现,Harness 的操作门槛对普通用户并不友好。Tech 星球体验 Harness 后发现,由于 Harness 版本依然处于测试版,因此依然存在不少 Bug,比如 Prompt 输入时经常不能完全显示。

  V4 Pro 发布前,DeepSeek 提前预告了那场史无前例的涨价:8 月 17 日峰谷定价把输入从 6 元拉升到 27 元,缓存命中输入涨幅最高达 1100%,是 DeepSeek 发布以来幅度最大的一轮提价。

  一边收窄低价优势,一边能力还被友商反超,外界自然要重新盘算:还值不值?

  涨价的冲击很快显现。OpenCode Go 的统计显示,涨价一周以来,DeepSeek 的调用量明显下滑,首当其冲的是高频、成本敏感型开发者。

  紧接着 DeepSeek 在 8 月 23 日把周末拉成全天低谷,用更低的价格把被劝退的需求往闲时分流。这恰恰说明,DeepSeek 自己也已经意识到:补贴式低价换来的“老大”光环,正在算力稀缺与成本压力下褪色。

  面对这种局面,DeepSeek 做出了两个动作。

  第一个动作,是补齐那块最显眼的短板“多模态”。8 月 21 日,

  Deepseek-V4Flash-Vision-Exp 上线,把视觉能力塞进以效率和低成本著称的 Flash 体系,且不“溢价”。同期上线的免费 Files API,更让图片一次上传、凭 file_id 复用,进一步压低重复调用的传输与计费成本。

  在大模型竞争加速的背景下,如果不愿在价格上守住,就只能在能力上进攻。Tech 星球用 DeepSeek 做完上面五个测评后,只花费了 0.14 元。不过,豆包是免费的,没花钱。

  第二个动作,是把“涨价”包装成资源调度。峰谷定价把工作日9:00—12:00、14:00—18:00 设为高峰、价格翻倍,其余为空闲、价格减半;随后更新了“周末全天低谷”。

  相当于用价格杠杆把闲时算力分配给对时延不敏感的批量任务,既缓解高峰拥堵,也给愿意错峰的开发者留出低价窗口。

  大模型行业正从“低价抢客户”转向“价值定价”,曾被称为“价格屠夫”的 DeepSeek 收刀,某种程度上也意味着纯低价策略已难以为继。但把视觉放进便宜的 Flash 线,等于用“低价多模态”重新定义性价比。

  如此一来,DeepSeek 的 V4 产品矩阵正在变完整:高频低价的 V4-Flash、复杂推理的 V4-Pro,再到补齐图像与界面理解的 DeepSeek‑V4‑Flash‑Vision‑Exp。比起一味追求低价,它开始重新考量“能力、价格、用户需求”的平衡。

  而这或许只是 DeepSeek 面向现实“低头”的开始。