DeepSeek不是“老大”了?一张图拉开40倍Token成本差,“视力”却输给豆包?|屠夫|kimi|token|flash|deepseek_网易订阅
时间:2026-08-25 18:01:28 出处:热点阅读(143)
来源| Tech星球文| 华卫 任雪芸大模型圈里,老大几乎没有哪家像DeepSeek这样,不张本差包屠把“调价”做成了连续剧。图拉2026年4月,开倍DeepSeek V4-Pro打到2.5折;5月砍到原价的视力四分之一,靠极致性价比把周调用量顶到全球第一。却输可到了8月,易订阅剧本反转,老大8月17日峰谷定价正式生效,不张本差包屠主峰时段V4-Pro输出价从6元/百万Tokens跳到27元,图拉刷新DeepSeek史上最大提价纪录;8月23日又开始回调,开倍把周末拉成全天低谷收费模式。视力半年之间,却输DeepSeek从全网最便宜变成了“收割者”,易订阅价格改了四五轮。老大就在这波价格调整振荡里,DeepSeek那只憋了许久的多模态“眼睛”也终于睁开了。8月21日,V4-Flash-Vision-Exp上线,把视觉能力塞进强调低成本的Flash系列。只是,这只眼睛视力还不够好:Tech星球实测,它把三位同框演员当成同一个人,把王兴兴错认成马化腾,直到景色图才勉强给出可能方位;而同样的问题,豆包几乎“一击即中”给出正确答案。现实的矛盾在用户中被激化,一边是“价格屠夫”主动收窄低价优势,另一边是能力短板刚补就被实测打脸。当豆包、千问、Kimi 们把推理、代码、Agent、多模态的短板一块块补上,DeepSeek必须回答一个新问题:如果价格趋同,但别的产品功能够全面,凭什么还能让用户一直选择?DeepSeek睁眼了,但“视力”不太好?按照DeepSeek公布的基准测试,在要求视觉理解的 Agent Benchmark 上,DeepSeek-V4-Flash-Vision-Exp 相比 DeepSeek-V4-Flash 实现了大幅跃升,多模态能力已经接近Claude Opus-4.8。Tech星球实测了一波,看看 DeepSeek 更新的多模态能力到底如何?率先是人物识别能力的对比,我们稍微上了点儿强度,发了一张三位长相气质相似的演员同框的照片。结果,DeepSeek不仅认不出来,还把三个人都当成了同一个人。然而,同样的问题丢给豆包,得到了清晰准确的答案,并给出了三位演员的照片,甚至连演员的曾用名都标出来了。于是,我们决定再给DeepSeek一次机会,发送了一张同一个人物做出不同表情的图。可惜的是,DeepSeek再次“出错”,把王兴兴认成了马化腾。反观豆包,依然给出了准确的答案,还认真分析了人物身份以及表情背后可能的原因,比如它指出王兴兴本身性格专注技术,不热衷资本仪式,甚至指出可能仅仅是抓拍角度问题。接下来,我们决定把识别对象切换到景色,选了新疆伊犁那拉提草原网红桥一张实拍照片,看模型是否能识别出对应的景点。这次,DeepSeek虽然将正确答案说了出来,但只把其当作了可能区域之一,并未给出确定性的回答。豆包就“一击即中”,直接给出了确定性的答案。虽然说目前任何AI大模型都存在幻觉,但豆包一直被公认为属于幻觉率较高的一个。然而,在这次视觉理解能力的测试中,DeepSeek的幻觉也十分明显。Tech星球先用豆包生成了一张“猫咪趴在笔记本电脑上”的图片,接着将这张明确标注“豆包AI”的图分别发给了DeepSeek和豆包,假装询问猫咪写代码的逻辑。DeepSeek的回答虽然有趣,但显然没有发现“猫咪并不能写代码”这个事实Bug,还对着实际并不能看清的一段模糊代码屏幕,自行描绘了一套猫系程序员版的伪代码逻辑。豆包也是一样,存在严重幻觉。它并没有区别出在现实生活中,猫咪是根本不能写代码的,还自创了一段代码。更离谱的是,无论豆包还是DeepSeek都没有发现这张AI生成的图,电脑只有五行键盘,明显缺少一行,还完全按照指令去分析“猫咪到底压住了哪个键盘”。在反幻觉上,豆包和DeepSeek都存在明显不足,水平大致相当。到了图表识别环节,DeepSeek就比较得心应手了,能够读懂收到的折线图,并能明确粉丝增长的正负,也可以通过图表进行二次计算。不过,豆包的表现也不差,答案亦准确无疑。对比下来,我们发现豆包在识别人物上有明显的优势,这可能因为背后抖音的数据优势有关。其他场景下,诸如图表识别,反幻觉,豆包和DeepSeek几乎处于水平相当。在外网,DeepSeek-V4-Flash-Vision-Exp倒是收获了一些不错的评价。有开发者表示,“DeepSeek-V4-Flash-Vision-Exp 搭配 DeepSeek harness框架,简直逆天了。它碾压的那些测试,我甚至之前从没跑过。”还有开发者将其与最近的神秘模型“牛来”(OX-Alpha)做了代码能力对比测试,结论是:从测试体验来看,OX-Alpha的参数规模应该很大,性能优势明显。此外,有细心的网友发现,V4-Flash-Vision-Exp只在 DeepSWE 和 Agents' Last Exam 上略胜 Opus 4.8 一筹,差距很小,且在Terminal Bench、NL2Repo 和 Cybergym 等Benchmark上仍然落后。性价比还是“王”,图片Token上限拉出40倍差距?DeepSeek最传奇之处,是它证明了一件此前很多人不太相信的事情:大模型可以用更低的成本做到异样高的能力水平。从R1到V4,其“便宜又能打”的标签一步步被强化。百万Token级上下文、Agent能力、代码和推理能力,再加上极低的API价格,DeepSeek一度成了开发者眼里的“性价比之王”。然而,国内模型厂商越来越多,能力间的绝对差距正在缩小。豆包可以在内容、交互和产品体验上做得更好,千问、Kimi、元宝等都在快速补齐推理、代码、Agent、多模态等能力,海外模型则在复杂推理、工具调用和Agent等等方向持续进化。而DeepSeek还依然只是个大语音模型,和用户要求存在明显gap。到了今天,一个正在变化的现实是:DeepSeek可能依然很强,但它已经越来越难被直接称为“老大”了。此前,DeepSeek是在向所有模型厂商发问:“你凭什么比我贵?”现在,它必须开始直面的挑战是:“如果其他家够值够全面,我为什么一定要一直选你?”曾经靠一个模型就能横扫市场的DeepSeek,现在显然要求适应一个更新的大模型竞争时代。DeepSeek或许也意识到了这一局面,这几天,用刚刚上线的V4-Flash-Vision-Exp新补齐了多模态能力这张牌,并且坚守“性价比”。定价上,DeepSeek-v4-flash-vision-exp 的价格与V4 Flash持平,并同样采用主峰、空闲两档计费。计费方面,图片会先按尺寸转换为token再计入用量,并没有附加增加一个明显的多模态溢价。对比国内其他厂商,即使在主峰时段,DeepSeek依然很有“诚意”,缓存命中与否及输入输出各维度定价均显著低于豆包Seed 2.1 Pro、小米MiMo-V2-Omni、Kimi K3和阿里云的主力视觉模型Qwen-VL-Plus,尤其输出端和缓存未命中场景优势更大。实际测试中,同样的图片,在不同厂商那里可能会被折算成完全不同的Token数量,而这直接决定了最终的账单会膨胀多少。根据Tech星球的统计,各厂商之间的差异巨大,单张图片的Token上限甚至相差超过40倍。率先是DeepSeek V4-Flash-Vision-Exp,给出了一个极具攻击性的数字:单张图片消耗最高为 384Token。即使在主峰时段的缓存未命中情况下,单张图片最高仅0.001152元,1000张图大约只需1.15元。对比来看,虽然豆包的视觉模型未公开具体的图片转Token算法,但此前官方给出了一个直观示例:“1元钱可处理284张720P的图片”。Kimi则采取完全不同的策略:固定计费。根据其官方文档,视觉模型每张图片的计费标准固定为1024 个Token,与图片大小或分辨率无关。相较来说,阿里云通义千问的视觉模型采用了最为精细的折算逻辑。根据阿里云官方文档,大多数模型支持每张图片最高1600万像素,更高的分辨率会消耗更多Token:每张图片的Token数计算公式为 h x w / (32 x 32) + 2。但真正值得关注的是其Token上限,按公式推算出的理论值,单张图片最多能消耗约15624个Token。在qwen-vl-plus-0710模型的规格中,还明确标注了“单图最大16384Token数”。此外,DeepSeek还同步上线了免费的Files API,开发者可以先把图片上传到平台,后续请求中凭file_id直接引用,同一张图片无需重复上传,能省下一笔重复传输的开销。目前,Files API 支持 JPEG、PNG、GIF 和 WebP 格式,单个文件最大支持 64 MiB,单用户最大存储空间为 25 GiB,最多可以保存 10000 个文件。尽管涨了一波价,但如果把整个市场拉进来比较,DeepSeek仍然具有明显的成本优势。用户如果能够错峰,还可以获得更低的成本。DeepSeek可能已经不再是那个遥遥打头的“老大”,但它显然还是牌桌上的大腕儿。从主打几度、低成本调用的V4 Flash,到面向复杂推理和高规格任务的V4 Pro,再到如今补上图像、截图和界面理解能力的V4 Flash Vision,DeepSeek V4 的产品结构正在变得更加完整。DeepSeek被“教育”后,战略变了多模态模型和DeepSeek V4 Pro发布后,DeepSeek 被“教育”了。所谓“教育”,一半来自外部,一半来自自己。外部的测评放大了DeepSeek的多模态短板,根据Tech星球实际测评,眼下DeepSeek的视力显然还没追上它的脑力。而V4 Pro,则要求在Harness框架上才能用更好的表现,Harness的操作门槛对普通用户并不友好。Tech星球体验Harness后发现,由于Harness版本依然处于测试版,因此依然存在不少Bug,比如Prompt输入时经常不能完全显示。V4 Pro发布前,DeepSeek提前测报了那场史无前例的涨价:8月17日峰谷定价把输入从6元拉升到27元,缓存命中输入涨幅最直达1100%,是DeepSeek发布以来幅度最大的一轮提价。一边收窄低价优势,一边能力还被友商反超,外界自然要重新盘算:还值不值?涨价的冲击很快显现。OpenCode Go的统计显示,涨价一周以来,DeepSeek的调用量明显下滑,首当其冲的是几度、成本敏感型开发者。紧接着DeepSeek在8月23日把周末拉成全天低谷,用更低的价格把被劝退的要求往闲时分流。这恰恰说明,DeepSeek自己也已经意识到:补贴式低价换来的“老大”光环,正在算力稀缺与成本压力下褪色。直面这种局面,DeepSeek做出了两个动作。第一个动作,是补齐那块最显眼的短板“多模态”。8月21日,Deepseek-V4Flash-Vision-Exp 上线,把视觉能力塞进以效率和低成本著称的Flash体系,且不“溢价”。同期上线的免费Files API,更让图片一次上传、凭file_id复用,进一步压低重复调用的传输与计费成本。在大模型竞争加速的背景下,如果不愿在价格上守住,就只能在能力上进攻。Tech星球用DeepSeek做完上面五个测评后,只花费了0.14元。不过,豆包是免费的,没花钱。第二个动作,是把“涨价”包装成资源调度。峰谷定价把工作日9:00—12:00、14:00—18:00设为主峰、价格翻倍,其余为空闲、价格减半;随后更新了“周末全天低谷”。相当于用价格杠杆把闲时算力分配给对时延不敏感的批量任务,既缓解主峰拥堵,也给愿意错峰的开发者留出低价窗口。大模型行业正从“低价抢客户”转向“价值定价”,曾被称为“价格屠夫”的DeepSeek收刀,某种程度上也意味着纯低价策略已未便为继。但把视觉放进便宜的 Flash线,等于用“低价多模态”重新定义性价比。如此一来,DeepSeek的V4产品矩阵正在变完整:几度低价的V4-Flash、复杂推理的V4-Pro,再到补齐图像与界面理解的DeepSeek‑V4‑Flash‑Vision‑Exp。比起一味追求低价,它开始重新考量“能力、价格、用户要求”的平衡。而这或许只是DeepSeek面向现实“低头”的开始。
分享到:
上一篇: ETF洞察|科创半导体设备ETF、科创半导体ETF年内累计涨94%_新浪财经_新浪网
下一篇: 陷入绝境!马竞堵死阿尔瓦雷斯加盟巴萨路,想离队只能去阿森纳|英超冠军|马德里竞技|巴塞罗那队|拉萨罗·阿尔瓦雷斯_网易订阅
温馨提示:以上内容和图片整理于网络,仅供参考,希望对您有帮助!如有侵权行为请联系删除!
猜你喜欢
- 人工智能ETF华夏(515070)涨0.47%,成交额1.07亿元_新浪财经_新浪网
- 158名特警队员同台竞技!广州巡特警上演实战练兵大比武_南方网
- 四大AI预计瓦伦西亚vs皇家贝蒂斯:三家看好平局,豆包猜客胜|西甲|巴伦西亚|皇家社会|皇家贝蒂斯队_网易订阅
- 上海国企ETF汇添富(510810)涨0.12%,半日成交额114.99万元_新浪财经_新浪网
- 杰瑞股份股价连续3天下跌累计跌幅7.75%,长盛基金旗下1只基金持3100股,浮亏损失3.68万元_新浪财经_新浪网
- [流言板]约翰:球队目前仍走在夺冠的正确道路上,要求球迷们的支持-中国足球-虎扑社区
- 国企ETF中银(510270)跌0.52%,半日成交额28.70万元_新浪财经_新浪网
- 券商年内收39张投行罚单 “尽调不规范”成几度问题_热点_经济频段
- 北青:国足在重庆约战新西兰,个别心仪对手无法来华|伊朗队|亚洲杯|重庆市|新西兰队_网易订阅