2026年7月31日,DeepSeek正式上线V4-Flash正式版API并开启公测。此次升级释放出一个明确信号:Flash在多项Agent评测中的表现,已接近甚至部分超过三个月前V4-Pro预览版的水准。
据官方披露,V4-Flash正式版在Terminal Bench 2.1取得82.7分,NL2Repo为54.2分,Cybergym达76.7分,Toolathlon
verified则为70.3分。作为对照,V4-Pro预览版在Terminal Bench 2.0上的成绩为67.9分。尽管两版测试集不同、不宜直接横向比较,但一个激活参数仅130亿的轻量模型,能够在Agent场景中跑出如此数据,足见后训练环节的优化潜力。目前该版本仅限API公测,App与网页端暂不开放,V4-Pro正式版也计划近期推出。
官方日志特别说明,V4-Flash-0731在模型结构与尺寸上与预览版完全一致,仅对后训练流程进行了重做。按照技术报告,V4-Flash总参数量为2840亿,激活参数130亿,而V4-Pro则为1.6万亿总参数、490亿激活参数,两者规模相差近一个数量级。若Flash能靠后训练将Agent水准拉升至接近Pro,则意味着在特定任务中,模型尺寸并非唯一决定因子,训练策略与数据质量的重要性正日渐凸显。测试中采用的DeepSeek Harness极简模式也暗示,团队在Agent框架层面同步做了针对性优化。
Harness的正式亮相,恰与DeepSeek对Agent和持续学习的技术判断吻合。梁文锋曾将AGI实现比作爬楼梯:语言模型为第一级,CoT是去年的突破,今年迈向Agent,而下一步必须攻克持续学习——让模型具备长期积累经验的能力。今年3月组建的Agent Harness团队由崔添翼领衔,其为浙大计算机背景,手握6枚ACM亚洲金牌,曾在Jane Street任职九年,并于5月启动扩编。按规划,Harness将随V4正式版同步推出。
放眼全球,Agent能力的第一阵营仍以闭源厂商为主,GPT-5.6 Sol、Claude Opus等在多数基准测试中领先,国内GLM、Qwen等也加紧追赶。DeepSeek此番大幅拉升Flash的Agent表现,战略意图明确:以高性价比轻量模型切入对推理速度与成本高度敏感的Agent应用市场。内部测试集DSBench-FullStack与DSBench-Hard分别取得68.7和59.6分,也验证了其作为开发者和Agent底座的方向定位。
生态维度上,V4-Flash正式版原生支持Responses API,并针对性适配Codex。Responses API相较传统Chat Completions更适配Agent场景,支持更灵活的工具调用和复杂多轮交互;对Codex的适配则直指代码生成领域。两措并举,不仅降低OpenAI生态开发者的迁移成本,也在OpenAI传统优势地带发起挑战,意在Agent时代构建自身生态位。
此番更新,距DeepSeek完成首轮外部融资尚不足两月。彼时融资金额超500亿元人民币,投后估值约520亿美元,投资方涵盖腾讯、宁德时代、京东及多家国资产业基金。7月中旬,新一轮私募已启动,投前估值约710亿美元,较此前上涨约37%。高估值之下,市场对其技术实力与商业化前景均寄予厚望。梁文锋在首轮中个人出资约200亿元,并通过特殊架构保持控制权,此次从“不融资不上市”转向积极引入资本,意味着DeepSeek正加速迈向商业化和IPO。
Flash正式版的发布,可视作资本加持下的一次技术兑现。而后续真正的考验在于:Pro正式版能否如期落地,Agent能力提升能否转化为持续营收,以及在巨头环伺中,高性价比路线如何持续发挥优势。Agent竞赛刚刚起跑,DeepSeek以轻量模型的显著进化,为行业提出一道新命题——当后训练红利被持续挖掘、效率提升逐步抵减参数差距,大模型的竞争逻辑,或许正在被重新定义。
【免责声明】部分数据来源于网络公开报道及行业资讯,如有侵权,请及时与本网站联系,我们将第一时间予以删改。文中所涉观点、数据及分析仅代表小编个人观点,仅供参考,不构成任何投资建议、商业决策依据或法律承诺。投资有风险,决策需谨慎;任何单位或个人据此进行商业决策、经营行为所产生的风险,均自行承担。