在人工智能大模型领域,一场激烈的竞争正以惊人的速度重塑行业格局。近日,DeepSeek发布的V4 Flash 0731成为焦点,这款新模型在Artificial Analysis的Intelligence Index评测中斩获50分,较上一版本提升10分。基于Intelligence Index v4.1的评测数据,若将各家模型绘制在散点图上,纵轴代表能力得分,横轴为每任务成本,V4 Flash 0731稳居左上角,形成一片“斩杀线”——区域内模型不仅成本更高,能力也明显逊色。
“斩杀线”这一概念源于电子游戏,如今在中英文AI圈广泛流传,成为大模型竞争白热化的标志。其核心逻辑在于:模型能力与成本的差距被智能体(Agent)的应用显著放大,导致市场分化加速。例如,Claude Opus 4.8(max)能力得分为56分,每任务成本1.78美元;而DeepSeek V4 Pro(max)仅得44分,成本却低至0.04美元。V4 Flash 0731以50分超越自家Pro版本,且与能力最接近的对手GPT-5.6 Luna(max)相比,在对方降价80%后,其每任务成本仍低约60%,凸显性价比优势。
智能体的崛起是这场竞争的关键变量。传统模型评测以单次对话或单轮任务为准,而智能体需连续执行多步骤、调用外部工具,并在出错后重试,最终交付完整任务结果。这一转变使得单次回答的准确性无法全面反映模型能力,而按token计价的成本模型也因任务复杂度提升而失效。美国国家标准与技术研究院下属的CAISI在2026年5月的评估中,对比DeepSeek V4 Pro与GPT-5.4 mini在7个基准上的表现,发现同一对模型的成本高低可能因任务不同而完全颠倒,进一步印证了“按任务评测”的必要性。
Intelligence Index v4.1的评测体系正是围绕任务设计:纵轴能力指数由9项评测加权构成,其中智能体任务占比34%,编程与科学推理各占24%,通用任务占18%;横轴每任务成本则综合输入、缓存、推理等五类token的计价,按权重加权得出。这种设计直接反映了智能体对模型能力与成本差距的放大效应。例如,在编码任务中,智能体的token消耗量是代码问答与推理的千倍,模型单价差距虽小,但最终支出可能相差数个数量级。Bai Longju等人在2026年4月的论文中分析,八个前沿模型在SWE-bench Verified上的执行轨迹显示,智能体任务的token消耗随步骤数增加而激增,进一步拉大了模型间的成本差距。
能力差距的放大同样显著。单轮问答中,模型准确率差异可能仅体现在个位数百分点;但在智能体任务中,二十步串联后,95%与90%的准确率对应的成功率分别为36%与12%,差距扩大至三倍。智能体的重试机制进一步加剧了这一效应——能力不足的模型需为失败任务重复支付成本,直接转化为额外支出。这种“双重放大”效应导致性价比落在斩杀线以内的模型迅速失去市场地位。
智能体的普及也引入了更多评测变数。例如,同一模型接入不同Agent框架时,任务执行效率可能差异显著。2026年7月,Reddit上的独立评测显示,DeepSeek V4 Flash在四个Agent框架中执行真实bug修复任务时,消耗的tokens与时间相差四倍。为统一标准,Artificial Analysis开源了测试框架Stirrup,所有模型的Intelligence Index跑分均在此框架内完成,但不同框架的差异仍提示:模型能力需在系统层级验证,单纯分数难以反映真实表现。
市场对性价比的敏感度极高。大模型切换成本低,API调用标准化,开发者可快速切换模型而不影响用户体验。与此同时,基础模型层的进步放缓,同质化竞争加剧,市场份额向性价比最优者集中。例如,2026年7月30日,OpenAI将GPT-5.6 Luna价格下调80%,次日DeepSeek即发布V4 Flash 0731,迫使竞争对手跟进降价。这种“毒圈”效应——即落后者被快速淘汰,幸存者需持续奔跑——使得价格战成为常态。OpenAI的算力投入从0.2吉瓦增至1.9吉瓦,收入增长10倍,但投入与产出几乎线性对应,未形成结构性优势,印证了这场竞赛的残酷性。
成本降低是唯一的喘息机会。2026年5月,DeepSeek将V4 Pro API价格降至原价的四分之一,创全球新低,其技术底气来自混合注意力架构与多token预测技术,使单token推理运算量降至前代的27%。国新证券研报指出,到2030年,大模型推理成本将较2025年降低超90%。路透社同年7月报道,DeepSeek正在研发专用于推理的自有芯片,OpenAI与Anthropic等头部厂商也已公布类似计划,通过技术迭代与硬件优化双管齐下,维持性价比优势。
在这场生死局中,“斩杀线”与“毒圈”的流行恰如其分地描述了行业现状:落后即出局,幸存者需不断突破。模型技术迭代与基础设施投入仍在推动“斩杀线”上移,而成本降低的耐力赛远未结束。大模型竞争已从技术比拼演变为综合实力的较量,唯有在能力、成本与执行效率上全面领先者,方能在这片开阔地上占据一席之地。