智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

AI大模型“生死局”:性价比“毒圈”紧缩,“斩杀线”持续攀升

2026-08-05来源:快讯编辑:瑞雪

在人工智能大模型领域,一场激烈的竞争正以惊人的速度重塑行业格局。近日,DeepSeek发布的V4 Flash 0731成为焦点,这款新模型在Artificial Analysis的Intelligence Index评测中斩获50分,较上一版本提升10分。基于Intelligence Index v4.1的评测数据,若将各家模型绘制在散点图上,纵轴代表能力得分,横轴为每任务成本,V4 Flash 0731稳居左上角,形成一片“斩杀线”——区域内模型不仅成本更高,能力也明显逊色。

“斩杀线”这一概念源于电子游戏,如今在中英文AI圈广泛流传,成为大模型竞争白热化的标志。其核心逻辑在于:模型能力与成本的差距被智能体(Agent)的应用显著放大,导致市场分化加速。例如,Claude Opus 4.8(max)能力得分为56分,每任务成本1.78美元;而DeepSeek V4 Pro(max)仅得44分,成本却低至0.04美元。V4 Flash 0731以50分超越自家Pro版本,且与能力最接近的对手GPT-5.6 Luna(max)相比,在对方降价80%后,其每任务成本仍低约60%,凸显性价比优势。

智能体的崛起是这场竞争的关键变量。传统模型评测以单次对话或单轮任务为准,而智能体需连续执行多步骤、调用外部工具,并在出错后重试,最终交付完整任务结果。这一转变使得单次回答的准确性无法全面反映模型能力,而按token计价的成本模型也因任务复杂度提升而失效。美国国家标准与技术研究院下属的CAISI在2026年5月的评估中,对比DeepSeek V4 Pro与GPT-5.4 mini在7个基准上的表现,发现同一对模型的成本高低可能因任务不同而完全颠倒,进一步印证了“按任务评测”的必要性。

Intelligence Index v4.1的评测体系正是围绕任务设计:纵轴能力指数由9项评测加权构成,其中智能体任务占比34%,编程与科学推理各占24%,通用任务占18%;横轴每任务成本则综合输入、缓存、推理等五类token的计价,按权重加权得出。这种设计直接反映了智能体对模型能力与成本差距的放大效应。例如,在编码任务中,智能体的token消耗量是代码问答与推理的千倍,模型单价差距虽小,但最终支出可能相差数个数量级。Bai Longju等人在2026年4月的论文中分析,八个前沿模型在SWE-bench Verified上的执行轨迹显示,智能体任务的token消耗随步骤数增加而激增,进一步拉大了模型间的成本差距。

能力差距的放大同样显著。单轮问答中,模型准确率差异可能仅体现在个位数百分点;但在智能体任务中,二十步串联后,95%与90%的准确率对应的成功率分别为36%与12%,差距扩大至三倍。智能体的重试机制进一步加剧了这一效应——能力不足的模型需为失败任务重复支付成本,直接转化为额外支出。这种“双重放大”效应导致性价比落在斩杀线以内的模型迅速失去市场地位。

智能体的普及也引入了更多评测变数。例如,同一模型接入不同Agent框架时,任务执行效率可能差异显著。2026年7月,Reddit上的独立评测显示,DeepSeek V4 Flash在四个Agent框架中执行真实bug修复任务时,消耗的tokens与时间相差四倍。为统一标准,Artificial Analysis开源了测试框架Stirrup,所有模型的Intelligence Index跑分均在此框架内完成,但不同框架的差异仍提示:模型能力需在系统层级验证,单纯分数难以反映真实表现。

市场对性价比的敏感度极高。大模型切换成本低,API调用标准化,开发者可快速切换模型而不影响用户体验。与此同时,基础模型层的进步放缓,同质化竞争加剧,市场份额向性价比最优者集中。例如,2026年7月30日,OpenAI将GPT-5.6 Luna价格下调80%,次日DeepSeek即发布V4 Flash 0731,迫使竞争对手跟进降价。这种“毒圈”效应——即落后者被快速淘汰,幸存者需持续奔跑——使得价格战成为常态。OpenAI的算力投入从0.2吉瓦增至1.9吉瓦,收入增长10倍,但投入与产出几乎线性对应,未形成结构性优势,印证了这场竞赛的残酷性。

成本降低是唯一的喘息机会。2026年5月,DeepSeek将V4 Pro API价格降至原价的四分之一,创全球新低,其技术底气来自混合注意力架构与多token预测技术,使单token推理运算量降至前代的27%。国新证券研报指出,到2030年,大模型推理成本将较2025年降低超90%。路透社同年7月报道,DeepSeek正在研发专用于推理的自有芯片,OpenAI与Anthropic等头部厂商也已公布类似计划,通过技术迭代与硬件优化双管齐下,维持性价比优势。

在这场生死局中,“斩杀线”与“毒圈”的流行恰如其分地描述了行业现状:落后即出局,幸存者需不断突破。模型技术迭代与基础设施投入仍在推动“斩杀线”上移,而成本降低的耐力赛远未结束。大模型竞争已从技术比拼演变为综合实力的较量,唯有在能力、成本与执行效率上全面领先者,方能在这片开阔地上占据一席之地。

打破商业边界,重塑城市肌理——高轮GATEWAY CITY如何让商业与城市共融共生
在空间、业态、运营与时间四个维度,高轮GATEWAYCITY究竟做了什么,让“商业消失了,城市显现了”成为一种可感知的真实——以及,这一切对国内市场意味着什么。 从空间语法上的“长得像城市”,到运营逻辑上…

2026-08-05

249元!5000mAh磁吸充电宝加AI彩屏,这差异化创新是惊喜还是鸡肋?
还有一点,不是有 AI 功能吗,也是搭配这个屏幕一起使用的。如果你就喜欢极简、实用,磁吸充电宝和手机贴一起拿手上,已经够厚重了,只想要轻薄、续航这俩核心卖点,那大概率觉得这款有点没必要? 且加墨水屏这操作…

2026-08-05

REDMI K100 Pro系列来袭:M11发光材料加持,画质续航双提升引领新体验
作为本次升级的核心,全新M11发光材料针对屏幕底层发光单元进行深度优化,大幅提升发光效率,搭配全RGB无损像素排列方案,彻底解决传统Pentile排列带来的像素损耗、画面发虚、边缘彩边等问题。K100 Pr…

2026-08-05

MirrorCode榜单揭晓:Claude Fable 5登顶,AI编程迈向“项目级委托”新阶段
在这19天里,模型会反复运行原程序、比较结果、补写功能,再把测试重新跑一遍。 虽然漏掉了一个处理日期注释的冷门边界,被MirrorCode的100%通关线拦了下来,但它已经把原本按周计算的工程量,压进了十几…

2026-08-05

谷歌Pixel Watch 5宣传图亮相:健康功能升级 续航内存提升还支持SOS卫星通信
IT之家 8 月 4 日消息,消息人士 OnLeaks 今天在 MyMobiles 平台发出谷歌 Pixel Watch 5手表的宣传图,新品支持 SOS 卫星通信,部分健康功能也将升级。 IT之家从原报道…

2026-08-05

安兔兔7月安卓手机性价比榜单揭晓 各价位段高性价比机型一览
CNMO科技注意到,0-1499元价位组被摩托罗拉包揽前三;1500-2499元价位组TOP3中有两款手机搭载旗舰级处理器;2500-3499元价位组TOP3都搭载骁龙8至尊版移动平台。 第三名:真我GT8,…

2026-08-05

2026阔折叠手机怎么选?Galaxy Z Fold8以软件适配重新定义大屏价值
阔折叠的屏幕已经足够大,真正影响使用率的却常常是软件:同一个应用展开后只是被等比例放大,两侧留下空白,图文、视频、评论和功能入口没有重新安排,大屏反而需要更多视线移动。 这四部分彼此相连:外屏与主屏先对应…

2026-08-05

AI助力“推翻”考拉兹猜想落空,Lean 4.32.2版本紧急修复内核漏洞
IT之家注:考拉兹猜想(又称奇偶归一猜想 / 3n+1 猜想)由德国数学家洛塔尔 · 考拉兹(Lothar Collatz)于 1937 年提出,是一个表述极其简单但至今未解的数学难题,断言任意正整数在经过…

2026-08-04

2025年中国外骨骼机器人:医疗领航,消费助力与行业应用齐头并进
【环球网科技综合报道】8月4日消息,市场分析机构IDC数据显示,2025年中国外骨骼机器人市场规模超过16亿元,出货量约2.6万台。其中,医疗康复市场仍占据主要市场价值,消费助力市场则贡献了七成以上出货量,…

2026-08-04

海外媒体盛赞小米澎程:成长迅猛 参数惊艳获多方高度认可
此外,小米澎程还获得了国际主流商业媒体“彭博社Bloomberg”、全球头部新能源汽车媒体“EV.com”、全球头部汽车媒体“AutoXing 车邢”、全球头部设计媒体“YankoDesign”、亚太头部汽…

2026-08-04