智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

阿里发布Qwen3-Max-Thinking:性能比肩国际顶尖,推理能力创新高

2026-01-27来源:天脉网编辑:瑞雪

阿里近日正式推出其最新一代千问旗舰推理模型——Qwen3-Max-Thinking,该模型在多项权威评测中创下全球新纪录,性能比肩国际顶尖的GPT-5.2和Gemini 3 Pro,成为国内AI大模型领域的新标杆。

作为阿里目前规模最大、能力最强的推理模型,Qwen3-Max-Thinking的总参数量超过万亿级别,预训练数据量高达36T Tokens。通过大规模扩展总参数、强化学习以及推理计算,新模型在科学知识、数学推理、代码编程等关键性能基准测试中刷新了全球纪录,展现了强大的技术实力。

在推理能力提升方面,Qwen3-Max-Thinking引入了一种创新的测试时扩展(Test-time Scaling)机制。这一机制通过提炼此前推理的“经验”,并进行多轮自我迭代,在相同上下文中实现更高效的推理计算,从而获得更智能的结果。相比业界普遍采用的冗余推理方式,该机制显著提升了推理效率和性能。例如,在“人类最后的测试”(HLE)中,Qwen3-Max-Thinking以58.3分的成绩超越了GPT-5.2-Thinking的45.5分和Gemini 3 Pro的45.8分,成为当前所有模型中的最高分。

针对即将到来的智能体Agent时代,Qwen3-Max-Thinking还大幅增强了自主调用工具的原生Agent能力。通过基于规则奖励与模型奖励的联合强化学习训练,模型能够更智能地结合工具进行思考。这种自适应的工具调用能力已在QwenChat上实现,用户可以体验到模型自主选用搜索、个性化记忆和代码解释器等核心Agent工具功能,获得更专业、更贴合需求的回答,同时模型幻觉问题也显著减少,为解决复杂任务奠定了基础。

目前,开发者可以在QwenChat上免费体验Qwen3-Max-Thinking模型,企业用户则可通过阿里云百炼获取新模型的API服务。普通用户也可以通过千问的PC端和网页端试用该模型。据悉,千问App即将接入这一新模型,届时所有用户均可免费体验这款国内最强的AI大模型。

华为多款机型通过星闪认证,涵盖车钥匙协议及L2HC编解码等多项测试
IT之家 1 月 26 日消息,国际星闪联盟官网显示,华为多款手机新通过了星闪认证,主要覆盖车钥匙协议一致性、L2HC 编解码等测试。根据产品型号,IT之家附此次通过测试的机型如下: SLY-AL00:华…

2026-01-27

2026年2000元档拍照手机怎么选?这五款高性价比机型出片率拉满
本文将聚焦五款出片率超高的高性价比机型,其中荣耀500凭借2亿像素主摄和全能实况功能稳居榜首,同时对比Redmi K80、vivo Y500Pro、realme GT Neo6和iQOO Z10 Turbo…

2026-01-27

荣耀WIN系列游戏手机大比拼:2026年性能续航双王牌,闭眼入不踩雷
7300mAh电池+120W快充的续航配置中规中矩,风驰游戏内核让骁龙8至尊版性能释放稳定,但缺乏主动散热设计,长时间游戏时机身温度比荣耀WIN高2.8℃。 在2026年4000左右高性价比手机市场中,荣耀W…

2026-01-27

库克卸任苹果CEO倒计时?外媒聚焦其继任者与交接时间线
几个月前,《金融时报》报道称,苹果公司正在为库克最早于2026年初卸任做准备。 有传言称,库克卸任首席执行官后可能会成为苹果公司董事会主席,但这一过渡似乎不会很快发生,因为苹果公司现任董事长亚瑟·D·莱文森…

2026-01-26

苹果用户必看!5款高性价比磁吸充电宝测评,合规认证大容量续航无忧
今天,我们就为大家带来5款高性价比的苹果专用磁吸充电宝测评,帮助大家快速选到适配自身场景的产品,同时也为大家提供一些选购避坑指南。总之,在选购磁吸充电宝时,要综合考虑安全性、便捷性、充电效率等因素,选择适合自…

2026-01-26