智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

大模型基准测试国际标准出炉,中国信通院引领制定

2025-04-11来源:ITBEAR编辑:瑞雪

近日,国际电信联盟电信标准分局(ITU-T)正式公布了由中国信息通信研究院(简称“中国信通院”)主导制定的全新国际标准——ITU-T F.748.44,该标准聚焦于大模型基准测试评估体系,命名为“基准测试/Assessment criteria for foundation models: Benchmark”。这一里程碑式的成就标志着大模型技术评估领域迈向了国际化标准化的新篇章。

该国际标准深入规范了大模型基准测试的各项关键要素,包括测试维度、数据集、方法及工具,旨在构建一个全球公认的大模型能力评估框架。通过系统性研究全球产学研界超过500项基准测试,标准确立了四大核心测试维度,即测试场景、测试能力、测试任务和测试指标,为全面、客观地衡量大模型性能提供了科学依据。

随着人工智能技术的飞速发展,如何准确评估大模型的综合能力及其潜在缺陷,已成为学术界与产业界共同关注的焦点。模型基准测试作为目前最为认可的评估手段,通过精心设计的测试任务和评价数据集,实现了对模型性能的公正、量化评估。然而,由于缺乏统一标准,当前市场上存在众多基准测试方法和数据集,评测结果的公正性备受质疑。

为了破解这一难题,中国信通院自2023年起便着手布局大模型基准测试研究,并于年底推出了“方升”大模型基准测试体系,创新性地引入了自适应动态测试方法,积累了600万条数据集,并构建了FactTeting测试工具,实现了大模型测试流程的自动化。这一系列的努力为国际标准的制定奠定了坚实基础。

自2024年起,中国信通院参照已发布的ITU大模型基准测试国际标准,对国内外众多标杆大模型进行了持续监测,涵盖了OpenAI o1、DeepSeek R1、Gemini 2.5 Pro、Claude 3.7 Sonnet、Qwen2.5-Max以及百度文心大模型X1等上百个模型。通过每两个月一次的周期性评测,发布了涵盖大语言通用能力、推理能力、代码能力、多模态理解能力、文生图能力以及文生视频能力等多个方面的评测结果,为行业提供了权威、全面的参考。

ITU-T F.748.44国际标准的发布,不仅为大模型技术的提供方和应用方提供了高质量的能力评估依据,还促进了大模型基准测试体系架构的国际共识,引导大模型技术及产业健康有序发展。这一标准化成果对于推动技术创新、引领行业趋势以及加强国际合作与交流具有重要意义,标志着大模型测试领域迈出了坚实的一步。

百度发布多项AI重磅成果,李彦宏:内化AI能力让智能不再是成本而是生产力
“当AI能力被内化,成为一种原生的能力,智能就不再是成本,而是生产力。”11月13日举办的2025百度世界大会上,百度创始人李彦宏演讲时表示,更应关心如何让AI跟每一项任务有机结合,“让AI成为企业发展和个人成长的

2025-11-13

TRAE SOLO正式版全量上线,新增SOLO Coder、多任务并行、上下文压缩等核心功能
11月12日,TRAE宣布推出SOLO正式版。SOLO正式版定位于“The Responsive Coding Agent”,旨在为专业开发者提供实时有感知(Responsive Review)、随时可掌握(Responsive Context)、多任务并行(Responsive Multi-Agent)

2025-11-13

家电家居品牌力挺京东为用户比价 直播间扎堆为用户加磅发福利
今年11.11,京东家电家居以真刀真枪的比价直播,掀起一场电商行业的低价战役。直播间拉起“为用户比价、给用户低价”的横幅,正是京东做这次比价直播的初心,通过“直播连麦比价”“贵就赔万元”“现场调价打9折”等

2025-11-12

索尼携多项移动出行创新成果亮相进博会,以安全和娱乐赋能未来移动出行
2025年11月5日,在第八届中国国际进口博览会(下称“进博会”)上,索尼(中国)有限公司(下称“索尼”)携多项移动出行业务领域的前沿技术与创新成果亮相。作为一家建立在坚实技术基础上的创意娱乐公司,索尼融合在影像

2025-11-11

聚合智能创新技术主题论坛在苏举办,共探汽车芯片国产化路径
在当前汽车产业智能化转型与全球供应链格局重塑的双背景下,突破芯片领域关键瓶颈已成为关乎产业安全与核心竞争力的重要议题。为此,汽车技术与装备发展论坛——“聚合智能创新技术”分论坛近日在苏州举办,汇聚行业

2025-11-11

2025汽车技术与装备发展论坛“电池安全 神机妙‘算’”主题分论坛顺利召开
中国汽车工程研究院股份有限公司(以下简称“中国汽研”)牵头承建的国家市场监督管理总局技术创新中心(新能源汽车数字监管技术及应用)(以下简称“创新中心”)于11月8日在中国汽研华东总部成功举办2025汽车技术与装备

2025-11-11

汽车与机器人产业加速融合,聚焦技术同源共探协同新路径
汽车与机器人产业如何打破边界,实现从“技术同源”到“产业链共享”的深度融合,已成为智能制造领域的重要议题。在近日举办的汽车技术与装备发展论坛——“汽车-机器人技术产业链协同发展”主题论坛上,会议由深圳

2025-11-11

海信、TCL、倍轻松、艾力斯特等品牌齐聚京东直播间 现场比价发5折优惠
11月10日,京东家电家居采销比价直播间将迎来海信、TCL、倍轻松、艾力斯特等多位品牌高管,现场进行多个家电家居品类的连麦比价,直面全网消费者的价格挑战。品牌高管做客直播期间,若用户连麦比价的是对应品牌商品

2025-11-10

催化新技术应用落地,“Tech-X”汽车未来黑科技前沿论坛创新成果发布
为推动汽车产业高质量发展,巩固和扩大新能源汽车产业发展优势,促进产业链上下游协同创新,2025汽车技术与装备发展论坛以“汽车产业拥抱人工智能”为主题在苏州召开。作为此次大会重要组成部分,“Tech-X”汽车未来

2025-11-10

智慧生活一触即发,Yeelight易来与三星电子在进博会展示智慧家居生态融合新成果
11月5日,第八届中国国际进口博览会在上海开展。在这场全球瞩目的盛会上,智能家居定制品牌Yeelight易来与三星电子强强联合,在三星展台的AI Home区域通过一系列沉浸式场景体验与前沿技术展示,为现场观众呈现了一场

2025-11-07