智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

OpenAI新模型性能提升却频现“幻觉”,错误率为何反增?

2025-04-19来源:ITBEAR编辑:瑞雪

近期,OpenAI推出了两款新型模型——o3与o4-mini,这两款模型在多个领域展示了卓越的性能,然而,它们却面临着一个棘手的问题:幻觉现象愈发严重。

据TechCrunch报道,幻觉问题一直是生成式AI领域难以攻克的一大难关,即便是业内顶尖的模型也难以完全摆脱其困扰。以往,每一代新模型的发布都会带来幻觉频率的小幅降低,但o3与o4-mini却打破了这一规律。

OpenAI的内部测试结果显示,作为推理模型的o3与o4-mini,在幻觉问题的出现频率上不仅超过了前代推理模型o1、o1-mini和o3-mini,甚至高于传统的“非推理”模型,如GPT-4o。这一现象引发了业内的广泛关注与讨论。

OpenAI在发布的技术报告中指出,随着推理模型规模的扩大,幻觉问题反而变得更加严重,这一原因尚需进一步的研究。尽管o3与o4-mini在编程、数学等任务上的表现有所提升,但由于模型输出的答案总量增加,导致准确判断与错误、幻觉现象并存。

在OpenAI设计的内部基准测试PersonQA中,o3回答问题时出现幻觉的比例高达33%,几乎是前代推理模型o1和o3-mini的两倍。而o4-mini的表现更为糟糕,幻觉率高达48%。这一数据无疑为业界敲响了警钟。

不仅如此,第三方机构Transluce的测试也证实了这一问题。该非营利AI研究实验室发现,o3在回答问题时经常会虚构一些“过程操作”。例如,o3曾声称在一台2021款MacBook Pro上“在ChatGPT之外”运行了代码,并将结果复制进了答案中。然而,实际上o3并不具备执行这种操作的能力。

面对这一问题,OpenAI发言人Niko Felix表示:“解决幻觉问题一直是我们研究的重点方向。我们将继续努力提升模型的准确性与可靠性,为用户提供更加优质的AI服务。”尽管面临挑战,但OpenAI并未放弃对完美模型的追求。

荣耀500 Pro规格揭晓:骁龙8 Elite加持 2亿主摄配8000mAh大电池
IT之家 11 月 14 日消息,博主 @数码闲聊站 今日曝光了荣耀 500 Pro 手机的核心规格,这款新机将于近期上市。 IT之家整理如下:6.55 英寸 2736*1264p 120Hz 中屏 骁龙…

2025-11-15

Apple Store应用6.6版焕新登场:液态玻璃设计带来视觉与交互新体验
2025-11-14 08:20:29 作者:狼叫兽 今日,iPhone与iPad平台的AppleStore应用迎来6.6版本更新,此次更新引入了全新设计的应用图标,并对界面进行了视觉升级,以适配iOS 2…

2025-11-14

中芯国际三季度业绩亮眼:月产能破百万,全年收入或创新高
赵海军指出,中国区收入的显著增长主要受益于国内产业链自主化进程加快,为应对客户紧急需求,公司及时优化了产能分配策略。赵海军补充表示,在当前国内企业加速替代海外供应链的背景下,公司长期合作的客户成功把握了市场机…

2025-11-14

华为Mate70 Air深度体验:打破常规,超大屏“Air”的另类演绎
可以确定,华为Mate70 Air的影像没有因为“Air”的定义做妥协,在同价位机型中是能打的,硬件配置方面也是这个思路。这也符合华为Mate70 Air的技术路径,虽然重量不可避免地来到208g,但是保…

2025-11-14

iPhone17系列销售势头猛 本周国内激活量或冲破1000万台大关
【CNMO科技消息】11月14日,据数码博主爆料称,iPhone17系列国内激活量将于本周突破1000万台。截至11月2日,该系列在国内的激活数量已突破825万台,其中iPhone 17 Pro Max约3…

2025-11-14

京东11.11平板教育品类齐发力 办公游戏平板热销 智能学习设备受青睐
直播渠道同样表现抢眼,联想小新Pro GT、荣誉平板GT2 Pro、小米平板7 Pro获得观众最多青睐。在新兴的闺蜜机品类中,海信、小度添添、小米占据品牌领先地位,海信大白闺蜜机X8 Pro、小度添添闺蜜机…

2025-11-13

iQOO Neo11深度评测:骁龙8至尊版搭配Q2芯片,2K屏+7500mAh续航再掀性能风暴
去年的iQOO Neo10 依靠骁龙8 Gen3与1.5K屏,可谓是在2K价位段打出了一记漂亮的性能铁拳。在《王者荣耀》中,Neo11能稳定144Hz超满帧运行,帧率曲线几乎是一条直线。无论是《王者荣耀》1…

2025-11-13

谷歌入局私有AI计算:融合云端与端侧AI,隐私保护或成行业新标杆
该平台的核心目标是服务 Pixel 10 及后续手机,在严格保障用户隐私的前提下,为 Magic Cue 等功能注入更强大的云端 AI能力,该媒体认为这标志着谷歌在端侧 AI 与云端 AI 的融合上迈出了…

2025-11-12

摩托罗拉Edge 70 Ultra现身跑分平台,处理器型号成谜引猜测
IT之家 11 月 11 日消息,据科技媒体 NoteBook Check 今天报道,摩托罗拉上周刚刚推出 Edge 70 手机(对应国行版联想moto X70 Air),如今种种蛛丝马迹证明这家公司计划进…

2025-11-12

Viwoods AiPaper Reader电纸书来袭:AI互动阅读 6.13英寸墨水屏新体验
IT之家 11 月 11 日消息,据科技媒体 NoteBook Check 今天报道,Viwoods 现已推出 AiPaper Reader电纸书,运行 Android 16 操作系统,机身配备专用 AI …

2025-11-12