智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

蚂蚁百灵Ling-3.0-tiny开源:轻量高效架构,多设备本地部署新选择

2026-08-12来源:快讯编辑:瑞雪

蚂蚁百灵大模型近日宣布开源一款轻量级混合推理MoE模型——Ling-3.0-tiny,该模型以7.9亿总参数和1.3亿激活参数的精简设计,在保持高效推理能力的同时,显著降低了本地部署门槛。模型同步发布BF16、FP8和INT4三个精度版本,已在DGX Spark、MacBook、Mac mini等设备上完成验证,覆盖从专业级AI工作站到个人电脑的多样化场景。

在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny以25分的综合成绩紧追260亿参数的Gemma-4-26B-A4B(仅差1分),同时超越gpt-oss-120B(high)、Qwen3.5-9B等知名模型。其核心优势在于通过稀疏MoE架构实现参数效率与计算成本的平衡:每个Token仅激活8个路由专家和1个共享专家,在保持长上下文建模能力的同时,将峰值内存占用控制在8.34GiB(8K上下文长度)。

该模型采用3:1的KDA-MLA混合注意力架构,即每4层中包含3层月之暗面自研的KDA(Kimi增量注意力)和1层DeepSeek自研的MLA(多头潜在注意力)。这种设计使模型在代码生成、数理推理、指令遵循等任务中表现均衡,尤其在Agent能力方面表现突出——其Artificial Analysis Agentic Index得分达16,高于310亿参数的Gemma-4-31B模型。实测显示,Ling-3.0-tiny的输出速度超过160 tokens/s,生成500个Token的端到端用时约18秒(含思考过程)。

本地部署能力是Ling-3.0-tiny的另一大亮点。在FP8精度下,模型于DGX Spark上的推理吞吐量达100-105 tokens/s,两路并发时聚合吞吐提升至161 tokens/s;在M4 Pro MacBook上,首Token响应时间低于100毫秒,可流畅运行代码辅助、文档处理等任务。开发者在一台36GB内存的MacBook Pro上复现了Infinite Wiki(无限百科)的核心功能:用户点击词语即可生成上下文解释卡片,支持多层知识下钻,全程无需云端调用,数据完全留存本地。

针对不同硬件环境,Ling-3.0-tiny提供差异化部署方案:BF16版本适合对精度要求高的研究场景;FP8版本在效果、速度和资源占用间取得平衡;INT4版本则进一步压缩资源需求,适用于算力有限的边缘设备。例如,在Mac mini上,模型可作为常驻式本地智能节点,提供划词翻译、语法纠错等离线服务,响应延迟低至毫秒级。

技术团队透露,后续优化将聚焦于提升长尾知识覆盖的准确性、增强复杂工具调用的稳定性,并完善FP8/INT4版本的硬件适配与部署文档。目前,模型代码已通过Hugging Face和ModelScope平台开源,开发者可根据需求选择不同精度版本进行二次开发或直接部署。

台积电5.5倍光罩尺寸CoWoS良率近99%,先进SoC验证加速迈向系统级
IT之家 8 月 12 日消息,台积电先进封装技术暨服务副总经理何军昨日在 OCP APAC 峰会上表示,台积电已量产的 5.5 倍光罩尺寸CoWoS 先进封装技术可在部分产品上达到 99% 的良率。 ▲ …

2026-08-12

2026年5000元价位手机怎么选?这三款“零差评”旗舰闭眼入不踩雷
讲真的,这三款机型不管是性能、影像还是细节堆料,都堪称同价位的卷王。老实讲,不管你怎么放大裁切,照片都清晰得能数毛,哪怕是录制8K视频也是手到擒来,完全是一台口袋里的微单。无论是想要轻薄手感与极致像素,还是喜…

2026-08-12

“5G+工业互联网”赋能智慧园区:开启数字化智能化协同化运营新篇章
“5G+工业互联网”智慧园区功能,是以5G网络为基础连接能力,以工业互联网平台为数据和应用中枢,将园区内的人员、车辆、设备、能源、生产系统、安防系统及基础设施进行统一连接和管理。 相比传统智慧园区,“5G+工…

2026-08-12

谷歌Pixel 11 Pro预热视频亮相,2026年8月13日发布会揭晓更多惊喜
IT之家 8 月 11 日消息,谷歌官方现已在 YouTube 平台发布 Pixel 11 Pro 手机的预热视频,展示新机的外观设计。该机搭载 Tensor G6 处理器和 Titan M3 安全协处理器…

2026-08-12

边缘AI崛起:传统AI数据中心将何去何从?混合部署成新趋势
在许多场景下,企业很可能同时投资两者:将数据极度敏感或对超低延迟有要求的工作负载部署在边缘,同时继续在集中式环境中运行其他模型。企业更可能同时投资两者:对延迟要求极高或数据极度敏感的工作负载部署在边缘,其他…

2026-08-12