智能日报
业界资讯 智能手机 电脑硬件 平板电脑 智能手表 智能家电 耳机音频 笔记本 热点资讯

DeepSeek开源3B小模型DeepSeek-OCR,以“光学压缩”探索文本处理新路径

2025-10-21来源:快讯编辑:瑞雪

DeepSeek 团队近日开源了一款名为 DeepSeek-OCR 的 30 亿参数模型,通过创新的“光学压缩”技术,在保持高准确率的同时大幅降低文本处理所需的计算资源。该模型将视觉模态引入文本信息处理领域,为解决大语言模型(LLM)处理长文本时的计算瓶颈提供了新思路。

传统 LLM 在处理长文本时面临计算复杂度平方级增长的难题——序列长度每增加一倍,算力消耗将呈四倍增长。DeepSeek-OCR 的突破性在于将文本转换为图像进行压缩处理:通过视觉模态的“光学压缩”,模型用更少的视觉 Token 承载相同信息量。实验数据显示,该技术可实现 7-20 倍的 Token 压缩率,在 10 倍压缩下 OCR 准确率超过 97%,即使压缩 20 倍仍能保持 60% 准确率。

模型架构由编码器 DeepEncoder 和解码器 DeepSeek3B-MoE 组成。DeepEncoder 采用 SAM-base(8000 万参数)与 CLIP-large(3 亿参数)的串联结构,前者负责局部特征提取,后者进行全局信息整合。中间嵌入的 16× 卷积压缩器可将输入图像的 Token 数量大幅削减,例如 1024×1024 图像经处理后,进入全局注意力层的 Token 从 4096 个降至数百个。这种设计使模型既能处理高分辨率输入(支持 512×512 至 1280×1280 多分辨率),又有效控制了内存开销。

解码器部分采用混合专家(MoE)架构,64 个专家中激活 6 个,配合 2 个共享专家,实际激活参数约 5.7 亿。这种设计使 30 亿参数规模的模型兼具 300 亿参数模型的表达能力与 50 亿参数模型的推理效率。在 OmniDocBench 基准测试中,使用 100 个视觉 Token 的 DeepSeek-OCR 表现优于 GOT-OCR2.0(每页 256 个 Token),使用 800 个 Token 时则超越 MinerU2.0(平均每页超 6000 个 Token)。

数据构建方面,团队从互联网收集了 3000 万页多语言 PDF 文档(中英文占 2500 万页),通过粗标注(fitz 提取)和精标注(PP-DocLayout 等模型生成)结合的方式构建训练集。针对小语种数据,创新采用“模型飞轮”机制:先用版面分析模型检测文本区域,再用生成的数据训练 GOT-OCR2.0,最后用训练好的模型标注更多数据,形成数据生成闭环。模型还整合了 300 万条 Word 文档数据以提升公式识别能力,以及 2000 万条场景 OCR 数据(中英文各半)增强自然图像解析能力。

该模型不仅具备基础 OCR 功能,更实现了对复杂图像的结构化解析。通过统一提示词,可自动提取金融图表数据、转换化学结构式为 SMILES 格式、解析几何图形并生成密集描述。在 STEM 领域(如化学、物理、数学),这种能力可显著提升符号和图形密集型场景的处理效率。

研究团队还提出了一个颇具前瞻性的设想:通过光学压缩模拟人类遗忘机制。具体方案是将历史对话内容渲染为图像,通过逐步压缩图像尺寸实现信息模糊化——近期内容保持高分辨率,久远内容自然淡化。这种设计理论上可支撑“无限上下文”处理,使模型在保持近期上下文高保真的同时,降低历史上下文的计算资源占用。

目前,DeepSeek-OCR 已开源原生分辨率的 Tiny(64 Token)、Small、Base、Large 四档模式,以及动态分辨率的 Gundam 模式。在实际生产环境中,单块 A100-40G 显卡每日可生成超 20 万页训练数据,20 个节点(160 块 A100)的集群日处理量可达 3300 万页。团队强调,当前成果仅是起点,后续将开展数字-光学文本交替预训练、“大海捞针”测试等系统性研究,以全面验证光学压缩技术在上下文处理中的潜力。

OPPO Find X9系列首销引热潮:追光红热销 哈苏套装秒罄Pro版占比超六成
其中,Pro版的热度居高不下,追光红配色更是备受消费者欢迎,甚至一些男性客户也选择了该配色,这在手机行业销售中较为少见,也进一步突显了OPPOFind X9系列在设计上的独特魅力和对不同消费群体的广泛吸引力…

2025-10-23

2025旗舰机优选:荣耀Magic8系列性能影像双优,成高端市场新宠
从性能表现到AI体验,再到影像与设计,Magic8系列用实际体验证明了它为何能被列为“最好旗舰”的代表。更重要的是,Magic8在手感上做了细腻优化,机身弧线与掌心贴合,带来更舒适的握持体验。对那些追求稳定性…

2025-10-23

结构力学测试龙头东华测试:业绩稳增,布局机器人赛道谋新发展
据了解,东华测试是国内领先的结构力学性能研究和电化学工作站整体解决方案企业,前身为成立于1993年的靖江东华测试技术开发有限公司,2012年在深交所成功上市,其产品广泛应用于国内航空航天、重大装备、大型建筑…

2025-10-23

4999元起!努比亚Z80 Ultra:影像性能双巅峰的诚意之作
努比亚还把红魔的CUBE擎天游戏引擎直接下放到了这台影像旗舰上,可以根据不同游戏场景智能调度性能,既能保持满帧运行,又能控制功耗。 4999元起的价格放在现在的旗舰市场,不算便宜,但考虑到影像系统和红魔级游…

2025-10-23

华为HarmonyOS 6升级亮点抢先看:新增14项功能,性能较鸿蒙4提升40%
【CNMO科技消息】近日,有数码博主曝光了华为HarmonyOS6操作系统增加的功能亮点和升级,其中包含一键生成视频和AI防诈骗等功能。在HarmonyOS 4升级HarmonyOS 6准备页面,提及用外部…

2025-10-22

性能旗舰之争:荣耀Magic8凭软硬件协同优势成今年热门之选
荣耀Magic8的影像系统结合AI算力,在长焦、夜景、人像等场景中都有显著提升。 对于正在考虑入手一款顶级旗舰的用户而言,荣耀Magic8无疑是今年最值得关注的答案——在众多高性能机型中,它以稳、快、智的综合…

2025-10-22

OpenAI首款浏览器Atlas来袭:AI整合新体验,实测感受抢先看
AI 协助功能:在任何打开的文本输入框中输入内容时,ChatGPT 能提供实时修改建议和智能补全,帮你更高效地码字Agent(代理)模式:能让 ChatGPT 在浏览器中自主完成多步骤任务从今天开始,ma…

2025-10-22

余承东微博官宣:华为路由X3Pro 11月登场,艺术外观搭配强劲性能
紫金财经10月21日消息 华为常务董事、终端BG董事长余承东在微博上揭晓了华为路由X3Pro,将于11月正式上市。 华为路由 X3 Pro 主体呈圆柱形,上半部分是透明的,下半部分渐变熏黑,呈现出“日照金山…

2025-10-22

中国核聚变领域迎突破:最大制冷功率氦制冷机成功启机并稳定运行
IT之家 10 月 21 日消息,据合肥综合性国家科学中心能源院消息,该院孵化企业河南中科清能科技有限公司 (简称“中科清能”) 研发制造的3kW@4.5K 氦制冷机近日在合肥一次启机成功,截至 2025 …

2025-10-22

iQOO 15性能旗舰登场:四款配色+顶级配置,4199元起售引爆手游市场
参数规格上,第五代骁龙8至尊版处理器采用的是目前现阶段制程工艺最成熟、性能最稳定的台积电3nm,处理器部分的话使用了第三代QualcommOryon CPU架构,主频为4.6GHz,性能核主频为3.62GH…

2025-10-22