← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

极简主义的“核弹级”泄露:DeepSeek 闪撤论文背后的空间智能革命

AI/Agent 阅读原文(微信)↗

一场发生在"五一"前夕的深夜闪击战

2026年4月底,正当全球AI开发者准备迎接五一假期时,国产大模型标杆DeepSeek在其官网和 ArXiv 上毫无征兆地发布了多模态技术论文《Thinking with Visual Primitives》。然而,该论文在发布不到 6 小时内便被全网"连夜撤回",相关链接均显示 404。

尽管撤稿迅速,但这份技术报告已被全球各大实验室镜像备份。它之所以引发恐慌式关注,是因为 DeepSeek 第一次系统性地证明了:大模型不仅能"理解"图像,更能像人类一样拥有精准的"空间逻辑推理"能力。这种能力的跃迁,被业内解读为 DeepSeek-V4 正式对标 GPT-5 的"肌肉展示"。

深度技术分析:CSA 机制与视觉原语(Visual Primitives)

这篇论文的核心在于解决了多模态模型长期存在的"幻觉"根源——感知与推理的脱节

1. 核心创新:视觉原语(Visual Primitives)的逻辑内化

传统模型(如 GPT-4o)在识别图像时,是将图片转化为一段模糊的语义描述。而 DeepSeek 引入了**"视觉原语"**概念:

  • 坐标锚定:点(Points)、**框(Bounding Boxes)掩码(Masks)**直接作为模型推理的基本单位,类似于语言中的 Token。
  • Point-to-Reason(边指边想):这是一个范式级的改变。模型在进行思维链(CoT)推理时,每输出一句逻辑,都会同步生成一个空间坐标。例如,在数数时,AI 会在内部逻辑中输出:\"这里有一个杯子 [x1, y1],它旁边是一个苹果 [x2, y2]...\"。这种**"手脑同步"**彻底解决了模型数不清物体、分不清左右的顽疾。

2. 性能怪兽:CSA(Compressed Sparse Attention)机制

为了支撑极高分辨率的图像理解,DeepSeek 祭出了名为CSA(压缩稀疏注意力)的工程杰作。

  • 超高压缩比:论文数据显示,CSA 实现了惊人的7,056 倍图像特征压缩。
  • 按需分配算力:不同于传统全量扫描像素的模式,CSA 允许模型仅对视觉原语指向的"兴趣区域"进行深度计算。这使得 DeepSeek 在处理 4K 甚至更高清图像时,显存占用仅为同类模型的30%

3. 284B 参数的"核威慑"

泄露的论文中多次提及在一个284B(2840亿参数)的 MoE 架构上进行实验。这向外界透露了一个关键信号:DeepSeek-V4 的 Flash 版本已经具备了超越现存所有闭源模型的多模态感知深度。

行业影响:通往具身智能的最后一块拼图

DeepSeek 的这次技术泄露,实际上为具身智能(机器人)自动驾驶指明了道路。

  • 精准操控:如果 AI 能精准地在像素级层面"思考"空间关系,那么指挥机器人抓取不规则物体、进行精细工业质检将变得轻而易举。
  • 成本护城河:如此高效的压缩机制意味着 DeepSeek 再次锁定了全球最低的推理成本,这对所有依赖高频多模态交互的初创公司具有致命的吸引力。

相关文献与参考资料

由于原文已被官方删除,以下是基于社区镜像、缓存及相关技术演进路径的参考列表,建议开发者通过 GitHub 镜像仓库搜索:

  1. 1.DeepSeek 镜像文档 (2026/04):Thinking with Visual Primitives: Embodied Reasoning in Large Multimodal Models.(ArXiv Cached Version: 2604.XXXXV1)
  2. 2.技术演进参考:DeepSeek-V3 Technical Report(2024/12) - 奠定了其 MoE 架构与高效训练的基础。
  3. 3.多模态对比文献:GPT-5 (Internal Preview) vs. Gemini 3.0: The Gap in Visual Reasoning.(AI Index Annual Report, 2026)
  4. 4.相关工程解读:关注公众号LeisureLinux(侧重底层算力与硬件适配分析)及IT 禅悟(侧重商业估值与产业趋势解读)。

总结:DeepSeek 连夜删稿,删掉的是公开的技术文档,删不掉的是国产模型在多模态"空间智能"赛道上已经处于世界顶尖水平的既定事实。

你认为这种"手脑一致"的定位能力,对目前的 AI 绘图、视频生成或者是无人机领域,哪一个的提升会更让你感到震撼?评论区见!

Deepseek v4 依旧是开源界的天花板

DeepSeek 又来炸场了!深度解析新模型 DeepSeek-OCR 2.0:给 AI 装上"带脑子"的眼睛

【转译】11款大模型本地单卡性能横向测评

从对话到进化:Ollama 2026 核心集成的六大 AI 智能体神器

影响力换主权:拆解中国 AI 开源权重的"闪电战"战略

Google DeepMind 论文论证:大语言模型永远不会产生意识

从 AlphaZero 到 AlphaEvolve:AI 算法进化的三个纪元

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)