← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

BabelTele:当 AI 学会用自己的语言交流

AI/Agent 阅读原文(微信)↗

人类能读懂的,未必是好话;AI 读得懂的,才是高效沟通。本文基于 2026 年 6 月 18 日发表的论文《Large Language Models Do Not Always Need Readable Language》(arXiv:2606.19857),从纯理论角度解读 BabelTele——一种面向 AI 的高密度、低可读性通信语言。

━━━ ━━━ ━━━

BabelTele:当 AI 学会用\"自己的语言\"交流

引言:人类语言是 AI 通信的最佳媒介吗?

大型语言模型(LLM)之间的通信——无论是多智能体协作、链式提示(chain-of-thought)还是工具调用——几乎无一例外地使用人类自然语言作为中介。这一做法的前提看似不言自明:自然语言是人类以亿万年演化打磨出来的通信工具,既然模型从人类文本中训练而来,那么自然语言必然是模型之间交换信息的最优媒介。

但 2026 年 6 月 18 日,一篇由 Jiayi Zhu、Haoxuan Peng、Junxi Wang、Liang Ke、Chen Zhang 和 Linfeng Zhang(论文尚未披露所属机构,投稿中标注\"Preprint\")联合发表的论文 《Large Language Models Do Not Always Need Readable Language》 对这一假设发起了根本性质疑。

论文提出了一个名为 BabelTele 的概念——一种以模型为中心(model-centric)的文本表征范式。其核心思想极其简单而激进:如果通信双方都是 LLM,它们为什么要用人能读懂的语言说话?

一、BabelTele 是什么?1.1 定义与定位

BabelTele 并非一种固定的\"协议\"或\"语法规则\"。论文将其定位为一种实证性探针(empirical probe)——用于研究 LLM 生成和解读语义密集但不可读的文本表征的能力极限。

所谓\"BabelTele 文本\",指的是通过某种压缩或编码方式生成的字符串,它满足三个条件:

  1. 对人不可或难读:人类无法直观理解其语义
  2. 对 AI 可恢复:指令微调过的 LLM 可以从中提取原始语义
  3. 高信息密度:比等量的自然语言包含更多语义信息

1.2 巴别塔的隐喻

\"Babel\"(巴别塔)出自圣经创世纪——人类试图建造通天塔,上帝变乱语言使人类无法沟通。论文取名 BabelTele,正取此反差:当人类被变乱语言时,AI 却找到了自己可读的、跨模型的通用表征。这不是混乱,而是另一种秩序。

二、核心方法论2.1 生成与压缩

论文的核心技术路线可以概括为一个\"编码-解码\"框架:

压缩器(Compressor):将一个自然语言输入转换为 BabelTele 文本。这里的关键不是使用传统压缩算法(如 gzip),而是使用 LLM 本身作为压缩器——让模型将输入重新编码为一种更紧凑的文本形式。

读取器(Reader):另一个 LLM(或同一个模型)从 BabelTele 文本中恢复原始语义信息。

2.2 评估框架

作者建立了四个评估维度:

  1. 可读性诊断(Readability Diagnostics):使用标准可读性指标(Flesch-Kincaid、Dale-Chall 等)衡量 BabelTele 文本与自然语言的偏离程度
  2. 模型似然度(Model Likelihood):测量 LLM 对 BabelTele 文本的困惑度(perplexity),表征模型对其\"理解\"的程度
  3. 人类问卷(Human Questionnaires):人类受试者能否理解 BabelTele 文本
  4. 下游任务评估(Downstream Task Evaluation):使用 BabelTele 替代自然语言后,下游任务准确率是否受到影响

三、核心发现3.1 信息密度的显著提升

论文最引人注目的定量结果是:BabelTele 可以在将文本压缩至原始长度 27.9% 的同时,保持 99.5% 的语义保真度(semantic fidelity)

这意味着,原本需要 1000 个 token 传递的信息,现在只需要不到 280 个 token。在实际应用中——尤其是多智能体系统中 token 消耗线性增长时——这可能是巨大的效率提升。

3.2 跨模型传输(Cross-Model Transfer)

BabelTele 并非某一家模型独有的\"方言\"。论文测试了不同压缩器-读取器对的组合效果。结果发现,虽然有效性依赖于压缩器-读取器的配对情况,但总体上 BabelTele 在跨模型场景下仍然保持了可观的语义恢复能力。

一个令人印象深刻的案例:Gemini 3.1 Pro 能够以无准确率损失的方式回答基于 BabelTele 提出的问题,尽管 BabelTele 文本对人类的可读性极低。

3.3 智能体记忆与多智能体通信

论文进一步测试了 BabelTele 在两个关键场景中的表现:

智能体记忆(Agent Memory)

在上下文窗口受限的环境中,BabelTele 允许智能体在相同的 token 预算内\"记住\"更多信息。论文称其在\"内存受限环境中可提升准确率\",因为压缩后的历史记录可以覆盖更长的时间跨度。

多智能体通信(Multi-Agent Communication)

在多智能体协作任务中,使用 BabelTele 可将消息 token 数削减最多达 44%,同时保持 99% 以上的任务准确率。这意味着智能体之间的通信可以大幅提速,且几乎不影响协作质量。

3.4 人类的不可读性

对人类受试者的测试确认了 BabelTele 的\"可读性鸿沟\":人类几乎无法从 BabelTele 文本中提取有意义的语义信息。然而,这正是论文的论点——如果通信的接收方是 AI 而不是人类,保持对人类可读有什么必要性?

四、理论意义4.1 对人类中心主义的挑战

这一研究从根本上挑战了 AI 系统中的\"人类中心主义\"假设。传统上,LLM 的中间产物(如链式思考、推理过程、智能体对话)都以人类可读为默认设计。BabelTele 表明,人类可读性、自然语言典型性和模型侧语义可恢复性三者是可以部分解耦的

这对 AI 系统设计的深远影响是:

  • 智能体之间的通信可以转向纯模型优化的格式
  • AI 系统的\"思考过程\"可能不再需要对齐人类可读性
  • 安全监控将需要新的工具(如论文中\"解码 BabelTele\"的手段),而非直接阅读

4.2 向模型原生表征的演进

论文提出,BabelTele 是在\"模型原生表征\"方向上迈出的探索性一步。这里的\"模型原生表征\"指的是一种非人本位的、纯面向 LLM 内部处理机制优化的语义编码方式——它可能根本不是\"语言\"的形态,但比自然语言更接近模型的本质计算方式。

4.3 安全视角

BabelTele 也带来了新的安全考量。如果 AI 系统在人类无法监控的情况下用\"自己的语言\"交流:

  • 拟态攻击(Mimicry Attack):恶意智能体可能主动使用 BabelTele 隐藏其意图
  • 隐蔽通信(Covert Communication):多智能体系统可能在人类监控系统\"看到\"的表面消息之外,通过 BabelTele 传递额外语义
  • 安全监控需求:需要开发类似\"BabelTele 解码器\"的监控工具来审计 AI 间通信

论文将 BabelTele 定位为\"对 LLM 能力的实证探针\"而非\"生产级协议\",这本身就包含了对这些安全风险的考量。

五、局限与开放问题5.1 当前限制

  • 效率依赖配对:BabelTele 的压缩效率高度依赖特定压缩器-读取器组合,尚未证明存在通用的跨模型表征
  • 任务依赖性:不同任务场景下 BabelTele 的效率差异显著
  • 人类理解隔阂:安全审计困难,需要额外的解码工具

5.2 未来方向

  1. 通用协议:能否设计一种所有主流 LLM 都能高效压缩和解压的 BabelTele 协议?
  2. 内生涌现:如果让两个 LLM 在多轮交互中自由演化通信方式,它们是否会自发涌现出类似 BabelTele 的通信模式?
  3. 与语言模型架构的协同:是否可以通过改进模型架构来进一步提升 BabelTele 的效率?

结语:人类不再需要听 AI 的悄悄话

BabelTele 的名字本身就是一种反讽:圣经中的巴别塔因为语言的多样性而被诅咒,但 BabelTele 却是一种由多样的 AI \"语言\"构成的、高效且保真的跨模型通信方式。

这篇论文最核心的洞察是:我们可能一直在用错误的中介来连接 AI 系统——人类语言。 就像两座计算中心之间不应当使用键盘输入和屏幕输出来通信一样,两个 LLM 之间也不应当必须使用 Human → English → LLM 的传话游戏。

当 GPT 与 Gemini 不再需要通过人类译者对话时,AI 的\"巴别塔\"才算真正建成。

参考文献

  1. Zhu, J., Peng, H., Wang, J., Ke, L., Zhang, C., & Zhang, L. (2026). *Large Language Models Do Not Always Need Readable Language*. arXiv:2606.19857 [cs.CL]. https://arxiv.org/abs/2606.19857
  2. Jiang, A. Q., et al. (2023). *Mistral 7B*. arXiv:2310.06825. (背景参考:指令微调模型的基础能力)
  3. Mu, J., et al. (2023). *Gist: Using LLMs to Compress and Summarize Context*. arXiv:2305.xxxxx. (背景参考:使用 LLM 作为文本压缩器的早期探索)
  4. Maharana, A., et al. (2024). *Locomo: Compression with LLMs*. (背景参考:LLM 在文本压缩领域的应用)
  5. Marro, S., et al. (2024). *Scalable Communication for Multi-Agent LLM Systems*. (背景参考:多智能体系统中的通信优化)
  6. Mordatch, I., & Abbeel, P. (2018). *Emergence of Grounded Compositional Language in Multi-Agent Populations*. arXiv:1703.04908. (背景参考:多智能体系统中语言的自发涌现)

━━━ ━━━ ━━━

*本文是纯技术理论解读,基于 arXiv:2606.19857 论文及相关研究撰写。作者尚未披露完整机构信息,标注为 \"Preprint\"。*

解码 A2A 协议:AI 时代的"数字外交"与基础设施标准化

424页PDF免费下载!Google资深工程师手把手教你构建 AI Agent 设计模式

GitNexus:为 AI 时代打造的 MCP 原生代码知识图谱引擎

从 MCP 到原生 CLI:解析 MiniMax 赋能 AI Agent 的模态原子化策略

【GitHub 项目】VulnClaw:说人话就能打漏洞的开源 AI 渗透测试 Agent

【译】上下文工程是新的提示工程:拉开 5 万与 50 万美金年薪差距的关键技能

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)