
Harness、冻结账本及一键笔记本代码库均托管于 github.com/Travis42/telegraph-test。
基于50篇短文、约1,300道题目的基准测试数据显示,一种名为“Cablese”(电报体)的文本压缩策略能在显著降低Token消耗的同时,保持甚至提升模型间的理解准确率。
跨家族矩阵表现
测试中,“读者”指外国模型根据 GLM-5.3-Flash 的记录作答,“作者”指 GLM-5.3-Flash 根据其记录作答。1
| 模型 | 角色 | 纯文本准确率 | Cablese 准确率 | 恢复比率 (1.00 = 纯文本控制组) | Token 节省率 |
|---|---|---|---|---|---|
| gemma-4-31b | reader | 70.9% | 77.5% | 1.09 | — |
| qwen3.8-27b | reader | 72.3% | 79.4% | 1.10 | — |
| nemotron-3-120b | reader | 76.1% | 76.7% | 1.01 | — |
| gemma-4-26b | reader | 71.8% | 76.9% | 1.07 | — |
| gemma-4-31b | writer | — | — | 1.09 | 40.4% |
| qwen3.8-27b | writer | — | — | 1.10 | 48.9% |
| gpt-5-mini | writer | — | — | 0.99 | 17.7%* |
GLM-5.3-Flash 自身在使用小写指令时实现了 48.4% 的节省率,家族内恢复比率为 1.09。2 矩阵比较未显示纯文本占优,所有恢复比率均处于 0.99–1.10 之间。
条件阶梯测试
针对同一组问题,每次仅改变一个变量进行测试:
| 条件 | 作答模型获取/执行的操作 | 锚定准确率 | 与纯文本控制组的对比 |
|---|---|---|---|
| 短文,纯文本作答 | 完整短文 | 91.5% | 1.00 (参考) |
| 短文,Cablese 作答 | 完整短文,简略语态 | 74.4% | 0.81 |
| └ + 转录为纯文本 | 那些简略答案,展开后 | 78.8% | 0.86 |
| 纯文本记录 | 纯文本摘要 | 75.8% | 1.00 (参考) |
| Cablese 记录 | 压缩后的摘要 | 82.5% | 1.09 |
| 解码记录 | Cablese 记录,重新展开 | 81.6% | 1.08 |
结果显示,包括四个从未见过示例的模型家族在内的下游模型,从压缩记录中回答问题的表现与从纯文本中回答一样好,甚至更好——恢复比率为 0.99–1.10(1.00 表示“与纯文本完全一样好”)。
这种能力并非人为构造,而是存在于模型权重之中,继承自人类在按量计费带宽下书写的历史习惯。关键发现如下:
- 保留结果的解读。 Cablese 记录的阅读效果略优于常规响应(1.09),可能是因为在严格评分标准下,压缩抑制了“照搬记录”式的措辞。
- 通用性。 每个测试过的模型都能做到这一点,但压缩率从 25% 到 49% 不等。这种每模型的差异是可测量的,使用时需予以考虑。
- 轻微的重构成本。 信息重构成本仅在对用户进行个别答案转录时发生。若消费者是模型或记录仅被重新读取,读取比率均 ≥0.99。3
- 存储经济性。 展开操作会返还约三分之一的节省量,因此人类可读的扩展归档成本仍远低于纯文本。
这意味着无需新硬件、无需训练、无需 API 变更,只需一句指令,智能体即可获得近两倍的上下文窗口,或以一半的输出账单完成同样的工作。
何时压缩是“免费”的?
这取决于压缩步骤的位置。如果模型在构思时就进行压缩(Cablese 作答,0.81,部分可恢复至 0.86),需支付“语态税”。但如果在内容确定后进行压缩,进入机器将读取的记录中(1.08–1.09),则无需支付任何费用。
Cablese 应位于“内容确定”和“机器消费”之间,如便签、记忆存储、智能体之间的交接,绝不在模型思考中途使用。
对于禁用推理过程的模型,可以干净地计费压缩。以 gpt-5-mini 为例,其推理是强制性的,Cablese 使其思考难度增加约 3 倍,导致写入成本翻倍。教训是:必须在使用思维可控的模型时进行压缩。
核心结论:
- LLM 账单中昂贵的一半对于机器消费的文本来说是可选开销。 输出 Token 成本通常是输入 Token 的 3–5 倍。对于模型间流量,在任何主要 API 上都可削减一半成本——只需一句指令,无需训练或额外设置(强制推理模型除外)。
- 智能体内存容量几乎翻倍。 以 Cablese 存储便签和摘要,模型在阅读时表现持平或更好。仅在人类查看时才展开回纯文本,归档成本依然低于纯文本。
- 模型选择与指令同样重要。 相同指令下,gemma 记录压缩 40%,Qwen 压缩 49%。可压缩性是每模型特有的属性,在规模化时差异显著。Telegraph Test 可用于评估模型在此类压缩方面的表现。
- 难以被封锁。 这种语态存在于所有测试家族的训练数据中。前沿模型实验室若抑制它,只会将优势转移给仍携带该特性的开源模型。
- 审计性得以保留。 与涌现的智能体协议不同,Cablese 是人类可读的,由惯例固定,并可按需解码,Token 缩减但未丢失审计轨迹。
电报时代:每个字都按量计费
1866 年,发送一条横跨大西洋的新电缆消息需花费 100 美元(仅限十个单词)4。电报公司按单词收费,行业由此成长。当时出现了两种压缩策略:
密码本。 出版商出售庞大的商业密码词典,如 Bentley 的 ABC 电报代码,将商务短语映射到单个代码词。这是一种替换技术,消息以完整散文形式存在,词典为其重命名片段。
Cablese(电报体)。 操作员演变出一种严谨的书面格式,如:“ARRIVE TUESDAY BRING FUNDS STOP CONFIRM WIFE SAILS FRIDAY.” 这种风格在不损失意义的情况下节省了单词,是从媒介成本中涌现出来的。
Token 再次成为按量计费的单词
LLM API 账单本质上是一份电报账单。我们将旧时代的两种策略与现代模型进行了对比测试:
密码本方法:取现有文本,用固定词典中的代码词替换。结果仅节省约 10%,因为大多数散文不具备词典形状,替换无法移除作者已写出的单词,只能重命名。
Cablese(电报体):指示模型:“以电报体撰写完整记录;删除冠词和填充词;缩写;逐字保留所有事实、数字和专有名词——使用小写,而非全大写。”
为何此法在不同模型间有效?
这种语态已存在于权重中,是训练数据的产物。电报电缆、密码本及更广泛的“电报风格”家族(标题新闻、电传打字机风格、笔记、SMS 缩写)都包含在模型共享的语料库中。两点观察支持这一观点:首先,模型能从一句指令中产生流畅、符合惯例的Cablese,无需示例或密码本;其次,跨家族矩阵中的读者即使未看到指令,直接阅读压缩记录也能表现持平。这种共享的零样本流利度表明该惯例潜伏在共享的人类文本中。5
我们不是已经见过 LLM 这样做了吗?
是的。BabelTele(arXiv,2026 年 6 月)证明 LLM 可以将文本编码为紧凑的、非标准的形式(多语言单词片段、符号、表情符号),其他模型能以高保真度恢复(语义保真度 99.5%,长度为原始长度的 27.9%)。此外,研究人员在 Token 预算下运行 LLM 智能体群体时观察到类似现象:GLOSSOGEN 发现预算压力产生了新的通信系统;另一篇论文《从 Token 效率到监管规避》显示智能体群体在效率压力下开发了涌现语言。
其他工作让智能体发明符号语言,在保持稳定准确度的同时削减 Token 3–6 倍,或直接传递原始嵌入向量。
已发布的产品
- Terse (terseai.org):一款为提示词销售“电报压缩”的产品,在输入端基于规则地剥离冠词和代词。其保真度是断言的,而非测量的。
- Caveman (github.com/juliusbrussee/caveman):一个 Claude Code 技能,使模型以简略片段作答。它在 Github 上有超过 10 万颗星。
为什么 Cablese 很重要?
尽管模型可以自行创建约 6 倍的压缩,但涌现的协议通常不稳定、对人类不可读。相比之下,Cablese 是已知标准,更具确定性,可泛化,无需设置或初始协商,且可读、可审计。这两种技术是压缩/审计性前沿上的不同点,工作负载的位置决定了选择。
电报测试:测量模型如何使用 Cablese
测试衡量什么:向模型提供短文及固定问题(日期、姓名、计数),根据原始短文、纯文本摘要、Cablese 摘要或解码后的 Cablese 摘要作答。答案与预期匹配即视为正确。每个分数除以其自身的纯文本控制组分数,因此 1.00 始终意味着“与纯英语完全一样好”。
百分比衡量的是什么:对事实的理解。每篇短文附带约 24 个问题,预期答案可从源文本中提取。模型接收一种呈现方式并用几个词回答。当重叠清除固定的 0.8 阈值时,答案被视为正确。所有比较保持问题和评分者恒定。
为什么纯文本基线不是 100%?纯文本回答得分约为 91%,缺失原因包括严格评分、模糊问题和真正遗漏。由于设计不需要拆分这三者,基线缺失在每个比较中相互抵消。因此,基准测试的主要数字是与各自条件的纯文本控制相比的比率。
比较是配对的,并使用 McNemar 检验进行测试。忽略两者都答对或都答错的问题,只看交换(恰好只有一个条件成功的问题)。倾斜的分配是真实差异的证据。
电报测试回答了关于任何模型的三个问题:
- 它写得有多精简?给定相同的 Cablese 指令,记录比纯文本短多少?
- 其他人能读懂吗?当不同模型家族使用该压缩记录时,准确度是否保持?
- 每种使用的成本是多少?分别测量机器回读和人类可转录的成本。
没有人能在不运行实验的情况下知道这些数字。这就是基准测试的目的:每个新模型花费一下午的计算时间,将该属性转化为表格上的数字,而非民间传说。
存放位置: github.com/Travis42/telegraph-test