連續自迴歸語言模型 CALM 技術解析

研究單位:騰訊微信 AI × 清華大學 核心命題:傳統大模型逐字(Token-by-token)生成的效率已觸及物理天花板。CALM 將離散 Token 轉換為連續向量(Continuous Vectors),將生成步數縮減至原來的 1/K 為大語言模型的擴充開闢了全新的效率路徑。

https://arxiv.org/html/2510.27688v1

https://shaochenze.github.io/blog/2025/CALM/

https://github.com/mahmoodlab/clam

一、背景與動機:離散生成的效率瓶頸

現有的大型語言模型(LLMs)都依賴「逐字預測」的舊範式。每個 Token 都需要進行一次完整的前向計算,當序列變長時,計算成本呈線性甚至平方級增長。

儘管文本表徵已經從字符集進化到子詞集(如 BPE),但這種「離散表示」已觸及物理極限:

  • 詞表膨脹的詛咒:為了涵蓋更多語義,詞表規模從 32,000 膨脹至 256,000,導致最後一層的計算與記憶體成本飆升。
  • 資訊密度極低:每個離散詞元僅攜帶約 15–18 bit 的資訊,潛力已然耗盡。模型擁有龐大的算力,卻被困在一次只能預測一個低資訊量 Token 的勞力密集工作中。

結論:必須轉向高維連續路線,從根本上改變生成機制。

二、CALM 核心思路與原理

基本機制:利用自編碼器(Autoencoder)將 K 個離散 Token 壓縮為「一個」高維連續向量。這使得模型的序列長度從 T 降至 T/K,生成步數直接縮減為原來的 K 分之一。

本質:以更高的「語義頻寬」(Semantic Bandwidth)換取更少的生成步驟,實現算力與速度的跨越式突破。

傳統範式 vs. CALM 連續模型

維度傳統離散模型 (Discrete)CALM 連續模型 (Continuous)
擴容方式詞表指數級膨脹,算力爆炸增加向量維度,算力平滑增長
計算目標從數十萬詞中選一個機率在連續空間中直接預測精確座標
序列長度極長序列 T短序列 T/K,步數銳減

通俗比喻:傳統生成就像在「擁有數十萬個抽屜的倉庫中盲目尋寶」,而 CALM 則是「直接繪製高維座標」,徹底擺脫了詞表膨脹的物理限制。

三、CALM 的四大技術支柱

  1. 高保真自編碼器 (Autoencoder) 將 $K$ 個離散詞元壓縮為 128 或更高維度的連續向量。在約 7500 萬參數的輕量級開銷下,重構準確率高達 > 99.9%。它是實現離散與連續間無損轉換的基石。
  2. 能量生成頭與無似然框架 摒棄了傳統的 Softmax 機率計算,在連續空間中直接透過迴歸(Regression)預測下一個目標向量,無需像擴散模型(Diffusion)那樣進行數十上百次的去噪迭代,實現單步生成
  3. 連續空間魯棒性三大魔法
  • 變分正則化 (Variational Regularization):熨平潛空間(Latent space)中的褶皺與斷層。
  • KL 裁減 (KL Clipping):防止潛空間維度嚴重塌陷。
  • 雙重 Dropout:提供額外的抗噪能力。 這三者共同構建了平滑且富有彈性的高維地形,確保微小的生成偏差不會導致亂碼。
  1. 無機率評估體系 BrierLM & 溫度控制
  • Brier 評估 (Brier Score):傳統的困惑度 (Perplexity) 在連續模型中失效。CALM 引入了無似然的 Brier 分數(準確率 − 碰撞率)作為專屬標尺,與交叉熵損失呈極強負相關。
  • 黑盒溫度採樣:因為沒有傳統機率分母可調,CALM 以「批量大小 N」(Batch Size) 作為新型的溫度旋鈕。N 小則低溫高確定性,N 大則高溫高多樣性。搭配拒絕採樣機制,效果與傳統溫度調節高度一致。

四、流程總覽

整個運作閉環如下,速度遠超傳統的逐字生成:

  1. 輸入:離散 Token 序列。
  2. 壓縮:編碼器將每 K 個 Token 壓縮為 1 個連續向量。
  3. 處理:Transformer 骨幹網絡在極短的連續向量序列上進行深層注意力計算。
  4. 預測:生成頭直接單步預測出下一個目標連續向量。
  5. 還原:解碼器將預測出的連續向量無損還原為 K 個離散 Token。

五、實驗結果與性能優勢

  • 極致的算力節省:在 K=4 的設置下,訓練算力降低 44%,推理算力降低 34%,生成步數從 T 驟降至 T/4。
  • 打破「更大必定更耗算力」的認知:CALM 參數達 3.71 億(略大於對照組),卻能在打平甚至超越基線性能的情況下,消耗更少的整體算力。
  • 全新縮放維度「資訊密度」:引入了全新的 Scaling 維度。當語義頻寬提高時,CALM 能以更低的算力達到更高的 Brier 分數,擊穿了原有的算力-性能邊界。
  • 「後積薄發」的訓練動態:呈現特殊的訓練曲線。模型在 20 萬步後性能會迎來急劇上升並超越傳統模型,顯示掌握高維連續規律需要前期積累,但後續爆發力極強。

六、總結與展望

CALM 成功構建了從離散到連續的完整基礎設施,其組件協同形成了一個強大的生態閉環: 魯棒自編碼器 (高保真壓縮) → 頻寬倍增 (步數縮短至 1/K) → 單步生成引擎 (極速推理) → 拒絕採樣 (多樣性可調) → BrierLM (公正尺標)。

這項研究證明了語言模型的未來可能不在離散的像素與詞表中,而是在連續的波瀾裡。這為未來的多模態連續生成強化學習整合以及終端設備部署開啟了全新的紀元。

開放資源:相關論文與程式碼已在 GitHub 開源,標誌著大語言模型從離散向連續遷徙的開端。