8X UTF-8X區域動態表示架構 EN

研究基線 v0.22

一個語義錨點。多種物理表示。

UTF-8 是優秀的交換格式。但「適合作為共同格式」與「適合作為所有內部計算的唯一表示」並不是同一個命題。UTF-8X 把 UTF-8 固定為規範性、可驗證的錨點,再讓儲存、傳輸、搜尋、編輯與模型推論各自採用符合自身成本的可逆表示。

21個版本
211項回歸測試
1,788個校驗檔案
21個測試模組

核心命題

統一語義 統一物理表示

傳統編碼把「一個字元如何表示」定為全域固定關係。這在系統邊界上至關重要,卻在其他地方變成一個隱含假設 —— 同一個語義對象應該在所有區域使用同一種物理形式。UTF-8X 否定的是那個延伸,不是 UTF-8 本身。只要存在穩定錨點與可驗證回復,兩種表示可以位元不同,但可被證明指向同一個序列。

為什麼先做 CJK

多數常用 CJK 字元需要三個 UTF-8 位元組,而真實文件會高度集中在有限的字元、詞組、標點與領域術語上。這種集中正是局部碼表能利用的東西。但設計單位不是國家語言 —— 而是任何可觀測、可分割、可評估的資料區域。

這裡的「區域」指什麼

不是地理。區域可以是語言、書寫系統、文件段落、領域詞彙、系統層級(記憶體、磁碟、快取、網路、索引)、任務(搜尋、編輯、模型輸入、歸檔、串流),或時間帶(熱對話與冷語料)。

AI 不被允許做的事

AI 分析資料並提出策略:怎麼分塊、用哪個 codec、哪份字典、哪些參數。策略接著被序列化、版本化並雜湊。解碼永遠不呼叫模型。

這是硬性的架構界線,不是偏好。一個需要模型「猜回」原文的格式不是無損的 —— 不同模型、不同版本、不同推論環境與浮點實作都有資格給出不同答案。manifest 一旦生成,解碼器只讀固定規格與已驗證的雜湊。即使當初生成策略的模型已經不存在,資料依然可以解碼。

它不是什麼

  • 不是 UTF-8 的替代品,也不提議更動任何標準。UTF-8X 是架在它之上的錨定容器。
  • 不宣稱在壓縮率上贏過通用壓縮器。本站實測:同一語料下純 brotli 明顯更小。
  • 不是 Unicode Consortium 或 IETF 標準。名稱是暫定的,而且絕不可被標示為 charset=UTF-8。
  • 不執行正規化。NFC/NFD/NFKC/NFKD、簡繁轉換與異體字合併都不屬於編碼層。
  • 還沒完成。v0.22 是研究工程基線,明確不是產品。