核心命題
統一語義 ≠ 統一物理表示
傳統編碼把「一個字元如何表示」定為全域固定關係。這在系統邊界上至關重要,卻在其他地方變成一個隱含假設 —— 同一個語義對象應該在所有區域使用同一種物理形式。UTF-8X 否定的是那個延伸,不是 UTF-8 本身。只要存在穩定錨點與可驗證回復,兩種表示可以位元不同,但可被證明指向同一個序列。
為什麼先做 CJK
多數常用 CJK 字元需要三個 UTF-8 位元組,而真實文件會高度集中在有限的字元、詞組、標點與領域術語上。這種集中正是局部碼表能利用的東西。但設計單位不是國家語言 —— 而是任何可觀測、可分割、可評估的資料區域。
這裡的「區域」指什麼
不是地理。區域可以是語言、書寫系統、文件段落、領域詞彙、系統層級(記憶體、磁碟、快取、網路、索引)、任務(搜尋、編輯、模型輸入、歸檔、串流),或時間帶(熱對話與冷語料)。
AI 不被允許做的事
AI 分析資料並提出策略:怎麼分塊、用哪個 codec、哪份字典、哪些參數。策略接著被序列化、版本化並雜湊。解碼永遠不呼叫模型。
這是硬性的架構界線,不是偏好。一個需要模型「猜回」原文的格式不是無損的 —— 不同模型、不同版本、不同推論環境與浮點實作都有資格給出不同答案。manifest 一旦生成,解碼器只讀固定規格與已驗證的雜湊。即使當初生成策略的模型已經不存在,資料依然可以解碼。
它不是什麼
- 不是 UTF-8 的替代品,也不提議更動任何標準。UTF-8X 是架在它之上的錨定容器。
- 不宣稱在壓縮率上贏過通用壓縮器。本站實測:同一語料下純 brotli 明顯更小。
- 不是 Unicode Consortium 或 IETF 標準。名稱是暫定的,而且絕不可被標示為 charset=UTF-8。
- 不執行正規化。NFC/NFD/NFKC/NFKD、簡繁轉換與異體字合併都不屬於編碼層。
- 還沒完成。v0.22 是研究工程基線,明確不是產品。