重言 Re-Sinitic:形聲為什麼沒有湧現 - 研究日誌(一)
這是「重言 Re-Sinitic」的第一篇研究日誌。專案還在探索階段,S3 才剛跑起來、confirmatory run 還沒做——這篇記的是目前為止量到的東西,不是最終結論。後面應該還會有第二集、第三集。
這個專案在問什麼
固定漢語的語意結構(meaning space)當控制變數,從零重新演化語言的表達層——音韻與書寫。問一件具體的事:
形聲——一個字由表義部件加表音部件組成——是不是雙通道語言系統的必然收斂解?如果不是,它需要什麼前提?
文獻上的空白很具體:現有的符號湧現研究全部停在「圖畫 → 抽象符號」,沒有人碰過形音義三元結構。
「做完」長什麼樣:S1 離散語音層跑出可信的音系 → S2 書寫層檢定形聲是否湧現 → S3 檢定方言壓力的作用,用 2×2 設計分辨「同音壓力」與「方言壓力」哪個才是必要條件。
主結論(先講重點)
在本研究測試的所有條件下,形聲都沒有湧現。
兩種理論上應該產生它的壓力各自產生了「一半」,而且是相反的一半:同音壓力讓語音資訊進入字形,方言壓力讓語音資訊退出字形。兩者都不產生「分工」。
形聲的定義性特徵不是「字形帶語音資訊」,是字形可分解為兩個功能不同的部分。這裡的操作化是雙重分離——遮蔽語意路只傷語意 Reader、遮蔽語音路只傷語音 Reader。那個交互作用在任何條件下都沒有變正。
S1:語音層可以從零演化出來
226 個詞、10 子音 8 母音、訊息長度 12、CV 音節模板、一個 D3 混淆通道。最佳設定下溝通成功率 72%、topsim 0.088–0.158、有同音詞的詞只有 1.3%。
一個值得記的量測錯誤:齊夫簡短律(M2,越常用的詞越短)的效果量一開始被低估了大約五倍。原因是訊息長度有硬上界,而 65–76% 的詞卡在那個上界——這是設限依變數(censored dependent variable),該用 Tobit 迴歸而不是 OLS。用 OLS 會把斜率往零壓,看起來效應很弱,其實是量測方式本身在說謊。
S2:同音壓力有門檻,但門檻之後走向拼音化
6 個劑量 × 3 種子,自變數是湧現的同音率(0.013 → 0.496),結果變數是「主力 − 同格位純表意基線」的聲符式共用效果量。
同音率 < 0.2(n=12) 平均 −0.028 ± 0.096 t = −1.00 ← 沒有效應
同音率 > 0.2(n=6) 平均 +0.494 ± 0.207 t = +5.84 ← 強效應
是門檻,不是斜坡:純門檻模型 R² = 0.775 勝過純線性的 0.730,兩者一起放進模型時只有門檻項活下來。
但門檻之後長出來的不是形聲。隨劑量升高:
| 趨勢 | |
|---|---|
| 聲符純度 | 0.054 → 0.178(上升) |
| 形符純度 | 0.120 → 0.011(崩塌) |
| 雙重分離 | +0.002 → −0.038(更負) |
字形越來越像在編碼發音,而不是分化成「一半表義、一半表音」。那是拼音化的方向,不是形聲化的方向。
S3:方言壓力讓 Writer 放棄語音路,而不是把它隔離出來
3 種子 × 6 劑量,自變數是湧現的跨子群語音距離 D(0 → 0.556)。
| 係數 | t 值 | 架構書 §5.1 的預測 | ||
|---|---|---|---|---|
| 形符純度 ~ D | +0.011 | +0.13 | 為正(形符強化) | ✗ |
| 聲符純度 ~ D | −0.124 | −2.62 | 為負(聲符退化) | ✓ |
| 消融損失 ~ D | −0.176 | −5.41 | — | — |
最強的訊號是消融:遮掉語音路造成的損失隨 D 單調下降,在最高劑量甚至變負——那條路已經是純粹的噪音,遮不遮都無所謂。
跨方言壓力不會讓書寫系統重組成形符加聲符,它讓 Writer 逐步、完全地放棄語音通道。形符純度沒有上升,是因為語意路本來就在做全部的工作,沒有東西可以「強化」。
為什麼沒有湧現:一個可檢定的假設
三個階段的結果指向同一件事:系統從來沒有理由「同時」使用兩條通道。它總是選一條——同音壓力下選語音,方言壓力下選語意。
分工要划算,必須有某種力量讓「兩條各做一半」勝過「一條做全部」。本研究的設定裡沒有那種力量,而最可能的缺項是:
詞表太小。 226 個詞、每字 6 筆畫。在這個規模上「背下來」永遠比「發展出系統性」便宜。真實漢字系統面對的是數千字,而可分解性的收益隨詞表規模超線性成長——形符讓你猜出沒學過的字的意思,聲符讓你猜出它的音。那個收益在 226 個詞上幾乎為零。
這個假設可檢定:把詞表放大一個數量級,看雙重分離會不會轉正。成本是標註,不是算力——而那正是目前最貴的資源。
其他候選(依可能性排序):
- 缺少習得成本。 模型每一代都從零學,學習成本沒有進入損失函數。真實文字系統的壓力有一大塊來自「下一代要學得會」。
- 書寫成本被證實只驅動崩潰,不驅動符號化。 在這個規模上,Reader 只有 15–26% 準確率時,任何筆畫成本都會贏過溝通收益。
這些結論有多硬
老實講:
| 狀態 | |
|---|---|
| 探索 / 確認 | 全部是探索階段(train 226 詞)。heldout 102 詞從未載入 |
| pre-registration | 2026-08-23 凍結,含 S1/S2/S3 的完整分析計畫 |
| 種子 | 每個劑量 3 個(prereg 要求確認階段要 5 個) |
| 詞表 | 單一詞表,單人標註。字形盲測顯示語意場 97.2% 可從語意單獨重建 |
| 最大的統計弱點 | 同音率與溝通成功率共線,r = −0.954。「形聲跟著同音走」這個判定靠「係數消不消失」成立,係數大小本身不可解讀 |
| 最大的設計弱點 | 詞表規模(見上) |
(附)量到看起來正常,其實在說謊的數字
過程中修掉的量測錯誤,每一個都會給出「看起來合理」的錯誤數字:
- 同音率一開始用詞對當分母算——25425 對裡只有 107 對同音,算出 0.005,但實際上 30% 的詞都有同音詞。分母選錯,整個數字的意思就變了。
- 形聲效應用置換檢定當參照——字形分佈本身不均勻,讓虛無分佈被壓低,結果連純表意的基線都顯著。
- 齊夫斜率用 OLS——76% 的詞撞上界,斜率被壓縮了五倍(見上面 S1 那段)。
- 雙重分離用加總當量表——單通道系統可以拿到 0.324 分,是真正雙通道系統的 15 倍。
紀律後來訂下來:任何分母可能是零、任何自變數可能沒有變異的地方,一律回傳 nan,不回傳 0 也不回傳巨大值——因為「沒有效應」跟「這個 run 根本沒問到問題」是兩件事,後續的動作完全相反:前者該寫進論文,後者該調參數重跑。
下一步
S3 的 confirmatory run 還沒開始,heldout 詞表也還沒碰。最有機會回答「為什麼沒有湧現」的下一步,是把詞表放大一個數量級——如果雙重分離在更大的詞表上轉正,「詞表太小」這個假設就立住了;如果沒有,就要回頭檢查習得成本或書寫成本這兩個候選。
等 S3 confirmatory 跑完、或詞表擴大實驗有結果,會有第二集。