重言 Re-Sinitic:形聲為什麼沒有湧現

這篇是「重言 Re-Sinitic」的現況總覽,會隨研究進度持續改寫,不是逐次發表的日誌。想看完整的推導過程、走過的錯路與撤回,見研究日誌(一)、(二)、(三)、(四)、(五)。確認階段已於 2026-08-27 完成,heldout 詞表已一次性用掉,不會再有第二次獨立驗證——下面標成「已確認」的結論來自那次結果,其餘仍是探索階段的觀察。

這個專案在問什麼

固定漢語的語意結構(meaning space)當控制變數,從零重新演化語言的表達層——音韻與書寫。問一件具體的事:

形聲——一個字由表義部件加表音部件組成——是不是雙通道語言系統的必然收斂解?如果不是,它需要什麼前提?

文獻上的空白很具體:現有的符號湧現研究全部停在「圖畫 → 抽象符號」,沒有人碰過形音義三元結構。

「做完」長什麼樣:S1 離散語音層跑出可信的音系 → S2 書寫層檢定形聲是否湧現 → S3 檢定方言壓力的作用,用劑量-反應設計分辨「同音壓力」與「方言壓力」各自的效果。

S1 語音層可行 S2 形聲有沒有湧現 S3 方言壓力的作用 確認階段 heldout,一次性
三個探索階段 + 一次性確認

目前的結論

書寫系統會演化出可泛化的語音編碼:一個只學過 226 個字的讀者,能以 10 倍 chance 的準確率認出 102 個從未存在過的新字的發音(t = +9.43),其中 7.4 個百分點來自語音路(t = +7.35)——這件事在 2026-08-27 的確認階段,用完全未參與任何訓練的 heldout 詞驗證過。 但字形從未分化成「這一半表義、那一半表音」。

本研究區分四件常被混為一談的事:

探索階段 確認階段
字形攜帶語音資訊 會 —
那個編碼是系統性的(能泛化到全新的字) 會 ✅ 確認,t = +7.35
那個能力隨同音壓力增強 成立(r = +0.903) ❌ 未確認,t = +1.63
兩類資訊由字形的不同部分攜帶(= 形聲) 從來沒有 未測,沿用探索階段結論

關於「存在」的宣稱通過確認,關於「函數形式」的宣稱沒有。 「聲符原則會湧現」是一個關於存在的宣稱,「隨同音壓力增強」是一個關於函數形式的宣稱——前者比後者更基本,而通過的是前者。

確認階段:heldout 用掉的那一次

2026-08-27,凍結既有的 Speaker 與 Writer,對 102 個從未出現過的 heldout 詞的語意向量產生發音與字形,再訓練一個只看過 train 226 詞的全新 Reader,問它認不認得這些新字。這些詞的語意、發音、字形都未參與過任何階段的訓練。

主力(語音路開啟)語音辨識   9.9%   = chance 的 10.1 倍   t = +9.43
基線(語音路關閉)語音辨識   2.5%   = chance 的  2.5 倍   t = +2.82
主力 − 基線                  +7.4 個百分點                t = +7.35

零樣本語音優勢 vs 同音率     r = +0.377   t = +1.63(未達顯著)

探索階段的劑量關係是 r = +0.903、t = +6.41,到 heldout 掉到不顯著——方向還在(低劑量平均 +6.4%、高劑量平均 +10.0%),但撐不起「單調增強」這句話。這是一次性資源,heldout 不會再被動用第二次,任何後續分析都要記為「看過確認資料之後」。這次確認也有已知的偏離:沿用了 16 選 1 訓練的舊 artifact,未滿足「訓練候選數等於評估候選數」的修訂要求;每個劑量只有 3 個種子,非原訂的 5 個。

探索階段的正向結果:聲符原則與形符原則都會湧現,而且能共存

以下是探索階段(train 226 詞)的觀察,其中「存在」那部分已如上經 heldout 確認;「隨同音壓力增強」的劑量曲線本身沒有通過確認,下面的數字要在這個保留下閱讀。

凍結 Writer、重新初始化 Reader、只給它 70% 的字,再問剩下的 30%——看到沒學過的字,能不能靠拆解猜出它的音,或猜出它的意思?

同音率 0.021 0.069 0.150 0.178 0.295 0.437
語音零樣本(主力) 5.9% 15.7% 12.7% 15.4% 16.2% 25.2%
語音零樣本(基線) 3.4% 3.7% 2.0% 3.9% 2.7% 2.5%
主力基線015305.915.712.715.416.225.23.43.723.92.72.50.0210.0690.1500.1780.2950.437
零樣本語音辨識率隨同音率上升(探索階段,n=36 run)

劑量點 r = +0.903,逐 run 迴歸(n=36)β = +0.366、t = +6.41、R² = 0.564。基線全程貼著 chance(1.5%)且不漂移。

早期資料裡,同音率極低的一組(v3)曾讓語音路看起來會把語意零樣本能力整個壓掉,像是「形符與聲符互斥」。用 72 個零樣本 run 直接檢定,那個說法不成立:36 個主力 run 裡有 15 個(42%)同時具備語意與語音兩種零樣本泛化。主力臂內部,語音泛化隨同音率上升(r = +0.748),語意泛化隨同音率下降(r = −0.273),兩者互為代價(r = −0.341)——是取捨,不是互斥。v3 之所以看起來像互斥,只是因為它的同音率落在曲線最左端,語音路在那裡幾乎只有干擾、沒有收益。

這兩者合起來是聲符與形符各自的核心功能——系統性的、可泛化到新字的編碼。先前所有指標(共部件率、純度、舊版雙重分離)都測不到它,因為它們建立在「已見過的字之間的關係」上,而差別只在泛化。

但它們從未分工——換一把尺之後看得更清楚

形聲的定義性特徵不是「字形帶語音資訊」,是字形在空間上可分解為兩個功能不同的部分(左形右聲)。最初的操作化是「雙重分離」:消融 Writer 的輸入(把語意向量或語音向量歸零),看 Reader 表現掉多少。這把尺測到的其實是「Writer 有沒有用到那條輸入」,不是「字形本身有沒有分成兩部分」——一個把語音資訊均勻塗滿整條字形的系統,在這個指標上會跟真正的形聲系統長得一模一樣。

換成直接遮字形的空間位置(5×5 網格的左半/右半),再測「同場題」(只靠形符答得出來)與「同音題」(只靠聲符答得出來):

遮左   同場 −0.584   同音 −0.602
遮右   同場 −0.341   同音 −0.376
同場同音-0.7000-0.584-0.602遮左-0.341-0.376遮右
遮字形一半的傷害:同場題與同音題幾乎相同

遮掉一半造成最多 71 個百分點的傷害——但對兩類題目的傷害幾乎完全相同(差 0.013–0.018)。字形的每一半都同時攜帶語意和語音兩種資訊,比例相同;左半承載的資訊多於右半,所以字形確實有空間結構,但那個結構不是形符和聲符。這是直接測到「沒有分工」,不再依賴會被均勻編碼混淆的代理指標。

⚠ spatial_dd 這個指標本身的雜訊比它要偵測的效應大三倍——同一設定同一種子重跑,數值可以從 −0.137 跳到 +0.040(跨度 0.18,SESOI 只有 0.05),原因是訓練過程的浮點累加順序在不同 batch 形狀下不同,30000 步後被放大成完全不同的解。任何 spatial_dd 的單點數值都不可解讀,包括支持虛無的那些,結論改用多種子平均,或是像上面那樣直接比較同一次評估內部的兩個數字(遮左 vs 遮右的傷害)——那個對比不受訓練過程的混沌影響。

三個階段各自的發現

S1:語音層可以從零演化出來

226 個詞、10 子音 8 母音、CV 音節模板、一個 D3 混淆通道。最佳設定下溝通成功率 85.4%、有同音詞的詞約 0.4%。

齊夫簡短律(M2,越常用的詞越短)成立,但要用 Tobit 迴歸而非 OLS——訊息長度有硬上界,多數詞卡在那個上界,是設限依變數,OLS 會把效果量低估數倍。噪音強度、長度懲罰、相鄰音節重複懲罰三者互相獨立:長度砍掉三成幾乎不影響音節重複率;OCP 懲罰能被最小化但買不到更低的重複率;噪音強度存在一個最適值,太少太多都同時讓溝通變差、重複變多。

S2:同音壓力把字形推向語音編碼,但推的是取捨不是分工

自變數是湧現的同音率(0.013 → 0.496)。訓練候選數必須等於評估候選數(全詞表)——早期在遠比評估任務簡單的候選集上訓練,導致 Reader 準確率被低估三倍,衍生出的門檻式結論不重現,已撤回。隨劑量升高,聲符純度上升而形符純度崩塌——字形越來越像在編碼發音,那是拼音化的方向,不是形聲化的方向。

(先前這裡報過「雙重分離對同音率的迴歸全程為負」,用的是消融 Writer 輸入路徑的舊版指標。那個指標測不到形聲——見上面「換一把尺」——已改用直接遮字形空間的版本,結論見主結論。)

S3:方言壓力讓 Writer 放棄語音路,而不是把它隔離出來

自變數是湧現的跨子群語音距離 D(0 → 0.59),漂變機制是條件化的規律音變——規則對所有詞一致,抽象音韻表徵完全可回復,排除了「對應根本不規律」這個混淆。

最強的訊號是消融:遮掉語音路造成的損失隨 D 單調下降,在最高劑量甚至變負——那條路已經是純粹的噪音,遮不遮都無所謂。跨方言壓力不會讓書寫系統重組成形符加聲符,它讓 Writer 逐步、完全地放棄語音通道。即使跨方言的對應完全規律,「發現那個抽象表徵」仍然比「忽略語音」難,系統選擇後者。

為什麼沒有分工:三個候選解釋,全數直接測過,全數失敗

三個階段的結果指向同一件事:系統從來沒有理由「同時」使用兩條通道。它總是選一條——同音壓力下選語音,方言壓力下選語意。分工要划算,必須有某種力量讓「兩條各做一半」勝過「一條做全部」。論文列了三個候選,現在三個都直接測過了:

假設 操作 spatial_dd(多種子平均) 部件複用率
(b) 兩個目標可加 對抗式候選集(逼任一通道單獨都不夠用) ≈ 0 0.805
(c) 沒有習得成本 讀者換代 +0.003 0.633
(a) 每個字都在訓練集裡 分離曝光——把「讀者只學過 70% 的字」這個限制直接放進訓練迴圈,Writer 的損失算在讀者沒看過的那 30% −0.001 0.966
— 對照 +0.004 0.736
00.5010.805目標可加0.633沒有習得成本0.966分離曝光0.736對照
三個候選解釋:部件複用率(分離曝光衝到全專案最高)

「分離曝光」是三個裡最直接的一個:不只是事後測「讀者認不認得沒學過的字」(那是零樣本探針),而是讓 Writer 在訓練當下就知道「有些字讀者永遠學不到,必須靠拆解才讀得懂」。結果:部件複用率衝到全專案最高的 0.966(三個種子 0.969 / 0.938 / 0.991),但 spatial_dd 平均是 0——分工的訊號完全沒有出現。曝光率壓得更低(0.4)時系統直接放棄溝通(部件數剩 4 個,準確率崩到 13.3%)。

三種介入都推動了部件化(複用率 0.736 → 0.805 → 0.966),沒有一個推動分工。可分解性與功能分化是兩件事,而這個系統只會做前者。

這個否定結論也不是只在一兩個劑量點上看到——擴到五個劑量 × 兩個種子的完整掃描,十格全部沒有達到最小有意義效應量,平均 −0.001,範圍 −0.075 到 +0.035,包括同音率最高、聲符原料理論上最充足的那一格。

「模組化是習得性問題」原本是全專案講得最久、最被看好的解釋,直接測試的結果是它不成立。 分散式編碼(語音資訊瀰漫全字形)對神經 Reader 沒有任何劣勢——它看過全部 226 個字形,每個上萬次;對一個已經記住全表的讀者,「形符在左、聲符在右」和「兩者揉在六筆裡」解碼難度一樣,後者甚至更容易,因為參數自由度更高。逼系統面對沒學過的字,它選擇的答案是「把更多零件做成共用的」,不是「把零件分成兩組各司其職」。

目前沒有第四個候選解釋在排隊——這是研究過程裡一個誠實的空白,不是還沒做完的待辦。

這些結論有多硬

狀態
探索 / 確認 確認階段已於 2026-08-27 執行,一次性,不得重跑。 主結果(存在)通過,劑量關係未通過
pre-registration 2026-08-23 凍結,2026-08-26 修訂一次(τ_end、S2 高劑量邊界、λ_len 的經驗基礎)
種子 探索階段每個劑量 3 個(prereg 要求確認階段 5 個);確認階段同樣是 3 個,非原訂 5 個;v3(極低同音率)設定目前只有 1 個種子
詞表 單一詞表,單人標註。字形盲測顯示語意場 97.2% 可從語意單獨重建
最大的統計弱點 同音率與溝通成功率共線,r ≈ −0.95。「形聲跟著同音走」這個判定靠「係數消不消失」成立,係數大小本身不可解讀
確認階段的已知偏離 沿用探索階段 16 選 1 訓練的既有 artifact,未滿足修訂 1「訓練候選數等於評估候選數」的要求。已在 train 上驗證不影響結論:對齊候選數重訓後效應不減反增(+13.7% → +16.7%,t = +7.80),刻意不重用 heldout 以維持一次性紀律
判準已更換 不再用消融 Writer 輸入路徑的雙重分離(dd_interaction)——它測不到形聲;改用直接遮字形空間的版本(spatial_dd),但這個指標本身雜訊比效應大三倍,單點數值不可解讀,只能用多種子平均或同一次評估內的成分對比
已撤回的結論 S2 的「同音率 0.2 門檻」;S1 的 τ_end=0.2(未掃描選定的次佳值);「形符與聲符互斥」;一組看似漂亮、但 4 個種子沒複製出來的「讀者換代 × 同音率」交互作用;探索階段的「隨同音壓力增強」(heldout 上 t = +1.63,未達顯著)
「為什麼沒有分工」 三個候選解釋(習得成本、目標可加、讀者換代)全數直接測過,全數失敗;目前無第四個候選

heldout 已經用完,不會再有第二次

第三集結尾的決策點——要不要動用 heldout——已經做了,而且是一次性的。之後任何新問題都只能在 train 226 詞或既有分析上回答,不能再拿 heldout 驗證,否則就不再是獨立確認。連確認階段自己留下的已知偏離,後續驗證都刻意改在 train 上做,沒有再碰 heldout。

進行中

  • 「為什麼沒有分工」目前沒有候選解釋在排隊——下一步是想出新的候選,不是繼續測已經想到的三個
  • 論文草稿中英文版已同步,準備投稿整理中
  • S1 音節重複率修好噪音強度後降到 27.9%(仍高於隨機期望約 7%),下一步查架構層面:Speaker 每個位置的輸入夠不夠分化
  • v3(極低同音率)設定補種子

最後更新:2026-08-28(三個候選解釋的測試結果、spatial_dd 的雜訊問題同步)。這篇會隨研究進度改寫,目前的標注(哪些結論已確認、哪些還在等驗證)尚未做完,之後的更新會逐步補齊,而不是重寫成新的一篇。