重言 Re-Sinitic:確認階段開了唯一一次獎,通過一半 - 研究日誌(四)
這篇是日誌,記的是當時的推論過程。想看目前最新的整體結論,見現況總覽。
第三集結尾留了一個決策點:探索階段已經跑完,剩下的問題是要不要動用那 102 個從未載入過的 heldout 詞。這是一次性資源,用掉就沒有回頭路。這集記的是那個決定被做了之後發生的事——2026-08-27,heldout 被打開,而且只開這一次。
開獎之前,先確認管線沒有壞掉
直接拿從未見過的資料驗證一個複雜管線,風險是「如果結果難看,說不清楚是理論錯了還是程式錯了」。所以正式動用 heldout 之前,先在 train 226 詞內部切一次 70/30,跑同一支評估腳本乾跑,確認它重現探索階段的主結果:
| r | β | t | |
|---|---|---|---|
| 探索階段(train 內部) | +0.903 | — | +6.41 |
| 乾跑(同一支腳本,另一次切分) | +0.743 | +0.295 | +4.44 |
方向和量級都在,管線驗證通過,才碰 heldout。
用的是最省算力的那個方案
第三集列過三個方案:只驗主結果(約 7 天)、降到 64 選 1(約 10 天,但違反修訂 1)、零樣本為主(數小時)。用的是第三個——零樣本探針不需要重新訓練 Writer,只需要凍結既有的 Speaker 與 Writer,對 heldout 的語意向量產生發音與字形,再訓練一個只看過 train 226 詞的全新 Reader,問它認不認得這 102 個新字。
heldout 的語意、發音、字形都從未參與過任何階段的訓練——它們是模型對全新語意的推論,不是背下來的東西。
通過:可泛化的語音編碼,在真正沒看過的字上也成立
主力(語音路開啟)語音辨識 9.9% = chance 的 10.1 倍 t = +9.43
基線(語音路關閉)語音辨識 2.5% = chance 的 2.5 倍 t = +2.82
主力 − 基線 +7.4 個百分點 t = +7.35
chance = 1/102 ≈ 1.0%。一個只學過 226 個字的讀者,能以 10 倍 chance 的準確率認出 102 個從未存在過的新字的發音,而這個能力有 7.4 個百分點來自語音路本身。
這不是記憶——那些字從未被任何人看過,包括訓練這個 Reader 的過程。是這套從零演化出來的書寫系統,具備擴充到新詞的能力。第二集報過的聲符原則(探索階段 25.2% vs chance 1.5%),現在有了在完全獨立的一批詞上的複製。
沒通過:隨同音壓力增強這件事
零樣本語音優勢 vs 同音率 r = +0.377 β = +0.111 t = +1.63
探索階段是 r = +0.903、t = +6.41;乾跑是 +0.743、+4.44。到了 heldout,掉到不顯著。方向還在(低劑量 n=8 平均 +6.4%,高劑量 n=6 平均 +10.0%),但 18 個資料點的散佈太大,撐不起「隨同音壓力單調增強」這句話。
為什麼「沒通過」不等於「白做」
| 探索階段的宣稱 | 確認結果 |
|---|---|
| 字形攜帶可泛化的語音資訊 | ✅ 確認,而且在完全未見的詞上成立 |
| 那個能力隨同音壓力增強 | ❌ 未確認(t = +1.63) |
| 兩類資訊由字形的不同部分攜帶(= 形聲) | 這次沒測,探索階段的結論(從未出現)維持 |
「聲符原則會湧現」是一個關於存在的宣稱;「隨同音壓力增強」是一個關於函數形式的宣稱。前者以 t = +7.35 在從未見過的詞上成立,後者不成立。存在比函數形式更基本,而通過的是存在。 這也是為什麼 pre-registration 要事先把兩件事分開寫清楚——如果當初只註冊了一條籠統的「聲符效應存在」,這次的結果會很難解讀成「部分通過、部分沒通過」,只會是一團模糊的「差不多」。
這次確認不完美,而且說清楚了哪裡不完美
- 用的是探索階段的既有 artifact(16 選 1 訓練),
PREREG_amend_1.md修訂 B 要求訓練候選數等於評估候選數,而在那個規模下重訓需要三個月。這次確認沒有滿足那個要求——是一個已知、必須報告的偏離,不是事後才發現的漏洞。 - 每個劑量只有 3 個種子,prereg §4 原本要求確認階段要 5 個。
- heldout 是一次性資源,這次是唯一一次使用。 不管接下來想到什麼新問題,都不能再拿 heldout 驗證——任何後續分析都要記為「看過確認資料之後」,不能再宣稱是獨立驗證。
論文摘要跟著改寫
三種理論上該產生分工的壓力並列進了摘要,而且各自失敗的方式不同:同音壓力主動破壞分工(雙重分離隨同音率單調降到 −0.243);跨方言壓力讓 Writer 完全放棄語音通道,即使方言間的音變對應完全規律;對抗式候選集把部件複用率推到全專案最高(0.805),但空間分工仍是虛無。三個方向都被堵死之後,主張變成:缺失的不是資訊量,是讓分解划算的那股壓力——在一個溝通目標可加、分散式編碼對神經讀者毫無劣勢的系統裡,把資訊塗滿整個字形永遠不劣於分割它。
這些結論現在有多硬
| 狀態 | |
|---|---|
| 探索 / 確認 | 確認階段已執行(2026-08-27,一次性,不得重跑)。零樣本主結果通過,劑量關係未通過 |
| 已確認 | 字形攜帶可泛化的語音資訊,在完全未見的詞上成立(t = +7.35) |
| 未確認 | 該能力隨同音壓力增強(t = +1.63,探索階段是 +6.41) |
| 已知偏離 | 本次確認沿用 16 選 1 訓練的既有 artifact,未滿足修訂 1「訓練候選數 = 評估候選數」的要求;種子數 3 個,prereg 要求 5 個 |
| 未測 | 空間分工(形聲的定義性特徵)——確認階段沒有重測,探索階段的「從未出現」是目前最後的證據 |
下一步
heldout 已經用完,不能再回去問它任何新問題。剩下能做的事都在 train 226 詞或既有分析上:論文譯成英文、給 v3 那組低同音率設定補種子。「模組化是不是習得性問題」這個假設如果要測,必須在 train 上設計新的介入,不能碰 heldout。等英文稿完成,或是那個介入有結果,會有第五集。