一個詞能指向六張牌,指不到九張
在《Codenames》裡,一位玩家看著 25 個詞的盤面,私下知道哪些屬於自己隊伍,必須只用一個線索詞加一個數字,讓夥伴剛好選中那些詞。說「ocean 3」,夥伴就挑出三個他們認為你指的詞。
你的隊伍最多可持有盤面上九個詞,所以夢幻的第一手就是一個線索同時指向全部九個,當場取勝。我想知道這樣的線索是否存在。
大多數情況並不存在,而原因很具體。
在固定的 7,009 個常用英文詞彙表與標準嵌入相似度讀者之下,單一合法詞只能在 0.286% 的盤面上鎖定你全部九張牌。依 2.02 億種分配的精確計數,這不到千分之三。現實上的上限約為六。而擋住它的是詞彙表:幾何允許這種分離,但沒有常用詞能實現它。
從同一個概念挑四個詞,真正的線索就會出現;全選九個就撞上牆,插隊的詞會標成紅色。
還有一個更奇怪的第二項結果,證據較薄弱:那些確實滿足該讀者的線索,在真實讀者身上大多失效。詳見下文。
我如何測量
讀者的設計很直觀。把線索與每個盤面詞嵌入成向量,依與線索的餘弦相似度為盤面詞排序,取前 k 個。當前 k 個正好是那些詞時,該線索就「還原」了一個 k 詞目標集。向量是 300 維 GloVe;合法線索清單是 7,009 個 WordNet 詞元,並設有 Brown 語料庫的詞頻下限,因此每個線索都是有人真的會說出口的詞。
還沒開始測,九就已經很難。要指名 25 張牌中任意 9 張大約需要 21 位元;從 7,009 個詞中取一個只承載約 12.8 位元。所以沒有任何單一詞能當通用的九牌線索:僅憑計數,一個符號無法分離兩百萬個目標集。這否定了通用版本,卻對特定盤面什麼也沒說。真正的問題是逐盤面的。對這九張牌,是否存在某個合法線索有效?那就要窮舉,而我做了。
上限約為六
把每個合法線索都在各盤面上跑過解碼器,收集它能還原的集合,就得到精確計數,每個線索都被窮舉。在九個目標時,覆蓋率是 0.286%。對隨機的九牌密鑰,你能精確還原的最大子集分布如下:
| 最佳精確數 | 盤面占比 |
|---|---|
| ≥ 6 | 64% |
| ≥ 7 | 22% |
| ≥ 8 | 3.8% |
| = 9 | 0.3% |
期望的最佳值是 5.87。五或六是常態,七偶有,八罕見,九幾乎從不出現。
以上方瀏覽器中的盤面為例,目標為 {barn, builder, call, colonel, educator, pit, product, specialist, wood}。解碼器最佳的合法線索仍會把某個非目標排在這九個中的一個之上。沒有合法詞能分離該集合;根本沒有線索可找。
牆在詞彙裡
直覺猜想是 25 個點太擁擠而無法分離。事實相反。在 300 維中,處於一般位置的 25 個向量可以任意切分:對幾乎每一個九牌子集,都存在某個方向把那九個排在其餘十六個之上。我在每個詞包上檢查了 100 個盤面的一般位置;每次都成立。
所以分離方向幾乎總是存在。只是合法詞並不指向那個方向。「有個可行方向」與「有個向量恰好實現它的詞」之間的落差,就是整個結果。把詞彙表收緊到更自然的詞,覆蓋率單調下降,這正是覆蓋問題的樣貌。只要線索必須是真實的詞,你就無法靠變換脫身。
我較沒把握的部分
這裡的證據較薄弱,所以我先設好界線。我取出解碼器認證為完美的線索,交給充當人類夥伴的語言模型讀者,同時附上「animal 3」、「vehicle 4」這類普通的對照線索。對照組還原了 24 個中的 23 個。解碼器認證的線索還原了 44 個中的 0 個。另外二十個位於解碼器負邊界的線索同樣為零。更強的讀者模型重現了這些零,一次盲測的人類測試也逐層重現了同樣的模式。
讓餘弦邊界最大化的線索,是在利用某個排序演算法對詞的排列方式。依語意運作的讀者無法還原它。瀏覽器的第二個頁籤重演了這點:一個解碼器認證的線索、它「完美」還原的集合,接著是真實讀者實際挑選的結果。vain 被認證能還原九個特定詞;讀者一個也沒選中。
真正奏效的是乾淨的分離概念。當九張牌共享一個銳利的類別,而盤面上沒有同類別的干擾詞時,還原率從零躍升到約三分之一,即使數量很高也是如此。加入一個同類別干擾詞,精確還原就崩潰,而部分辨識則緩慢衰減。決定可讀性的是是否存在乾淨概念;一旦存在,數量幾乎無關。
那一節屬初步結果:稽核規模小,讀者大多是語言模型,唯一的人類測試也只有一位知曉假設的標註者。它需要的檢驗是真正的人類評測小組,而這還沒有做。我報告的是觀測計數;別把它們當成整體比率。
為何這超越遊戲本身
嵌入之間的餘弦相似度是「這個詞傳達這個概念」的標準代理指標。這項測量說明,這個代理在最誘人的地方恰恰不可靠:目標多、邊界薄。一個靠最大化嵌入分數來挑線索、圖說或類別標籤的系統,正在最佳化另一端的人並不共享的目標,而失敗在分數看起來最有信心的地方最為嚴重。
乾淨的版本不需要任何保留:來自共享有限詞彙表的單一詞,無法可靠地指出任意的二十五取九集合;限制在於把理想語意投射到真實詞彙上;而數量的重要性,遠不如是否有乾淨概念能為它們命名。疊在上面的那個分離現象,是我最希望人類評測小組來確認或推翻的部分。