在《Codenames》(行动代号)里,一名玩家看到由25个词组成的牌面,暗中知道哪些属于自己队伍,然后要用一个提示词加一个数字,让队友恰好选中那些词。你说「ocean 3」,队友就挑出他们认为你指的那三个词。

你的队伍最多可以持有牌面上九个词,所以最理想的第一步是用一个提示词指向全部九个,当场取胜。我想知道这样的提示词是否存在。

基本上不存在,而原因很具体。

在固定的7,009个常用英语单词词表和标准的嵌入相似度读取者设定下,单个合法词只能在0.286%的局面上精确锁定你全部九张牌。不到千分之三,这是对2.02亿种分配情况的精确计数结果。现实的上限约为六个。而阻碍它的是词表:几何结构允许这种分割,但没有一个常用词能真正实现它。

从同一概念里挑四个词,真实可用的提示词就会出现;全选九个就会撞墙,干扰词会被标红。

还有一个更奇怪的第二个结果,证据较弱:那些确实能满足读取者的提示词,在真实读取者面前大多失败。下文详述。

我是怎么测量的

读取者的设计很直白。把提示词和每个牌面词都嵌入为向量,按与提示词的余弦相似度对牌面词排序,取前 k 个。当前 k 个恰好就是那些词时,提示词就「恢复」了这个 k 词目标集。向量是300维的GloVe;合法提示词表是7,009个高于Brown语料频率下限的WordNet词元,所以每个提示词都是真有人会说的词。

还没开始测量,就知道九很难。从25张牌中指定任意9张大约需要21比特;从7,009个词中选一个只携带约12.8比特。所以没有哪个单词能成为通用的九牌提示词:仅凭计数就知道,一个符号无法区分两百万个目标集。这否定了通用版本,但对某个具体局面什么也没说。真正的问题是逐局面的:对这九张牌,是否存在某个合法提示词可用?这要靠枚举,我做了。

上限约为六

在每个局面上把所有合法提示词都过一遍解码器,收集它能恢复的集合,就得到精确计数,每个提示词都被枚举。在九个目标时,覆盖率是0.286%。对随机的九牌钥匙,你能精确恢复的最大子集分布如下:

最佳精确数量 局面占比
≥ 6 64%
≥ 7 22%
≥ 8 3.8%
= 9 0.3%

期望最佳值是5.87。五或六很常见,七会出现,八很罕见,九几乎从不出现。

看上面探索器里的那个局面,目标是 {barn, builder, call, colonel, educator, pit, product, specialist, wood}。解码器给出的最佳合法提示词,仍会把一个非目标词排在这九个中的某一个之上。没有合法词能分开这个集合;根本没有提示词可找。

墙在词里

人们自然会猜是25个点太挤了分不开。事实恰恰相反。在300维里,处于一般位置的25个向量可以按你想要的任意方式切分:对基本上每一个九牌子集,都存在某个方向把那九个排在另外十六个之上。我在每个词包上检查了100个局面的一般位置条件;每次都成立。

所以分离方向几乎总是存在。只是合法词并不指向那个方向。「存在可行的方向」和「存在向量恰好实现它的词」之间的鸿沟,就是全部结论。把词表收紧到更自然的词,覆盖率单调下降,这正是覆盖问题的样子。只要提示词必须是真实词,你就无法靠变换绕开。

我不太确定的部分

这里证据较弱,所以我把它圈出来。我拿解码器认定为完美的提示词,交给充当人类队友的语言模型读取者,同时给出「animal 3」「vehicle 4」这类普通对照提示词。对照组恢复了24个中的23个。解码器认证的提示词恢复了44个中的0个。另外二十个处于解码器负边界的提示词也全为零。更强的读取模型重现了这些零,一次盲测的人类试验也逐层重现了这一模式。

最大化余弦边界的提示词,是在利用某个排序算法对词的排列方式。按意义工作的读取者恢复不了它。探索器的第二个标签页重放了这一点:一个解码器认证的提示词、它「完美」恢复的集合,然后是真实读取者的实际选择。vain 被认证为能恢复九个特定词;读取者一个都没选中。

真正起作用的是干净的分离概念。当九张牌共享一个清晰类别,而牌面上没有同类别干扰词时,恢复率从零跃升到约三分之一,即使数量很大也是如此。加入一个同类别干扰词,精确恢复就崩塌,而部分识别则缓慢衰减。决定可读性的是是否存在干净概念;一旦存在,数量几乎无关紧要。

这一节是初步的:样本审计规模小,读取者大多是语言模型,唯一一次人类试验是单个知晓假设的标注者。它需要的检验是真正的人类评审团,而这还没有做。我报告的是观测计数,不要把它们当作总体比率。

这件事在游戏之外的意义

嵌入之间的余弦相似度,是「这个词传达了这个概念」的标准代理指标。这次测量说明,这个代理指标恰恰在最诱人的地方不可靠:目标多、边界薄。一个通过最大化嵌入分数来挑选提示词、图像描述或类别标签的系统,优化的是另一端的人并不共享的目标,而失败在分数看起来最自信的地方最严重。

干净的结论无需附加条件:来自共享有限词表的单个词,无法可靠地指示25个中任意9个组成的集合;限制在于把理想意义投射到一个真实词上;而数量的重要性不如是否存在一个干净概念来命名它们。叠在上面的那个分离现象,是我最希望人类评审团去确认或推翻的部分。

完整论文 · 代码与数据