本站每一篇文章现在都有简体中文、繁体中文和日文版本,除此之外没有别的语言。原本这个名单会有一百种语言,最后只剩三种,原因是 Search Console 的一份报告。

谷歌会把你的英文页面翻译成 20 种语言

打开 Search Console 的「效果」,把「搜索结果外观」筛选为翻译结果。这份报告显示的是谷歌在自己的 translate.goog 代理上,把你的英文页面机器翻译后提供给大约二十种语言的搜索者:法语、德语、西班牙语、葡萄牙语、阿拉伯语、土耳其语、波斯语、印尼语、越南语、泰语、韩语,以及从印地语、孟加拉语到卡纳达语的主要印度语言。当一条印地语查询最适合用你的英文页面回答时,谷歌会翻译它并展示结果。无论如何,展示量和点击都归你。

  语言 你自己做翻译能带来什么
谷歌会代理 fr, de, es, pt, ar, tr, fa, id, vi, th, ko, hi, bn, ta, te, mr, gu, kn, ml, ur 把已有的点击转移到你的域名上
谷歌不代理 zh, ja 打开一扇原本关闭的门

在这些语言里自建页面收益很小

代理只在没有优质母语页面的地方触发,而那恰恰是你的英文页面本来就会胜出的地方。在那里,你自己的葡萄牙语页面只是把点击从谷歌的副本转移到你的域名上:你的分析、你的嵌入、你的品牌。有点价值,但读者还是同一批。而在确实存在葡萄牙语母语页面的地方,代理根本不会触发,你自己的页面必须在对方的主场把它们打败,一个只有 38 个页面的站点很少做得到。能赢的地方是冗余,赢不了的地方处于劣势。

这份报告还免费告诉你,你正准备修的那扇门是否有必要。对本站来说,在任何翻译存在之前,「翻译结果」那一行是零。被代理的语言里根本没人找到这些页面,所以越南语版本也没有任何点击可以转移。

中文和日文是例外

它们不在名单上,因为名单的规律是搜索人口庞大而母语网页稀薄(印地语约占网页内容的 0.1%),而日语一种语言就约占全网的 5%。谷歌假定任何日语查询都存在母语页面。这对语言整体成立,对具体话题则不成立。关于动物将棋残局库,并没有日语页面。一位搜索 象棋殘局 的台湾读者永远不会看到我的英文残局表,不是因为谷歌翻不了,而是因为谷歌判断没必要翻。对这两种语言来说,翻译是唯一的门。

Mistboard 已经验证过

mistboard.com 今年早些时候上线了两种中文字形版本,没有做母语审校。到九月,它自然流量前十的页面里有六个是中文版本,台湾成为点击量最高的地区。这些读者本来是不可能找到英文版的。

大规模堆机器翻译会被惩罚

唯一一个不做审校就大规模上机器翻译的大站被打了。Reddit 的 ?tl= 页面,跨 31 个 hreflang 变体、数百万个 URL,增长了大约十五个月,然后在 2026 年 5 月和 6 月的核心更新与垃圾内容更新中失去了翻译页面的可见度,AI Overview 和 ChatGPT 的引用量也同步下滑。在一个只有 38 个已收录页面的域名上放三十种未经审校的语言,就是同一种模式,只是规模小到连恢复都没人会注意。

这三种语言是怎么做出来的

没有任何审校者读过其中任何一段。让这件事站得住脚的是:模型从不接触标记语言,而校验比较的是含义而不是词元。

每篇文章按字节偏移切分成散文段落(段落、标题、列表项、表格单元、图片 alt、图注)。代码、HTML、URL 和表格竖线从不离开文件。模型拿到一个 {id, text} 的 JSON 数组,按 id 返回译文;文件通过在原始偏移处拼接来重组,所以在没有任何译文时,重组在构造上就是恒等变换。

我最初的保真度校验,在一批 56 个请求里先误拒了 30 次正确译文,才抓到一个错的:

英文 译文 我原本校验的内容 修正方式
6.9 million 690万 数字 6.9 是否保留 比较数值:6.9 × 10⁶ = 690 × 10⁴
$40-70k 4 万至 7 万 4070 是否保留 区间共用一个单位后缀
202 million 2億200万 只有一个量级字 对复合的中日文数词求和
90-95% 90% 到 95% 90 后面没有百分号 百分数与纯数字视为相等
Tailwind CSS, Elo, Las Vegas 保持不变 输出 ≠ 原文 只有小写的常用词才算作未翻译

那一批里两个真正的错误是由不比较词元的校验抓到的:一个日语句子中间出现了一个韩语词,以及一个加粗链接返回时丢了开头的方括号。字形和结构校验站得住脚;词元匹配大多在误拒正确输出。之后用同一个模型做评判、第二轮复核,给它原文、译文和术语表,三轮之内把 84 个页面上的未修错误数从 65 降到 0,每轮约两美元。整件事总共花了大约 25 美元。

规则

把每篇文章翻译成搜索引擎无法替你代劳的语言,其他一种都不做。对于一个讲象棋、暗棋、斗兽棋和将棋的站点,这条规则指向的正是最在意这些内容的读者。

门后到底有没有人,这是个 Search Console 的问题:按语言前缀看每个国家每个页面的展示量,展示量看八周,点击看十六周,而这个站点一个季度只有 55 次点击。不看覆盖率报告,因为 hreflang 备用页面按设计就会显示为未收录(Illyes,2026 年 8 月)。如果台湾和日本根本没出现,那么「读者本来是在用错误的语言找到这些内容」的理论就是错的。切分器、校验和评判提示词都在站点仓库的 _i18n/ 目录下。