Google 早已把你的網站翻成 20 種語言,但中文和日文不在其中
本站每篇文章現在都有簡體中文、繁體中文和日文版本,其他語言一種也沒有。原本這份名單打算做到一百種,最後只剩三種,原因是一份 Search Console 報表。
Google 會把你的英文頁面翻成 20 種語言
打開 Search Console 的「成效」,把「搜尋結果外觀」篩選為 已翻譯的結果。那份報表代表 Google 正把你的英文頁面經過機器翻譯,放在它自己的 translate.goog 代理上,提供給約二十種語言的搜尋者:法文、德文、西班牙文、葡萄牙文、阿拉伯文、土耳其文、波斯文、印尼文、越南文、泰文、韓文,以及從印地文、孟加拉文到坎那達文的主要印度語言。當一則印地文查詢最適合由你的英文頁面回答時,Google 會把它翻譯後顯示結果。不論哪一種方式,曝光和點擊都算在你身上。
| 語言 | 你自己做翻譯的作用 | |
|---|---|---|
| Google 會代理 | fr, de, es, pt, ar, tr, fa, id, vi, th, ko, hi, bn, ta, te, mr, gu, kn, ml, ur | 把已經存在的點擊移到你的網域上 |
| Google 不會代理 | zh, ja | 打開一扇原本關著的門 |
在那些語言自己做頁面,收穫很小
代理只在沒有好的母語頁面時才啟動,而那正是你的英文頁面本來就會勝出的地方。在那裡你自己做一個葡萄牙文頁面,只是把點擊從 Google 的副本移到你的網域:你的分析、你的嵌入內容、你的品牌。有點價值,但讀者是同一批。而在真的存在葡萄牙文原生頁面的地方,代理根本不會啟動,你自己的頁面得在對方的主場把它們打敗,一個只有 38 頁的網站很少做得到。該贏的地方是多餘的,贏不了的地方則被壓過。
這份報表還免費告訴你,你正打算蓋的那扇門到底需不需要。以本站來說,在任何翻譯出現之前,「已翻譯的結果」那一列是零。被代理的那些語言裡根本沒有人找到這些頁面,所以一個越南文版本根本沒有點擊可以搬移。
中文和日文是例外
它們不在名單上,是因為名單的規律是搜尋人口龐大、母語網頁內容稀薄(印地文約占網頁內容的 0.1%),而日文單獨就約占整個網路的 5%。Google 假設任何日文查詢都存在母語頁面。這對語言整體成立,對單一主題則不然。網路上沒有一篇關於動物將棋殘局庫的日文頁面。一位搜尋 象棋殘局 的臺灣讀者永遠不會被推薦我的英文殘局表,不是因為 Google 翻不了,而是因為 Google 認定不需要翻。對這兩種語言來說,翻譯是唯一的那扇門。
Mistboard 早就驗證過了
mistboard.com 今年初就推出了兩種中文字形的版本,沒有經過母語審校。到了九月,它自然搜尋流量前十名的頁面中有六個是中文版本,而臺灣是點擊數最高的國家。那些讀者是不可能找到英文版的。
大規模上機器翻譯會被懲罰
唯一一個未經審校就大規模上機器翻譯的大型網站被打了。Reddit 的 ?tl= 頁面,橫跨 31 種 hreflang 變體的數百萬個網址,成長了約十五個月,接著在 2026 年五月和六月的核心更新與垃圾內容更新中失去了翻譯版的曝光度,AI Overview 與 ChatGPT 的引用同時下滑。在一個只有 38 個已收錄頁面的網域上放三十種未審校的語言,就是同一套模式,只是規模小到連恢復都沒人會注意。
這三種語言是怎麼產出的
沒有任何審校者讀過其中任何一段。讓這件事站得住腳的原因是:模型從來看不到標記語言,而檢查比對的是意義而不是字符。
每篇文章都依位元組位移切成散文片段(段落、標題、列表項目、表格儲存格、圖片替代文字、圖說)。程式碼、HTML、網址和表格的分隔線從不離開檔案。模型拿到的是一個 {id, text} 的 JSON 陣列,並依 id 回傳翻譯;檔案再依原始位移拼接還原,所以在沒有任何翻譯的情況下,還原後在結構上就等於原檔。
我最初的忠實度檢查,在一批 56 次請求中誤判了 30 次正確的翻譯,才抓到一個真正錯的:
| 英文 | 翻譯 | 我原本檢查的內容 | 修正方式 |
|---|---|---|---|
| 6.9 million | 690万 | 數字 6.9 是否保留 |
比較數值:6.9 × 10⁶ = 690 × 10⁴ |
| $40-70k | 4 万至 7 万 | 40 和 70 是否保留 |
一個區間會共用同一個單位後綴 |
| 202 million | 2億200万 | 只有一個數量級字 | 把複合的中日文數字相加 |
| 90-95% | 90% 到 95% | 90 後面沒有百分比符號 |
把百分比和純數字視為相等 |
| Tailwind CSS, Elo, Las Vegas | 未變更 | 輸出 ≠ 原文 | 只有小寫的常見詞才算未翻譯 |
那一批裡兩個真正的錯誤,是由不比對字符的檢查抓到的:一句日文中間夾了一個韓文詞,以及一個粗體連結回傳時少了開頭的方括號。字形與結構檢查站得住腳;字符比對大多只是把正確的輸出誤判掉。之後再跑第二輪,用同一個模型當評審,給它原文、翻譯和術語表,三輪就把 84 個頁面上未解決的錯誤數從 65 降到零,每輪約兩美元。整件事總共花了約 25 美元。
規則
把每篇文章翻成搜尋引擎無法代替你處理的語言,其他它能處理的一種都不做。對一個談象棋、暗棋、鬥獸棋和將棋的網站來說,這條規則正好點出最在意這些題材的讀者。
門後究竟有沒有人,是個 Search Console 的問題:依語言前綴看每個頁面每個國家的曝光數,曝光看八週、點擊看十六週,而這個網站一季只有 55 次點擊。不要看涵蓋範圍報表,因為 hreflang 替代頁面本來就會顯示為未收錄(Illyes,2026 年八月)。如果臺灣和日本完全沒有出現,那麼「讀者原本是用錯誤的語言找到這些內容」的假設就是錯的。切分器、檢查機制和評審提示詞都放在網站程式庫的 _i18n/ 底下。