没有不值得去解决的问题,也没有不值得去学习的技术!

A Tour of Go 多语言翻译项目:从 swap 问题重新审视 Token 保护,原始输入与最小保护的一次真实实验

图 1:flowcontrol/6 首次原始输入实验直接通过统一自动校验

作者:

在

,

A Tour of Go 多语言翻译项目

图3:访问过去的 Go Tour 简体中文站 tour.go-zh.org 时,当前已经无法正常建立连接。

(1) 从「A Tour of Go 中文版」这个搜索词开始:我决定做一个持续维护的 Go Tour 中文版

本地运行的 A Tour of Go「Methods continued」课程页面,左侧为课程说明,右侧为 Go 代码编辑器及运行结果。

(2) A Tour of Go 中文版项目设计冻结:从 101 页到 103 页,从 Gin 转向 Cobra CLI

A Tour of Go 中文版开发实战:英文基线、在线运行与 101 页上游同步体系

(3) A Tour of Go 中文版开发实战:英文基线、在线运行与 101 页上游同步体系

go-tour-i18n 项目完成首个简体中文课程页面 welcome/1 的整页翻译、结构校验和本地预览。

(4) A Tour of Go 多语言翻译项目实录:完成首个 zh-CN 页面翻译闭环

图 1:DeepSeek 官方更新日志显示,本次只更新 DeepSeek-V4-Flash,DeepSeek-V4-Pro API 与 APP、Web 模型均未更新

(5) A Tour of Go 中文翻译项目进展:完成前 8 页、修复 present 语法,并暂缓 DeepSeek 对比

图 1:generics/1 简体中文页面本地预览

(6) 一个页面重试五次:使用 GLM-5.2 翻译 A Tour of Go 时遇到的 Token 与 Present 结构问题

图 1:methods/16 简体中文页面浏览器预览

(7) A Tour of Go 中文翻译实录:如何只翻译教学代码注释,而不破坏 Go 代码

图 2:A Tour of Go methods/20「练习:错误」中文候选页面最终渲染效果

(8) A Tour of Go 多语言翻译:当正确的中文语序被受保护标记顺序校验误判

图 3:methods/24 中文页面,静态代码、Bounds 行内代码和链接内的 image.Rectangle 均正确渲染

(9) A Tour of Go 中文翻译完成 7 个代表页校准:最后 3 页又发现了哪些真实问题

图 2:首批 10 个普通页面经过试跑与流程校准后全部进入 ready

(10) A Tour of Go 多语言翻译项目:首批 10 个普通页面试跑,从 2 个 blocked 到全部 ready

图 2:flowcontrol/6 最终中文页面,return 与 v 为适应自然中文语序发生整体换位

(11) A Tour of Go 中文翻译第二批实跑:从 Inline Code 顺序误判到历史响应重新验证

图 1:flowcontrol/6 首次原始输入实验直接通过统一自动校验

(12) A Tour of Go 多语言翻译项目:从 swap 问题重新审视 Token 保护,原始输入与最小保护的一次真实实验

图 7:moretypes/1 最终中文页面预览。左侧课程正文、静态代码块、行内代码和教学注释均正常渲染,右侧官方 Go 示例继续保持原样。

(13) A Tour of Go 多语言翻译实战:第三批 10 页全部 Ready,继续校准 Protected Token 的结构角色

图 4:上游源码确认共有 103 个课程页面,zh-CN 最终达到 ready=103、pending=0、blocked=0

(14) A Tour of Go 多语言翻译项目:zh-CN 103 个课程页面全部 ready,课程正文翻译阶段完成

图 4:GitHub 与 ChatGPT 已成功连接

(15) ChatGPT 连接 GitHub 实测:让 AI 直接读取 go-tour-i18n 仓库参与译文审核

图 3:中文 Go 术语校准完成后,将确定的译法写入 zh-CN glossary

(16) 为什么 channel 最终选择“通道”:A Tour of Go 中文术语统一的一次实践

图 1:技术含义基本正确,但“返回一个返回……”已经明显影响阅读,因此仍被列入 C 类修订

(17) 103 页逐页审核后,只返修 16 页:A Tour of Go 中文正文发布前质量审计

图 2:中文课程页面以及已经完成本地化的编辑器控制区

(18) A Tour of Go 多语言翻译项目:公共 UI 本地化完成,从课程译文走向完整中文界面

图 2:完整 zh-CN 正式投影成功生成,103 个课程页面被重新组装为 7 个 .article

(19) 从 103/103 ready 到完整站点验收:A Tour of Go 中文版补齐正式投影与课程元数据本地化

图 3:从 production bundle 独立启动的 A Tour of Go 简体中文页面,课程正文、公共 UI 和官方 Go 示例均已进入最终发布形态。

(20) A Tour of Go 多语言翻译项目:103 页全部完成后,我终于生成了可独立部署的 zh-CN Production Bundle

图 1:A Tour of Go 简体中文版正式生产页面,远程运行已经成功输出“Hello, 世界”。

(21) A Tour of Go 多语言翻译项目:zh-CN 正式上线,从生产发布到 go.dev Playground 的完整部署记录

图 1:新生产域名 go-dev.shuijingwanwq.com 已正常访问,Go 示例远程运行成功

(22) A Tour of Go 多语言翻译项目:从 go-tour 到 go-dev,完成 EdgeOne、Nginx 与 HTTPS 生产域名迁移

图 1:A Tour of Go 多语言翻译项目正式生产首页

(23) A Tour of Go 多语言翻译项目正式上线:从项目首页、公共 Footer 到生产发布元数据的完整收尾

图 3:GA4 g/collect 请求返回 HTTP 204,并携带当前课程页面地址,确认 Google Analytics 已产生真实事件上报

(24) A Tour of Go 多语言翻译项目:接入 Google Analytics 与百度统计,从 systemd 注入到 EdgeOne 与真实上报验证

图 1:生产环境 robots.txt 与 sitemap.xml 已正确对外提供,Sitemap 共包含 104 个规范 URL。

(25) A Tour of Go 中文站上线后:补齐 robots.txt、Sitemap,并完成五大搜索引擎提交

图 4:发布生产并刷新 EdgeOne 缓存后,再次通过真实手机访问,顶栏项目名称已经完整保持在一行,最终移动端验收通过。

(26) A Tour of Go 多语言翻译项目:修复手机端首页顶栏标题换行,并完成真机验证

图 3:生产自动部署脚本第一次真实运行时,systemd 已经显示 active,但首次 localhost 探测仍然得到 HTTP 000;随后连续 3 次同时满足 active + HTTP 200 后,脚本才判定部署成功,并继续完成公网 HTTP 200 验收。这次真实运行验证了连续应用层健康检查的必要性。

(27) A Tour of Go 多语言翻译项目:从一次 203/EXEC 故障到生产自动部署脚本落地

图 1:阿里云生产环境访问 go.dev Playground 时出现 TLS 握手超时

(28) A Tour of Go 多语言翻译项目:为 Playground 搭建独立的 ZgoCloud 执行代理

图 3:清除 /tour/script.js 缓存后,Run 已直接请求 ZgoCloud /compile 并返回 HTTP 200

(29) A Tour of Go 多语言翻译项目:将生产 Run / Format 切换到 ZgoCloud 执行节点

【图 1:微信中运行 Go 示例时出现 Error communicating with remote server.】

(30) A Tour of Go 中文版手机端运行与格式化偶发失败排查:从间歇性报错到补强 Nginx 可观测性

【图 4:向 golang-dev 公开邮件列表发送 Playground 使用告知邮件并投递成功】

(31) A Tour of Go 多语言项目:为 Playground 代理增加唯一 User-Agent,并主动告知 Go 官方

【图 3:百度剩余 9 个核心 URL 提交成功,remain 归零】

(32) A Tour of Go 搜索引擎收录实测:从 Google 自然索引到百度主动提交与 Bing IndexNow

【图 1:当前正式中文 methods/24 页面,右侧示例代码运行成功】

(33) A Tour of Go 中文翻译完成后,我为什么重新评估 minimal-protect 翻译模式

【图 3:5 个页面 Request SHA256 完全一致,但 Response SHA256 全部不同】

(34) A Tour of Go 翻译实验:更多原始上下文为什么没有更好?从 157 个保护标记到 30 次重复盲评

图 3:3 个代表页 × 4 个评审模型,共 12 次匿名评审的完整排名与第一名票数。

(35) A Tour of Go 翻译质量再评估:minimal-protect 未达预期后,我开始比较 ChatGPT、Codex 与 GLM-5.2

图 2:GitHub 中的 chatgpt-zh-CN-008 重译批次。一个 Batch 同时保存 inputs、raw-responses、candidates、validation 和 retry 记录,GitHub 成为 ChatGPT 与本地翻译流水线之间的数据交接层。

(36) 没有 OpenAI API,我如何用 ChatGPT + GitHub 完成 A Tour of Go 103 页全量重译

图 1:103 个正式课程页面完成最终语义质量审核,结果为 A=103、B/C/D=0,同时不存在缺失、重复或额外页面。A/B/C/D 是本轮项目内部语义质量分级,并不是自动结构 validator 的结果。

(37) 103 页翻完还不能发布:A Tour of Go ChatGPT 译文的语义审核与 Canonical Promotion

图 3:7 个 article endpoint 的 production origin 与 EdgeOne 公网响应全部 exact match,同时新的 ChatGPT 译文标记存在,旧版译文标记已经消失。

(38) 103/103 与 7/7 Exact Match:A Tour of Go ChatGPT 新译文的最终线上验收

【图 2:upstream source preview】

(39) A Tour of Go 多语言翻译项目首次实现 upstream 同步机制:从一次性翻译到长期维护

图 2:A/B/C/D 质量评级规则,展示正式质量 rubric 与 Promotion gate。

(40) A Tour of Go 多语言翻译项目引入 Translation Quality Review:从自动验证到 AI 翻译质量控制

图 4:翻译后 Playground Example,展示中文注释与保持不变的 Go 代码结构。

(41) A Tour of Go 多语言翻译项目实现 Playground Example 本地化:从代码注释翻译到完整学习体验

图 5:公网页面验证广告脚本输出

(42) A Tour of Go 多语言翻译项目接入广告系统:从 AdSense 专用配置到通用 HTML 注入架构

图 3:百度统计单页应用设置

(43) go-dev 单页网站接入统计与 Google AdSense Auto Ads 验证记录

图 1:GitHub 仓库中的多语言翻译项目结构

(44) A Tour of Go 多语言翻译项目:选择日语作为第二语言并启动翻译验证

图 5:模型身份描述不一致

(45) A Tour of Go 多语言翻译项目中的 AI 协作异常排查:一次长期工程会话失效分析

【图 1:ChatGPT GitHub 写入流程调整说明截图】

(46) go-tour-i18n 翻译流程调整:从 ChatGPT GitHub 写入到本地 artifact 导入

图 4 展示了本次异常状态。

(47) go-tour-i18n 翻译自动化流程复盘:已验证的 ChatGPT 翻译能力在新任务中的稳定性问题

【图 6:全部评审结束以后才读取 secret key,完成最终揭盲】

(48) A Tour of Go 翻译质量再评估:Codex High 已接近 ChatGPT High,我决定调整默认翻译引擎

图 4:ja-JP 生产课程页实际运行 Go 示例

(49) A Tour of Go 日语版正式上线:第二门语言 ja-JP 完成生产发布

图 1:ja-JP 上线以后,先提交“新增语言标准化流程”

(50) A Tour of Go 多语言扩展复盘:为第三门语言建立标准化流程

图 1:课程正文结束以后,页面左侧仍然存在大块视觉空白,但 AdSense 并没有在这里插入展示广告。

(51) A Tour of Go 明明有大片空白,为什么 AdSense 就是不显示展示广告?

图 2:golang/website 当前的 _content/tour/。课程内容、静态资源和模板都在这个上游目录中持续维护。

(52) 为了 AdSense,要不要放弃 SPA?A Tour of Go 页面架构的一次取舍

图 4:最终的手动课程广告真实展示在课程内容区域内,而不是 footer 之后。

(53) 保留 SPA 以后,广告应该放在哪里?从 AdSense 预览到方案 B

图 1:Google Search Console 中,多个不同的 A Tour of Go 课程 URL 被判断为“重复网页,用户未选定规范网页”。

(54) SPA 的 SEO 老问题:为什么最后还是给 103 个 A Tour of Go 课程页生成了 Prerender HTML

图 2:方案 B 生产环境中,源码已经正常,但课程主体高度异常缩短,footer 提前进入第一屏。

(55) 从源码空白到 AdSense 高度污染:A Tour of Go 方案 B 的生产收尾

图 1:A Tour of Go 德语版 de-DE 已正式运行在生产环境

(56) A Tour of Go de-DE 上线复盘:第三门语言用了约 16 小时,下一门如何压到 8 小时?

图 1:fr-FR 首次 production 验收完成后,我没有立即开始 ko-KR,而是先连续完成新增语言与首次生产流程的优化

(57) 法语版上线后,我没有马上开始韩语:A Tour of Go 新增语言流程的一轮完善与简化

图 1:根据 ko-KR 期间 76 次 Git 提交估算实际工作时间

(58) 原本预计 6 小时,最后用了约 16~18 小时:A Tour of Go 韩语版上线复盘

图 2:英文 source 与当时发生 validation failure 的 ko-KR candidate 对比

(59) Validator 报错,到底该改译文还是改规则?一次 A Tour of Go 韩语翻译实战

图 2:法语 A Tour of Go 仓库目前已经归档,页面仍保留 553 Commits 和 61 Contributors 的历史

(60) 从法语 553 次提交到韩语两代离线:A Tour of Go 社区翻译为什么难以长期维护

【图 4:es-ES 首次 Production 收口后连续完成的流程优化 commit】

(61) 从 es-ES 首次上线复盘:我把 A Tour of Go 新增语言的 Production 流程又收敛了一轮

图 1:旧公网验收链路连续出现 curl 28 超时,最终导致 public-machine 阶段失败

(62) A Tour of Go Production 公网验收踩坑:从跨境 SOCKS 链路改为 zgocloud direct

图 1:两次 Production Machine Acceptance 都已经通过,但 Headless Chrome 分别在 / 和 /tour/ 判定页面没有完成渲染

(63) 页面明明能打开,为什么 Headless Chrome 仍然判定 Production 失败?

图 3:Bing 从 Google Search Console 中识别到新的 it-IT 站点,并同时发现已有的 1 个 sitemap

(64) GSC → Bing Webmaster Tools:多语言站点如何减少重复验证

图 3:英文站 3 小时内出现 565 个 Cloudflare 来源 URL

(65) IndexNow 实战:手工提交长期不显示,Cloudflare Crawler Hints 却很快出现在 Bing Webmaster Tools

【图 1:A Tour of Go 项目首页目前的语言版本列表】

(66) 从 nl-NL 到 tr-TR:A Tour of Go 连续上线三门语言后,我又优化了哪些流程

【图 4:Go local 页面中已经出现 French、German、Korean、Simplified Chinese】

(67) 从邮件无人回复到进入 Go 官方 Go local:我的 4 个 A Tour of Go 翻译站终于被收录

图8:最终只保留一把启用的新 API Key

(68) 腾讯云 EdgeOne API 自动化:从 CAM 子用户到最小权限 API Key 的完整配置

【图 7:Production Release Batch 最终汇总】

(69) 从同步 Go 官方上游到一个命令发布 10 个语言站:A Tour of Go Production 流程的再次收敛

【图 3:Cloudflare Smart Tiered Cache 已启用】

(70) Cloudflare 缓存 HIT 很快,MISS 却不稳定:回源阿里云杭州的一次真实优化

【图 3:简体中文站 Support 页面】

(71) 广告之外,社区项目如何长期活下去?我给 A Tour of Go 多语言项目加了 Support

图5:评论成功发布

(72) 从 Go Weekly 到 Reddit、DEV 和 Go Forum:第一次系统推广 A Tour of Go 多语言项目

【图 4:RTL 桌面课程布局修复后的效果】

(73) 第一次把 A Tour of Go 做成 RTL:阿拉伯语版本上线,以及我踩过的几个坑

最近几天,我一直在继续推进 A Tour of Go 多语言翻译项目。

前面的开发重点之一,是保护 .article 页面里那些不应该被大模型随意翻译或修改的结构,例如行内代码、链接目标、预格式化代码、强调结构以及 .play directive 等。

整体思路大致是:

Plaintext
完整课程页面
↓
识别需要保护的结构
↓
替换为 protected token / sentinel
↓
GLM-5.2 整页翻译
↓
恢复 protected token
↓
统一自动校验
↓
通过 → ready
失败 → 重试 / blocked

这套方案已经能够正常工作,而且前面经过多轮代表页校准以后,结构保护、恢复和校验能力也越来越完整。

但随着保护规则不断增加,我开始重新考虑一个更基础的问题:

输入给大模型之前,真的有必要对原始课程页面做这么多处理吗?

2026 年 8 月 10 日,我专门围绕这个问题做了一轮真实实验。

最后的结果并不是简单地证明“新方案更好”,而是让我对保护多少、在哪里保护,以及翻译质量和程序复杂度之间如何取舍有了更清晰的认识。


一、真正让我重新考虑输入架构的,是前一天的 swap 问题

此前遇到过行内代码因为中文语序调整而换位的问题。

不过,这个问题后来已经意识到,而且对应的校验规则也已经放宽。因此,它并不是这次重新考虑输入架构的直接原因。

真正让我开始认真怀疑“大量 Token 保护是否必要”的,是前一天遇到的 swap 问题。

为了确保某些原始内容绝对不被 GLM-5.2 修改,程序会先将它们替换成 protected token,让模型围绕这些占位符完成整页翻译。

这种做法在结构安全方面有很明显的优势,但同时也意味着:

Plaintext
模型真正看到的输入
≠
A Tour of Go 原始页面

当 swap 这样的真实标识符被替换成没有业务语义的占位符以后,模型无法再直接理解:

Plaintext
swap

究竟是函数名、代码标识符,还是普通英文单词。

保护层越复杂,模型实际能够看到的真实上下文就越少。

更麻烦的是,保护本身还会引入新的程序逻辑:

Plaintext
识别
→ Token 化
→ Token 完整性校验
→ 恢复
→ 边界处理
→ 顺序与数量比较

也就是说,我们原本是为了防止大模型犯错而增加保护,但保护系统本身也开始成为一个需要持续维护的复杂子系统。

swap 问题让我开始重新思考:

如果最终输出本来就必须经过严格自动校验,那么输入端是否真的需要保护这么多内容?

换一种思路:

是否可以尽量让 GLM-5.2 看到真实的英文原始页面,只保护极少数真正不能让模型碰的机器结构,然后把更多安全责任交给统一 validator?

这才是这次架构实验真正的起点。


二、先增加一个 --raw-input 实验模式

我没有直接删除已经成熟的默认保护流程,而是增加了一个专门用于实验的参数:

Plaintext
--raw-input

启用以后,程序仍然按照原有规则:

Plaintext
ReadCatalog
→ BuildSourceCatalog
→ HydrateCatalogSources
→ 根据 page_id 提取完整 production 页面

也就是说,一个浏览器课程页面对应的完整源内容仍然由程序正确提取。

改变的只是后面这一段。

默认模式:

Plaintext
Page.Source
↓
protectTranslation
↓
GLM-5.2
↓
restore
↓
ValidateCandidate

--raw-input:

Plaintext
Page.Source
↓
GLM-5.2
↓
ValidateCandidate

不再执行大规模 protected token 替换,也不再执行翻译后的 restore。

但有一点非常重要:

--raw-input 并没有绕过任何输出校验。

GLM-5.2 的输出仍然必须继续通过现有:

Plaintext
present 单页解析
directive 校验
链接 target 校验
链接内代码校验
普通 inline code 校验
预格式化内容校验
emphasis/font span 校验
Section topology 校验
directive placement 校验
术语规则

也就是说,新实验并不是:

相信大模型不会犯错。

而是:

允许模型犯错,但程序必须发现错误。


三、flowcontrol/6:第一次 raw-input 真实请求直接通过

第一个真实测试页面选择了:

Plaintext
flowcontrol/6

执行:

Bash
go run ./cmd/tour-i18n translate run \
    --locale zh-CN \
    --id flowcontrol/6 \
    --dev \
    --raw-input

结果直接通过:

Plaintext
status: ready
token_valid: true
present_valid: true
passed: true
图 1:flowcontrol/6 首次原始输入实验直接通过统一自动校验
图 1:flowcontrol/6 首次原始输入实验直接通过统一自动校验

这里终端显示:

Plaintext
attempts: 4

后来检查真实审计记录以后确认,这并不意味着 raw-input 连续尝试了 4 次。

attempt 1~3 是此前默认 protected-token 流程留下来的历史审计。

真正的 raw-input 只有:

Plaintext
attempt 4

而且一次通过。

这次调用的实际 Token 使用量为:

Plaintext
prompt:     1318
completion:   85
total:      1403

相比之前同页默认方案单次约 2300 多 Tokens,输入量明显减少。

不过,我现在并不会因为这一页就得出:

raw-input 的翻译质量一定比默认方案高。

更准确的结论应该是:

减少 protected token 后,GLM-5.2 能直接看到更多真实页面内容,同时至少在这一页上仍然可以一次通过现有统一校验。

这证明“大量 Token 化”并不是可靠翻译的唯一途径。

如果某些结构实际上可以直接暴露给模型,而 validator 又能够可靠检查,那么输入端确实存在明显简化的空间。


四、这里需要区分“首次机器翻译质量”和“最终发布质量”

raw-input 有一个很直观的潜在优势:

模型看到的原始上下文更多。

因此,模型第一次生成的中文可能更自然,语言组织也受到更少占位符干扰。

但这不意味着:

raw-input 最终一定比默认 protected-token 方案翻译得更好。

项目最终交付的并不是 GLM-5.2 第一次吐出来的 candidate。

即使继续使用当前默认方案,全部课程页面翻译完成以后,仍然可以统一进行人工润色和微调。

因此最终发布质量很可能是:

Plaintext
默认 protected-token
+ 完整自动校验
+ 发布前统一润色

与:

Plaintext
raw / minimal-protect
+ 完整自动校验
+ 发布前统一润色

达到相近水平。

甚至前者最终完全可能更好。

所以这次实验真正需要比较的,并不是简单的:

哪一种方案第一次翻译出来的中文更漂亮?

而是整体工程成本:

Plaintext
输入处理复杂度
模型能够看到的真实上下文
结构失败概率
重试次数
Token 消耗
restore 复杂度
validator 能否可靠发现错误
长期维护成本
最终发布质量

翻译质量当然非常重要,但它不是唯一指标。


五、methods/24 很快证明:完全 raw 同样有明显风险

如果只看 flowcontrol/6,很容易变得过于乐观:

那是不是干脆所有页面都直接发送原始内容?

所以第二个测试页面,我选择了结构明显复杂得多的:

Plaintext
methods/24

这一页包含:

Plaintext
.play methods/images.go

同时还有多个链接、链接 target、9 个行内代码、链接标签中的 image.Rectangle、静态预格式化 Go 代码块,以及 *Note* emphasis/font span。

第一次 raw-input 运行以后:

Plaintext
present_valid: false

报错:

Plaintext
methods/24: candidate present structure:
present parse:
methods.article:21: no match for zh-cn
图 2:完全原始输入下,methods/24 首次实验在 present 解析阶段失败
图 2:完全原始输入下,methods/24 首次实验在 present 解析阶段失败

进一步查看 GLM-5.2 的完整 response 后,原因非常明确。

原始页面是:

Plaintext
.play methods/images.go

模型却自行生成了:

Plaintext
.play methods/images.go /zh-cn/methods/24

也就是说,GLM-5.2 似乎认为自己是在“完善”这条内容,为它补充一个路径。

但是对于 Go present 来说,这不是自然语言。

这是机器指令。

于是 parser 将附加内容当成 directive 参数继续解析,最终报:

Plaintext
no match for zh-cn

我又做了一次独立 raw-input 实验。

这一次 GLM 没有追加:

Plaintext
/zh-cn/methods/24

而是换成:

Plaintext
.play methods/images.go /src/methods/images.go

两次独立请求都主动修改 .play,已经足以说明:

.play 这种机器 directive 不适合完全交给模型自由生成。


六、GLM 还会主动“改善”链接显示格式

methods/24 的 raw-input 实验还发现了另外一个很有意思的问题。

4 个链接 target 始终都被正确保留。

已有的 9 个 inline code 也没有丢失。

静态 Go 代码块同样逐行保持正确。

但模型会主动调整链接显示文字的格式。

例如原始:

Plaintext
[[/pkg/image/#Image][Package image]]

GLM 会生成:

Plaintext
[[/pkg/image/#Image][`image` 包]]

最后一个链接中的:

Plaintext
image/color package

也被改成:

Plaintext
`image/color` 包

从普通技术中文的阅读习惯来看,这种排版甚至很合理。

但从这个项目的结构原则来看,模型凭空新增了源页面不存在的 inline code span。

因此 validator 仍然应该拒绝。

这说明完全 raw 的一个根本风险:

模型不仅会翻译,它偶尔还会主动“优化”它认为可以优化的结构。

对于普通文章,这可能是优点。

对于需要和上游 .article 保持结构对应关系的翻译项目,这有时候就是错误。


七、于是开始实验第三条路线:--minimal-protect

走到这里,两个极端都已经出现问题。

原方案:

Plaintext
大量 protected token

结构控制能力强,但输入和恢复逻辑越来越复杂。

完全 raw:

Plaintext
原始页面
→ GLM

程序明显简单,但机器结构可能被模型主动改写。

所以我开始测试第三条路线:

只保护已经有真实证据证明高风险的机器结构。

为此增加:

Plaintext
--minimal-protect

第一版没有重新保护 inline code、链接、emphasis 或静态代码块。

只保护完整的:

Plaintext
.play methods/images.go

它会被替换成唯一 Token,例如:

Plaintext
⟪GTI18N_d80f0d46_000001⟫

其余页面仍然几乎保持原始状态交给 GLM-5.2。

模型返回以后,这一个 Token 再恢复成:

Plaintext
.play methods/images.go

结果非常明确:

.play 问题彻底消失。

GLM 原样、恰好一次保留了该 Token。

restore 也精确生成:

Plaintext
.play methods/images.go

没有再追加:

Plaintext
/zh-cn/...

或者:

Plaintext
/src/...

这说明最小保护这个方向确实是有效的。

至少对于 .play:

让模型完全没有修改权,比依靠提示词要求“请不要修改”更稳定。


八、只保护 .play 后,真正剩下的问题变得更清楚

.play 被稳定处理以后,再次运行 methods/24。

这一次不再出现 present directive 解析失败。

取而代之的是:

Plaintext
link inline code at link index 1 count mismatch:
expected 0, actual 1
图 3:仅保护 .play directive 后,directive 问题消失,但链接标签被模型自行加上行内代码格式
图 3:仅保护 .play directive 后,directive 问题消失,但链接标签被模型自行加上行内代码格式

检查 response 后确认:

Plaintext
Package image

仍然被改成:

Plaintext
`image` 包

而:

Plaintext
image/color package

也再次变成:

Plaintext
`image/color` 包

也就是说,最小保护确实解决了第一类问题。

同时也把下一类真实风险暴露得更加清楚:

Plaintext
机器 directive
→ 应该直接保护

普通链接标签
→ 模型仍然需要翻译
→ 但不能自行改变 span 结构

此时最容易想到的是:

那就继续保护 image 和 image/color。

但仔细分析以后发现,这并没有真正解决问题。

假设:

Plaintext
Package image

变成:

Plaintext
Package ⟪TOKEN⟫

GLM 完全可能仍然生成:

Plaintext
`⟪TOKEN⟫` 包

Token 本身没有被改。

restore 以后仍然是:

Plaintext
`image` 包

所以:

保护一个字符串本身,并不等于保护这个字符串周围的结构边界。

如果沿着这种方向继续扩展,很容易重新出现越来越多的边界 Token。


九、再试一次:让 validator 的失败反馈真正进入下一次请求

项目正式翻译流程本来支持有限整页重试。

前一次 candidate 校验失败以后,可以生成 feedback,再交给下一次完整页面翻译。

但开发模式:

Plaintext
--dev

此前每运行一次命令,只执行一个 attempt。

这意味着前面的多个实验虽然连续执行,但实际上属于不同进程。

后一轮并没有真正收到上一轮 validation failure。

为了验证:

不增加新的保护,只告诉模型具体错在哪里,能不能自行纠正?

我又增加了:

Plaintext
--dev-attempts

例如:

Plaintext
--dev \
--dev-attempts 2

这样,同一个 TranslationRunner.Run 内就可以连续执行两个 attempt。

第一次失败后生成的 feedback,会真正加入第二次 user prompt。

针对链接标签新增 inline code 的情况,反馈也被改得更具体:

Plaintext
上一次输出在链接显示文本中新增了源页面不存在的行内代码格式。
不要给原本是普通文本的链接标签添加反引号或行内代码标记;
保留源页面已有的链接 target 和已有行内代码结构。
普通链接显示文字仍可正常翻译。
请重新翻译完整页面。

这里没有写死:

Plaintext
methods/24
image
image/color

因此仍然属于可以复用的通用反馈。


十、继续实验以后,又出现新的 font span 问题

最后一次真实实验使用:

Bash
go run -mod=readonly ./cmd/tour-i18n translate run \
    --locale zh-CN \
    --id methods/24 \
    --dev \
    --dev-attempts 2 \
    --minimal-protect

最终 attempt 7 仍然没有通过:

Plaintext
font span count mismatch:
expected 10, actual 9
图 4:加入连续重试与针对性反馈后,又暴露出新的 font span 结构问题
图 4:加入连续重试与针对性反馈后,又暴露出新的 font span 结构问题

到这里,整个实验已经开始出现一条很有代表性的路径:

Plaintext
完全 raw
↓
.play 被改写

只保护 .play
↓
链接标签被主动新增 inline code

增加精确反馈和连续重试
↓
又出现新的 font span 结构问题

这并不能说明 minimal-protect 的方向是错的。

相反,它已经证明:

Plaintext
.play

这样的机器结构非常适合采用最小保护。

而很多其他结构实际上也比我最初预想的稳定。

真正需要警惕的是:

如果每发现一种新失败,就立即增加一种新的保护规则,最后很可能又重新走回“大量 Token 化”。

只不过重新实现了一遍。


十一、因此我决定在这里停止继续优化

理论上,接下来还可以继续。

看到:

Plaintext
font span count mismatch

以后,再增加 emphasis/font span 保护。

然后测试 .image。

再测试其他 directive。

继续验证更多预格式化内容和复杂链接。

从纯技术研究角度看,这些都有价值。

但项目真正的目标不是:

写出一个理论上最完美的翻译保护框架。

真正的目标还是:

完成 A Tour of Go 简体中文翻译,并建立一套以后能够扩展其他语言的稳定流程。

而且继续进行这种高频架构实验,还存在一个非常现实的问题:

每发现一个现象,都需要 Codex 读取仓库、分析审计、修改程序、补测试,然后再做 GLM 实验。

开发资源不是无限的。

如果继续追求理论上的完美,很可能反而拖慢真正的翻译工作。

所以这次我决定:

实验到这里暂时收口,不继续主动扩展 minimal-protect。


十二、现在应该怎样评价默认方案与 raw-input?

经过这轮实验以后,我反而不认为应该简单地说:

raw-input 更好。

或者:

默认 protected-token 更好。

两种方案解决的是不同问题。

默认方案的优势很明显:

Plaintext
结构控制更成熟
已经经过多轮代表页验证
自动校验体系已经适配
当前可以继续正式生产翻译

raw-input 或 minimal-protect 的潜在优势同样明显:

Plaintext
模型看到更多真实上下文
提示输入更短
protected token 数量更少
restore 逻辑可能明显简化
程序长期维护成本可能更低

至于翻译质量,也不能只比较第一次机器输出。

raw-input 因为上下文更加完整,有可能直接产生更加自然的初稿。

但当前默认方案完成全部页面以后,还可以统一进行人工润色、术语调整和细节微调。

因此最终结果完全可能是:

Plaintext
默认 protected-token 方案
+ 自动校验
+ 后期人工润色

最终质量与 raw-input 相当,甚至超过 raw-input。

所以这次实验真正让我感兴趣的,不只是译文质量。

更重要的是:

有没有办法在不牺牲结构安全的前提下,让输入处理和恢复程序变得更简单。


十三、我现在更看好的长期方向

如果以后继续简化当前架构,我现在更倾向于:

Plaintext
完整原始页面优先
↓
只保护少量真正高风险的机器结构
↓
GLM-5.2 整页翻译
↓
最小恢复
↓
严格统一 validator
↓
针对性 retry feedback

也可以概括成:

Plaintext
真实上下文尽量交给模型
机器控制结构尽量不给模型修改权
最终安全由统一 validator 保证

这比“所有危险内容全部 Token 化”更加轻量。

同时也比:

Plaintext
完全 raw

更加可靠。

不过,这只是这次实验留下的一个长期方向。

它还没有成熟到可以直接替换当前正式流程。


十四、保存实验成果,但恢复正式翻译现场

虽然这轮实验暂时停止了,但所有代码和真实审计都保留下来了。

最终形成两个提交:

Plaintext
62b1b1a feat: 增加翻译输入实验与最小保护能力
35259cf docs: 记录翻译输入架构实验结论

其中保存了:

Plaintext
--raw-input
--minimal-protect
--dev-attempts
针对性 retry feedback
真实 request / response / validation 审计

实验过程中,因为使用了 --dev,flowcontrol/6 和 methods/24 的状态曾临时发生变化。

结束实验后,我又把:

Plaintext
status.tsv
candidate

全部恢复到正式实验前状态。

最终检查:

Plaintext
flowcontrol/6  ready
methods/24     ready
Working tree clean

两个提交也已经同步到:

Plaintext
origin/main
图 5:实验代码、真实审计与项目状态结论完成提交,正式翻译状态保持干净
图 5:实验代码、真实审计与项目状态结论完成提交,正式翻译状态保持干净

这样,这轮实验既没有丢失,也没有污染目前已经确认的正式翻译结果。

以后如果重新研究输入架构,可以直接基于这些真实 attempt 继续,而不是重新从头开始。


十五、下一步:回到真正的课程翻译

实验结束以后,当前正式翻译路径暂时不变:

继续使用已经成熟的 protected-token 流程。

接下来重新回到此前已经确定的计划:

开始普通 pending 页面自动试跑。

不再主动枚举剩余几十个页面可能出现的所有结构风险。

如果普通页面大多数能够直接通过,那么就继续推进。

只有实际出现新的失败时,再分析:

Plaintext
是模型真正翻译错了
还是保护层的问题
还是 validator 仍有缺口

然后只解决真实出现的问题。

这比在正式翻译开始以前不断预测未来边界,要更符合项目现在的阶段。


总结

这轮实验最开始的问题其实很简单:

输入给 GLM-5.2 之前,真的有必要做这么多 Token 保护吗?

flowcontrol/6 证明:

不做大规模保护,完整原始页面也可以直接通过现有统一校验,而且输入更加简洁。

methods/24 又证明:

完全 raw 不足以稳定保护 .play 这样的机器结构,大模型会主动“帮忙”修改它。

而 --minimal-protect 进一步证明:

少量、有明确证据支持的机器结构保护确实有效。

但继续实验以后又出现链接标签和 font span 等新问题,也提醒我:

如果每出现一种失败就继续增加一种保护规则,最终仍然可能回到复杂的 Token 系统。

因此,这次并没有得出“应该马上推翻现有方案”的结论。

当前默认方案已经成熟到足以继续完成剩余页面。

而且等所有页面翻译完成以后,还可以再统一做一次人工润色和微调,进一步提高最终译文质量。

这轮实验真正留下的价值,是让我更明确了以后可能的简化方向:

原始页面优先,减少不必要的 Token,只保护真正高风险的机器结构,再用严格 validator 和针对性重试反馈守住安全边界。

至于是否值得最终切换到这种架构,不需要现在急着决定。

先把真正的翻译项目继续做下去。

等第一阶段简体中文接近完成以后,再结合真实失败率、Token 消耗、程序复杂度和最终人工润色效果重新评估,可能会比现在继续追求一个理论上的最优方案更有价值。

A Tour of Go 中文翻译第二批实跑:从 Inline Code 顺序误判到历史响应重新验证 A Tour of Go 多语言翻译实战:第三批 10 页全部 Ready,继续校准 Protected Token 的结构角色

A Tour of Go 多语言翻译项目

本系列完整记录 A Tour of Go 多语言翻译项目从架构设计、整页翻译、结构保护、自动校验,到生产发布与后续维护的实际开发过程。

项目入口:
✅ Brazilian Portuguese — Português (Brasil)
✅ Dutch — Nederlands
✅ French — Français
✅ German — Deutsch
✅ Italian — Italiano
✅ Japanese — 日本語
✅ Korean — 한국어
✅ Simplified Chinese — 简体中文
✅ Spanish — Español
✅ Turkish — Türkçe
✅ 项目源码:GitHub:shuijingwan/go-tour-i18n

项目正在持续扩展更多语言版本,并长期维护翻译质量、生产发布与后续更新。项目属于非官方社区多语言翻译项目,与 Go 官方无隶属或授权关系。