标签: AI 翻译
-
在完成 A Tour of Go 简体中文 103 个正式课程页面的 ChatGPT 全量重译后,我没有立即覆盖现有正式译文,而是继续进行了完整语义质量审核,并使用 A/B/C/D 四级标准区分“可以直接发布”“可选优化”“建议修订”和“必须修复”。审核过程中曾有 2 页处于 B 级,本身已经达到发布质量,但由于最终只剩少量页面且修改成本很低,仍继续 revision,最终达到 A=103、B/C/D=0。随后项目进一步完善 canonical promotion 的 evidence chain、retry provenance 与 EOF normalization,确认每个正式 candidate 都能追溯到对应的 ChatGPT 原始译文和最终有效 attempt。正式 apply 后 103 页中 102 页发生变化,80 页完成确定性 EOF normalization,再次 dry-run 得到 0 changed、103 unchanged,完整测试最终通过。结合 103 页全量重译、完整语义审核和统一工程验证,我对当前 zh-CN 的内部综合质量评价由原来的约 94 …
-
在 A Tour of Go 简体中文项目中,上一篇实验已经确认 ChatGPT 值得作为新的 Translation Engine 继续扩大验证。本轮进一步将实验扩展到全部 103 个正式课程页面,并通过固定 retranslation batch、GitHub 数据交接、ChatGPT 整页翻译、raw response 保存、restore、统一 validator 与有限 retry,完成 103/103 全量重译。整个过程没有改变原有完整 present.Section 翻译单元和结构校验体系,而是利用 ChatGPT + GitHub 减少大量人工复制粘贴,并通过 11 个 Batch、独立 Git 提交和历史 evidence 保留,使新的 ChatGPT 译文能够进入可追踪、可校验的工程流程,为后续完整语义审核和 canonical promotion 做好准备。
-
在完成 A Tour of Go 简体中文 103 个课程页面后,我继续验证如何把现有约 94 分的工程性翻译质量进一步提升到 96~97 分。最初重点研究 minimal-protect,希望通过减少 protected token、保留更多原始上下文改善 GLM-5.2 译文,但后续对 157 个 protected token 的信息损失审计、Static Context 实验以及重复请求测试均未显示稳定质量优势,因此优化重点从 Protection Policy 转向 Translation Engine。本轮选取 methods/24、concurrency/7、concurrency/11 三个代表页,由 ChatGPT、Codex Sol 和 GLM-5.2 独立生成最终译文,再交给 ChatGPT、DeepSeek、GLM-5.2 和豆包进行 12 次匿名质量评审。ChatGPT 获得 8/12 第一名,即使排除自身作为评审模型后仍获得 5/9 第一名。现阶段不会立即覆盖已有 103 页,而是准备进一步验证自动化 ChatGPT retranslation stagin…
-
在 A Tour of Go 简体中文翻译流程中,我一直担心大量 protected token 会遮挡模型上下文,从而影响 GLM-5.2 的翻译质量。为验证这一点,我先将保护策略缩减到 minimal-v1,又进一步设计了只额外暴露静态代码的 Static Context 单变量实验。结果却逐渐指向另一个问题:7 个代表页中的 157 个保护标记并没有隐藏任何可翻译英文自然语言,而完全相同的 API Request 在 5 个页面上全部生成了不同的 Response。随后通过 5 页、2 种模式、3 次独立运行共 30 个计划样本,并对所有通过结构校验的译文进行匿名多候选排名,最终发现模型自身的运行间波动明显大于目前能够观察到的 Static Context 质量收益。基于这一结果,正式翻译流程继续保留成熟的 Default protected-token 方案,而 minimal-v1 与 Static Context 保留为开发实验能力。
-
在一篇包含大量 Gutenberg 段落、引用、列表、图片和 90 个 Code Block Pro 区块的超长文章中,我继续验证 WordPress 中文到英文整篇 AI 翻译流程。排查过程中先后发现受保护标记过多、普通段落边界过度保护、Plaintext Code Block Pro 内容字段被误判为结构变化,以及空白 freeform 导致 PARAGRAPH_RUN 结构签名漂移等问题。通过引入普通段落区域、区分内容字段与结构配置、修正最终 Gutenberg 结构签名后,受保护标记降至 506 个,最终仍以一次完整 GLM-5.2 请求成功生成英文译文,并通过 Gutenberg 编辑器实际验证。
-
在 WordPress 后台使用 SlyTranslate + GLM-5.2 翻译技术文章时,一次看似普通的尾部 STRUCT Token 缺失,最终定位为两个 INLINE Token 为适应自然英文语序发生了合法换位。主校验允许这种变化,但 Tail Repair 仍要求完整 raw Token 序列保持原始前缀,导致安全的尾部结构修复被错误阻断。本文记录从 first_mismatch_index=814 定位真实差异、修正 Tail Repair 为 fixed Token 前缀判断、补充回归测试,到生产部署并验证同一文章最终翻译成功的完整过程。
-
本文记录了一次 WordPress 历史文章英文覆盖翻译过程中遇到的 HTTP 400 内容安全拦截问题。排查最初从网络访问相关技术术语入手,但连续进行中文名称和中性表达改写后仍然失败。随后转向文章中的国家和地区流量统计内容,通过逐步概括相关表达并重新建立当前中文源基线,最终成功完成 GLM-5.2 英文覆盖翻译。文章同时总结了内容安全错误的定位思路、WordPress 图片 ALT 对翻译输入的影响,以及历史文章处理中优先采用等义改写而非直接删除内容的实践原则。
-
A Tour of Go 多语言翻译项目完成简体中文课程正文的全量翻译:基于官方 upstream master@e11dacba76c5aae474746e9eedee19693f492803,重新确认 101 个普通顶层 Section 加 2 个 #appengine 条件顶层 Section,共计 103 个课程页面。批量翻译过程中进一步修复了行内代码完整结构换位导致的恢复边界问题,以及完整链接按中文自然语序换位导致的校验误判,并直接利用已有 GLM-5.2 历史响应重新校验恢复。最终状态达到 ready=103、pending=0、blocked=0,课程正文翻译阶段正式完成,下一步进入 zh-CN 发布前全局验收。
-
A Tour of Go 多语言翻译项目继续推进第三批普通页面。本批最初 10 页中有 8 页直接进入 ready,flowcontrol/10 与 moretypes/1 因静态预格式化代码块、行内结构和教学注释 Go 标识符等问题进入 blocked。排查过程中进一步确认:Protected Token 不仅需要保护 payload,还需要向模型明确其结构角色;同时 static preformatted block 的 token 化还曾吞掉原有块级换行边界,导致模型输入本身误导结构判断。完成首次 Prompt、protected input 边界和教学注释标识符角色校准后,两页均在干净首次请求中通过全部自动校验;同时修复了 retry feedback 因 diagnostic suffix 中包含 directive 而导致的字符串误分类。第三批最终实现 10/10 ready,全局状态更新为 ready=45、pending=58、blocked=0。
-
A Tour of Go 多语言翻译项目完成最后 3 个代表页 concurrency/7、concurrency/11 和 methods/24 的真实翻译与校准,总代表页达到 7 页。本轮继续发现并修复了非尾部指令位置校验、standalone 条件源码投影、Go 普通英语词义误保护、链接显示文本内行内代码保护,以及中文全角标点与 legacy present 行内代码边界等问题。多次失败还通过保存原始模型响应、本地回放和统一校验确认了真正根因。至此代表页校准阶段结束,下一步将进入 10 个普通 pending 页面自动试跑。
