标签: 匿名评审
-
本次重新评估 A Tour of Go 的 TranslationUnit 翻译方案,根本原因不是单纯比较模型能力,而是 ChatGPT 作为批量翻译引擎在实际工作中出现持续稳定性问题,即使从 ZIP 交付简化为 JSON,翻译任务仍可能卡住。实验使用 5 个正式 TranslationUnit、完整 zh-CN glossary、protected token、独立随机匿名和 Engineering Gate,对 ChatGPT GPT-5.6 High、Codex GPT-5.6 Sol High 与 Extra High 进行四模型匿名评审。结果显示,ChatGPT High 的外部评审平均分为 96.67,Codex High 为 95.73,Extra High 为 95.87,三者已进入相近的高质量梯队,而 Extra High 并未表现出稳定优势。综合翻译质量与本地批量执行能力,后续默认翻译引擎准备调整为 Codex GPT-5.6 Sol High,ChatGPT 则重点用于统一 Quality Check,并以所有 TranslationUnit 最终达到 A 作为质量验收目标。
-
在完成 A Tour of Go 简体中文 103 个课程页面后,我继续验证如何把现有约 94 分的工程性翻译质量进一步提升到 96~97 分。最初重点研究 minimal-protect,希望通过减少 protected token、保留更多原始上下文改善 GLM-5.2 译文,但后续对 157 个 protected token 的信息损失审计、Static Context 实验以及重复请求测试均未显示稳定质量优势,因此优化重点从 Protection Policy 转向 Translation Engine。本轮选取 methods/24、concurrency/7、concurrency/11 三个代表页,由 ChatGPT、Codex Sol 和 GLM-5.2 独立生成最终译文,再交给 ChatGPT、DeepSeek、GLM-5.2 和豆包进行 12 次匿名质量评审。ChatGPT 获得 8/12 第一名,即使排除自身作为评审模型后仍获得 5/9 第一名。现阶段不会立即覆盖已有 103 页,而是准备进一步验证自动化 ChatGPT retranslation staging,在统一 validator 和页面验证基础上评估是否值得全量重译。
