标签: AI 翻译
-
在完成 A Tour of Go 简体中文 103 个课程页面后,我继续验证如何把现有约 94 分的工程性翻译质量进一步提升到 96~97 分。最初重点研究 minimal-protect,希望通过减少 protected token、保留更多原始上下文改善 GLM-5.2 译文,但后续对 157 个 protected token 的信息损失审计、Static Context 实验以及重复请求测试均未显示稳定质量优势,因此优化重点从 Protection Policy 转向 Translation Engine。本轮选取 methods/24、concurrency/7、concurrency/11 三个代表页,由 ChatGPT、Codex Sol 和 GLM-5.2 独立生成最终译文,再交给 ChatGPT、DeepSeek、GLM-5.2 和豆包进行 12 次匿名质量评审。ChatGPT 获得 8/12 第一名,即使排除自身作为评审模型后仍获得 5/9 第一名。现阶段不会立即覆盖已有 103 页,而是准备进一步验证自动化 ChatGPT retranslation staging,在统一 validator 和页面验证基础上评估是否值得全量重译。
-
在 A Tour of Go 简体中文翻译流程中,我一直担心大量 protected token 会遮挡模型上下文,从而影响 GLM-5.2 的翻译质量。为验证这一点,我先将保护策略缩减到 minimal-v1,又进一步设计了只额外暴露静态代码的 Static Context 单变量实验。结果却逐渐指向另一个问题:7 个代表页中的 157 个保护标记并没有隐藏任何可翻译英文自然语言,而完全相同的 API Request 在 5 个页面上全部生成了不同的 Response。随后通过 5 页、2 种模式、3 次独立运行共 30 个计划样本,并对所有通过结构校验的译文进行匿名多候选排名,最终发现模型自身的运行间波动明显大于目前能够观察到的 Static Context 质量收益。基于这一结果,正式翻译流程继续保留成熟的 Default protected-token 方案,而 minimal-v1 与 Static Context 保留为开发实验能力。
-
在一篇包含大量 Gutenberg 段落、引用、列表、图片和 90 个 Code Block Pro 区块的超长文章中,我继续验证 WordPress 中文到英文整篇 AI 翻译流程。排查过程中先后发现受保护标记过多、普通段落边界过度保护、Plaintext Code Block Pro 内容字段被误判为结构变化,以及空白 freeform 导致 PARAGRAPH_RUN 结构签名漂移等问题。通过引入普通段落区域、区分内容字段与结构配置、修正最终 Gutenberg 结构签名后,受保护标记降至 506 个,最终仍以一次完整 GLM-5.2 请求成功生成英文译文,并通过 Gutenberg 编辑器实际验证。
-
在 WordPress 后台使用 SlyTranslate + GLM-5.2 翻译技术文章时,一次看似普通的尾部 STRUCT Token 缺失,最终定位为两个 INLINE Token 为适应自然英文语序发生了合法换位。主校验允许这种变化,但 Tail Repair 仍要求完整 raw Token 序列保持原始前缀,导致安全的尾部结构修复被错误阻断。本文记录从 first_mismatch_index=814 定位真实差异、修正 Tail Repair 为 fixed Token 前缀判断、补充回归测试,到生产部署并验证同一文章最终翻译成功的完整过程。
-
本文记录了一次 WordPress 历史文章英文覆盖翻译过程中遇到的 HTTP 400 内容安全拦截问题。排查最初从网络访问相关技术术语入手,但连续进行中文名称和中性表达改写后仍然失败。随后转向文章中的国家和地区流量统计内容,通过逐步概括相关表达并重新建立当前中文源基线,最终成功完成 GLM-5.2 英文覆盖翻译。文章同时总结了内容安全错误的定位思路、WordPress 图片 ALT 对翻译输入的影响,以及历史文章处理中优先采用等义改写而非直接删除内容的实践原则。
-
A Tour of Go 多语言翻译项目完成简体中文课程正文的全量翻译:基于官方 upstream master@e11dacba76c5aae474746e9eedee19693f492803,重新确认 101 个普通顶层 Section 加 2 个 #appengine 条件顶层 Section,共计 103 个课程页面。批量翻译过程中进一步修复了行内代码完整结构换位导致的恢复边界问题,以及完整链接按中文自然语序换位导致的校验误判,并直接利用已有 GLM-5.2 历史响应重新校验恢复。最终状态达到 ready=103、pending=0、blocked=0,课程正文翻译阶段正式完成,下一步进入 zh-CN 发布前全局验收。
-
A Tour of Go 多语言翻译项目继续推进第三批普通页面。本批最初 10 页中有 8 页直接进入 ready,flowcontrol/10 与 moretypes/1 因静态预格式化代码块、行内结构和教学注释 Go 标识符等问题进入 blocked。排查过程中进一步确认:Protected Token 不仅需要保护 payload,还需要向模型明确其结构角色;同时 static preformatted block 的 token 化还曾吞掉原有块级换行边界,导致模型输入本身误导结构判断。完成首次 Prompt、protected input 边界和教学注释标识符角色校准后,两页均在干净首次请求中通过全部自动校验;同时修复了 retry feedback 因 diagnostic suffix 中包含 directive 而导致的字符串误分类。第三批最终实现 10/10 ready,全局状态更新为 ready=45、pending=58、blocked=0。
-
A Tour of Go 多语言翻译项目完成最后 3 个代表页 concurrency/7、concurrency/11 和 methods/24 的真实翻译与校准,总代表页达到 7 页。本轮继续发现并修复了非尾部指令位置校验、standalone 条件源码投影、Go 普通英语词义误保护、链接显示文本内行内代码保护,以及中文全角标点与 legacy present 行内代码边界等问题。多次失败还通过保存原始模型响应、本地回放和统一校验确认了真正根因。至此代表页校准阶段结束,下一步将进入 10 个普通 pending 页面自动试跑。
-
在一次 GLM-5.2 WordPress 整篇翻译完成后,服务器 Trace 明确记录了 3 次 API 请求,但智谱开放平台的费用明细却显示了 4 条模型推理记录。通过导出费用明细 Excel,并结合请求时间、输入与输出 Tokens、请求次数以及资源包余额进行交叉核对,最终确认费用明细的一行并不等于一次 API 请求:同一时间范围内的请求会汇总统计,而输入 Tokens 与输出 Tokens 又分别形成计费记录。本次 3 次请求共消耗 10,880 Tokens,与新用户赠送的 200 万通用模型推理资源包余额变化完全一致,同时也验证了资源包抵扣与“后付费”字段的实际含义。
-
在 WordPress 历史文章英文覆盖翻译过程中,文章 ID 4652 持续触发 GLM-5.2 HTTP 400 安全检测错误。通过执行 Trace、模型真实 Payload 与 Plaintext Region 分析,最终发现多个不含中文的服务器日志、文件列表等 Plaintext 区块没有翻译必要,却仍被完整发送给模型。本文记录如何调整 Code Block Pro Plaintext 保护策略,将纯机器文本改为 SWQBLOCK 整体保护,使正文 Payload 从 49938 字符降至 8876 字符,并继续处理 Ctrl+C 遗留状态、recovery_generation 重试计数、counter_drift 与 WordPress REST Nonce 过期问题,最终成功完成 GLM-5.2 整篇翻译。
