盲评实验 标签归档 - 永夜 没有不值得去解决的问题,也没有不值得去学习的技术! Mon, 17 Aug 2026 09:49:29 +0000 zh-Hans hourly 1 https://wordpress.org/?v=7.1.2 https://media.shuijingwanwq.com/2026/05/logo-150x150.png 盲评实验 标签归档 - 永夜 32 32 A Tour of Go 翻译实验:更多原始上下文为什么没有更好?从 157 个保护标记到 30 次重复盲评 https://www.shuijingwanwq.com/2026/08/17/26558/ Mon, 17 Aug 2026 09:34:49 +0000 https://www.shuijingwanwq.com/?p=26558 在 A Tour of Go 简体中文翻译流程中,我一直担心大量 protected token 会遮挡模型上下文,从而影响 GLM-5.2 的翻译质量。为验证这一点,我先将保护策略缩减到 minimal-v1,又进一步设计了只额外暴露静态代码的 Static Context 单变量实验。结果却逐渐指向另一个问题:7 个代表页中的 157 个保护标记并没有隐藏任何可翻译英文自然语言,而完全相同的 API Request 在 5 个页面上全部生成了不同的 Response。随后通过 5 页、2 种模式、3 次独立运行共 30 个计划样本,并对所有通过结构校验的译文进行匿名多候选排名,最终发现模型自身的运行间波动明显大于目前能够观察到的 Static Context 质量收益。基于这一结果,正式翻译流程继续保留成熟的 Default protected-token 方案,而 minimal-v1 与 Static Context 保留为开发实验能力。

A Tour of Go 翻译实验:更多原始上下文为什么没有更好?从 157 个保护标记到 30 次重复盲评最先出现在永夜。

]]>