没有不值得去解决的问题,也没有不值得去学习的技术!

GPT-6.1 能取代 GPT-5.6 做翻译吗?一次 3 模型 × 5 Reviewer 的盲测

作者:

在

9 月 24 日,我曾经做过一次 GPT-5.6 Sol High、GPT-6 Sol High 和 GPT-6 Sol Medium 的 Marathi 技术翻译对比,详细过程记录在上一篇文章中。

当时 GPT-5.6 Sol High 已经是我的正式默认翻译模型。测试的真正目的,是确认 GPT-6 Sol High 或 GPT-6 Sol Medium 是否已经足以接替它。最终四份有效 AI 盲审给出的三页平均分分别是 93.58、92.67、91.67,GPT-6 没有证明自己更好,所以我继续保留 GPT-5.6 Sol High。

现在 GPT-6.1 Sol 已经进入 Codex,我自然又有了同一个问题:GPT-6.1 Sol High 这次能不能真正超过 GPT-5.6 Sol High?

这篇只记录上一篇之后的新测试和新的决策。上一轮已经详细写过的盲审规则、Marathi glossary、六维百分制评分、protected token 机制以及为什么 automatic validation 不能替代独立 Reviewer,这里不再重复。

一、继续使用同一组 Marathi 基准,而不是重新挑题

为了尽量让结果可以和上一篇衔接,我继续使用同样三个复杂 Page:

  • methods/16:type switch 与密集术语;
  • generics/1:type parameters 与 comparable constraint;
  • concurrency/5:select 的阻塞与执行语义。

GPT-5.6 Sol High 不重新生成,而是直接复用 2026 年 9 月 24 日保存下来的原始输出。这样可以避免因为重新采样而让 baseline 自己发生变化。

本轮真正新生成的是:

  • Codex GPT-6.1 Sol High;
  • Codex GPT-6.1 Sol Medium。

两者都使用与历史 benchmark 字节一致的 frozen English source、protected input、Marathi glossary、Translation Task Spec 和 Generation instruction,各自在一个独立 invocation 中完成三个 Page。

执行时间方面,这一次 GPT-6.1 Sol High 大约用了 91 秒,GPT-6.1 Sol Medium 大约用了 70 秒。这次我没有再把 Codex Usage 百分比当作核心比较指标,因为上一篇已经证明:订阅额度存在延迟结算,单次刷新很难精确归因。

二、Index-Translate API 能用,但 4096 context 装不下完整测试

本来这次还准备增加一个新的 contender:Index-Translate-35B-A3B。

它的免费公开 API 本身是正常工作的。我实际发送了短文本请求,能够正常返回翻译结果。真正的问题是当前 public preview serving 的 context window。

把这次完整 frozen benchmark 输入打包后,请求大约包含 12,353 prompt tokens,而官方接口返回:

n_ctx = 4096
exceed_context_size_error

理论上,我可以删 glossary、删任务规范、压缩 context,或者把三个 Page 拆成多次请求。但这样以后,它面对的实验条件就和 GPT-5.6 / GPT-6.1 不一样了。

所以这次没有为了“凑四个模型”而改变测试条件。Index-Translate 的状态是 NOT SCORED:不是翻译质量失败,而是当前公开 API 的 serving 规格无法承载这套完整 frozen input。以后 context window 提高后,可以直接用同一套 benchmark 再补测。

三、这次终于拿齐了五份独立 Reviewer 报告

Reviewer 方案本身不是这次新发明的。上一篇同样计划使用五家 AI 独立盲审,只是当时千问连续三次执行失败,最终只保留 ChatGPT、豆包、DeepSeek 和 GLM 四份完整有效报告。

这一次五家都顺利完成:

  • ChatGPT GPT-5.6 Sol High;
  • DeepSeek;
  • GLM 5.3 极致;
  • 千问;
  • 豆包。

评分规则完全沿用上一篇,不再赘述。唯一进一步收紧的地方,是我给五个 Reviewer 分别生成了独立的 A/B/C blind mapping,而且三个真实模型在全部 15 个“Reviewer × Page”位置中,落在 Candidate A、B、C 各恰好 5 次。

这样除了隐藏模型身份,也进一步降低了 Candidate 标签位置本身可能带来的偏差。

四、一个旧 checker 还差点误杀 GPT-6.1 Medium

GPT-6.1 Sol Medium 的 generics/1 在旧 benchmark checker 中曾经报出一次 protected token sequence mismatch。

继续检查后发现,它并没有丢失、重复或修改任何 protected token,只是为了 Marathi 的自然语序,把两个完整 inline-code pair 整体换了位置。

而当前正式 Page contract 明确允许这种 whole-pair reorder;重新按历史 token mapping restore 后,再使用当前正式 ValidateCandidate 检查也正常 PASS。

因此这次被归类为 legacy checker false positive,GPT-6.1 Medium 保留正式评分资格,也没有为了“修成绩”而重新生成。

这件事和上一篇的结论其实是一致的:机械验证必须严格,但 validator 本身也需要接受规范约束,不能把目标语言为了自然语序进行的合法结构调整误判成翻译缺陷。

五、揭盲后,GPT-5.6 Sol High 仍然第一

五份 Reviewer 报告全部完成后,我才读取本地 private mapping,把每个 Page 的 Candidate A/B/C 还原成真实 Generation 模型。

这里还有一个统计细节:由于 A/B/C 是逐 Page 独立随机的,所以 Reviewer 自己在报告结尾计算的“Candidate A 三页平均分”不能直接对应某个真实模型。最终模型成绩必须在揭盲以后,根据每个 Page 的真实 mapping 重新聚合。

ReviewerGPT-5.6 Sol HighGPT-6.1 Sol HighGPT-6.1 Sol Medium
ChatGPT97.6797.6796.00
DeepSeek96.0092.6792.67
GLM 5.3 极致94.0091.6792.00
千问81.6785.3382.67
豆包94.0093.6795.00
五 Reviewer 平均92.6792.2091.67
中位数94.0092.6792.67

最终排名仍然是:

1. GPT-5.6 Sol High      92.67
2. GPT-6.1 Sol High      92.20
3. GPT-6.1 Sol Medium    91.67

GPT-5.6 Sol High 比 GPT-6.1 Sol High 只高 0.47 分,比 Medium 高 1.00 分。

所以这绝对不是“5.6 碾压 6.1”。更准确的结论是:三个模型已经处于非常接近的高质量区间,但 GPT-6.1 High 仍然没有证明自己应该取代 incumbent。

六、按 Page 看,GPT-6.1 High 也有明显胜出的地方

PageGPT-5.6 HighGPT-6.1 HighGPT-6.1 Medium
methods/1693.291.491.2
generics/193.490.691.6
concurrency/591.494.692.2

GPT-5.6 在 Methods 和 Generics 上更稳,但 GPT-6.1 High 在 Concurrency 上反而明显领先。

这更像是不同模型在不同技术表达场景中的细微优势,而不是某一个模型全面压倒另一个模型。

15 个独立 Page 排名中,GPT-5.6 Sol High 获得 6 次第一,GPT-6.1 Sol Medium 获得 5 次,GPT-6.1 Sol High 获得 4 次,同样没有出现压倒性差距。

七、这次结果也提醒我,不要太迷信绝对分数

这轮还有一个很值得注意的现象:五个 Reviewer 的打分尺度差别很大。

ChatGPT 对优秀译文经常给到 98~99,千问明显更严格,很多分数只有 77~90。不同 Reviewer 对同一个小问题究竟算 Minor 还是 Major,也并不总是一致。

甚至同一份 GPT-5.6 Sol High 历史输出,在上一篇四 Reviewer 中的总均分是 93.58,这一次五 Reviewer 聚合以后变成 92.67。译文本身一个字都没有变,变化的是 Reviewer panel。

这本身就说明,跨轮 benchmark 不应该过度解读零点几分的绝对差值。真正更值得关注的是:谁长期保持前列、多个 Reviewer 是否得到一致方向、有没有 Critical technical defect,以及结果换一组 Reviewer 后会不会翻转。

作为一个简单的敏感性检查,如果完全去掉这次明显更严格的千问报告,其余四位 Reviewer 的平均分仍然是:

GPT-5.6 Sol High      95.42
GPT-6.1 Sol High      93.92
GPT-6.1 Sol Medium    93.92

排名仍然没有反转。

八、所以这一次还是不切换默认模型

如果问题只是“GPT-6.1 Sol High 能不能做高质量技术翻译”,答案已经很明确:能,而且已经非常接近 GPT-5.6 Sol High。

但如果问题是“有没有足够证据让我把正式 Generation 默认从 GPT-5.6 Sol High 切过去”,这次答案仍然是否定的。

当前执行决定因此保持:

正式 Generation 默认:
GPT-5.6 Sol High

独立 Reviewer:
GPT-5.6 Sol High

可信 Generation fallback / 下一位候选:
GPT-6.1 Sol High

暂不作为最高质量默认:
GPT-6.1 Sol Medium

Index-Translate-35B-A3B:
NOT SCORED
当前 public preview context 不足

GPT-6.1 Medium 这次大约 70 秒就完成了三个 Page,确实比 High 更快。但在我的项目里,几十秒的 Generation 时间远没有 revision、re-QC 和长期翻译质量重要,所以目前也没有因为速度而降低 reasoning effort 的必要。

上一篇的结论是:GPT-6 Sol 没有证明自己应该取代 5.6。到了 GPT-6.1,这个差距已经进一步缩小到几乎可以忽略,但最终结论仍然没有改变。

新模型不是因为版本号更高就自动替换旧模型,而是要等同一套生产约束下的实际证据证明它更好。

至少在目前这组 Marathi 技术翻译 benchmark 中,GPT-5.6 Sol High 仍然守住了默认 Generation 模型的位置;GPT-6.1 Sol High 则已经成为一个非常接近、并且我愿意随时启用的后备选择。

关于作者 · 持续学习与技术实践

我是一名拥有 15 年以上开发经验的技术从业者,自 2013 年起持续运营个人技术博客,记录工作与个人项目中遇到的真实问题,以及解决问题过程中的探索、实践和思考。

除了技术写作,我也在持续开发和维护自己的独立项目,探索新技术和新工具在实际场景中的应用。我始终相信,没有不值得去解决的问题,也没有不值得去学习的技术。

如果这篇文章对你有所帮助,欢迎浏览博客中的其他文章,也欢迎交流技术经验与想法。

关于我  ·  GitHub  ·  邮件联系