9 月 24 日,我曾经做过一次 GPT-5.6 Sol High、GPT-6 Sol High 和 GPT-6 Sol Medium 的 Marathi 技术翻译对比,详细过程记录在上一篇文章中。
当时 GPT-5.6 Sol High 已经是我的正式默认翻译模型。测试的真正目的,是确认 GPT-6 Sol High 或 GPT-6 Sol Medium 是否已经足以接替它。最终四份有效 AI 盲审给出的三页平均分分别是 93.58、92.67、91.67,GPT-6 没有证明自己更好,所以我继续保留 GPT-5.6 Sol High。
现在 GPT-6.1 Sol 已经进入 Codex,我自然又有了同一个问题:GPT-6.1 Sol High 这次能不能真正超过 GPT-5.6 Sol High?
这篇只记录上一篇之后的新测试和新的决策。上一轮已经详细写过的盲审规则、Marathi glossary、六维百分制评分、protected token 机制以及为什么 automatic validation 不能替代独立 Reviewer,这里不再重复。
一、继续使用同一组 Marathi 基准,而不是重新挑题
为了尽量让结果可以和上一篇衔接,我继续使用同样三个复杂 Page:
methods/16:type switch 与密集术语;generics/1:type parameters 与comparableconstraint;concurrency/5:select的阻塞与执行语义。
GPT-5.6 Sol High 不重新生成,而是直接复用 2026 年 9 月 24 日保存下来的原始输出。这样可以避免因为重新采样而让 baseline 自己发生变化。
本轮真正新生成的是:
- Codex GPT-6.1 Sol High;
- Codex GPT-6.1 Sol Medium。
两者都使用与历史 benchmark 字节一致的 frozen English source、protected input、Marathi glossary、Translation Task Spec 和 Generation instruction,各自在一个独立 invocation 中完成三个 Page。
执行时间方面,这一次 GPT-6.1 Sol High 大约用了 91 秒,GPT-6.1 Sol Medium 大约用了 70 秒。这次我没有再把 Codex Usage 百分比当作核心比较指标,因为上一篇已经证明:订阅额度存在延迟结算,单次刷新很难精确归因。
二、Index-Translate API 能用,但 4096 context 装不下完整测试
本来这次还准备增加一个新的 contender:Index-Translate-35B-A3B。
它的免费公开 API 本身是正常工作的。我实际发送了短文本请求,能够正常返回翻译结果。真正的问题是当前 public preview serving 的 context window。
把这次完整 frozen benchmark 输入打包后,请求大约包含 12,353 prompt tokens,而官方接口返回:
n_ctx = 4096 exceed_context_size_error
理论上,我可以删 glossary、删任务规范、压缩 context,或者把三个 Page 拆成多次请求。但这样以后,它面对的实验条件就和 GPT-5.6 / GPT-6.1 不一样了。
所以这次没有为了“凑四个模型”而改变测试条件。Index-Translate 的状态是 NOT SCORED:不是翻译质量失败,而是当前公开 API 的 serving 规格无法承载这套完整 frozen input。以后 context window 提高后,可以直接用同一套 benchmark 再补测。
三、这次终于拿齐了五份独立 Reviewer 报告
Reviewer 方案本身不是这次新发明的。上一篇同样计划使用五家 AI 独立盲审,只是当时千问连续三次执行失败,最终只保留 ChatGPT、豆包、DeepSeek 和 GLM 四份完整有效报告。
这一次五家都顺利完成:
- ChatGPT GPT-5.6 Sol High;
- DeepSeek;
- GLM 5.3 极致;
- 千问;
- 豆包。
评分规则完全沿用上一篇,不再赘述。唯一进一步收紧的地方,是我给五个 Reviewer 分别生成了独立的 A/B/C blind mapping,而且三个真实模型在全部 15 个“Reviewer × Page”位置中,落在 Candidate A、B、C 各恰好 5 次。
这样除了隐藏模型身份,也进一步降低了 Candidate 标签位置本身可能带来的偏差。
四、一个旧 checker 还差点误杀 GPT-6.1 Medium
GPT-6.1 Sol Medium 的 generics/1 在旧 benchmark checker 中曾经报出一次 protected token sequence mismatch。
继续检查后发现,它并没有丢失、重复或修改任何 protected token,只是为了 Marathi 的自然语序,把两个完整 inline-code pair 整体换了位置。
而当前正式 Page contract 明确允许这种 whole-pair reorder;重新按历史 token mapping restore 后,再使用当前正式 ValidateCandidate 检查也正常 PASS。
因此这次被归类为 legacy checker false positive,GPT-6.1 Medium 保留正式评分资格,也没有为了“修成绩”而重新生成。
这件事和上一篇的结论其实是一致的:机械验证必须严格,但 validator 本身也需要接受规范约束,不能把目标语言为了自然语序进行的合法结构调整误判成翻译缺陷。
五、揭盲后,GPT-5.6 Sol High 仍然第一
五份 Reviewer 报告全部完成后,我才读取本地 private mapping,把每个 Page 的 Candidate A/B/C 还原成真实 Generation 模型。
这里还有一个统计细节:由于 A/B/C 是逐 Page 独立随机的,所以 Reviewer 自己在报告结尾计算的“Candidate A 三页平均分”不能直接对应某个真实模型。最终模型成绩必须在揭盲以后,根据每个 Page 的真实 mapping 重新聚合。
| Reviewer | GPT-5.6 Sol High | GPT-6.1 Sol High | GPT-6.1 Sol Medium |
|---|---|---|---|
| ChatGPT | 97.67 | 97.67 | 96.00 |
| DeepSeek | 96.00 | 92.67 | 92.67 |
| GLM 5.3 极致 | 94.00 | 91.67 | 92.00 |
| 千问 | 81.67 | 85.33 | 82.67 |
| 豆包 | 94.00 | 93.67 | 95.00 |
| 五 Reviewer 平均 | 92.67 | 92.20 | 91.67 |
| 中位数 | 94.00 | 92.67 | 92.67 |
最终排名仍然是:
1. GPT-5.6 Sol High 92.67 2. GPT-6.1 Sol High 92.20 3. GPT-6.1 Sol Medium 91.67
GPT-5.6 Sol High 比 GPT-6.1 Sol High 只高 0.47 分,比 Medium 高 1.00 分。
所以这绝对不是“5.6 碾压 6.1”。更准确的结论是:三个模型已经处于非常接近的高质量区间,但 GPT-6.1 High 仍然没有证明自己应该取代 incumbent。
六、按 Page 看,GPT-6.1 High 也有明显胜出的地方
| Page | GPT-5.6 High | GPT-6.1 High | GPT-6.1 Medium |
|---|---|---|---|
methods/16 | 93.2 | 91.4 | 91.2 |
generics/1 | 93.4 | 90.6 | 91.6 |
concurrency/5 | 91.4 | 94.6 | 92.2 |
GPT-5.6 在 Methods 和 Generics 上更稳,但 GPT-6.1 High 在 Concurrency 上反而明显领先。
这更像是不同模型在不同技术表达场景中的细微优势,而不是某一个模型全面压倒另一个模型。
15 个独立 Page 排名中,GPT-5.6 Sol High 获得 6 次第一,GPT-6.1 Sol Medium 获得 5 次,GPT-6.1 Sol High 获得 4 次,同样没有出现压倒性差距。
七、这次结果也提醒我,不要太迷信绝对分数
这轮还有一个很值得注意的现象:五个 Reviewer 的打分尺度差别很大。
ChatGPT 对优秀译文经常给到 98~99,千问明显更严格,很多分数只有 77~90。不同 Reviewer 对同一个小问题究竟算 Minor 还是 Major,也并不总是一致。
甚至同一份 GPT-5.6 Sol High 历史输出,在上一篇四 Reviewer 中的总均分是 93.58,这一次五 Reviewer 聚合以后变成 92.67。译文本身一个字都没有变,变化的是 Reviewer panel。
这本身就说明,跨轮 benchmark 不应该过度解读零点几分的绝对差值。真正更值得关注的是:谁长期保持前列、多个 Reviewer 是否得到一致方向、有没有 Critical technical defect,以及结果换一组 Reviewer 后会不会翻转。
作为一个简单的敏感性检查,如果完全去掉这次明显更严格的千问报告,其余四位 Reviewer 的平均分仍然是:
GPT-5.6 Sol High 95.42 GPT-6.1 Sol High 93.92 GPT-6.1 Sol Medium 93.92
排名仍然没有反转。
八、所以这一次还是不切换默认模型
如果问题只是“GPT-6.1 Sol High 能不能做高质量技术翻译”,答案已经很明确:能,而且已经非常接近 GPT-5.6 Sol High。
但如果问题是“有没有足够证据让我把正式 Generation 默认从 GPT-5.6 Sol High 切过去”,这次答案仍然是否定的。
当前执行决定因此保持:
正式 Generation 默认: GPT-5.6 Sol High 独立 Reviewer: GPT-5.6 Sol High 可信 Generation fallback / 下一位候选: GPT-6.1 Sol High 暂不作为最高质量默认: GPT-6.1 Sol Medium Index-Translate-35B-A3B: NOT SCORED 当前 public preview context 不足
GPT-6.1 Medium 这次大约 70 秒就完成了三个 Page,确实比 High 更快。但在我的项目里,几十秒的 Generation 时间远没有 revision、re-QC 和长期翻译质量重要,所以目前也没有因为速度而降低 reasoning effort 的必要。
上一篇的结论是:GPT-6 Sol 没有证明自己应该取代 5.6。到了 GPT-6.1,这个差距已经进一步缩小到几乎可以忽略,但最终结论仍然没有改变。
新模型不是因为版本号更高就自动替换旧模型,而是要等同一套生产约束下的实际证据证明它更好。
至少在目前这组 Marathi 技术翻译 benchmark 中,GPT-5.6 Sol High 仍然守住了默认 Generation 模型的位置;GPT-6.1 Sol High 则已经成为一个非常接近、并且我愿意随时启用的后备选择。
