标签: 模型评测
-
在 GPT-6.1 Sol 上线 Codex 后,我重新使用此前的 Marathi 技术翻译基准,对 GPT-5.6 Sol High、GPT-6.1 Sol High 和 GPT-6.1 Sol Medium 进行盲测。测试继续使用相同的三个复杂 A Tour of Go 页面,并由 ChatGPT、DeepSeek、GLM、千问和豆包五个独立 Reviewer 按统一规则评分。最终五 Reviewer 聚合结果为:GPT-5.6 Sol High 92.67、GPT-6.1 Sol High 92.20、GPT-6.1 Sol Medium 91.67。GPT-6.1 High 已经非常接近现有默认模型,但仍没有形成足以推动正式 Generation 默认切换的质量优势,因此项目暂时继续使用 GPT-5.6 Sol High。文章同时记录了 Index-Translate-35B-A3B 因公开 API 4096-token context 无法承载完整 benchmark 而未进入评分,以及旧 mechanical checker 对合法 inline-code pair 换序产生 false positive 的情况。
