行业资讯 · 2026年8月30日
RWS 发布 M-GATE 基准:70 个大模型、30 种语言,没有全能冠军

8 月 25 日,RWS 旗下数据服务团队 TrainAI 发布 M-GATE(Multilingual Grammar, Accuracy in Translation & Efficiency)基准:在 30 种语言上评测 70 余个前沿大模型,测量的不是“模型能不能用某种语言做题”,而是它是否真正掌握这种语言。覆盖范围从英语、中文等到基尼亚卢旺达语、巴斯克语、斐济语等低资源语言。排行榜持续更新,公开地址为 m-gate.ai。
三项测试分别是:每种语言 100 句语言学家设计的“难题句”(一半有错、一半正确但容易误判)做语法对错判断;100 句英语源文译入 29 种语言再译回英语,看意义能否存活;以及分词器效率与响应速度——直接对应成本和可用性。为保持独立性,RWS 因与 Cohere 合作开发 Language Weaver Pro,刻意未将 Cohere 纳入评测。
结果没有全能冠军。语法测试是对错二选一,随机猜测大约 50%;但同一语种内模型差距极大。以斐济语语法为例,xAI 的 Grok 4.20 位列全场第一,而基准中回译成绩最好的 OpenAI GPT-5.5 却低于随机水平,Meta 的 Muse Spark 仅得 23%。整体语法榜目前由 Google Gemini 3.1 Pro Preview 领跑,回译榜由 GPT-5.5 领跑——翻译强不等于语法强。分词成本同样分化:处理高棉语等语言时,最重的分词器消耗的 token 可超过英语的十倍;最慢模型的平均延迟约为最快模型的 100 倍。
对采购语言服务与企业 AI 的买家,这则新闻的价值不在榜单本身,而在它拆穿了一条采购捷径:把“支持 30 种 / 50 种语言”当成能力证明。RWS《Content Unlocked 2026》对 200 名企业内容负责人的调研也给出侧面证据:86% 的人表示 AI 加快了内容生产,同时 65% 的人表示本地化因返工反而变慢。TrainAI 创新负责人 Tomáš Burkert 的表述更直白:有些市场上最强的模型,在特定语言上的表现还不如抛硬币。
我们的建议是:选引擎、选供应商,都按“要出海的那几种语言 + 那一类文本”做对照评测,而不是买一个总榜第一。AI 初译可以提速,但语法盲区、低资源语种和术语边界,仍然需要资深译审把关——榜单告诉你模型会在哪里失手,人要决定哪些失手不能出厂。
本文信息来源:RWS 官方新闻稿(2026 年 8 月 25 日)、Slator 报道。