行业资讯 · 2024年5月14日

GPT-4o 发布:实时语音翻译的“科幻时刻”

一人手持手机进行语音对话,屏幕显示声波

2024 年 5 月 13 日,OpenAI 发布旗舰模型 GPT-4o("o"代表 omni,全能)。发布会演示中最令人印象深刻的场景之一,是近乎实时的语音对话翻译:演示者说英语,AI 即时译成意大利语,对方用意大利语回答,AI 再译回英语——延迟低到接近自然对话的节奏,语音中甚至保留了语气与情感色彩。

这段演示在全球媒体上被反复播放,"AI 同传要取代口译员了吗"的讨论再次升温。行业内的专业判断则保持了一贯的冷静:演示场景是节奏可控的双人对话,而真实会议中的多人发言、专业术语、口音噪声、文化微妙,是完全不同的难度量级;语音翻译在"辅助沟通"场景会持续进步,但高规格会议的同声传译,仍将是专业译员的领地。

真正值得关注的是技术架构的变化:GPT-4o 实现了语音到语音的端到端处理,不再经过"语音转文字→翻译→文字转语音"的串联——这意味着更少的误差累积与更自然的韵律保留。这条技术路线的成熟,将逐步改善远程会议辅助、展会服务等场景的体验。

对口译员而言,GPT-4o 的演示是一面镜子:简单沟通的市场会继续被技术覆盖,而专业口译的价值——准确、责任、文化判断——在对比中反而更加清晰。

让我们谈谈您的语言需求

提交项目信息,一个工作日内回复报价与交付方案。