目前,谷歌的技术和产品已支持全球300多种语言,覆盖超过70亿用户,占全球人口的86%。这一里程碑凸显了消除数字语言鸿沟的关键意义。数十年来,技术主要服务于少数主导语言,导致数千种活语言及方言在数字世界中代表性不足甚至完全缺失。

自2006年推出Google Translate以来,谷歌旨在打破语言壁垒。借助人工智能进步,翻译服务已从最初几种语言扩展至250多种。但仅靠文本翻译不足以理解现实世界的真实交流,因此研发重点转向构建尊重文化细微差别和人类语言丰富性的系统。

从文本转录到原生音频智能

传统语音识别遵循“音频转文本-处理-合成”的僵化流程,剥离了语调、节奏和情感等交流要素。为捕捉人们说话时的笑场、重叠、犹豫及多语言混合(如西英混合语)等细节,谷歌转向“原生音频智能”,训练Gemini等模型直接处理原始音频以理解声音和意图。

  • 实时对话工具:Gemini 3.5 Live Translate支持70种语言和2,000多个语言对的实时口语翻译,能自然捕捉代码切换和情感线索。
  • 高精度转录:Gemini 3.5 Transcribe可将原始音频转化为格式精美的文本,即便在嘈杂环境或使用复杂术语时也能保持精确。该模型驱动Android Gboard上的Rambler等功能,可去除填充词、修复语法标点,并支持语音命令编辑及多语言无缝切换。
  • 千语计划:目标是支持全球使用人数最多的1,000种语言。通用语音模型(Universal Speech Model)利用跨语言迁移学习技术,将数据丰富语言的知识转移到数据稀缺语言中,提升后者的语音理解能力。
  • 基础研究支撑:基于25年的开放研究和400多篇同行评审语音论文,持续推动前沿发展。

以社区为核心的语言数据建设

鉴于网络数据对少数主导语言的倾斜,谷歌通过本地草根合作伙伴关系重新思考数据收集方式,建立了三个关键开放数据合作项目:

  • WAXAL:与Makerere大学等合作构建的大规模开源语音数据集,涵盖撒哈拉以南非洲27种语言,覆盖26个国家超1亿人口,捕捉了传统数据集中缺失的音调变化和对话节奏。
  • Project Vaani:与印度科学研究所和Bhashini合作,以地区为核心绘制印度语言多样性地图,已从超15.5万名演讲者处收集109种语言的超3万小时语音数据。
  • Amplify Initiative:联合四大洲1,600多名当地专家及20所大学,贡献了15,000个捕捉当地细微差别的多模态数据点。

此外,谷歌推出交互式工具Language Explorer,可视化展示包含7,000多种口语、书面语和手语的开源数据存储库LinguaMeta。Google.org还通过Centre for Digital Language Inclusion等项目,帮助将多语言工具带给全球农民、医护人员等关键社区成员。

突破 connectivity 与硬件限制

为解决全球超30亿人互联网接入受限的问题,谷歌开发了基于Gemini构建的轻量级开源翻译模型TranslateGemma。该模型经过55种语言训练,可在设备端高效运行,无需云端连接即可提供高质量翻译。

针对仍在使用功能机的低资源地区人群,谷歌支持Viamo组织推出语音AI助手“Ask Viamo Anything”(AVA),将Gemini能力带入标准功能手机。在卢旺达的试点中,AVA已通过交互式语音响应用户,回答超200万个问题。

无障碍设计与文化语境

为改变传统语音工具迫使非标准言语者适应技术的现状,谷歌推出了Sign Language-to-Text (SL2T)。该模型经过50多种手语训练,已在Pixel 11的Gboard和Live Transcribe中提供手语转文本听写功能(首发支持美国手语到英语),旨在提升全球7,000万手语用户的可访问性。

在文化语境方面,谷歌与当地社区合作确保发音准确。例如在新西兰,通过与毛利语专家合作改进Google Maps地名发音,将文化真实的发音纳入文本转语音模型,尊重当地语言和遗产。

历经20年AI语言研发,谷歌语言技术已嵌入Search、Android、YouTube等九大平台,连接超50亿用户。未来,谷歌将继续与当地社区紧密合作,构建能理解语境、尊重文化并扩大人类表达范围的技术体系。