发现商业评论 旗下
洞察商业 启迪未来

谷歌Gemini 3.5 Transcribe语音转文本模型:提升速度,智能优化转录内容

   时间:2026-08-27 16:00 来源:快讯作者:冯璃月

谷歌近日悄然推出了一款名为Gemini 3.5 Transcribe的新型语音转文本AI模型,在语音输入领域引发关注。这款模型并非外界期待的Gemini 3.5 Pro,而是专注于优化语音转写体验的专项工具,能够自动过滤口语中的冗余表达,生成更符合书面语习惯的文本内容。

据技术文档显示,该模型已率先应用于Pixel 11手机Gboard键盘的"Rambler"功能,后续将逐步扩展至谷歌生态内的其他产品。相较于前代Chirp 3引擎,新模型在转写速度上提升约70%,实时语音场景的错误率从7.32%降至5.5%。虽然准确率提升幅度看似有限,但对于高频语音输入用户而言,错误率的降低意味着后期校对工作量显著减少。

模型的核心优势在于语义理解能力。当检测到用户使用"嗯""啊"等填充词时,系统会自动删除这些影响流畅度的表达;若用户中途修正错误表述,模型也能实时调整已生成的文本。更值得关注的是,用户可上传自定义词汇库,帮助系统准确识别专业术语或特定领域的特殊用语,这在医疗、法律等垂直领域具有重要应用价值。

目前该模型支持85种语言的转写,可处理包含最多3名说话者的预录音频。不过技术团队也指出,模型在"智能润色"过程中可能改变用户原始表述方式,这在需要精确还原原话的场景(如法庭记录、学术访谈)中可能存在适用性问题。从实际测试效果看,模型对短文本的优化表现良好,能有效清理前后矛盾的表达和口语化磕绊。

这项技术的推出,标志着语音输入正从单纯的"听写"向"智能整理"阶段进化。虽然完全信任AI的语义理解仍需时间,但其在提升输入效率方面的价值已得到初步验证。随着模型持续优化,未来可能重塑人们的文字输入方式。

 
 
更多>同类内容
全站最新
热门内容