发现商业评论 旗下
洞察商业 启迪未来

谷歌发布“最精准”语音转文本模型,加速语音交互,重塑AI交互新格局

   时间:2026-08-27 16:09 来源:快讯作者:冯璃月

谷歌近日推出了一款被其称为“迄今最精准”的语音转文本模型——Gemini 3.5 Transcribe,并同步将其整合至旗下多款核心产品中,同时通过Gemini API向开发者开放预览功能。这一动作标志着谷歌在语音交互领域的战略布局进一步深化,试图通过技术升级重塑用户与AI系统的交互方式。

该模型的核心优势在于其“意图理解”能力。与传统语音转文本工具仅能逐字记录不同,Gemini 3.5 Transcribe可自动过滤“um”“uh”等口语化填充词,并智能添加标点符号、调整文本格式,将非结构化的口述内容直接转化为结构化文本。例如,用户无需手动修正,即可获得一段排版整齐、逻辑清晰的会议记录或备忘录。

在产品落地层面,谷歌已将该模型嵌入Android版Gboard的Rambler语音输入功能,以及Mac版Gemini应用中。用户可通过语音直接完成消息回复、帖子撰写等操作。更值得关注的是,谷歌计划将其引入Chrome浏览器,未来用户可在网页文本输入框内直接通过语音输入内容,覆盖从日常聊天到向Gemini发出指令的多元场景。

开发者生态方面,Gemini 3.5 Transcribe已通过Gemini API进入预览阶段,支持实时语音流与录制音频文件两种处理模式。这意味着开发者可基于该模型开发语音助手、会议记录工具等应用,进一步拓展语音交互的应用边界。

从商业逻辑看,语音转文本正从后台基础能力升级为AI应用的核心交互入口。随着模型具备“听懂—理解—整理—执行”的全链路能力,用户与AI的交互方式有望从键盘输入向语音指令转移。对谷歌而言,将Gemini 3.5 Transcribe嵌入Chrome、Gboard、Docs等高频产品,不仅可提升用户粘性,更能在语音交互这一新兴赛道巩固其技术领先地位。

此次发布与Gemini 3.5 Live及Gemini 3.5 Live Experimental共同构成谷歌新的Gemini Audio系列,标志着其语音战略从文本、图像向实时对话、语音翻译等场景的全面延伸。尽管谷歌股价在发布当日盘中下跌1.37%,但市场普遍认为,语音交互的普及趋势将为谷歌带来长期增长空间。

 
 
更多>同类内容
全站最新
热门内容