发现商业评论 旗下
洞察商业 启迪未来

OpenAI推出GPT-Live-1接入API:实时语音交互升级,开发者迎新工具

   时间:2026-09-11 13:31 来源:快讯作者:朱天宇

OpenAI 正式推出 GPT-Live-1 语音交互模型,并将其集成至 API 平台,为开发者提供构建实时语音应用的新工具。该模型突破传统语音交互架构,通过整合语音理解与生成模块,显著降低系统延迟,同时支持全双工对话模式,可同步处理语音输入输出、应对打断场景并过滤背景噪声干扰。

技术架构方面,GPT-Live-1 摒弃了"语音转文本-LLM处理-文本转语音"的三段式流程,将核心功能集成于单一模型。复杂推理任务可交由后端文本模型处理,开发者通过系统提示词即可调节语音输出参数,包括语速、语调及对话风格。该模型同时支持原生语音识别与文本回复,具备数字字母识别、关键词强化及对话轮次检测等专项能力。

在电话客服、餐厅预订等双工语音场景中,GPT-Live-1 展现出显著优势。语言学习平台 Speak 的测试数据显示,新系统使学习者思考停顿期间的误打断率降低80%。医疗服务平台技术团队通过集成该模型,精简了2.3万行代码,开发效率提升4倍。性能评测显示,在 Full Duplex Bench 基准测试中,其表现较前代模型提升30个百分点,搭配 GPT-6 Astra 推理模块时,在 Tau3 智能体任务测试中登顶榜首。

OpenAI 同步扩展了语音资源库,新增 Quartz、Ripple、Vesper 等12种音色选项,并承诺未来将持续增加多语言支持。商业合作层面,开发者可通过 API 调用前端语音层服务,定价为每分钟0.05美元(约合人民币0.34元),后端模型及智能体工具费用另计。该模型已开放企业系统集成接口,支持构建可执行审批操作、自动转接人工的复合型语音工作流。

 
 
更多>同类内容
全站最新
热门内容