AI 语音
OpenAI 推出 GPT-Live-1,面向更自然的实时语音智能体
OpenAI 在 API 中发布 GPT-Live-1,帮助开发者构建低延迟、可处理中断的语音体验。
OpenAI 推出 GPT-Live-1,这是面向开发者的实时语音模型,可通过 API 构建语音智能体。9 月 10 日发布的这项能力瞄准语音 AI 中最难的部分:系统需要快速回应、能处理中断,并在客服、销售、辅导和互动助手等场景中表现得足够自然。OpenAI 称,该模型已在 Realtime API 中提供,设计目标是原生语音到语音交互,而不是把语音识别、文本推理和语音合成拆成多个环节。
这种架构差异很重要。许多语音机器人仍先把用户语音转成文本,再把文本交给语言模型,最后把回答转回音频。每一次转接都会增加延迟,也可能丢失语气、节奏和会话线索。语音到语音模型则能在同一系统中保留更多信息。OpenAI 表示,GPT-Live-1 能识别用户插话,以更接近人类对话的节奏继续交流,并支持更具表现力的声音,开发者不必拼接多个服务。
商业用途很直接。企业希望 AI 智能体接听电话、筛选销售线索、安排预约、指导用户排障,并在必要时转接人工。语音场景对延迟尤其敏感,文字聊天里可接受的停顿,放到电话里就会显得卡顿。如果 GPT-Live-1 能降低等待时间并改善轮流发言体验,开发者就可能用更自然的智能体替代僵硬的电话菜单。
OpenAI 也把 GPT-Live-1 描述为开发效率工具。模型直接处理更多交互循环,因此能减少语音智能体实现所需代码。它支持工具调用,语音智能体可以在通话中查询订单、更新记录、预约会议或读取账户信息。这种能力很强,也带来企业熟悉的问题:模型能调用哪些工具、用户同意如何记录、日志保存什么,以及何时必须转人工。
语音 AI 正变得拥挤。创业公司和大型平台都在让口语智能体更少机器人感,并更能适应噪音、口音和插话。真正可信的产品不能只有好听声音,还需要稳健理解、严格权限、优雅降级和清楚告知用户正在与 AI 交流。