OpenAI Realtime API指南2026:构建可实时打断和倾听的语音Agent
想要一个一秒内响应的语音助手,而不是STT转LLM再转TTS的串行延迟。
💡 你将学到
想要一个一秒内响应的语音助手,而不是STT转LLM再转TTS的串行延迟。
OpenAI Realtime API 2026 指南:构建一个能打断并实时聆听的语音代理
OpenAI Realtime API:无需流水线延迟的语音到语音
OpenAI Realtime API 于 2024 年 10 月推出,允许您直接将音频发送给模型并接收音频返回——中间无需单独的语音转文字或文字转语音调用。延迟降至模型思考所需的时间,并且 API 支持自然的轮次交替,包括模型在说话时能听到您的声音并在被中断时停止。
为什么团队选择它而非经典流水线
经典技术栈(Whisper 转录、LLM 思考、TTS 说话)存在两个问题:每次跳转增加 300-800 毫秒延迟,并且流水线没有对话时机的感知。Realtime API 保持一个 WebSocket 连接打开,双向流式传输音频。对于电话代理、自助终端和车载助手,这改变了从对讲机到对话的感觉。
API 提供的内容
- 音频输入、音频输出 通过单个 WebSocket,使用 gpt-4o-realtime 或 gpt-4o-mini-realtime 模型系列。
- 函数调用 - 代理可以在对话中查询订单状态或预订时段,并将结果整合到其回答中。
- 内置轮次检测 - 模型检测用户何时停止说话以及何时被中断。
- 输入和输出音频样本 - 您获得双向的精确音频,用于录音和合规性。
定价现实检查
音频按分钟计费,音频令牌比文本令牌更昂贵——在标准实时模型层,音频输入大约每分钟 0.06 美元,音频输出每分钟 0.24 美元(查看 OpenAI 定价页面获取当前费率)。因此,一个 5 分钟的支持电话在调用任何文本工具之前大约需要 1.5 美元。这就是为什么许多生产环境中的语音代理只在实际对话中使用 Realtime API,而将更便宜的文本调用用于后台查询。
最小工作示例
from openai import OpenAI
client = OpenAI()
with client.beta.realtime.connect(model="gpt-4o-realtime") as conn:
conn.send({"type": "session.update", "session": {"instructions": "You are a hotel concierge."}})
# stream mic audio in, receive audio deltas out
每个应用的模式都相同:打开一个套接字,发送会话配置,流式传入音频,播放音频增量输出。
常见问题
我需要单独的 TTS 模型吗? 不需要——模型直接生成语音。 我可以用它进行电话通话吗? 可以,它与 Twilio 等电话供应商配合使用;音频桥接到同一个 WebSocket。 Realtime API 比文本更贵吗? 是的,音频令牌每分钟的使用成本高于文本令牌。 它支持英语以外的语言吗? 支持,底层模型原生支持数十种语言。
相关文章
❓ 常见问题
Do I need a separate TTS model?
No - the model produces speech directly.
Can I use it for phone calls?
Yes, it pairs with telephony providers like Twilio; the audio bridges into the same WebSocket.
Is the Realtime API more expensive than text?
Yes, audio tokens cost more than text tokens per minute of use.
Does it support languages other than English?
Yes, the underlying models handle dozens of languages natively.
本站文章由编辑人工撰写,收录的工具均经过实测或公开资料核验。文中链接指向工具官网或 GitHub 仓库,仅作信息参考,不构成付费推广。
