← 返回 AI Hub 首页

GPT-Live 底层拆解:OpenAI 如何让 95% 的音频帧不再延迟

来源:雷锋网  ·  发布时间:2026-08-06  ·  热度:0 分

通过重写 Python、魔改 WebRTC 握手,GPT-Live 让Agent从单向对话进入「实时交互」时代。 作者丨郑佳美 编辑丨岑 峰 在实时语音交互中,延迟是唯一的“死线”。文字回答慢几百毫秒,用户顶多觉得体验不佳;但音频只要卡顿一次,那种“非人”的割裂感就会瞬间摧毁信任。为了解决这个工程顽疾,OpenAI 耗时 6 个月重做了整个语音系统。刚刚,OpenAI 发布了一篇 GPT-Live 工程文章,详细披露了新版 ChatGPT 语音系统背后的架构改造。其中最值得注意的一组数据是:新的媒体系统,其 p95 音频帧延迟已经降到了旧系统 p50 的水平。这意味着,新系统中最慢的 95% 的音频帧,现在都能跑得和旧系统中最快的 50% 音频帧一样的顺滑。虽然 OpenAI 没有公布具体毫秒数,但这个结果说明,改造主要压缩了那些偶发但明显的慢帧。现在的 GPT-Live 不再等待用户说完

openai gpt agent

阅读原文 →