OpenAI 近日发布新一代语音模型 GPT-Live,将 ChatGPT Voice 体验推向新阶段。该模型基于全双工架构构建,支持同时听和说,带来轻松自然的语音交互体验。
技术架构突破
在 GPT-Live 之前,语音 AI 主要采用级联式(多模型串联,响应慢)或轮次式(一来一回,易误判停顿)架构。GPT-Live 通过两项变化解决局限:
1. 持续交互:基于全双工架构,在生成输出的同时持续处理输入,每秒多次做出交互决策,实现自然的来回交流与实时翻译。
2. 委派机制:将负责持续交互的 GPT-Live 与深层任务处理能力解耦。需要搜索或推理时,委派给 GPT-5.5 等前沿模型,后台处理时仍可维持对话流畅。
评估与性能
OpenAI 构建了新的人类评估体系,GPT-Live-1 和 mini 版本在整体偏好、轮次衔接、流畅度等维度明显优于 Advanced Voice Mode。在专业评测中:
- GPQA:在生物、化学和物理等专家级科学推理能力上显著优于前代。
- BrowseComp:智能体式网页搜索及查找难以定位信息的能力明显提升。
- τ³-Voice Telecom:在真实多轮电信客服任务中表现更优。
全新 ChatGPT Voice 体验
目前 GPT-Live 已面向全球用户逐步推出,覆盖 iOS、Android 和网页端,带来四大升级:
- 更自然的对话:支持随时插话、停顿思考,模型会用自然回应,并重新制作了九种声音。
- 更智能的回答:调用最新前沿模型,提供 Instant、Medium 和 High 三种推理强度选择。
- 更好的倾听能力:用户思考时会等待不插话,且能更好过滤背景噪声。
- 可视化回答:对话中可展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆和文件上传。
GPT-Live-1 将成为 Go、Plus 和 Pro 用户的默认模型,GPT-Live-1 mini 为 Free 用户默认模型。
原始来源: 机器之心 ↗
本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。