AI

OpenAI深夜放出GPT-Live,ChatGPT终于像真人一样说话

OpenAI发布新一代语音模型GPT-Live,升级ChatGPT Voice体验。该模型基于全双工架构,支持同时听和说,实现自然的持续交互。GPT-Live将交互与深层任务处理解耦,后台调用GPT-5.5处理复杂任务并维持对话流畅。目前已面向全球用户推出,覆盖多端,带来更自然的对话、更智能的回答、更好的倾听能力及可视化回复,显著提升人机语音交互体验。

OpenAI 近日发布新一代语音模型 GPT-Live,将 ChatGPT Voice 体验推向新阶段。该模型基于全双工架构构建,支持同时听和说,带来轻松自然的语音交互体验。

技术架构突破

在 GPT-Live 之前,语音 AI 主要采用级联式(多模型串联,响应慢)或轮次式(一来一回,易误判停顿)架构。GPT-Live 通过两项变化解决局限:
1. 持续交互:基于全双工架构,在生成输出的同时持续处理输入,每秒多次做出交互决策,实现自然的来回交流与实时翻译。
2. 委派机制:将负责持续交互的 GPT-Live 与深层任务处理能力解耦。需要搜索或推理时,委派给 GPT-5.5 等前沿模型,后台处理时仍可维持对话流畅。

评估与性能

OpenAI 构建了新的人类评估体系,GPT-Live-1 和 mini 版本在整体偏好、轮次衔接、流畅度等维度明显优于 Advanced Voice Mode。在专业评测中:
- GPQA:在生物、化学和物理等专家级科学推理能力上显著优于前代。
- BrowseComp:智能体式网页搜索及查找难以定位信息的能力明显提升。
- τ³-Voice Telecom:在真实多轮电信客服任务中表现更优。

全新 ChatGPT Voice 体验

目前 GPT-Live 已面向全球用户逐步推出,覆盖 iOS、Android 和网页端,带来四大升级:
- 更自然的对话:支持随时插话、停顿思考,模型会用自然回应,并重新制作了九种声音。
- 更智能的回答:调用最新前沿模型,提供 Instant、Medium 和 High 三种推理强度选择。
- 更好的倾听能力:用户思考时会等待不插话,且能更好过滤背景噪声。
- 可视化回答:对话中可展示天气、股票、体育等可视化卡片,并继续支持搜索、记忆和文件上传。

GPT-Live-1 将成为 Go、Plus 和 Pro 用户的默认模型,GPT-Live-1 mini 为 Free 用户默认模型。

原始来源: 机器之心

本文由博一・AI营销中枢整理编辑,用于行业观察分享。观点归原作者所有。

更多「AI」资讯

让品牌在 AI 中生长

免费诊断你的品牌 AI 可见度