
会话界面就绪
用户一键打开摄像头与麦克风进入实时会话。在场感真实,同时因为画面仅本机预览、不参与生成请求,隐私边界清晰。
实时语音 API · Seed Realtime AI
SeedRealtime 是面向 Seed Realtime AI 的实时语音 API 与会话界面:浏览器采集语音、服务端生成、语音播报回复。摄像头仅作本机在场预览,不进入模型请求。
你将获得什么
多数团队第一天并不需要完整媒体网格。SeedRealtime 打包实用的 Seed Realtime 路径:浏览器采集、受保护的服务端生成、端上播报——先验证体验与 API 契约,再决定是否上更重的实时基础设施。

用户一键打开摄像头与麦克风进入实时会话。在场感真实,同时因为画面仅本机预览、不参与生成请求,隐私边界清晰。

说话经浏览器识别转为文本,再以干净 payload 打到你的服务端路由。Seed Realtime AI 的生成与密钥只在服务端,不进浏览器。

模型文本经设备 TTS 朗读,闭环更像通话。同一条转写路径日后可换成流式音频或定制音色,无需重做界面。
请求路径
每一轮都是有界动作:倾听、转写、生成、播报。相比始终在线的媒体流,更容易限流、排障与计量,同时仍给出用户熟悉的 Seed Realtime 产品体验。
YOU“给我三条,五分钟客户同步会可以怎么开场。”
SEED先讲结果,点出风险,用一个需要对方拍板的问题收尾。
SeedRealtime 适合哪里
SeedRealtime 面向「人边说、世界还在动」的时刻:双手被占用、画面在变、房间里不止一个声音。
引导用户完成实体步骤:按哪个键、哪根线、指示灯什么状态。说话保持自然,会话界面用摄像头保留在场感。
自我介绍、站会、饭桌闲聊。Seed Realtime AI 的定位包含人名、声音与「谁说了什么」的对应,尤其适合交叠发言。
边走边问展品、菜单与街景——不必停下打字,就能围绕眼前事物对话。
更接近真实通话的口语循环:可打断、可改口、可继续,而不是一问一答的文字聊天。
驾驶时的语音协助:回答要短、摩擦要低,会话模型默认连续音频输入。
工程师与客服需要一边看设备/单据/客户屏幕,一边把任务说清楚并得到即时反馈。
品类对照
公开报道与字节 Seed 发布叙事将 SeedRealtime 与 OpenAI 的 GPT-Live 放在同一全双工对话赛道,但模态取舍不同。下表依据公开产品信息整理,并非实验室跑分。
| 维度 | SeedRealtime | GPT-Live |
|---|---|---|
| 研发方 | 字节跳动 Seed | OpenAI |
| 架构重点 | 原生音视频全双工大模型;感知、决策与表达在同一闭环 | 全双工语音模型;每秒多次决定听/说/停/打断 |
| 主要模态 | 统一音频 + 视频 + 文本流(边看、边听、边说) | 语音全双工优先;ChatGPT 上线时不含语音+视频/投屏 |
| 交互模型 | 音视频联合理解意图、指示代词消歧、噪声中的节奏控制 | 附和、抢话、用户思考时静默;说话过程中可调用工具 |
| 实时视觉 / 投屏 | 面向连续摄像头理解与语音联合决策 | GPT-Live 在 ChatGPT 上线时不包含;视频能力官方称后续推进 |
| 深度推理方式 | 端到端多模态流;感知与表达同一模型路径 | Live 负责对话节奏;重推理可委派(如 GPT-5.5 模式) |
| 多人场景 | 发布演示强调多人场景(人名 ↔ 面孔 ↔ 发言) | 侧重自然的双向对话节奏 |
| 公开可用(发布报道时) | 豆包 App(视频通话入口)据中文发布报道全量上线 | ChatGPT Voice(发布报道中的 Go / Plus / Pro) |
资料来源:字节 Seed / 豆包上线报道(音视频全双工、多人场景);OpenAI《Introducing GPT-Live》(全双工语音、连续决策、上线时 ChatGPT 未开放语音+视频)。产品会迭代,采购前请以官方页面为准。
常见问题
关于 SeedRealtime、Seed Realtime AI 会话,以及 API 当前实际能力的直接说明。
SEEDREALTIME / 2026
打开实时界面,跑通一轮语音,再把同一 API 路径用到你的产品里。