实时语音 API · Seed Realtime AI

SeedRealtime:把实时语音接入你的产品。

SeedRealtime 是面向 Seed Realtime AI 的实时语音 API 与会话界面:浏览器采集语音、服务端生成、语音播报回复。摄像头仅作本机在场预览,不进入模型请求。

了解工作原理
准备就绪
实时画面设备预览
信号
本机摄像头
转写 → API

你将获得什么

从说话到语音回答的完整回合路径。

多数团队第一天并不需要完整媒体网格。SeedRealtime 打包实用的 Seed Realtime 路径:浏览器采集、受保护的服务端生成、端上播报——先验证体验与 API 契约,再决定是否上更重的实时基础设施。

01
SeedRealtime 实时会话界面示意:摄像头与麦克风在场 — Seed Realtime AI 实时语音

会话界面就绪

用户一键打开摄像头与麦克风进入实时会话。在场感真实,同时因为画面仅本机预览、不参与生成请求,隐私边界清晰。

02
SeedRealtime 语音转结构化数据示意:声波汇入 Seed Realtime AI 生成链路

语音进,结构化出

说话经浏览器识别转为文本,再以干净 payload 打到你的服务端路由。Seed Realtime AI 的生成与密钥只在服务端,不进浏览器。

03
SeedRealtime 语音回复示意:Seed Realtime AI 回答以自然语音播报

回答可以被听懂

模型文本经设备 TTS 朗读,闭环更像通话。同一条转写路径日后可换成流式音频或定制音色,无需重做界面。

请求路径

在场在客户端,生成在服务端。

每一轮都是有界动作:倾听、转写、生成、播报。相比始终在线的媒体流,更容易限流、排障与计量,同时仍给出用户熟悉的 Seed Realtime 产品体验。

连续场景

YOU“给我三条,五分钟客户同步会可以怎么开场。”

SEED先讲结果,点出风险,用一个需要对方拍板的问题收尾。

01本机摄像头
02语音 → 文本
03服务端生成
04语音回复

SeedRealtime 适合哪里

真实会话,对应真实工作。

SeedRealtime 面向「人边说、世界还在动」的时刻:双手被占用、画面在变、房间里不止一个声音。

01

动手操作指导

引导用户完成实体步骤:按哪个键、哪根线、指示灯什么状态。说话保持自然,会话界面用摄像头保留在场感。

02

多人房间

自我介绍、站会、饭桌闲聊。Seed Realtime AI 的定位包含人名、声音与「谁说了什么」的对应,尤其适合交叠发言。

03

展馆与出行

边走边问展品、菜单与街景——不必停下打字,就能围绕眼前事物对话。

04

口语练习

更接近真实通话的口语循环:可打断、可改口、可继续,而不是一问一答的文字聊天。

05

车载副驾

驾驶时的语音协助:回答要短、摩擦要低,会话模型默认连续音频输入。

06

售后与现场作业

工程师与客服需要一边看设备/单据/客户屏幕,一边把任务说清楚并得到即时反馈。

品类对照

SeedRealtime 与 GPT-Live 对照。

公开报道与字节 Seed 发布叙事将 SeedRealtime 与 OpenAI 的 GPT-Live 放在同一全双工对话赛道,但模态取舍不同。下表依据公开产品信息整理,并非实验室跑分。

维度SeedRealtimeGPT-Live
研发方字节跳动 SeedOpenAI
架构重点原生音视频全双工大模型;感知、决策与表达在同一闭环全双工语音模型;每秒多次决定听/说/停/打断
主要模态统一音频 + 视频 + 文本流(边看、边听、边说)语音全双工优先;ChatGPT 上线时不含语音+视频/投屏
交互模型音视频联合理解意图、指示代词消歧、噪声中的节奏控制附和、抢话、用户思考时静默;说话过程中可调用工具
实时视觉 / 投屏面向连续摄像头理解与语音联合决策GPT-Live 在 ChatGPT 上线时不包含;视频能力官方称后续推进
深度推理方式端到端多模态流;感知与表达同一模型路径Live 负责对话节奏;重推理可委派(如 GPT-5.5 模式)
多人场景发布演示强调多人场景(人名 ↔ 面孔 ↔ 发言)侧重自然的双向对话节奏
公开可用(发布报道时)豆包 App(视频通话入口)据中文发布报道全量上线ChatGPT Voice(发布报道中的 Go / Plus / Pro)

资料来源:字节 Seed / 豆包上线报道(音视频全双工、多人场景);OpenAI《Introducing GPT-Live》(全双工语音、连续决策、上线时 ChatGPT 未开放语音+视频)。产品会迭代,采购前请以官方页面为准。

常见问题

SeedRealtime:接入前先看清楚。

关于 SeedRealtime、Seed Realtime AI 会话,以及 API 当前实际能力的直接说明。

SeedRealtime 是面向 Seed Realtime AI 语音会话的产品界面与 API 路径:语音进、服务端生成、语音回复出。帮助团队在不必从零拼采集、鉴权与模型调用的情况下交付实时语音体验。

SEEDREALTIME / 2026

开始一次 SeedRealtime 会话。

打开实时界面,跑通一轮语音,再把同一 API 路径用到你的产品里。