Realtime 需要配置支持实时对话的服务商渠道(OpenAI 或 Azure OpenAI)。如果 WebSocket 连接被拒绝,请联系你的 Anyone 管理员。
连接
端点:GET /v1/realtime
将 HTTP GET 请求升级为 WebSocket 连接。可通过查询参数或 WebSocket 握手中的 Authorization 头传入 API key。
认证
通过以下方式传入 API key:- 查询参数:
?token=YOUR_TOKEN - Authorization 头:
Authorization: Bearer YOUR_TOKEN(在 HTTP 升级握手时设置)
事件类型
连接后,双方交换 JSON 事件消息。每条消息包含type 字段标识其用途。以下是核心事件类型。
客户端 → 服务端
服务端 → 客户端
会话配置
连接后,发送session.update 事件配置会话:
string[]
启用的交互模式。例如
["text", "audio"]。string
系统级指令,引导模型在整个会话中的行为。
string
音频输出使用的语音。例如
alloy、echo、nova 或 shimmer。string
你发送的音频格式。例如
pcm16、g711_ulaw 或 g711_alaw。string
模型返回的音频格式。例如
pcm16。object
音频输入转录配置。
object | null
控制服务端如何检测音频输入的轮次结束。设为
null 禁用自动检测,手动管理。object[]
会话中模型可用的工具列表,遵循 OpenAI function calling schema。
string
控制模型何时使用工具。
auto、none 或指定工具名。number
模型的采样温度。默认
0.8。用量统计
模型完成响应后,response.done 事件包含 usage 对象:
integer
此轮响应消耗的总 token 数。
integer
输入中的 token 数(音频 + 文本)。
integer
模型输出中的 token 数(音频 + 文本)。
object
输入 token 类型明细(如缓存、音频)。
object
输出 token 类型明细(如音频、文本)。
示例
以下 JavaScript 示例连接 Realtime 端点、配置会话并记录收到的事件。javascript

