Skip to main content
Realtime API 允许你通过 WebSocket 连接与模型进行低延迟、双向的语音和文本对话。无需发送离散的 HTTP 请求,你打开一个持久连接,双向交换事件消息——发送音频或文本输入,接收流式生成的音频或文本响应。 Anyone 的 Realtime 端点兼容 OpenAI Realtime API 格式,也支持 Azure OpenAI Realtime。连接前需要配置一个支持 Realtime 的渠道(OpenAI 或 Azure OpenAI)。
Realtime 需要配置支持实时对话的服务商渠道(OpenAI 或 Azure OpenAI)。如果 WebSocket 连接被拒绝,请联系你的 Anyone 管理员。

连接

端点: GET /v1/realtime 将 HTTP GET 请求升级为 WebSocket 连接。可通过查询参数或 WebSocket 握手中的 Authorization 头传入 API key。
TLS 加密实例:

认证

通过以下方式传入 API key:
  • 查询参数: ?token=YOUR_TOKEN
  • Authorization 头: Authorization: Bearer YOUR_TOKEN(在 HTTP 升级握手时设置)

事件类型

连接后,双方交换 JSON 事件消息。每条消息包含 type 字段标识其用途。以下是核心事件类型。

客户端 → 服务端

服务端 → 客户端


会话配置

连接后,发送 session.update 事件配置会话:
string[]
启用的交互模式。例如 ["text", "audio"]
string
系统级指令,引导模型在整个会话中的行为。
string
音频输出使用的语音。例如 alloyechonovashimmer
string
你发送的音频格式。例如 pcm16g711_ulawg711_alaw
string
模型返回的音频格式。例如 pcm16
object
音频输入转录配置。
object | null
控制服务端如何检测音频输入的轮次结束。设为 null 禁用自动检测,手动管理。
object[]
会话中模型可用的工具列表,遵循 OpenAI function calling schema。
string
控制模型何时使用工具。autonone 或指定工具名。
number
模型的采样温度。默认 0.8

用量统计

模型完成响应后,response.done 事件包含 usage 对象:
integer
此轮响应消耗的总 token 数。
integer
输入中的 token 数(音频 + 文本)。
integer
模型输出中的 token 数(音频 + 文本)。
object
输入 token 类型明细(如缓存、音频)。
object
输出 token 类型明细(如音频、文本)。

示例

以下 JavaScript 示例连接 Realtime 端点、配置会话并记录收到的事件。
javascript