Skip to content

语音能力

Aivisx Link 提供语音合成、语音识别和实时语音接口。

功能状态

语音能力依赖上游与分组配置。是否可用请以站点「模型广场」展示为准。

端点一览

方法路径用途
POST/v1/tts文字转语音(Text to Speech)
POST/v1/stt语音转文字(Speech to Text)
POST/v1/custom-voices创建自定义音色
GET/v1/custom-voices列出自定义音色
GET/v1/custom-voices/{voice_id}获取音色信息
GET/v1/custom-voices/{voice_id}/audio获取音色示例音频
DELETE/v1/custom-voices/{voice_id}删除音色
GET/v1/realtime实时语音(WebSocket)

文字转语音

bash
curl https://aivisx.link/v1/tts \
  -H "Authorization: Bearer sk-你的KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "你的语音模型",
    "input": "欢迎使用 Aivisx Link",
    "voice": "alloy"
  }' \
  -o speech.mp3

语音转文字

bash
curl https://aivisx.link/v1/stt \
  -H "Authorization: Bearer sk-你的KEY" \
  -F "model=你的语音模型" \
  -F "file=@./audio.mp3"

返回识别出的文本,通常还带时间戳等元信息。

自定义音色

上传一段参考音频即可克隆音色:

bash
curl https://aivisx.link/v1/custom-voices \
  -H "Authorization: Bearer sk-你的KEY" \
  -F "name=我的音色" \
  -F "file=@./reference.wav"

拿到 voice_id 后,在 TTS 请求里把它作为 voice 参数即可使用。

音色克隆的质量取决于参考音频

建议 10~30 秒、干净无噪音、单一说话人的音频,效果最好。

实时语音

GET /v1/realtime 是一个 WebSocket 端点,适合做实时对话类应用(边说边识别、边生成边播报)。

连接时需要在请求头或查询参数中带上你的 Key。具体协议参考所用上游模型的文档。

计费

能力计费方式
TTS按字符数或时长
STT按音频时长
自定义音色按次或按存储
实时语音按音频时长

具体单价见「模型广场」。

常见问题

Q:返回 404 当前分组不含语音模型。

Q:生成的音频有杂音 检查输入文本是否含特殊字符;音色克隆场景检查参考音频质量。

Q:WebSocket 连不上 确认使用 wss:// 而非 ws://,并正确携带鉴权信息。

相关文档

Aivisx Link · AI API 网关平台