外观
语音能力
Aivisx Link 提供语音合成、语音识别和实时语音接口。
功能状态
语音能力依赖上游与分组配置。是否可用请以站点「模型广场」展示为准。
端点一览
| 方法 | 路径 | 用途 |
|---|---|---|
| POST | /v1/tts | 文字转语音(Text to Speech) |
| POST | /v1/stt | 语音转文字(Speech to Text) |
| POST | /v1/custom-voices | 创建自定义音色 |
| GET | /v1/custom-voices | 列出自定义音色 |
| GET | /v1/custom-voices/{voice_id} | 获取音色信息 |
| GET | /v1/custom-voices/{voice_id}/audio | 获取音色示例音频 |
| DELETE | /v1/custom-voices/{voice_id} | 删除音色 |
| GET | /v1/realtime | 实时语音(WebSocket) |
文字转语音
bash
curl https://aivisx.link/v1/tts \
-H "Authorization: Bearer sk-你的KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "你的语音模型",
"input": "欢迎使用 Aivisx Link",
"voice": "alloy"
}' \
-o speech.mp3语音转文字
bash
curl https://aivisx.link/v1/stt \
-H "Authorization: Bearer sk-你的KEY" \
-F "model=你的语音模型" \
-F "file=@./audio.mp3"返回识别出的文本,通常还带时间戳等元信息。
自定义音色
上传一段参考音频即可克隆音色:
bash
curl https://aivisx.link/v1/custom-voices \
-H "Authorization: Bearer sk-你的KEY" \
-F "name=我的音色" \
-F "file=@./reference.wav"拿到 voice_id 后,在 TTS 请求里把它作为 voice 参数即可使用。
音色克隆的质量取决于参考音频
建议 10~30 秒、干净无噪音、单一说话人的音频,效果最好。
实时语音
GET /v1/realtime 是一个 WebSocket 端点,适合做实时对话类应用(边说边识别、边生成边播报)。
连接时需要在请求头或查询参数中带上你的 Key。具体协议参考所用上游模型的文档。
计费
| 能力 | 计费方式 |
|---|---|
| TTS | 按字符数或时长 |
| STT | 按音频时长 |
| 自定义音色 | 按次或按存储 |
| 实时语音 | 按音频时长 |
具体单价见「模型广场」。
常见问题
Q:返回 404 当前分组不含语音模型。
Q:生成的音频有杂音 检查输入文本是否含特殊字符;音色克隆场景检查参考音频质量。
Q:WebSocket 连不上 确认使用 wss:// 而非 ws://,并正确携带鉴权信息。