两大能力
语音合成 TTS
将文本内容转换为自然流畅的语音音频。支持多种音色,适合有声内容创作。
语音识别 ASR
将音频文件中的语音转录为文字。支持长音频,适合会议记录和内容整理。
语音合成 (TTS)
使用方式
在对话中告诉专家你想将哪些内容转为语音,音频会以文件卡片的形式直接出现在对话里,可试听和下载:tts_batch,一次提交多段文本,并发上限 20,适合把长稿切段配音。
音色选择
你可以在请求中指定偏好的音色类型。不同模型提供的音色选项不同,通常包括:- 男声 / 女声
- 年轻 / 成熟
- 温柔 / 有力
- 新闻播报 / 日常对话
适用场景
有声读物
有声读物
将文字稿件转为有声内容,快速制作有声书或音频课程的样片。
视频配音
视频配音
为视频内容生成旁白配音,搭配视频生成能力使用。
无障碍辅助
无障碍辅助
将文档、网页内容转为语音,方便视障用户或不便阅读时的信息获取。
内容二次创作
内容二次创作
将文字内容快速转为音频格式,发布到播客或音频平台。
语音识别 (ASR)
使用方式
1
上传音频文件
将需要转录的音频文件(如 MP3、WAV、M4A 等)拖拽到对话框或点击附件上传。
2
请求转录
告诉专家你需要做什么,例如”帮我把这段录音转成文字”或”提取会议记录的要点”。
3
获取结果
专家会返回转录后的文字内容。你可以进一步让专家整理格式、提炼摘要或翻译成其他语言。
适用场景
会议纪要
会议纪要
上传会议录音,让专家转录并整理出结构化的会议纪要,包含议题、决议和待办事项。
采访整理
采访整理
将采访录音转为文字稿,专家还可以帮你区分不同发言者。
课程笔记
课程笔记
录音转文字后,让专家提炼知识点、生成思维导图或整理学习笔记。
多语言处理
多语言处理
转录后可直接让专家翻译,实现”听一种语言,读另一种语言”的工作流。
使用建议
计费说明
TTS 到底按「每字符」还是「每万字符」结算,由该模型在后台配置的计价单位决定——数据库配置是唯一真相源,运行时上报的单位只是缺省提示。所以同样一段文本换个语音模型,账单口径可能不同。字符计量用的是 MiniMax 口径:一个汉字算 2 个字符,一个英文字母算 1 个。所以 500 字中文稿约等于 1,000 字符,别按肉眼字数估。
对话输入框里的语音输入是免费的,不走上面的 ASR 计费——
POST /api/audio/transcribe 没有接计费链路。产生费用的是转写结果进入对话后那一轮的 token 消耗。上表的 ASR 计费适用于专家在任务中主动调用语音识别处理音频文件的场景(比如”把这段会议录音整理成纪要”)。两者是不同的入口,别混。
