火山引擎提供开箱即用的音频处理能力,支持语音识别(asr)、音频降噪与人声分离(mediaprocessing)、ai配音(tts);需开通服务、获取app key/secret及access key,再通过python sdk或api调用。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想把一段录音自动转成文字、提取人声、降噪或生成AI配音,火山引擎提供了开箱即用的音频处理能力,无需自建FFmpeg集群或训练模型。
开通服务并获取凭证
登录火山引擎控制台,在搜索栏输入“语音识别”或“语音合成”,进入对应服务页,点击【立即开通】。
开通后进入【API管理】→【创建应用】,填写应用名称(如“短视频配音后台”),系统自动生成App Key和App Secret;【务必复制保存App Secret,页面关闭后无法再次查看】。
在【密钥管理】中创建Access Key,选择“程序调用”,生成后下载CSV文件——里面含ACCESS_KEY_ID和SECRET_ACCESS_KEY,这是后续调用所有音频API的身份凭据。
用Python调用语音识别(ASR)
方法一:同步识别(适合≤60秒短音频)
安装SDK:pip install volcengine。
初始化客户端并发起请求,注意AudioUrl必须是公网可直连的HTTPS地址(不能是本地路径或内网地址):
```python
from volcengine.volc import get_service()
asr = get_service("asr", region="cn-beijing", access_key="AKLTxxx", secret_key="SKLTxxx")
resp = asr.sync_submit_task(AudioUrl="https://example.com/audio.mp3", AudioFormat="mp3")
print(resp["Result"]["Text"])
```
方法二:异步识别(推荐用于长音频或批量任务)
调用async_submit_task获取TaskId,再用get_task_result轮询结果;轮询间隔不得小于2秒,否则触发限流。
音频降噪与人声分离(使用MediaProcessing服务)
第一步:上传原始音频到火山引擎对象存储(TOS)
在TOS控制台新建Bucket(如“audio-raw”),将待处理的wav/mp3文件拖入,设为公共读权限,获得类似https://audio-raw.tos-cn-beijing.volces.com/noisy_20260819.mp3的URL。
第二步:调用MediaProcessing API发起任务
请求Body中指定降噪强度(0–100,默认50)和是否启用语音增强:
```json
{
"Input": {"ObjectKey": "noisy_20260819.mp3"},
"Output": {"Bucket": "audio-clean", "ObjectKey": "cleaned.mp3"},
"Template": {
"NoiseReduction": {"Enable": true, "Strength": 75},
"VoiceEnhancement": {"Enable": true}
}
}
```
第三步:监听回调或主动查询任务状态
任务成功后,清洗后的文件会自动存入你指定的Output Bucket,可直接下载或用于下一步合成。
生成AI配音(TTS)并控制语速语调
① 访问火山引擎TTS控制台,确认已开通服务并处于“运行中”状态。
② 在【语音库管理】中选择适合场景的音色,例如“zh_female_yunxi”(女声·云溪)适用于知识类口播,“zh_male_zhixing”(男声·志行)适合新闻播报。
③ 构造请求体,关键参数必须传全:
"text":纯文本,不支持HTML标签;"voice_type":音色ID必须与控制台一致;"format":仅支持mp3、wav、pcm;"speed":0.5–2.0之间,1.0为默认,低于0.7易失真;"pitch":-5~5,调节基频,负值更沉稳,正值更清亮。
④ 发起POST请求至https://openspeech.bytedance.com/api/v1/tts,Header中携带Authorization: Bearer YOUR_API_TOKEN(Token需用App Key/Secret通过STS服务签发,不可直接填Secret)。











