小云雀不支持独立人声分离,需改用转换猫、vocalremover.org或aifooler:转换猫网页拖拽处理视频并下载wav人声;vocalremover.org离线运行webassembly模型,隐私安全;aifooler适合高杂音场景,支持人声聚焦强度调节。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想从视频里干净提取人声用于配音、剪辑或AI翻唱,但又不想装专业软件、调参数、等渲染——小云雀AI能直接在网页端完成人声分离,无需下载,上传即处理,40秒内出结果。
确认小云雀是否支持人声分离
小云雀当前版本(2026年6月)不提供独立的人声分离功能。它主打“智能成片”“数字人口播”“图文转视频”,所有音频处理均绑定在视频生成流程中,无法单独上传一段视频提取人声。
如果你手头已有视频文件,需要从中剥离纯净人声,请跳过小云雀,改用专做人声分离的工具——比如转换猫、VocalRemover.org 或 aifooler。
替代方案:用转换猫快速提取视频人声
这一步操作起来很简单,直接把视频文件拖进网页就行。
方法一:网页版在线处理(推荐新手)
① 打开 https://www.zhuanhuanmao.com → 点击【人声伴奏分离】→ 选择【混合音频】模式;
② 将你的MP4/MOV/AVI视频文件直接拖入上传区,或点击上传按钮选取;
③ 等待AI自动分析音轨,进度条走完后,页面会同时显示【人声】和【伴奏】两个音轨预览按钮;
④ 点击【人声】试听,确认无明显伴奏残留、无断续、气声保留完整 → 满意后点击【下载人声】,格式默认为WAV(保真度高)。
【注意】MP4视频若含DRM加密或硬件编码(如iPhone HEVC硬编),可能无法解析音频流,需先用剪映导出为H.264+AAC标准封装再上传。
小云雀AI (Windows) 1.0.37版重点优化Windows端运行性能与生成稳定性,升级Seedance 2.0视频模型与Seedream图像生成能力,新增智能分镜自动排版与脚本联动生成机制,强化“爆款视频复刻”和数字人口播效果,提升批量生成效率,让用户在Windows端实现更高效的AI短视频与图像内容生产。
用VocalRemover.org免费分离(零注册)
适合对隐私敏感、不想登录账号的用户,完全开源前端,音频不上传服务器。
方法二:本地浏览器运行(离线可用)
第一步:访问 https://vocalremover.org;
第二步:点击【Upload Audio】→ 选择你视频转出的音频(MP3/WAV/M4A),不支持直接传视频文件;
第三步:在模型选项中选【UVR HP2 (High Quality)】→ 勾选【Instrumental Only?】下方的【Vocals Only】;
第四步:点击【Start Processing】→ 浏览器本地运行WebAssembly模型,10~30秒后生成人声轨;
第五步:点击【Download Vocals】保存为WAV,文件名自动带_vocals后缀。
这一步不用联网上传音频,所有计算都在你电脑里完成,录音笔录的会议视频、家人语音祝福这类私密内容可放心处理。
用aifooler处理高杂音场景
当视频里有持续鸣笛、空调轰鸣、多人交谈背景音时,普通分离工具容易把人声切碎,aifooler的时域掩蔽技术对此类干扰抑制更强。
方法三:精准降噪+人声提取
- 打开 aifooler 官网 → 上传视频或音频 → 选择【人声分离+智能降噪】双模式;
- 处理前可手动拖动滑块调节“人声聚焦强度”:数值越高越激进,但可能损失齿音;
- 预览时重点听“嗯”“啊”“s”“sh”等高频起始音是否连贯,若发虚,说明强度设太高;
- 导出选【WAV 48kHz】,避免MP3二次压缩损伤瞬态细节。
【关键提醒】AI翻唱训练必须用WAV格式干声,MP3会抹除气声与泛音细节,导致模型输出机械感严重。










