有人说ai编程能赚钱,也有人讲ai agent有商机,还有人看好ai视频生成的潜力,但你可能没注意到——ai音频其实同样蕴藏着巨大财富。
据海外媒体报道,ElevenLabs正内部推进一项二级市场股份转让计划,允许员工出售所持股票。该交易预计将在9月前完成,公司估值已达约220亿美元。
而就在短短5个月前,这家公司刚完成5亿美元D轮融资,彼时估值为110亿美元。
换言之,不到半年时间,估值翻倍。
那么问题来了:一家专注AI语音技术的企业,凭什么在半年内实现百亿级跃升?
01
从AI配音工具,跃迁为声音基础设施
2022年,ElevenLabs两位创始人马蒂·斯坦尼舍夫斯基(Mati Staniszewski)与彼得·达布科夫斯基(Piotr Dabkowski)选择切入TTS(Text-to-Speech)赛道。
传统TTS多依赖“拼接合成”:将真人录音切分为音素片段,再按文本顺序机械拼接。虽能发声,却缺乏语气起伏、节奏变化与情感表达,听起来如同冰冷机器念稿。
马蒂和彼得则另辟蹊径,借助深度学习模型让系统真正理解语义,并直接生成富有情绪、具备自然停顿与韵律感的语音。两人自掏腰包投入10万美元启动首轮训练,成果令人惊艳。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

尽管产品形态仍属TTS范畴,但从那一刻起,ElevenLabs已悄然打下AI语音的根基。
进入2024年,ElevenLabs推出Conversational AI平台(后更名为ElevenLabs Agents),构建起端到端语音交互闭环:
用户语音输入 → Speech-to-Text转译 → 大模型理解并生成回复 → Text-to-Speech合成输出 → 声情并茂播报结果。
整个流程耗时仅数百毫秒。
其核心优势在于,“听”与“说”全部由自家模型驱动:
- “听”的环节采用ElevenLabs自研Speech-to-Text模型,精准捕捉用户语音;
- “说”的部分配备双轨语音合成模型:
- eleven_flash_v2_5 主打极速响应,延迟压至约75毫秒,专为实时对话场景优化;
- eleven_v3 注重表现力,支持超70种语言,适用于对音质要求高、对延迟容忍度高的内容生产场景。
随着ElevenLabs Agents成为业务主干,公司顺势拓展出Dubbing(多语种配音)与Music(AI音乐生成)两大新方向。
更值得瞩目的是,2026年7月上线的Netflix旺卡主题真人秀《Wonka’s The Golden Ticket》,其旁白使用的是已故传奇演员吉恩·怀尔德(Gene Wilder)的声音复刻版本——该方案经Wilder遗产管理委员会正式授权。Wilder遗孀亦公开表示,家人认可这种以科技延续经典的方式。
几乎同期,ElevenLabs还发布了AI朗读版《奥德赛》,由迈克尔·凯恩(Michael Caine)声音克隆演绎,同样获得合法授权。
名人的声音,本质上是一种可确权、可授权、可规模化商用的IP资产,与肖像权具有同等法律地位。
基于此,ElevenLabs进一步打造了Iconic Voice Marketplace(标志性声音市场),将名人声音转化为标准化数字资产;同时推出AI前台接待员Reception AI,强化B端服务能力。
截至2025年底,ElevenLabs年度经常性收入(ARR)接近3.5亿美元;到2026年4月,这一数字已突破5亿美元。
截至目前,Eleven Agents平台上累计创建Agent超200万个。仅2026年上半年,就完成了逾3300万次真实对话调用——注意,这些数据不含任何测试或演示流量,全部来自实际生产环境。
看到这里,你或许会疑惑:ElevenLabs发展势头如此强劲,为何员工还要急于套现?继续持有岂不更划算?
实际情况是:根据外媒披露,ElevenLabs正与OpenAI、Anthropic等巨头争夺同一批顶尖AI工程师与研究员。不少核心成员已在公司服务两三年,手中股票账面价值已翻数倍,但由于尚未上市,无法兑现收益。长期无法变现,跳槽动机自然增强。
此次二级市场交易,实质是企业为稳定核心团队所设的“泄压阀”。事实上,在完成D轮融资的同时,ElevenLabs已执行过一次金额达1亿美元的要约收购(tender offer);不到一年,这已是第二次同类操作。
投资人愿以220亿美元估值回购员工股份,恰恰说明他们坚信公司未来估值有望超越该数字。
02
AI语音赛道:
为何声音比视频更早实现盈利?
Sora因高昂成本与持续亏损被关停;火山引擎总裁谭待也曾明确指出,当前市面上流传的所有Seedance营收数据均不属实,且普遍严重高估。
这意味着,无论海内外,AI视频生成目前仍未找到可持续的商业化路径。
那为何AI音频却已跑通盈利模型?
第一,成本结构显著更轻。
语音生成处理的是单维时间序列,核心任务是将文字、语义与情绪映射为连续音频流;而视频生成需同步建模人物、背景、动作、镜头运动、光影变化及帧间一致性,属于高维空间建模。
后者信息密度更高、推理链更长、容错率更低。
因此,如Sora这类模型单次生成成本极高,且产出结果常因人物失真、运镜抖动、动作僵硬或风格割裂等问题反复重试——每次重试都意味着额外算力消耗。
相比之下,音频产品成熟度更高,极少需要重复生成,单次调用成本远低于视频。
更重要的是,语音可用性标准更易工程化落地:客服语音只需足够自然+低延迟,即可嵌入企业流程;而视频往往还需人工剪辑、调色、配乐才能发布。
所以AI音频更像水电般的基础设施,AI视频则更像是一个尚处实验阶段的“创意玩具”。
这也正是ElevenLabs增长迅猛的根本逻辑——它售卖的不是一次性炫技效果,而是企业可高频调用、即插即用的声音能力。低成本、低延迟、低重试率、易集成,才使AI语音率先成为一门“算得清账”的生意。
第二,应用场景高度确定。
字节跳动正式推出了其最新的智能图像创作模型——Seedream 5.0 Lite。作为豆包大模型2.0系列的重要组成部分,该模型不仅在理解、推理和生成能力上实现了全面跃升,更针对企业级视觉创作需求进行了深度优化,标志着AI生图技术向“实用化”与“智能化”迈出了关键一步。
配音、有声书、短视频旁白、本地化翻译、智能客服、销售外呼、员工培训、在线教育、游戏NPC语音……仅凭日常观察,就能罗列出大量刚需场景。
AI音频并非创造全新需求,而是对已有配音方式的效率升级与产能放大。
反观AI视频,其应用边界仍模糊:广告素材?微短剧?社媒内容?每个方向都存在不确定性,难以形成稳定付费闭环。
正是这些清晰、高频、可规模化的场景,构成了ElevenLabs持续增长的底层支撑。
第三,技术门槛明显更低。
视频需攻克世界模型、物理真实性、肖像权合规等多重难题,涉及跨学科复杂挑战。
而语音只需满足四项基础指标即可商用:
- 音质清晰度达标
- 情绪表达自然度达标
- 端到端延迟可控
- 系统运行稳定性达标
一旦这四个维度通过验证,语音即可直连生产系统,无需人工后期干预。
门槛低,意味着从Demo演示走向商业落地的距离极短;距离短,则意味着变现周期更快。
第四,也是最关键的一点:语音是AI Agent最自然的交互入口。

若AI Agent要真正走进现实世界,光会打字远远不够,它必须具备“听”与“说”的能力。
文字交互是互联网时代的界面范式,语音才是Agent时代的原生接口。生活中大量事务本就不发生在键盘上——电话沟通、车载交互、门店咨询、耳机播报……默认交互方式就是语音。
ElevenLabs Agents不仅实现了完整语音对话闭环,更关键的是让机器真正理解了用户意图。这也是ElevenLabs强调其Agent“员工属性”的深层原因。
此外,语音入口还有一个不可替代的优势:它能延伸至无屏场景。
文本型Agent高度依赖网页、App或办公软件界面;而语音型Agent则可无缝接入电话线路、蓝牙耳机、车载系统、线下智能终端等无屏设备。
哪怕你的AI视频再精美,离开屏幕便彻底失效。
03
语音,才是AI时代的真正入口
对国内从业者而言,ElevenLabs的故事并不玄妙。
打开任意一款主流AI助手App,语音唤醒、语音提问、语音朗读、切换音色……所有功能都能流畅实现。
“AI会说话”,在中国早已不是稀缺能力。那为何我们没能诞生自己的ElevenLabs?
以字节跳动旗下豆包为例:其战略目标是吸引用户入驻、留存于豆包生态,并深度使用字节系产品矩阵。语音功能在此定位中,本质是超级App/全能助手的交互载体。
豆包的语音能力,是字节AI入口战略的关键一环——体验越顺滑,用户越愿意留在豆包,也越倾向将其作为日常AI助手。

ElevenLabs之所以能在海外市场突围,关键在于当地市场高度碎片化:内容平台、游戏厂商、教育机构、客服服务商、独立创作者、开发者工具商……各自拥有不同系统、不同需求、不同采购路径。
ElevenLabs恰好处在这些分散需求的交汇点,把自己打造成“声音基础设施提供商”,并将模块化能力打包销售给各类型客户。
而在中国,短视频配音有剪映,网文听书有番茄小说,AI助手语音有豆包,企业级语音API有火山引擎,直播带货讲解有抖音……
换句话说,ElevenLabs在海外需逐一攻克的细分场景,在国内早已内生于各大平台生态之中。
中国大概率难孕育出完全对标ElevenLabs的独立语音公司。 因为最具商业价值的语音场景,早已被各大生态提前“截流”。
与此同时,ElevenLabs自身也面临新的挑战:当语音模型能力日趋同质化,它的护城河究竟在哪里?
比如Vapi,它是一个面向开发者的AI语音Agent构建平台,支持将语音识别、大模型调用、语音合成、电话信令、工具集成、打断机制、延迟控制、测试部署等环节一站式串联。
Vapi对ElevenLabs构成的潜在威胁在于:当语音模型质量差距缩小,客户真正关心的,不再是“谁的声音更像真人”,而是“谁能更快把语音Agent部署上线”。
ElevenLabs强项在于TTS模型本身,但Vapi站在更高维的编排层,直面开发者与企业客户,可将TTS模块化为可插拔组件。
今天它可以对接ElevenLabs,明天也能轻松切换至OpenAI、Cartesia、PlayAI等其他供应商。
而ElevenLabs呢?只能绑定自有模型。这意味着,一旦受限于算力、研发节奏或迭代能力,无法持续更新高质量模型,反而会加速Vapi这类聚合型平台的崛起。
本文来自微信公众号“直面AI”(ID:faceaibang),作者:苗正,编辑:王靖,36氪经授权发布。










