Miranda ElevenLabs Speech (TTS/STT)

Polar Sponsor
爱发电 赞助
.NET 9.0

使用 ElevenLabs AI 实现文字转语音和语音转文字。当用户需要将文字转为语音、转录音频消息或在音乐中处理语音时使用。

十一Labs Speech. 完成语音解决方案 — TTS 和STT 都使用一个 API:.

功能概述

十一Labs Speech. 完成语音解决方案 — TTS 和STT 都使用一个 API:.是一项面向实际任务的技能,主要用于TTS : Text to- Speech (高质量语音).;STT : Speaking- to- Text 透過 Scribe( 准确的转录) QQ 快速启动.;

核心要点

  • Environ。
  • 它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
  • 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。

使用与执行

从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。

结果检查与注意事项

执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。该技能适合用于一次性任务,也可以接入自动化工作流,与其他技能或上层代理配合完成更完整的业务链路;在组合使用时,应明确每一步的输入输出关系,并避免不同步骤之间出现参数冲突。

ElevenLabs 语音服务

完整的语音解决方案 —— 使用单一 API 同时支持 TTS(文本转语音)与 STT(语音转文本):

  • TTS:文本转语音(高质量语音)
  • STT:通过 Scribe 实现语音转文本(高精度转录)

快速开始

环境配置

设置您的 API 密钥:

export ELEVENLABS_API_KEY="sk_..."

或在工作区根目录下创建 .env 文件。

文本转语音(TTS)

将文本转换为自然流畅的语音:

python scripts/elevenlabs_speech.py tts -t "Hello world" -o greeting.mp3

使用自定义音色:

python scripts/elevenlabs_speech.py tts -t "Hello" -v "voice_id_here" -o output.mp3

列出可用音色

python scripts/elevenlabs_speech.py voices

在代码中使用

from scripts.elevenlabs_speech import ElevenLabsClient

client = ElevenLabsClient(api_key="sk_...")

# 基础 TTS
result = client.text_to_speech(
    text="Hello from zerox",
    output_path="greeting.mp3"
)

# 带自定义参数
result = client.text_to_speech(
    text="Your text here",
    voice_id="21m00Tcm4TlvDq8ikWAM",  # Rachel
    stability=0.5,
    similarity_boost=0.75,
    output_path="output.mp3"
)

# 获取可用音色列表
voices = client.get_voices()
for voice in voices['voices']:
    print(f"{voice['name']}: {voice['voice_id']}")

常用音色

音色 ID 名称 描述
21m00Tcm4TlvDq8ikWAM Rachel 自然、通用(默认)
AZnzlk1XvdvUeBnXmlld Domi 有力、富有活力
EXAVITQu4vr4xnSDxMaL Bella 柔和、舒缓
ErXwobaYiN019PkySvjV Antoni 均衡全面
MF3mGyEYCl7XYWbV9V6O Elli 温暖、友好
TxGEqnHWrfWFTfGW9XjX Josh 低沉、沉稳
VR6AewLTigWG4xSOukaG Arnold 权威感强

音色参数说明

  • stability(0–1):数值越低,情感表现越丰富;越高则语音越稳定
  • similarity_boost(0–1):数值越高,生成语音越接近原始音色特征

默认值:stability=0.5,similarity_boost=0.75

模型选择

  • eleven_turbo_v2_5 — 快速且高质量(默认)
  • eleven_multilingual_v2 — 多语言支持最佳(推荐用于非英语场景)
  • eleven_monolingual_v1 — 仅支持英语

与 Telegram 集成

当用户发送文本并希望获得语音回复时:

# 生成语音
result = client.text_to_speech(text=user_text, output_path="reply.mp3")

# 通过 Telegram 消息工具发送语音文件(指定 media 路径)
message(action="send", media="path/to/reply.mp3", as_voice=True)

定价信息

请访问 https://elevenlabs.io/pricing 查看最新资费详情。提供免费额度!

使用 ElevenLabs Scribe 进行语音转文本(STT)

使用 ElevenLabs Scribe 对语音消息进行转录:

音频转录

python scripts/elevenlabs_scribe.py voice_message.ogg

指定语言:

python scripts/elevenlabs_scribe.py voice_message.ogg --language ara

启用说话人区分(适用于多人对话):

python scripts/elevenlabs_scribe.py voice_message.ogg --speakers 2

在代码中使用

from scripts.elevenlabs_scribe import ElevenLabsScribe

client = ElevenLabsScribe(api_key="sk-...")

# 基础转录
result = client.transcribe("voice_message.ogg")
print(result['text'])

# 指定语言(提升识别准确率)
result = client.transcribe("voice_message.ogg", language_code="ara")

# 启用说话人检测
result = client.transcribe("voice_message.ogg", num_speakers=2)

支持的音频格式

  • mp3、mp4、mpeg、mpga、m4a、wav、webm
  • 最大文件大小:100 MB
  • 对 Telegram 语音消息(.ogg 格式)兼容性极佳

语言支持

Scribe 支持 99 种语言,包括但不限于:

  • 阿拉伯语(ara)
  • 英语(eng)
  • 西班牙语(spa)
  • 法语(fra)
  • 以及其他多种语言……

若未指定语言,系统将自动识别。

完整工作流示例

用户发送语音消息 → 您以语音形式回复:

from scripts.elevenlabs_scribe import ElevenLabsScribe
from scripts.elevenlabs_speech import ElevenLabsClient

# 1. 转录用户语音消息
stt = ElevenLabsScribe()
transcription = stt.transcribe("user_voice.ogg")
user_text = transcription['text']

# 2. 处理/理解文本内容
# ... 您的业务逻辑 ...

# 3. 生成回复文本
response_text = "Your response here"

# 4. 将回复文本转为语音
tts = ElevenLabsClient()
tts.text_to_speech(response_text, output_path="reply.mp3")

# 5. 发送语音回复
message(action="send", media="reply.mp3", as_voice=True)

定价信息

请访问 https://elevenlabs.io/pricing 查看最新资费详情:

TTS(文本转语音):

  • 免费额度:每月 10,000 字符
  • 提供付费套餐

STT(语音转文本)— Scribe:

  • 提供免费额度
  • 具体价格请参阅官网

相关专题

更多
LLVM自定义Pass怎么写
LLVM自定义Pass怎么写

本专题聚焦LLVM自定义Pass开发,整理Pass类结构、run()方法、PreservedAnalyses、CMake构建、插件注册、-load-pass-plugin加载和测试用例编写流程。

2026.09.30

0

10

LLVM RISC-V参数配置教程
LLVM RISC-V参数配置教程

本专题介绍LLVM对RISC-V基础ISA和扩展的支持方式,涵盖RV32、RV64、标准扩展、实验性扩展、厂商扩展、-menable-experimental-extensions和版本差异。

2026.09.30

0

14

LLVM IR中间表示入门指南
LLVM IR中间表示入门指南

本专题整理LLVM IR的核心概念,包括中间表示作用、模块结构、函数、基本块、SSA形式、类型系统和常见语法,帮助新手理解LLVM编译流程中的关键层。

2026.09.30

0

12

PDF转图片方法
PDF转图片方法

需要把 PDF 页面用于上传、预览、分享或图片归档时,PDF 转图片方法专题整理 JPG/PNG 格式选择、逐页导出、清晰度设置、批量下载和结果检查等流程,帮助用户稳定完成 PDF 图片化处理。

2026.09.30

0

26

PixTV AI视频生成与无限画布创作
PixTV AI视频生成与无限画布创作

PixTV专题整理AI视频与视觉内容创作相关功能使用教程,涵盖AI生图、视频生成、无限画布、多模型创作、素材管理、声音音乐及视频剪辑等功能,帮助用户快速掌握PixTV从创意到成片的完整制作方法。

2026.09.29

0

15

Buffalo框架数据库开发全教程
Buffalo框架数据库开发全教程

本专题围绕Buffalo框架数据库开发,讲解database.yml多环境配置、soda与fizz迁移生成回滚、模型结构体标签、增删改查与条件查询、一对多与多对多关联、数据校验、回调钩子、事务处理及原生SQL执行能力。

2026.09.23

0

15

Buffalo框架路由与请求处理实操指南
Buffalo框架路由与请求处理实操指南

本专题讲解Buffalo框架路由与请求处理机制,涵盖路由注册与分组、资源路由、Handler编写规范、Context上下文方法、参数绑定、中间件编写挂载、Session与Cookie读写、Flash消息及错误页面定制方法。

2026.09.23

0

15

Buffalo框架零基础入门教程
Buffalo框架零基础入门教程

本专题整理Buffalo框架入门内容,涵盖Go环境准备、buffalo CLI安装、新项目生成、目录结构说明、dev热加载启动、数据库连接配置与常见报错排查,帮助新手按约定优于配置的思路跑通第一个Buffalo框架应用。

2026.09.23

0

15

Conan创建软件包配方指南
Conan创建软件包配方指南

本专题介绍通过conanfile.py创建软件包的方法,讲解包名、版本、依赖和构建设置等基础信息,以及source、build、package、package_info等常用方法的作用及编写思路。

2026.09.22

0

12

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
热门推荐
/
最新课程
phpStudy极速入门视频教程
phpStudy极速入门视频教程

共6课时 | 54.6万人学习

独孤九贱(4)_PHP视频教程
独孤九贱(4)_PHP视频教程

共89课时 | 133.4万人学习