php无法直接提取音频关键词,需调用外部asr+nlp服务:先用ffmpeg转码为16khz单声道mp3/wav,再通过curl以multipart/form-data上传至云api(如whisper),最后用php-jieba或tf-idf等处理文本提取关键词。

PHP 本身无法直接从音频文件中提取关键词——它没有内置的语音识别或语义分析能力。你需要调用外部服务或本地部署的 ASR(自动语音识别)+ NLP 模块,PHP 只负责上传、中转和发起请求。
上传后怎么把音频交给语音识别服务
上传完成得到临时路径(如 $_FILES['audio']['tmp_name'])后,不能直接拿这个文件去“分析”,得先确保格式兼容、时长合理,并选择传输方式:
- 若用云服务(如阿里云智能语音交互、腾讯云ASR、OpenAI Whisper API),需将音频转为服务支持的格式(常见是
mp3或wav,采样率 ≤16kHz,单声道优先) - 推荐用
ffmpeg命令行预处理:例如ffmpeg -i input.mp4 -ar 16000 -ac 1 -c:a libmp3lame -y output.mp3 - 上传方式选
multipart/form-data(适用于小文件<10MB)或分片 + 预签名 URL(大文件) - 记得检查
$_FILES['audio']['error'] === UPLOAD_ERR_OK,否则后续全白忙
调用 Whisper API 时常见的 400 错误怎么排
用 PHP 的 curl 调 OpenAI 或自建的 whisper.cpp / fast-whisper 接口时,400 Bad Request 最常因以下原因触发:
- 音频文件未以
file字段名提交(应是curl_file_create($path),不是file_get_contents()拼字符串) -
Content-Type被手动设成application/json—— multipart 请求必须让 cURL 自动设置 boundary - 参数写错:比如传了
language=zh但服务只认zh-CN,或漏了必需的model(如small、medium) - 音频时长超限:免费版 Whisper API 通常限制 25 秒以内,超时会静默截断并返回空结果
拿到文本后怎么靠谱地抽关键词
ASR 输出的是纯文本($transcript),关键词提取不是正则匹配几个高频词就能解决的。真实场景要注意:
- 避免用
array_count_values(explode(' ', $transcript))—— 中文没空格分词,英文还可能有缩写/大小写混杂 - 轻量方案:调用已封装好的 PHP NLP 库,如
php-jieba(中文)或php-nlp-tools(英文),再配合 TF-IDF 或 TextRank 算法 - 更稳做法:把文本 POST 到轻量级 NLP 服务,例如 Hugging Face 上的
zero-shot-classification模型,或用curl请求本地运行的keybert(Python)HTTP 封装接口 - 别忽略停用词过滤——中文要剔除“的”“了”“在”,英文要处理 “the”、“is”、“and”,否则“用户”“今天”“我们”这种超高频虚词霸榜
真正卡住人的地方往往不在 PHP 代码本身,而在于音频质量(背景噪音、语速过快)、服务配额限制(每分钟调用次数)、以及中文关键词缺乏上下文时容易误判(比如“苹果”指水果还是公司)。建议先用固定音频文件硬编码调试通路,再接入上传逻辑。
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











