ffmpeg本身不支持语义分割,仅用于抽帧、缩放等预处理及结果合成;php调用ffmpeg准备图像,交由python模型推理,再用ffmpeg叠加标注生成视频。

ffmpeg 本身不支持视频语义分割——它只是个音视频编解码与转封装工具,没有 AI 推理能力。所谓“PHP + FFmpeg 实现语义分割”,实际是 PHP 调用 FFmpeg 做预处理(抽帧、缩放、格式转换),再把图像喂给独立的 Python 模型(如 Segment Anything、Mask2Former),最后用 FFmpeg 把标注结果合成为带 mask 叠加或关键帧标注的视频。
PHP 中调用 FFmpeg 抽帧并准备模型输入
语义分割需要高质量、统一尺寸的单帧图像,FFmpeg 是最可控的抽帧工具。常见错误是直接用 -r 1 硬设帧率,导致关键动作帧被跳过。
- 用
-vf "select=eq(pict_type\,I)"提取 I 帧(关键帧),更稳定;若需密集采样,改用-vf "fps=2"(每秒 2 帧)并配合-q:v 2控制质量 - 务必加
-s 640x360或匹配模型输入尺寸(如 SAM 要求能被 64 整除),避免 PHP 后续用 GD 处理时引入插值失真 - 输出命名用
-strftime 1和%Y%m%d_%H%M%S易于对齐时间戳,例如:ffmpeg -i input.mp4 -vf "fps=1,scale=640:360" -strftime 1 frame_%Y%m%d_%H%M%S.jpg
Python 模型推理环节不能绕过
PHP 没有成熟、轻量的语义分割推理库。强行用 exec("python segment.py ...") 调用外部脚本是唯一可行路径,但要注意环境隔离和超时控制。
- 模型必须提前加载(不要在每次请求中
torch.load()),推荐用 FastAPI 封装成 HTTP 服务,PHP 用file_get_contents()或 cURL 发送 base64 图像 - 输入图像路径别传绝对路径给 Python —— 容易触发权限或路径编码问题,改用相对路径 + 共享存储目录(如
/tmp/frames/) - 输出建议为 JSON 格式:每个对象含
"frame_time"(秒级时间戳)、"masks"(base64 编码的 uint8 二值图)、"labels"(如 "person", "car")
用 FFmpeg 合成带标注的视频
拿到模型输出后,不能靠 PHP 画图再逐帧编码(性能极差),应生成标注图层(PNG 序列),再用 FFmpeg 叠加。
- 先用 Python 把 mask 渲染成带透明通道的 PNG(如红色半透 overlay),保存为
overlay_00001.png等,确保尺寸与原帧一致 - 用
ffmpeg -i input.mp4 -i overlay_%05d.png -filter_complex "[0:v][1:v]overlay=shortest=1" -c:a copy output_annotated.mp4合成 - 若需文字标签(如框+文字),得先用
drawtext滤镜生成文字层,或用subtitles滤镜加载 SRT 时间轴文件——FFmpeg 不解析 JSON,必须转成它认的格式
PHP 层要防住的三个硬伤
不是功能写不出来,而是部署后立刻崩在边界上。
-
exec()默认被禁用(disable_functions),且超时默认 30 秒,语义分割单帧常超 5 秒,必须改set_time_limit(0)并用proc_open()捕获 stderr 查错 - FFmpeg 进程没回收会导致句柄泄漏,尤其并发时。务必用
proc_close()或信号监听(pcntl_signal(SIGCHLD, ...)) - 模型输出坐标是归一化值(0–1),PHP 里不做反算就直接喂给 FFmpeg 的
overlay=x:y,结果永远偏移——必须按原始视频分辨率还原像素坐标
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











