predict接口应返回json可序列化的字典结构,标量用.item()、多类logits用.detach().cpu().numpy().tolist()、检测输出用固定键名的纯python数据。

predict 接口该返回什么结构才不踩 ValueError: too many dimensions
模型推理接口的输出结构必须和下游消费方(比如 Flask 路由、前端 JSON 解析)对齐,否则容易在序列化或维度处理时崩。常见错误是直接返回 torch.Tensor 或 np.ndarray,而没做 .item() / .tolist() / .squeeze()。
- 标量预测(如二分类概率):用
.item()转 Python 原生类型,避免传tensor(0.84)这种对象 - 多类 logits:先
.softmax(dim=-1),再.detach().cpu().numpy().tolist(),别漏.cpu()(GPU 张量不能直接转 list) - 检测/分割等结构化输出:用字典包装,键名固定(如
"boxes","scores"),值全为 list 或 float/int,禁用嵌套 tensor
怎么写一个可复用的 predict 函数,不和模型加载耦合
把模型加载和推理逻辑拆开,否则每次调用都 reload 权重,既慢又占显存。核心是让 predict 只关心输入预处理 → 模型 forward → 后处理,模型实例由外部传入。
- 函数签名建议:
def predict(model, image_path: str, device="cuda") -> dict:,不硬编码模型路径或 device - 输入校验放最前:检查
image_path是否存在、是否为支持格式(os.path.splitext(image_path)[1].lower() in {".jpg", ".png"}) - 预处理统一走
transforms.Compose,别手写cv2.resize+torch.from_numpy混搭,容易错通道顺序
测试 predict 时遇到 RuntimeError: Input type (torch.cuda.FloatTensor) and weight type (torch.FloatTensor)
这是 device 不一致的典型报错——模型在 CPU 加载,但输入送到了 GPU,或反过来。不是模型写错了,是运行时环境没对齐。
SkillSub Pro - Python 题解与代码注释双功能技能功能概述SkillSub Pro - Python 题解与代码注释双功能技能是一项面向实际任务的技能,主要用于SkillSub Pro 是一个 Python 题解生成与代码注释的 双功能合体技能 ,专为学生、算法学习者和开发者设计;✅ 一个技能,两种用途 :;核心要点📝 题解模式 :输入题目/题号,自动生成完整 Python 题解(含详细注释、解题思路、复杂度分析);💬 注释模式 :输入 Python 代码,自动添加详细中。它将相关步骤、
- 加载模型后立刻指定 device:
model = model.to(device),别只在predict里调.cuda() - 输入张量也要同步:
input_tensor = input_tensor.to(device),且必须在model(input_tensor)前完成 - 本地测试建议默认用
device="cpu",CI 或部署时再切 cuda;避免开发机没 GPU 却写死.cuda()
为什么本地 predict 正常,API 里就返回空字典或 500?
多数是日志没打、异常被吞,或者 JSON 序列化失败。Flask/FastAPI 默认不会把 tensor 错误堆栈吐给客户端。
- 在
predict外层加try/except,捕获后logging.exception("predict failed"),别只 print - 返回前强制校验:
assert isinstance(result, dict), f"predict must return dict, got {type(result)}" - 用
json.dumps(result, ensure_ascii=False)测试能否序列化,np.float32和torch.int64都会直接报错
设备切换、数据类型、JSON 可序列化性,这三个点串起来才是 predict 稳定的关键。少一个,线上就可能静默失败。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










