pixtv各版本对参考图的尺寸、内容和光照要求逐代严格:v1限512×512正方形,v2支持三档固定比例并校验边缘,v3动态适配但需长边≥1024且通过语义分割;均禁多主体与镜像,v3还强制exif光源标签。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

PixTV不同模型对参考图的尺寸与比例要求
PixTV系列模型在生成视频时高度依赖参考图的空间结构信息,不同版本对输入图像的宽高比和最小分辨率有明确差异,强行使用不匹配的参考图会导致帧抖动、主体错位或首帧渲染失败。
基础版PixTV-v1仅支持严格1:1正方形输入,必须为512×512像素。若上传480×640人像图,模型会自动裁切顶部和底部共128像素,导致人物头部被截断——【裁切不可逆,且无警告提示】。
PixTV-v2放宽为支持16:9、4:3、1:1三档固定比例,但每档对应唯一基准尺寸:16:9须为768×432,4:3须为640×480,1:1仍为512×512。上传600×900(2:3)图像时,系统静默拉伸至768×432,人物脸部横向畸变明显。
PixTV-pro采用动态分辨率适配机制,允许任意尺寸,但要求长边≥1024像素且短边≥576像素;低于该阈值时,模型拒绝加载并返回“REF_TOO_SMALL”错误码,不进入推理阶段。
PixTV不同模型对参考图内容构成的要求
所有PixTV模型均禁止参考图含多主体、镜像翻转或半透明叠加层,但对细节敏感度逐代提升。
方法一:PixTV-v1可接受轻微模糊的静态人像,只要面部区域清晰度达标(PSNR≥28dB),背景杂乱不影响生成质量;但若参考图中人物佩戴反光眼镜,v1会将镜面高光误判为额外人脸关键点,造成后续帧眼部位置漂移。
方法二:PixTV-v2引入边缘一致性校验,要求参考图中主体轮廓与背景交界处无羽化、无PS涂抹痕迹。上传经美颜App处理过的磨皮图(如皮肤边界泛白),v2会在第3帧开始出现轮廓重影,持续到视频结束。
方法三:PixTV-pro强制启用语义分割预检,仅当参考图通过内部CLIP-ViT分割器判定“主物体置信度>0.92且背景占比<65%”时才允许提交。一张风景照中远距离人物占比仅12%,即使放大到1200×800也无法通过校验。
PixTV不同模型对参考图光照与色彩的要求
第一步:PixTV-v1对白平衡不敏感,手机直出sRGB图可直接使用,但要求全局亮度均匀——若参考图左侧过曝(亮度值>245)、右侧欠曝(亮度值<30),生成视频前5帧会出现左右半脸色温分裂现象。
第二步:PixTV-v2内置色域映射表,仅接受Adobe RGB(1998)或sRGB色彩配置文件嵌入的参考图。上传无ICC Profile的PNG图时,v2默认按sRGB解析,若原图实为ProPhoto RGB,则肤色严重发青,且该偏差无法在后期调节中修复。
第三步:PixTV-pro要求参考图EXIF中包含LightSource标签,且值必须为1(日光)、2(荧光灯)或9(标准光源D50)。上传手机夜景模式图(LightSource=255,即“未知光源”),任务直接被API拒绝,返回HTTP 400错误及提示“UNSUPPORTED_LIGHTSOURCE”。











