文心一言的跨模态能力可实现图生诗、语音转歌词、视频生成分镜脚本:网页端或千帆api支持图文联合生成,语音输入需清晰以避免识别偏差,视频处理要求h.264编码且时长≤30秒。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你想用文心一言把一张照片变成一首诗、把一段语音描述转成带情绪的广告文案、或让模型一边看图一边写分镜脚本——这正是其跨模态能力的核心价值:打破文本与图像、语音、视频之间的理解壁垒,让AI真正“看见并读懂”多源信息。
用图片+文字联合生成诗歌或文案
这一步适用于已有明确画面但缺文字表达的场景,比如你拍了一张雨夜咖啡馆窗边的侧影照,想配一句有电影感的短文案。
方法一:网页端直接上传图片+输入提示词
打开文心一言官网或APP → 点击输入框旁的「图片」图标 → 选择本地图片(支持JPG/PNG,单张≤10MB)→ 在同一对话框中紧接着输入:“请根据这张图写一首现代诗,用冷色调意象,突出孤独与等待感,不超过8行。” → 发送。
注意:图片必须清晰可辨主体,模糊或纯色图会导致模型退化为纯文本推理,输出质量断崖式下降。
方法二:调用千帆平台API实现批量图文创作
在千帆大模型平台开通ERNIE-ViL或多模态API权限 → 准备图片URL或base64编码字符串 → 构造JSON请求体,其中messages字段需同时包含{"type": "image_url", "image_url": {"url": "https://xxx.jpg"}}和{"type": "text", "text": "写三句适配该画面的小红书标题"} → POST至https://aip.baidubce.com/rpc/2.0/ai_custom/v1/wenxinworkshop/multimodal → 解析返回的result字段。
【必须使用ERNIE-Bot 4.5 Turbo VL或更高版本模型,低版本不支持多模态输入】
用语音描述反推歌词或剧本段落
当你只有听觉记忆没有画面时,比如脑中反复回响“老式收音机沙沙声+女生轻哼副歌前奏”,就可以用语音转文字+语义增强的方式触发跨模态联想。
第一步:在文心一言APP中点击话筒图标,清晰说出:“凌晨两点,旧公寓,窗外有霓虹灯牌闪烁,收音机放着走调的邓丽君,女孩坐在地板上写一封寄不出的信——请把这段听感写成主歌加副歌的歌词。”
第二步:等待语音识别完成并自动提交 → 模型将提取“霓虹”“走调”“寄不出”等关键词,映射到视觉符号(如褪色海报、未贴邮票的信封)与情绪节奏(慢速、略带颗粒感的韵律)。
第三步:若首版歌词偏直白,追加指令:“把‘霓虹灯牌’具象为‘‘永和豆浆’四个字只剩两个半在闪’,押iu韵,副歌改用短句重复。”
这一步操作起来很简单,直接把语音拖进去就行。但要注意:环境噪音过大会导致语音识别错误,进而让模型误解核心意象——例如把“邓丽君”识别成“登机君”,整段歌词会跑偏到航空主题。
用视频片段生成分镜脚本与运镜建议
适用于短视频创作者或学生作业,输入10秒手机实拍素材,直接获得可执行的影视化拆解。
方法一:网页端上传MP4/MOV文件(≤50MB,时长≤30秒)→ 输入提示词:“分析这段视频,输出分镜表,含镜头编号、画面描述、景别、运镜方式、时长、匹配音效建议。”
方法二:使用千帆平台的ERNIE-ViL-Video专用接口 → 将视频切片为关键帧序列(推荐每秒1帧)→ 对每一帧调用图文理解API → 聚合时间维度语义,生成带时序标记的剪辑策略。
【当前仅支持H.264编码的MP4,AV1或HEVC编码会报错中断】











