火山引擎豆包大模型多模态能力怎么调用?

浅婷小哥_8213

浅婷小哥_8213

2026-09-11

732人浏览

原创

调用火山引擎豆包多模态模型需明确输入格式、选用doubao-seed-vision/2.0-pro/2.1-pro三类模型,构造含role/content的list消息结构,支持base64图片、https/tos/s3链接及混合图文输入,并通过thinking_type字段与x-las-llm-thinking-type头控制深度思考,响应含llm_result与reasoning_content字段。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

火山引擎豆包大模型多模态能力怎么调用?

要在实际项目中调用火山引擎豆包大模型的多模态能力,必须明确输入数据格式、选择适配的模型版本,并正确构造符合规范的 message 结构,否则请求会直接被拒绝或返回空推理结果。

确认可用的多模态模型版本

截至2026年8月,火山引擎官方支持多模态能力的主力模型为:【Doubao-Seed-Vision】(视觉理解专用)、【Doubao-Seed-2.1-pro】(通用多模态强推理)、【Doubao-Seed-2.0-pro】(空间与运动理解强化版)。其中 Doubao-Seed-Vision 仅支持图片输入,不支持视频或文本混合;Doubao-Seed-2.1-pro 和 2.0-pro 支持 images + videos + texts 三类混合输入,且默认启用深度思考机制。

调用前务必检查 API 文档中 model 字段是否列出该模型——例如 /v1/chat/completions 接口只接受 2.1-pro 及以上版本,而 /v1/vision/analyze 接口仅接受 Doubao-Seed-Vision。

构造合法的多模态输入结构

多模态输入必须以 list 形式组织 message,每个元素为 dict 类型,含 role 和 content 两个键。content 必须是 list,且每个子项需明确标注 type:

方法一:本地图片转 base64 后嵌入

将 JPG/PNG 文件读取为二进制 → base64 编码 → 构造 {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,xxx"}}。注意:base64 字符串不能换行,且总长度不能超过 20MB;超大会触发 413 错误。

方法二:传 HTTPS/TOS/S3 URL

直接提供可公开访问的图片链接,如 {"type": "image_url", "image_url": {"url": "https://example.com/img.png"}}。若使用 TOS 或 S3,URL 必须带预签名参数,否则返回 403;火山引擎不会自动帮你生成签名,需自行调用 TOS SDK 签发。

方法三:混合图文输入(推荐用于文档解析场景)

火山引擎
火山引擎

火山引擎是一款面向企业的云计算与AI服务平台。

下载

第一步:把 PDF 第一页截图保存为 page1.jpg → 转 base64
第二步:提取 PDF 文本段落 → 存为 text_block.txt → 读取为字符串
第三步:组合 message → [{"role": "user", "content": [{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,..."}}, {"type": "text", "text": "请逐条提取图中表格字段名和对应值"}]}]

启用并控制深度思考行为

在 request body 中加入 thinking_type 字段可干预模型推理路径:

① 设置 "thinking_type": "enabled":强制输出 reasoning_content 字段,适合需要审计推理链的金融/医疗场景;但 token 消耗增加 30%~50%,响应延迟上升 1.2~2.3 秒。

② 设置 "thinking_type": "disabled":跳过思维链生成,仅返回 llm_result;适用于实时性要求高的 UI Agent 场景,如网页按钮点击判断。

③ 设置 "thinking_type": "auto"(默认):模型根据输入复杂度自动决策是否展开推理;当检测到视频帧数>30 或图像中存在多张表格时,会主动启用深度思考。

【必须在 headers 中添加 X-LAS-LLM-THINKING-TYPE: enabled】 才能使 thinking_type 字段生效,否则服务端直接忽略该参数。

处理多模态响应结果

成功响应为 JSON object,结构固定包含 llm_result(最终回答)和 reasoning_content(思维链),二者均为 string 类型。若未开启 thinking_type,则 reasoning_content 为空字符串。

当输入含视频时,response 中可能额外出现 video_summary 字段(仅限 Doubao-Seed-2.1-pro),内含关键帧时间戳、动作标签、空间关系三元组;该字段需显式在 request 中声明 "output_format": "detailed" 才会返回。

若 response 中出现 finish_reason: "content_filter",说明某帧图像或某段文本触发安全策略——此时不会返回 llm_result,仅返回空字符串和该 reason,【无法通过重试绕过】,必须更换原始素材。

相关文章

AI工具
AI工具

AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型,支持联网搜索。

下载

本站声明:本文内容由网友自发贡献,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系admin@php.cn

相关专题

更多
豆包App怎么下载和使用
豆包App怎么下载和使用

字节跳动推出的“豆包”是一款 ai 助手 app,提供文本创作和图像生成等功能。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2024.12.17

4143

7

豆包是干什么的怎么用
豆包是干什么的怎么用

豆包是一款功能强大的ai聊天智能对话问答助手,主要用于提供聊天机器人、写作助手、英语学习助手等功能,帮助用户获取信息、进行对话、辅助创作等‌‌。想了解更多相关的内容,请阅读专题下面的文章。

2024.12.25

16157

7

豆包是国产软件吗
豆包是国产软件吗

豆包是一款国产AI工具,由字节跳动公司基于云雀模型开发。它提供聊天机器人、写作助手和英语学习助手等功能,支持网页、iOS和安卓平台。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.02.05

17161

7

豆包是什么软件有什么作用
豆包是什么软件有什么作用

豆包是一款跨平台文件传输工具,支持多种操作系统。其主要功能包括:快速传输:采用先进协议,实现高速文件传输。安全加密:端到端加密,确保数据安全。跨平台支持:支持各种操作系统和设备。大文件传输:轻松传输不受限的大文件。多设备互传:提高工作效率。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.02.08

3322

7

豆包是哪个公司开发的软件
豆包是哪个公司开发的软件

豆包是字节跳动开发的软件。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.02.08

5196

7

豆包是什么时候发布的
豆包是什么时候发布的

字节跳动的 AI 产品 “豆包” 第一次发布时间是 2023 年 8 月 17 日。本专题为大家提供相关的文章、下载、课程内容,供大家免费下载体验。

2025.02.12

4698

6

豆包存在哪些风险
豆包存在哪些风险

豆包软件的风险主要在于其安全性、隐私性以及潜在的法律合规问题。想了解更多相关的内容,请阅读专题下面的文章。

2025.02.17

19057

14

抖音旗下的豆包是什么
抖音旗下的豆包是什么

抖音旗下的豆包是一款即时语音互动社交平台,定位于年轻群体。想了解更多相关内容,请阅读专题下面的文章。

2025.03.27

5094

7

豆包Ai手机版使用常见问题汇总
豆包Ai手机版使用常见问题汇总

本专题聚焦豆包AI手机版使用中的高频痛点,涵盖登录授权、功能入口查找、网络卡顿、文件上传失败、AI操作权限设置等核心问题,结合实测案例给出分步解决方案,同时解析会员权益边界、隐私保护机制等争议点,帮助用户快速避开使用雷区,高效解锁跨APP协同、智能生图、文档解析等进阶功能。

2026.05.06

380

37

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程