必须调用gemini多模态api接口,配置google_api_key环境变量,安装google-generativeai库,使用gemini-1.5-flash或gemini-1.5-pro模型,通过upload_file、base64或pil.image传图,再调用generate_content生成中文描述。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让AI准确识别上传的图片内容并生成自然流畅的中文描述,必须绕过纯文本模型的限制,直接调用Gemini原生支持多模态输入的API接口,否则图像信息根本无法进入模型处理流程。
获取并配置合法API密钥
访问 Google AI Studio,用你的Google账号登录,在左侧面板点击「API keys」→「Create API key in new project」生成新密钥。
将密钥复制后,保存到本地环境变量中:在终端执行 export GOOGLE_API_KEY="your_api_key_here",Windows用户请改用 set GOOGLE_API_KEY=your_api_key_here。
这一步不可跳过——【未配置环境变量或密钥拼写错误会导致后续所有调用返回401错误】。官方SDK默认从该变量读取密钥,硬编码在代码里属于高风险实践。
安装SDK并选择正确的模型
运行命令安装官方Python库:pip install google-generativeai。
初始化时必须指定支持视觉能力的模型名:genai.GenerativeModel("gemini-1.5-flash") 或 "gemini-1.5-pro"。注意:【gemini-pro、gemini-flash等旧版名称已弃用,调用会报错404】。
gemini-1.5-flash适合快速验证和轻量级图像理解;gemini-1.5-pro更适合复杂场景(如多对象关系推理、图文混合长文档分析)。
构造合法的多模态输入结构
方法一:使用 upload_file 上传本地图像文件
调用 genai.upload_file(path="photo.jpg"),返回一个 File 对象,它携带服务器托管地址与元数据,可直接传入 generate_content。
方法二:手动编码 Base64 字符串(仅限小图)
先用 base64.b64encode(open("photo.jpg", "rb").read()).decode() 得到字符串,再组装为字典:{"mime_type": "image/jpeg", "data": base64_str}。此方式不推荐用于 >1MB 的图——容易触发请求体超限错误。
方法三:传入 PIL.Image 对象(需额外安装 Pillow)
用 PIL.Image.open("photo.jpg") 加载后直接作为 content 列表元素,SDK 自动处理编码。这种方式内存友好,但不支持 GIF 动图帧提取。
编写可运行的图像识别与描述脚本
第一步:导入模块并配置密钥
import google.generativeai as genai
genai.configure(api_key=None) # 让SDK自动读取环境变量
第二步:加载模型与图像
model = genai.GenerativeModel("gemini-1.5-flash")file = genai.upload_file(path="scene.jpg")
第三步:发起多模态请求
response = model.generate_content([file, "请用中文分三点描述图中主体、环境及人物动作,每点不超过20字。"])
第四步:提取并输出结果
if response.text:
print(response.text)else:
print("模型未返回有效文本,请检查图片是否清晰、提示词是否明确")
大量免费API接口:立即使用
涵盖生活服务API、金融科技API、企业工商API、等相关的API接口服务。免费API接口可安全、合规地连接上下游,为数据API应用能力赋能!











