Baoyu Danger Gemini Web

Polar Sponsor
爱发电 赞助
.NET 9.0

通过逆向工程的Gemini网页API生成图像和文本。支持文本生成、提示词图像生成以及用于视觉输入的参考图像等。

双子网络客户端 1: Text/ 图像生成通过双子网络 API. 支持参考图像和多回合对话

功能概述

双子网络客户端 1: Text/ 图像生成通过双子网络 API. 支持参考图像和多回合对话是一项面向实际任务的技能,主要用于. 用户输入工具;当此技能提示用户时, 遵循此工具选择。

核心要点

  • 它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。
  • 使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。
  • 该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。

使用与执行

从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;

结果检查与注意事项

若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。

Gemini Web 客户端

通过 Gemini Web API 实现文本/图像生成。支持参考图像与多轮对话。

用户输入工具

当本技能向用户发起提示时,请遵循以下工具选择规则(按优先级顺序):

  1. 优先使用当前 agent 运行时暴露的内置用户输入工具 — 例如 AskUserQuestion、request_user_input、clarify、ask_user,或任何功能等效的工具。
  2. 降级方案:若无此类工具,则输出编号的纯文本消息,并请用户针对每个问题以所选编号/答案形式回复。
  3. 批量处理:若该工具支持单次调用中提交多个问题,则将所有适用问题合并为一次调用;若仅支持单问题调用,则按优先级顺序逐个提问。

下方具体出现的 AskUserQuestion 示例仅供参考 — 在其他运行时中请替换为对应本地等效工具。

脚本目录

重要说明:所有脚本均位于本技能的 scripts/ 子目录下。

Agent 执行说明:

  1. 将本 SKILL.md 文件所在目录路径确定为 {baseDir}
  2. 脚本路径 = {baseDir}/scripts/.ts
  3. 解析 ${BUN_X} 运行时:若已安装 bun → 使用 bun;若可用 npx → 使用 npx -y bun;否则建议安装 bun
  4. 将本文档中所有 {baseDir} 和 ${BUN_X} 替换为实际值

脚本参考:

脚本 用途
scripts/main.ts 文本/图像生成的 CLI 入口
scripts/gemini-webapi/* gemini_webapi 的 TypeScript 移植版(含 GeminiClient、类型定义、工具函数)

授权确认(必需)

首次使用前,须验证用户是否同意使用逆向工程所得 API。

授权文件位置:

  • macOS:~/Library/Application Support/baoyu-skills/gemini-web/consent.json
  • Linux:~/.local/share/baoyu-skills/gemini-web/consent.json
  • Windows:%APPDATA%baoyu-skillsgemini-webconsent.json

流程:

  1. 检查是否存在授权文件,且其内容包含 accepted: true 及 disclaimerVersion: "1.0"
  2. 若存在有效授权 → 打印含 acceptedAt 时间戳的警告信息,继续执行
  3. 若无授权 → 展示免责声明,并通过 AskUserQuestion 向用户提问:
    • "是,我接受" → 创建授权文件,写入 ISO 格式时间戳,继续执行
    • "否,我拒绝" → 输出拒绝提示,终止执行
  4. 授权文件格式:{"version":1,"accepted":true,"acceptedAt":"","disclaimerVersion":"1.0"}

偏好设置(EXTEND.md)

按优先级顺序查找 EXTEND.md — 首个匹配者生效:

优先级 路径 作用域
1 .baoyu-skills/baoyu-danger-gemini-web/EXTEND.md 项目级
2 ${XDG_CONFIG_HOME:-$HOME/.config}/baoyu-skills/baoyu-danger-gemini-web/EXTEND.md XDG 配置目录
3 $HOME/.baoyu-skills/baoyu-danger-gemini-web/EXTEND.md 用户主目录

若未找到任一文件,则使用默认配置。

EXTEND.md 支持配置项:默认模型、代理设置、自定义数据目录。

使用方法

# 文本生成
${BUN_X} {baseDir}/scripts/main.ts "您的提示词"
${BUN_X} {baseDir}/scripts/main.ts --prompt "您的提示词" --model gemini-3-flash

# 图像生成
${BUN_X} {baseDir}/scripts/main.ts --prompt "一只可爱的猫" --image cat.png
${BUN_X} {baseDir}/scripts/main.ts --promptfiles system.md content.md --image out.png

# 视觉输入(参考图像)
${BUN_X} {baseDir}/scripts/main.ts --prompt "描述这张图" --reference image.png
${BUN_X} {baseDir}/scripts/main.ts --prompt "生成变体" --reference a.png --image out.png

# 多轮对话
${BUN_X} {baseDir}/scripts/main.ts "请记住:42" --sessionId session-abc
${BUN_X} {baseDir}/scripts/main.ts "是什么数字?" --sessionId session-abc

# JSON 输出
${BUN_X} {baseDir}/scripts/main.ts "Hello" --json

选项

选项 说明
--prompt, -p 提示词文本
--promptfiles 从文件读取提示词(按顺序拼接)
--model, -m 模型:gemini-3-pro(默认)、gemini-3-flash、gemini-3-flash-thinking、gemini-3.1-pro-preview
--image [path] 生成图像(默认输出为 generated.png)
--reference, --ref 用于视觉输入的参考图像
--sessionId 多轮对话的会话 ID
--list-sessions 列出已保存的会话
--json 以 JSON 格式输出结果
--login 刷新 cookies 后退出
--cookie-path 自定义 cookies 文件路径
--profile-dir Chrome 用户资料目录

模型

模型 说明
gemini-3-pro 默认模型,最新版 Gemini 3.0 Pro
gemini-3-flash 快速轻量级 Gemini 3.0 Flash
gemini-3-flash-thinking Gemini 3.0 Flash(启用推理能力)
gemini-3.1-pro-preview Gemini 3.1 Pro 预览版(空请求头,自动路由)

身份认证

首次运行将自动打开浏览器进行 Google 账户认证,cookies 将被自动缓存。

当未显式指定 --profile-dir 时,cookies 刷新可能复用一个已在运行的本地 Chrome/Chromium 调试会话(该会话绑定至标准用户数据目录)。可通过设置 --profile-dir 或环境变量 GEMINI_WEB_CHROME_PROFILE_DIR 强制使用专用 profile,从而跳过已有会话复用。

此机制属于尽力而为的 CDP 会话复用路径,并非 Chrome 官方文档中所述基于 Chrome DevTools MCP 的 --autoConnect 提示式流程。

支持的浏览器(自动检测):Chrome、Chrome Canary/Beta、Chromium、Edge。

强制刷新 cookies:使用 --login 标志;覆盖默认浏览器:设置环境变量 GEMINI_WEB_CHROME_PATH。

环境变量

变量 说明
GEMINI_WEB_DATA_DIR 数据目录
GEMINI_WEB_COOKIE_PATH cookies 文件路径
GEMINI_WEB_CHROME_PROFILE_DIR Chrome 用户资料目录
GEMINI_WEB_CHROME_PATH Chrome 可执行文件路径
HTTP_PROXY, HTTPS_PROXY 访问 Google 服务所用代理(可内联于命令中设置)

会话

会话文件存储于数据目录下的 sessions/.json 路径中。

文件内容包括:id、metadata(Gemini 对话状态)、messages 数组及时间戳。

扩展支持

通过 EXTEND.md 提供自定义配置。详见 偏好设置 章节中的路径说明与支持选项。

相关专题

更多
Gemini 高级Prompt工程与多模态能力优化专题
Gemini 高级Prompt工程与多模态能力优化专题

PHP中文网为您提供Gemini高级Prompt工程与多模态能力优化专题。针对谷歌最新一代原生多模态大模型(如Gemini 3.5系列),我们为您系统梳理了结构化提示词构建法则(如XML标签界定、约束前置与指令后置),以及涵盖四档Thinking推理深度控制、强制自我审视与任务拆解等高级Prompt工程实战指南。

2026.06.10

60

7

如何编写高效提示词:Gemini结构化指令设计与优化指南
如何编写高效提示词:Gemini结构化指令设计与优化指南

本指南深入解析高效提示词编写技巧,聚焦结构化指令设计与参数优化。通过拆解角色设定、任务分解及约束条件,演示如何引导Gemini输出精准结果。涵盖思维链应用与迭代优化策略,助初学者掌握核心方法论,显著提升交互质量与任务完成效率。

2026.03.24

80

11

Gemini网页版实战:从文档分析到代码生成的全流程教程
Gemini网页版实战:从文档分析到代码生成的全流程教程

本教程详解Gemini网页版全流程实战,涵盖长文档深度解析、关键信息提取及复杂代码生成。通过真实案例演示,指导用户高效利用多模态交互提升工作效率。适合初学者快速掌握核心功能,从基础问答进阶至自动化办公与开发辅助,轻松释放AI生产力。

2026.03.24

105

10

什么是Gemini:核心架构解析与多模态能力入门指南
什么是Gemini:核心架构解析与多模态能力入门指南

本专题深度解析 Gemini 核心架构,涵盖混合专家模型与原生多模态设计原理。指南详解其文本、图像及代码的统一理解能力,帮助初学者建立系统性认知。通过理论结合实例,助您快速掌握模型优势与适用场景,为后续进阶开发与复杂应用奠定坚实基础。

2026.03.24

61

11

Gemini多模态Agent实战:浏览器控制与工具链指南
Gemini多模态Agent实战:浏览器控制与工具链指南

本实战指南详解构建基于 Gemini 的多模态 Agent,实现浏览器自动化控制与复杂工具链编排。通过整合视觉理解与代码执行能力,演示如何让 AI 自主导航网页、提取动态数据并操作外部 API。涵盖环境搭建、安全沙箱及任务规划策略,助开发者打造能“看”会“做”的智能助手,突破传统文本交互局限,开启全自动工作流新篇章。

2026.03.23

59

11

Gemini上下文缓存功能:如何大幅降低长对话成本指南
Gemini上下文缓存功能:如何大幅降低长对话成本指南

本指南深入解析 Gemini 上下文缓存(Context Caching)功能,助您大幅降低长对话与大规模文档处理成本。通过复用高频输入的嵌入表示,避免重复计算令牌,显著减少延迟与费用。内容涵盖缓存创建、管理及最佳实践,特别适合多轮对话、知识库问答等场景,让您在保持高性能的同时,实现极具性价比的 AI 应用部署。

2026.03.23

55

8

Gemini结构化输出JSON模式:API稳定提取数据实战
Gemini结构化输出JSON模式:API稳定提取数据实战

本实战指南详解如何利用 Gemini API 的 JSON 模式实现结构化数据提取。通过配置响应格式约束,确保模型输出严格符合预定义 Schema,彻底解决解析错误难题。内容涵盖字段定义、类型校验及异常处理,助您在信息抽取、数据清洗等场景中构建高稳定性管道,轻松将非结构化文本转化为可靠的应用数据。

2026.03.23

91

13

如何实现Gemini函数调用:Tool Use与外部工具集成教程
如何实现Gemini函数调用:Tool Use与外部工具集成教程

本教程深入解析 Gemini 函数调用机制,详解 Tool Use 配置与外部工具集成流程。从定义函数架构到处理动态参数,手把手教您连接数据库、搜索 API 及自定义服务。通过实战案例,展示如何让 AI 自主规划并执行复杂任务,突破纯文本限制,构建具备真实行动力的智能代理系统。

2026.03.23

145

11

Gemini API快速上手:Python调用generateContent完整指南
Gemini API快速上手:Python调用generateContent完整指南

本指南详解如何使用 Python 快速调用 Gemini API 的 generateContent 方法。从环境配置、密钥管理到核心代码实现,逐步演示文本生成、多模态输入及流式响应处理。包含完整示例与错误排查技巧,助开发者轻松集成 Gemini 强大能力,构建高效智能应用,开启 AI 开发新篇章。

2026.03.23

70

11

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Gemini Notebook常见问题解答
Gemini Notebook常见问题解答

共0课时 | 0人学习

Gemini Notebook官方手册
Gemini Notebook官方手册

共0课时 | 0人学习