省token关键在优化配置:关全量历史回传、精简system prompt、按任务选推理档位、视觉/工具调用掐点使用,同任务消耗可降至1/3。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

GPT-6 Astra 的 Token 消耗高,不是模型“太贵”,而是很多操作在无形中反复付费。真正省 Token 的关键,是把开聊前的配置和提示词结构理清楚——这些动作做完,同任务消耗常能降到原来的 1/3。
关掉默认全量历史回传
多数客户端(包括网页版)默认开启“完整对话历史回传”。你以为只发了一句“继续”,其实模型每轮都在重读前面几十轮消息+系统提示+工具返回结果。实测显示:聊到第 25 轮时,单次输入 Token 可能比首轮高 8–12 倍。
- 网页端:进设置 → 关闭「自动携带全部历史」或启用「仅保留最近 3 轮」选项
- API 调用:不要无脑传整个 messages 数组;只保留当前任务强相关的 2–3 条上下文 + 当前指令
- Computer Use 模式下尤其要警惕:每次截图+操作+返回日志都会叠加进输入,建议单任务单会话,完成后清空上下文
精简系统提示词和固定内容
系统提示词(system prompt)不是写得越细越好。它会在每一轮请求中被完整计入输入 Token,且无法缓存降本。一份 1200 字的 system prompt,等于每轮多付 1200 字的“固定租金”。
- 删掉所有客套话:“请认真思考”“务必准确回答”“谢谢配合”——模型不认礼貌,只认指令动词
- 合并重复约束:“简洁回答”“不要冗余”“控制在 200 字内”留一条即可
- 把可变部分(如用户上传的文档、当前任务目标)和固定部分(角色定义、输出格式)彻底分离;固定部分用 API 的 system 字段,变量部分走 user 字段
按任务选对推理档位和模型版本
GPT-6 Astra 提供多个推理强度档位(Low / Medium / High / Ultra),不是越高越好。档位影响的是模型“想多久”,不是“能不能做”。简单任务开 High,就像让博士生解加减法还验算三遍。
- 资料提取、格式转换、代码补全 → 用 Medium 档位足够,Token 成本比 Ultra 低 40% 以上
- 跨模块架构设计、模糊需求澄清、多步工具链编排 → 再升到 High 或 Ultra
- 日常轻量任务(比如查文档、改错别字)可交由 GPT-5.6 处理,成本通常不到 Astra 的 1/5
视觉与工具调用要“掐点用”
截图、网页渲染图、代码沙箱返回结果,都是 Token 消耗大户。一张普通屏幕截图≈ 400–800 文本 Token;一次浏览器操作附带的状态日志可能再加 200+ Token。
- Computer Use 模式下,关闭自动高频截图,改为“仅在关键节点截屏”(如页面加载完成、表单填写后、结果弹窗出现时)
- 工具返回内容不要原样塞给模型;先用轻量脚本做摘要(例如提取表格首行+关键列+异常值),再把摘要喂进去
- 搜索类工具返回的长网页正文,用“标题+前两行+相关段落标记”代替全文粘贴











