私有代码仓库本身不会被用于训练,但copilot交互数据(如光标附近代码、提示词、操作行为)默认可能被收集训练;business/enterprise及教育用户豁免,个人用户需手动关闭隐私设置。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您正在使用 GitHub Copilot 并担心私有代码库是否会被用于 AI 模型训练,则需明确区分“代码库存储”与“Copilot 交互数据”两类行为。GitHub 明确声明:您的私有代码仓库本身不会被直接抓取或纳入训练语料库;但当您在私有仓库中使用 Copilot 时产生的交互数据,可能被默认收集并用于模型训练。以下是具体说明:
一、私有代码仓库不被直接访问或训练
GitHub 的政策始终强调,静态存储的私有仓库内容(如未通过 Copilot 调用的原始文件、issues、discussions)不会被用于训练。这些数据属于“静止状态”,不受本次交互数据政策影响。该原则适用于所有用户,无论订阅类型。
1、GitHub 不会扫描或爬取您私有仓库的 Git 历史记录或文件树以获取训练样本。
2、您未主动调用 Copilot 的任何操作,均不产生可被采集的交互数据。
3、私有仓库代码本身不是训练数据源,这一点在官方条款中被反复确认。
二、交互数据才是关键风险点
当您在 IDE 中打开私有仓库文件,并启用 Copilot 行内建议或 Chat 功能时,Copilot 必须读取当前光标附近上下文才能生成响应——这部分实时加载的代码片段、注释、文件名、目录结构等,构成“交互数据”,且被明确列入训练范围。
1、Copilot 在处理请求时,会将光标周围约 150–300 行代码作为上下文送入模型。
2、您接受、修改或拒绝某条建议的动作,连同输入提示词(prompt)和输出结果,均被记录为交互事件。
3、即使代码位于私有仓库中,只要参与 Copilot 交互,该上下文即可能成为训练数据。
三、不同订阅版本的数据处理差异
Copilot Business 和 Enterprise 用户受合同约束,其所有交互数据默认排除在训练池之外;而 Free、Pro、Pro+ 个人用户则适用新政策,默认开启数据共享,除非手动关闭。
1、若您账户隶属于企业组织(即使使用个人邮箱登录),且由组织分配 Copilot 权限,则自动适用 Business/Enterprise 数据隔离策略。
2、教育用户(经认证的学生/教师)亦被豁免,默认不参与训练。
3、是否受政策影响,取决于您的订阅归属,而非代码存放位置。
四、如何验证当前设置状态
GitHub 不提供自动通知或弹窗提醒,需主动进入设置页面核查数据授权开关是否处于关闭状态。历史已关闭设置将延续生效,但新注册用户或长期未调整者极可能处于默认开启状态。
1、登录 github.com,点击右上角头像,选择“Copilot settings”。
2、进入 Privacy 标签页,查找“Allow GitHub to use my data for AI model training”选项。
3、确认其右侧开关显示为“Disabled”,若为“Enabled”则需立即关闭。
4、该设置需分别在个人账户及所属组织策略中检查,二者独立生效。
五、关闭后仍可能残留的上下文边界
即使关闭了模型训练授权,Copilot 仍需运行基础服务,因此部分临时上下文数据会在会话期间驻留内存,仅用于即时响应生成,不会持久化存储或跨会话复用。
1、关闭训练授权后,GitHub 承诺不再将您的交互数据上传至训练集群。
2、服务运行所必需的最小上下文(如单次请求的代码片段)仍会在本地 IDE 插件与 GitHub 后端间传输,但标记为“非训练用途”。
3、关闭开关仅阻断训练路径,不改变 Copilot 实时服务所需的必要数据流。











