微软在2026年10月7日举办的 windows 与 surface 新品发布会上透露,github copilot 将于本月底前正式支持本地 ai 模型运行,使开发者能够在云端模型与设备端模型之间灵活切换,或启用后台智能自动调度机制。
为应对端侧推理过程中常见的内存压力及长上下文处理带来的资源消耗问题,微软发布了轻量高效的新一代混合专家(MoE)模型——MAI Code1.1Flash。该模型总参数量达1370亿,但每次推理仅激活68亿参数,通过先进量化策略与投机解码技术,在大幅压缩显存与内存占用的同时,显著加快了本地编码建议的响应速度。该模型已率先预装于搭载 NVIDIA RTX Spark 芯片的新款 Surface Laptop Ultra 设备中。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在实际使用层面,用户可通过 GitHub Copilot CLI 工具、独立 Copilot 应用程序,以及 Visual Studio Code 插件自主设定推理模式:既可交由 Copilot 后台统一调度计算资源,也可手动指定调用 Windows ML 提供的运行时环境,或连接符合 OpenAI API 规范的本地服务端点来加载 MAI Code1.1Flash 等端侧模型。安全方面,系统深度集成了由 Windows 团队研发的微软执行容器(MXC),依托各平台原生容器隔离能力,确保代码片段在沙箱环境中安全执行。
此次更新标志着 AI 编程助手正快速迈向“云+端”深度融合的新阶段。它不仅降低了本地大模型部署与集成的技术门槛,更为强调数据隐私保护与实时交互性能的开发场景提供了切实可行的本地化解决方案。











