3 月 31 日,外媒消息显示,anthropic 正式将 claude 模型的“电脑操作”能力整合进 claude code cli 工具,面向 macos 用户推出研究预览版。用户可在终端中启动内置 mcp 服务器,使 claude 具备自主启动程序、模拟鼠标点击与键盘输入、实时捕获并理解屏幕内容的能力,真正实现对图形界面任务的“亲手”执行。例如,claude 可独立完成 swift 代码编写、编译构建,并运行一个 macos 菜单栏应用,随后依次点击各控件进行功能验证,全程无需开发者介入。

该功能采用分层调用策略:优先尝试通过专用 MCP 服务器完成任务;若不可用,则退而调用 Bash 命令或 Chrome 浏览器扩展;仅当上述方式均不适用时,才启用“电脑操作”模式。其典型用途涵盖端到端 UI 自动化测试、可视化布局缺陷排查,以及操控那些未提供命令行接口或公开 API 的封闭型软件(如专业设计工具、工业硬件管理面板等),显著提升了软件工程中 GUI 层面的自动化覆盖范围。

在安全性设计上,Anthropic 实施了多重防护机制。当 Claude 首次尝试控制某一应用程序时,终端将即时弹出权限确认窗口,清晰列出目标应用名称、拟执行的操作类型及其潜在影响范围,用户可选择“仅本次允许”或“拒绝”。不同类别的应用被赋予差异化权限等级:浏览器与金融交易平台默认设为只读模式;终端模拟器和集成开发环境(IDE)仅开放点击权限;其余应用则具备完整交互能力。系统还集成了运行时风险预警(哨兵机制)及 Esc 键一键中断功能,保障用户始终保有最终控制权。
当前该功能仅适配 macOS 系统,要求安装 Claude Code v2.1.85 或更高版本,并限于订阅 Pro 或 Max 套餐的用户在交互式会话中启用;非交互式脚本调用暂不支持。Anthropic 强调,此功能尚处于研究预览阶段,后续将依据实际使用反馈持续优化,并逐步拓展至 Windows 和 Linux 平台。此次升级标志着 AI 能力正由传统的“推理与内容生成”,迈向更深层次的“环境感知与物理交互”,为自动化测试体系、GUI 应用开发流程及桌面级智能工具集成开辟全新路径。









