cursor推出自研程式开发模型composer 2,已在产品中开放使用,定价为每百万输入词元0.50美元、输出词元2.50美元,另有快速版并将成为预设选项

AI程式开发工具Cursor发布自家模型Composer 2,并已在产品中提供使用。该模型主打在维持程式开发能力的同时压低使用成本,定价为每百万输入词元(Token)0.50美元、每百万输出词元2.50美元。官方还推出另一个较快版本,定价为每百万输入词元1.50美元、每百万输出词元7.50美元,且快速版将成为预设选项。
官方公布的CursorBench 图表显示,Composer 2在较低成本下仍维持61.3分,位置略低于GPT-5.4的high与medium设定,但高于GPT-5.4的low设定,单次任务的中位成本也更低。若与Opus 4.6的high、medium、low三种设定相比,Composer 2则同时位于更高分且较低成本的位置。
Composer 2在CursorBench得分61.3,明显高于Composer 1.5的44.2与Composer 1的38.0,在Terminal-Bench 2.0与SWE-bench Multilingual两项评测中,Composer 2分别为61.7与73.7,也都高于前两代。
Cursor表示,Composer 2的提升来自新采用的持续预训练,让后续强化学习建立在更强的基础上,之后再针对长任务训练,使模型能处理需要数百个操作步骤的问题。官方将此类需要连续执行多步骤操作的程式开发工作,称为长程程式开发任务(Long-horizon Coding Tasks)。
当开发者愈来愈常将AI用于程式开发、除错与推理等工作,词元成本已成为评估模型时不可忽略的因素。从Cursor这次公布的资料来看,Composer 2的重点除了模型能力提升,也试图在效能与使用成本之间取得更具吸引力的平衡。
不过,这组模型比较结果的测试条件并不完全相同,Cursor指出,Anthropic模型分数采用Claude Code评测执行器,OpenAI模型分数采用Simple Codex评测执行器,Cursor自己的分数则依Terminal-Bench 2.0指定的Harbor评测框架,在预设设定下执行,每组模型与代理组合各测试5次后取平均。因此,这些数据可作为观察模型表现的参考,但若要直接比较不同模型,仍需考虑代理执行方式与测试条件存在差异。











