neon 与 castform 两家公司协同完成了一项令人重新审视“小模型”潜力的突破性工作——通过强化学习对一个仅含4b参数的开源模型进行后训练,使其在文档搜索任务中的准确率不仅媲美 gpt-5.6sol,甚至实现反超;而单次推理成本仅为后者的约百分之一。
这背后,是对搜索范式的一次深层重构。当前主流文档检索依赖嵌入式搜索:将文档编码为高维向量,再基于向量相似度匹配内容。但随着 AI 智能体广泛应用,搜索正加速转向“智能体式搜索”:模型自主将复杂问题分解为若干子任务,动态生成搜索关键词、评估返回结果、决定是否发起新一轮检索,循环推进直至聚合出完整答案。该范式显著提升复杂查询处理能力,代价却是每次搜索均需调用一次大模型——耗时与开销陡增。据 Neon 提供的典型请求基准,GPT-5.6Sol 单次搜索平均耗时超10秒,成本约为0.03美元。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

双方分工明确:Neon 负责提供文档存储基础设施及底层搜索执行能力,Castform 则专注于训练模型的核心决策模块——即“下一步该搜什么”。训练采用强化学习框架:模型在真实搜索流程中尝试完成任务,系统依据多维表现实时打分,并将反馈直接用于优化后续策略。评估维度不仅涵盖最终答案正确性,还包括是否精准定位目标文档、是否合理引用关键段落等细粒度指标。最终,经 Castform 强化后训练的模型在 Neon 的标准验证集上取得平均得分1.447,超越 GPT-5.6Sol 的1.369,也高于对照基线 GPT-5.4 的1.377,创下该评测体系历史最高分。
真正具备颠覆性的,是成本层面的巨大优势:该4B小模型单次推理成本低至0.000929美元,而 GPT-5.6Sol 高达0.087338美元,相差近94倍。以4B参数规模达成 GPT-5.6Sol 级别的搜索精度,同时将推理开销压缩至近乎可忽略水平——这对高度依赖多轮模型调用的智能体类应用而言,意味着单位任务的成本结构被彻底重写。











