云雀模型是字节跳动自主研发的大语言模型,为豆包大模型前身与技术底座,2023年内部上线、2024年5月对外发布,通过国家首批算法备案;在11项评测中总分达76.8分,代码、知识理解等能力显著提升,已支撑抖音、飞书等50多个业务线及日均5000亿tokens处理量。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

豆包AI的云雀模型是字节跳动自主研发的大语言模型,也是豆包大模型的前身与技术底座。以下是关于该模型起源、定位及性能表现的详细说明:
一、云雀模型的技术起源与命名背景
云雀模型是豆包大模型的研发代号,于2023年在字节内部完成上线,并于2024年5月15日正式以“豆包大模型”之名对外发布。该模型通过国家网信办首批大模型算法备案,是国产大模型中较早完成合规落地的技术体系之一。
1、模型研发主体为字节跳动AI实验室,依托其在多模态、长文本、低时延交互等方向多年积累构建;
2、名称“云雀”取自轻盈、敏捷、高适应性的鸟类意象,象征模型在响应速度、上下文理解与跨任务泛化上的设计目标;
3、所有对外发布的豆包通用模型pro、lite及细分领域模型,均基于云雀架构进行深度优化与能力拆分。
二、云雀模型在主流评测集中的性能表现
根据火山引擎2024年5月公布的内部评测结果,云雀Skylark2作为上一代基线模型,在11个权威公开评测集上总得分为64.5分;而基于其升级的豆包通用模型pro-4k版本,总得分提升至76.8分,整体性能提升19%。
1、在代码生成能力评测HumanEval与MBPP中,性能提升约50%;
2、在专业知识理解(MMLU)与指令遵循(BBH)两项关键指标上,分别提升33%和24%;
3、在数学推理(GSM8K)、中文综合能力(CMMLU、CEval)等评测中,得分稳居国产模型前三;
4、对比GPT-4同期80.1分的总分,云雀演进后的豆包模型已逼近国际第一梯队水平。
三、云雀模型支撑的实际业务规模与调用强度
云雀模型并非仅限于实验室评测,而是深度嵌入字节跳动全系产品并实现大规模生产级部署。其真实负载能力与稳定性已在亿级用户场景中持续验证。
1、截至2024年,字节内部已有50多个业务线接入云雀模型,包括抖音、今日头条、飞书、剪映等核心应用;
2、豆包大模型日均处理1200亿Tokens文本,生成3000万张图片,该数据在2026年初已进一步跃升至日均5000亿Tokens;
3、在终端侧,云雀模型已联合OPPO、vivo、小米、三星、吉利汽车、长城汽车等超20家车企与5家头部手机厂商共建智能终端大模型生态;
4、外部企业客户覆盖金融、汽车、消费、互娱等30多个行业,其中鱼泡科技单日调用量超1亿Tokens。











