可采用三种方法构建标签体系:一、大模型零样本生成层级化标签树;二、嵌入聚类+llm生成动态标签;三、规则引导迭代优化。均依托duck.ai api实现,适配冷启动、长尾覆盖与成熟业务场景。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您需要为大量非结构化内容(如文章、视频、商品描述)快速构建可扩展、语义一致的标签和分类体系,但缺乏人工标注资源或领域专家支持,则可能是由于传统人工打标效率低、主观性强、难以覆盖长尾语义。以下是实现该目标的多种方法:
一、基于大语言模型的零样本标签体系生成
该方法利用大语言模型对自然语言指令的理解能力,在不提供任何样例的前提下,仅通过提示词引导模型归纳原始内容语义,输出层级化、互斥且业务可解释的标签树结构。适用于冷启动阶段或需快速验证分类维度合理性的场景。
1、将待分类内容集合(如1000条小红书笔记标题或商品描述)整理为纯文本列表,去除HTML标签与特殊符号。
2、构造系统提示词:“你是一名资深内容架构师。请分析以下文本集合,提取出5–8个顶层业务维度(如‘使用场景’‘人群属性’‘功能特性’),每个维度下生成3–5个具体、无重叠、可直接用于筛选的二级标签。输出严格采用Markdown层级列表格式,不添加解释性文字。”
3、将文本列表与提示词组合后提交至Duck.ai API(model=duck-llm-v2.1),设置temperature=0.3以保障输出稳定性。
4、解析返回结果,对二级标签进行去歧义处理:合并语义高度重合项(如“学生党”与“大学生”),剔除出现频次低于3次的标签。
5、将清洗后的标签体系导入Excel,按“维度|标签名|示例原文片段”三列结构固化,作为后续规则校验基准。
二、结合嵌入向量聚类的动态标签发现
该方法先将内容映射至高维语义空间,再通过无监督聚类自动识别潜在主题簇,最后由模型为每个簇生成自然语言标签。适用于内容语义分布稀疏、人工预设维度易遗漏长尾意图的场景。
1、调用Duck.ai Embedding API(endpoint=/v1/embeddings),以batch_size=64批量获取全部内容的768维文本嵌入向量。
2、对嵌入矩阵执行UMAP降维(n_components=50)与HDBSCAN聚类(min_cluster_size=8, min_samples=3),获得初始簇标签数组。
3、对每个聚类簇抽取Top5代表性文本,构造输入:“以下5条用户表达均指向同一隐含需求,请用不超过8个字概括该需求本质,并给出一个业务友好的中文标签名称:[文本1] [文本2] …”
4、并行调用Duck.ai LLM接口生成各簇标签,人工审核时重点关注标签是否具备区分度——若两个簇的生成标签语义相似度>0.85(经Duck.ai Semantic Similarity API验证),则强制合并该两簇。
5、将最终簇数映射为一级分类节点,各簇内高频动词/名词短语提炼为二级操作型标签(如“一键下单”“支持定制”“适配Mac”)。
三、规则引导的标签体系迭代优化
该方法将AI生成的初版标签作为种子,结合业务规则引擎进行逻辑校验与冲突消解,形成可落地、可审计的闭环优化机制。适用于已有部分标签资产但存在覆盖不全或定义模糊问题的成熟业务线。
1、在Duck.ai控制台创建新项目,上传现有标签表(CSV格式,含“标签ID”“名称”“适用内容类型”“排除条件”四列)。
2、启用“Rule-Aware Tag Expansion”模块,配置三条硬性约束:同一内容不得同时命中“高端”与“平价”类标签;所有“教程”标签必须关联至少一个动作动词(如“安装”“配置”“调试”);含“限时”“限量”字样的标签自动归入“营销活动”维度。
3、提交待分类内容样本集(≥200条),触发Duck.ai的混合推理流程:先执行向量匹配初筛,再调用规则引擎执行逻辑过滤,最后对未覆盖样本启动主动学习请求。
4、审核系统返回的“待确认标签建议”列表,对每条建议标注“接受”“拒绝”或“拆分”,每次反馈将实时更新规则权重,且拒绝记录自动加入负样本库。
5、当连续5轮迭代中“新增标签建议量”<5条且“规则冲突率”稳定在0.2%以下时,导出当前版本标签体系JSON Schema文件。











