需结合qwen3-embedding-4b向量化聚类、qwen2.5-7b-instruct规则增强标签聚类、qwen3-reranker-0.6b跨渠道权重融合聚类三类方法,分别实现语义驱动的无监督分群、业务对齐的标签归并及多源行为加权聚合。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您希望利用通义千问系列模型开展市场细分分析与用户画像聚类,需结合其Embedding、Reranker及Instruct类模型的能力,对多源异构用户行为数据进行语义建模与结构化分群。以下是实现该目标的具体方法:
一、基于Qwen3-Embedding-4B的用户行为向量化聚类
该方法通过将用户行为文本(如搜索词、商品点击序列、客服对话摘要、评论关键词)统一映射为高维稠密向量,使语义相近的用户在向量空间中自然邻近,从而支持无监督聚类。Qwen3-Embedding-4B具备2560维输出、32k上下文支持及119语种覆盖能力,可有效处理跨渠道、跨语言的非结构化行为描述。
1、提取用户原始行为文本:从日志系统导出每位用户的最近30天高频行为短句,例如“查看iPhone 15 Pro参数”“咨询退货流程”“评价物流慢”“搜索平价防晒霜”。
2、批量调用Embedding API:使用vLLM部署的Qwen3-Embedding-4B服务,向http://localhost:8000/v1/embeddings端点发送POST请求,每批次不超过128条文本,设置input字段为行为短句列表,model字段指定为Qwen3-Embedding-4B。
3、执行K-Means聚类:将返回的N×2560维向量矩阵输入scikit-learn的KMeans算法,设定聚类数K=8,启用init='k-means++'与n_init=10提升稳定性,输出每位用户所属簇ID。
4、人工标注簇语义:抽取每个簇中Top10高频行为短句,由业务人员归纳命名,例如“价格敏感型售后咨询者”“新品技术参数深度研究者”“复购驱动型快消品浏览者”。
二、基于Qwen2.5-7B-Instruct的规则增强型标签聚类
该方法适用于已有结构化标签体系但存在冗余、交叉或语义模糊问题的场景。利用Qwen2.5-7B-Instruct的指令遵循与逻辑推理能力,对原始标签进行语义归并、层级抽象与业务对齐,生成可解释性强的细分维度。
1、构造标签描述Prompt:为每个用户标签生成标准化描述,格式为“标签名:[标签ID];原始定义:[数据库字段说明];典型行为示例:[3条真实日志片段]”。
2、批量提交至本地推理服务:通过Ollama加载qwen2.5:7b-instruct模型,向http://localhost:11434/api/generate发送请求,要求模型执行“将以下20个标签按业务意义聚为5类,每类给出命名与核心特征总结,不新增标签,仅合并与重命名”。
3、解析结构化输出:捕获模型返回的JSON格式结果,提取cluster_name与merged_tags字段,验证每类内标签的共现率是否高于阈值0.65(通过Hive SQL计算用户级共现矩阵)。
4、构建分层标签树:将5个一级聚类作为市场细分主维度(如“决策阶段”“品类倾向”“服务诉求”),再对每个维度下标签做二次聚类,形成二级颗粒度,例如“决策阶段→信息搜集期→技术参数比对型”。
三、基于Qwen3-Reranker-0.6B的跨渠道行为权重融合聚类
该方法解决多渠道行为信号强度不一致的问题。不同渠道(APP点击、小程序浏览、客服通话转文本、短信回复)对用户意图的表征效力不同,Qwen3-Reranker-0.6B可对同一用户在各渠道的行为片段两两打分,生成归一化相关性权重,用于加权聚合向量或调整聚类距离度量。
1、构造行为对样本:对每位用户,随机组合其来自两个不同渠道的行为短句,构成query-document对,例如query=“APP内加入购物车”,document=“微信小程序咨询客服发货时间”。
2、调用Reranker服务:向已部署的Qwen3-Reranker-0.6B vLLM服务发送请求,URL为http://localhost:8000/v1/rerank,传入query与documents数组,获取每个document的relevance_score。
3、计算渠道可信度系数:统计全体用户在某渠道作为document时的平均relevance_score,例如APP行为均分0.82,短信回复均分0.41,则赋予APP行为权重1.0,短信行为权重0.5。
4、加权向量融合:对每位用户,将其各渠道行为向量乘以对应权重后求和,再L2归一化,输入DBSCAN算法进行密度聚类,eps参数设为0.35,min_samples设为15。











