countvectorizer默认仅提取1元语法,需显式设置ngram_range(如(1,2))才能支持n元组;停用词和标点会中断n元连续性,应预处理或调整token_pattern;特征易爆炸,须配合min_df、max_features剪枝;中文需替换analyzer(如jieba.cut),否则无法正确切分。

CountVectorizer默认只做1元语法,想用N元得显式设ngram_range
很多人跑完CountVectorizer发现结果全是单字或单词,以为它不支持短语——其实它原生支持,但默认ngram_range=(1, 1),也就是只取unigram。要包含bigram或trigram,必须手动指定范围。
比如想同时保留单词和相邻二元组,就得写成:
from sklearn.feature_extraction.text import CountVectorizer vec = CountVectorizer(ngram_range=(1, 2))
这个参数接收一个二元组:(min_n, max_n),合法值如(1, 1)、(2, 2)、(1, 3)。设成(2, 3)就跳过所有单字,只留bi-和trigram——这点容易误配,导致特征全空。
停用词和标点会影响N元连续性,得提前清理或调token_pattern
N元语法本质是按token序列滑动窗口,一旦中间被停用词或标点截断,bigram就断了。比如句子"I love Python!",若默认分词把!当独立token,那"Python !"也会进特征,通常不是你想要的。
常见应对方式:
- 用
stop_words='english'或自定义列表,但注意停用词移除发生在分词后,不影响窗口对齐 - 改
token_pattern:比如设为r'(?u)\b\w+\b'可排除标点;更激进的r'[a-zA-Z]{2,}'还能过滤单字母 - 预处理时用
re.sub(r'[^\w\s]', ' ', text)先抹掉标点,比依赖分词器更可控
稀疏矩阵里N元特征爆炸快,max_features和min_df得一起调
从unigram到bigram,特征维度可能翻几倍甚至几十倍。比如1万文档、5千词表,bigram组合理论上限是5000²——实际虽远小于此,但很容易撑爆内存。
必须配合剪枝参数:
-
min_df=2:直接过滤只在1篇文档出现的N元组(尤其trigram几乎全是低频噪声) -
max_features=10000:硬限制总特征数,优先保留TF-IDF加权高的(注意:CountVectorizer本身不计算IDF,但vocabulary_按词频排序,所以这等价于留高频N元) - 慎用
max_df:设太高(如0.95)可能把真正有区分度的常见短语(如"machine learning")也干掉
中文场景下analyzer不换就等于没用N元语法
默认analyzer='word'依赖空格切词,中文文本没空格,整个句子变一个超长token,ngram_range完全失效。
必须替换分词器:
- 用
jieba:传analyzer=jieba.cut(注意别加括号!) - 用
hanlp或pkuseg同理,关键是返回list[str] - 简单场景也可用
analyzer=lambda s: [s[i:i+2] for i in range(len(s)-1)]做字级别bigram,但语义弱
另外,中文N元对min_df更敏感——“北京”和“京市”可能分别只出现几次,但合起来才是有效短语,这时候宁可降低min_df到1,再靠后续模型或人工规则过滤。
真正麻烦的是跨词边界的N元,比如“深度学习模型”切出[“深度学习”, “学习模型”],但“深度”和“模型”本身不相邻——这种得上依存句法或专门的短语提取,CountVectorizer做不到。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











