networkx计算节点度需区分有向/无向图:无向图g.degree()返回整数,有向图默认返回(in_degree,out_degree)元组,自环默认计入(无向+2、有向各+1),建议预先清理;批量计算推荐dict(g.degree())转dataframe,大数据量宜用生成器或nx.degree_histogram()。

NetworkX 计算节点度非常直接,但容易忽略有向图与无向图的语义差异、自环处理方式,以及度中心性(degree centrality)和原始度(degree)的区别。
用 degree() 获取节点度,注意图类型
无向图调用 G.degree() 返回每个节点的邻居数量;有向图默认返回 (in_degree, out_degree) 元组。若只想要出度,得显式调用 G.out_degree(),入度同理。
常见错误是把有向图当无向图用,比如在 Twitter 关注关系中误用 G.degree() 得到“总连接数”,实际掩盖了关注方向性——这会导致后续分析完全偏离真实传播逻辑。
- 无向图:直接
G.degree("user_a")→ 返回整数 - 有向图:用
G.out_degree("user_a")查谁被该用户关注,G.in_degree("user_a")查谁关注该用户 - 想统一处理?先确认
G.is_directed(),再分支调用
自环(self-loop)是否计入度?默认计入,但需确认业务含义
NetworkX 默认将自环计入度:一个自环在无向图中为该节点度 +2,在有向图中为 in_degree 和 out_degree 各 +1。但现实中,“用户关注自己”通常无意义,应提前清理。
示例:若数据含大量自环(如从 CSV 误导入),G.number_of_selfloops() 可快速检查,用 G.remove_edges_from(G.selfloop_edges()) 清除。
- 自环影响度分布尾部:可能让少数节点虚假地呈现“超高连接”
- 社区检测或 PageRank 等后续算法对自环更敏感,建议在度分析前统一处理
- 若业务上允许自环(如知识图谱中的“概念定义自身”),需在报告中明确标注统计口径
批量计算度并转为 Pandas DataFrame 便于分析
直接遍历 G.degree() 返回的视图效率低,且不带列名。推荐用 dict(G.degree()) 构造字典后转 pd.DataFrame,尤其适合筛选 Top-K 节点或画直方图。
import pandas as pd
deg_df = pd.DataFrame(list(G.degree()), columns=["node", "degree"]).set_index("node")
# 排序取头部
deg_df.sort_values("degree", ascending=False).head(10)
注意:若图很大(>10⁵ 节点),避免用 list(G.degree()) 全量加载,改用生成器逐批处理,或直接用 nx.degree_histogram(G) 快速看分布形态。
-
nx.degree_histogram(G)返回列表,索引是度值,值是该度的节点数,轻量高效 - 想加权重?用
G.degree(weight="weight"),前提是边已有weight属性 - 别直接对
deg_df["degree"]做 .mean() —— 零度节点(孤立点)是否纳入会影响均值解释力,先查G.number_of_isolates()
真正难的不是算度,而是判断“这个度值在当前网络里到底算高还是低”——需要结合网络规模、密度、度分布偏态程度一起看,单看一个数字容易误读。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











