numpy 无内置 join,需用 np.intersect1d/np.union1d 结合布尔索引或 np.searchsorted 实现内/外连接;二维数组连接推荐转 pandas.dataframe;大数据量时 np.isin 性能差,应优先排序后用 np.searchsorted 或哈希映射优化。

NumPy 里没有 join,但可以用 np.intersect1d、np.setdiff1d 和布尔索引模拟内连接
NumPy 本身不提供类似 SQL 的 JOIN 操作,也没有内置的 left/right/full outer join 函数。想实现数组间“按某列匹配”的连接,核心思路是:先找出匹配的索引位置,再用布尔掩码或索引拼接数据。
假设你有两个一维数组 id_a 和 id_b,分别对应两组记录的主键,你想基于它们做内连接(即只保留两边都存在的 id):
import numpy as np <p>id_a = np.array([1, 2, 3, 4]) val_a = np.array([10, 20, 30, 40]) id_b = np.array([2, 3, 5, 6]) val_b = np.array([200, 300, 500, 600])</p><h1>找交集</h1><p>common_ids = np.intersect1d(id_a, id_b, assume_unique=True)</p><h1>构造布尔掩码</h1><p>mask_a = np.isin(id_a, common_ids) mask_b = np.isin(id_b, common_ids)</p><h1>拼接结果(注意顺序对齐)</h1><p>result_a = val_a[mask_a] result_b = val_b[mask_b]</p>
这里关键点是:np.intersect1d 默认会排序,如果你需要保持原始顺序,得配合 return_indices=True 或改用 np.isin + 布尔索引;assume_unique=True 能提速,但前提是输入已去重,否则结果可能出错。
外连接要用 np.union1d + np.isin 分别补缺失值
全外连接本质是取并集,然后对每边缺失的位置填 np.nan 或占位符。NumPy 没有自动填充机制,必须手动构造对齐后的数组。
-
np.union1d(id_a, id_b)得到所有唯一 id(已排序) - 用
np.searchsorted或布尔索引定位每个 id 在原数组中的位置 - 初始化结果数组,用
np.full预设默认值(如np.nan),再把真实值填进去
示例中若要实现 full outer join:
all_ids = np.union1d(id_a, id_b) out_a = np.full(len(all_ids), np.nan) out_b = np.full(len(all_ids), np.nan) <h1>填充 a 侧</h1><p>idx_a = np.searchsorted(id_a, all_ids) valid_a = (idx_a </p><h1>同理填 b 侧</h1>
注意 np.searchsorted 要求 id_a 和 id_b 是升序,否则结果错乱;如果原始数组无序,得先 argsort 并保存索引映射,否则顺序和值就对不上了。
inference.sh 的 Python SDK:运行 AI 应用、构建智能体,并集成 150 多个模型。包名:inferencesh (pip install inferencesh)。支持同步/异步……
二维数组连接更麻烦:别硬写,优先转 pandas.DataFrame
如果你的操作对象是二维数组(比如 shape=(n, 3) 表示 [id, x, y]),用纯 NumPy 实现 left join 就得自己管理多列对齐、广播、缺失填充——代码量陡增且易错。
真实项目中,只要不是性能瓶颈场景(比如数组小于百万级),直接转成 pandas 更可靠:
import pandas as pd
<p>df_a = pd.DataFrame({'id': id_a, 'val_a': val_a})
df_b = pd.DataFrame({'id': id_b, 'val_b': val_b})
merged = df_a.merge(df_b, on='id', how='inner') # or 'left', 'outer'</p>
这比手写 NumPy 索引逻辑快得多,也支持重复 key、多列 join、NaN 处理等边缘情况。只有在明确受限于不能引入 pandas(如嵌入式环境、超低延迟要求)时,才值得投入时间手写 NumPy 版本。
性能陷阱:np.isin 在大数据量下很慢,考虑用 np.searchsorted 或哈希映射
当 id_a 或 id_b 超过十万量级,np.isin(..., assume_unique=False) 时间复杂度接近 O(M×N),会明显卡顿。
优化方向:
- 确保 key 数组已排序,改用
np.searchsorted(O(log N) 单次查找) - 用 Python 字典预建 id → index 映射(适合一边小、一边大,比如 lookup table 场景)
- 若 key 是整数且范围不大,可用布尔数组索引:
present = np.zeros(max_id+1, dtype=bool); present[id_a] = True
这些优化都需要你主动判断数据特征,NumPy 不会替你选——这也是它和 pandas 的根本差异:前者暴露控制权,后者封装常见模式。
真正难的不是写出能跑的代码,而是判断该用哪种索引策略、要不要排序、是否接受内存换时间。这些决策点,往往比语法本身更影响最终效果。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!










