iloc按位置索引,只认物理行号;loc按标签索引,切片为闭区间;二者在返回类型、索引稳定性、性能及适用场景上存在本质差异。

iloc只认数字位置,不认索引标签
当你写 df.iloc[2],Pandas 不会去看你的行索引是不是叫 '2023'、'C1001' 或者 100,它只数物理内存里的“第几行”:从 0 开始,跳过前两行,取第三行。哪怕你用 df = df.drop([0, 1]) 把前两行删了,df.iloc[0] 依然返回当前 DataFrame 的第一行——不是原来索引为 0 或 1 的那行。
常见错误现象:
-
KeyError不会出现,但结果完全不对:比如你想取“索引为'Q3'的行”,却误用了df.iloc['Q3']→ 直接报TypeError: cannot do positional indexing - 用
df.iloc[1:3]想取两行,结果只拿到第 1、2 行(不含第 3 行),而你脑子里想的是“第 1 行到第 3 行共三行”
loc按标签匹配,切片是闭区间
df.loc[2:4] 的行为完全取决于 df.index 是什么。如果 index 是 [0, 1, 2, 3, 4, 5],那它返回第 2、3、4 行;如果 index 是 ['a', 'b', 'c', 'd', 'e'],df.loc[2:4] 就直接报错——因为根本不存在标签为 2 的行。
使用场景与参数差异:
- 行切片
df.loc['start':'end']是闭区间:包含'start'和'end'对应的两行(前提是它们都在 index 中) - 列选择
df.loc[:, 'col_a':'col_c']同样闭区间,但要求列名必须是有序可比类型(如数字、日期字符串),否则抛TypeError - 混合写法
df.loc[2, ['A', 'B']]合法,但df.loc[2:4, 0:2]会失败——列名0、1、2必须真实存在于df.columns中
两者对单行/单列返回值类型不一致
这是协作中高频踩坑点:df.iloc[0] 返回 Series,而 df.iloc[[0]] 才返回 DataFrame;df.loc[0] 同样返回 Series,但 df.loc[[0]] 返回 DataFrame。表面看一样,但一旦链式操作(比如后面接 .mean() 或 .plot()),类型错位就会立刻暴露。
容易被忽略的地方:
-
df.iloc[:, 1]返回Series,df.iloc[:, [1]]返回单列DataFrame——后者能直接参与pd.concat,前者会触发隐式升维或广播异常 -
df.loc[:, 'name']和df.loc[:, ['name']]行为不同,尤其在后续做assign或drop时,传错类型会导致静默失败或列名丢失
索引重排后,loc 和 iloc 的“稳定性”完全不同
执行 df = df.sample(frac=1).reset_index(drop=True) 后:df.iloc[0] 仍是你随机抽样的第一行;但 df.loc[0] 可能指向一个完全无关的原始记录(如果原 index 有 0),也可能直接报 KeyError(如果原 index 没有 0)。
性能与兼容性影响:
-
iloc访问是 O(1),底层直通 NumPy 数组;loc需哈希查找或二分搜索,大数据量下延迟更明显 - 当 index 是非唯一值(如重复的日期字符串),
loc['2023-01-01']返回多行,而iloc[0]始终只返回一行——这个差异在条件筛选后极易被忽略 - 读 CSV 时若未指定
index_col,默认 index 是RangeIndex(0, n),此时loc和iloc看似等价,但只要调一次df.sort_values(..., inplace=True),两者就彻底分道扬镳
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











