list(set(lst)) 不总是可行,因其会打乱顺序、报错不可哈希类型(如字典)、无法自定义去重逻辑;保留顺序应优先用 dict.fromkeys(lst),不可哈希对象需提取元组键手动判重。

用 set() 去重最快,但会丢失顺序且要求元素可哈希;真要保留顺序又处理百万级数据,得换思路。
为什么 list(set(lst)) 不总是可行?
它快,但有三个硬伤:一是打乱原始顺序;二是报 TypeError: unhashable type(比如列表、字典当元素);三是无法自定义“重复”的逻辑(比如忽略大小写、按某字段判重)。
- 字符串列表小规模去重可直接用:
list(set(lst)),但别指望顺序一致 - 含嵌套结构(如
[{"id":1}, {"id":1}])必须先序列化或提取 key,否则set()直接炸 - 若需保留首次出现位置,得用
dict.fromkeys(lst)(Python 3.7+ 保序)
保留顺序的大列表去重,dict.fromkeys() 是最简解
它本质是利用 dict 插入时自动去重 + 保序特性,比手写循环快得多,内存开销也远低于 seen 集合 + 列表推导。
lst = ["apple", "banana", "apple", "cherry"] unique_lst = list(dict.fromkeys(lst)) # ['apple', 'banana', 'cherry']
- 适用于所有可哈希元素,且 Python 3.7+ 行为稳定
- 比
[x for i, x in enumerate(lst) if x not in lst[:i]]快几十倍(后者是 O(n²)) - 注意:如果元素本身是字典/列表,仍需先转成可哈希形式,例如
tuple(sorted(d.items()))
对不可哈希对象(如字典)按字段去重,得手动控制“判重键”
不能靠 set 或 dict 自动处理,必须显式提取唯一标识。常见错误是用 json.dumps(d, sort_keys=True) 当 key —— 小数据可以,大数据会明显拖慢并吃内存。
- 优先用元组提取关键字段:
key = (d["id"], d["name"]),然后用seen集合记录 - 避免在循环里反复调用
json.dumps或str(d),提前算好 key - 示例:
data = [{"id":1, "name":"a"}, {"id":2, "name":"b"}, {"id":1, "name":"a"}]
seen = set()
unique_data = []
for d in data:
key = (d["id"], d["name"]) # 显式定义判重依据
if key not in seen:
seen.add(key)
unique_data.append(d)
真正卡住性能的往往不是算法本身,而是没想清楚“什么叫重复”——字段组合?浮点容差?字符串归一化?这些逻辑一旦加进去,set 就彻底退场了。
Python免费学习笔记(深入):立即使用
在学习笔记中,你将探索 Python 的核心概念和高级技巧!











