full outer join最贴切“excel并集”语义,因它保留两表所有行、不匹配处用null填充;mysql不支持,需用left join+right join+union all模拟,并确保字段对齐、类型一致、避免null键遗漏。

SQL 里没有直接叫“并集操作”的 JOIN,但用 FULL OUTER JOIN 最接近 Excel 的 VLOOKUP 左右拉通+补空效果;不过多数 MySQL 用户得绕道走。
为什么 FULL OUTER JOIN 是最贴切的“Excel 并集”语义?
Excel 中把两个表按某列对齐、左右都保留所有行、缺数据填空——这正是 FULL OUTER JOIN 的行为:它保留左表和右表的所有记录,匹配不上就用 NULL 填充。
- 常见误解:
UNION是纵向堆叠(去重合并行),不是横向对齐;LEFT JOIN只保左表全量,右表缺失行直接丢掉 - 注意兼容性:
FULL OUTER JOIN在 PostgreSQL、SQL Server、Oracle 中原生支持;MySQL **不支持**,强行写会报错ERROR 1054 (42S22): Unknown column '...' in 'on clause'或直接语法错误 - 性能提示:大表做
FULL OUTER JOIN时,连接字段必须有索引,否则扫描开销陡增
MySQL 用户怎么模拟 FULL OUTER JOIN?
靠 LEFT JOIN + RIGHT JOIN + UNION ALL 拼出来,关键是避免重复匹配行被算两次。
将 PySpark .show() 输出转为 Tab 分隔文本,方便粘贴 Excel。触发词:pyspark、数据转excel、表格整理、venus数据、show输出、复制到excel、数据格式化。
- 先
LEFT JOIN拿左表全量 + 右表匹配项 - 再用
RIGHT JOIN拿右表中“左表没匹配到”的行(加WHERE left_table.id IS NULL过滤) - 用
UNION ALL合并(不用UNION,避免隐式去重拖慢速度)
SELECT a.id, a.name, b.score FROM students a LEFT JOIN scores b ON a.id = b.student_id UNION ALL SELECT NULL AS id, NULL AS name, b.score FROM scores b LEFT JOIN students a ON a.id = b.student_id WHERE a.id IS NULL;
⚠️ 注意:字段顺序、类型、别名必须完全一致,否则 UNION ALL 会报错 ERROR 1222 (21000): The used SELECT statements have a different number of columns。
什么时候该换思路,别硬套“Excel 并集”?
如果只是为了查“哪些学生没成绩”或“哪些分数没对应学生”,用 LEFT JOIN ... WHERE right_table.col IS NULL 更清晰高效。
- 想导出完整对齐表用于报表或导出?用
FULL OUTER JOIN(或 MySQL 上述模拟)合理 - 只是校验数据完整性?两个独立查询更快:
SELECT id FROM students WHERE id NOT IN (SELECT student_id FROM scores) - 连接字段含
NULL?小心:ON a.id = b.student_id会跳过所有NULL值匹配,Excel 里可能当空白处理,SQL 里得额外OR (a.id IS NULL AND b.student_id IS NULL)
真正麻烦的从来不是写法,而是搞清你要的到底是“对齐补空”还是“查差异”。很多人抄了 FULL OUTER JOIN 示例,结果发现业务上根本不需要右表那些孤立行——白跑半小时。










