ubuntu大数据运维核心是构建“可维护、可监控、可回滚”稳定链路,需明确环境目标、夯实基础环境、按序隔离部署组件、内置运维能力并落实安全权限。

Ubuntu 服务器上做大数据运维搭建,核心不是堆组件,而是建一条“可维护、可监控、可回滚”的稳定链路。重点不在装多少服务,而在每个环节是否可控、日志是否可查、配置是否版本化、扩容是否无感。
明确目标再动手
先想清楚:这是开发测试环境?还是准生产?是否要支持多用户、高并发、HA?不同目标决定架构复杂度。比如单机伪分布式适合学习和验证逻辑;三节点集群才具备基本容错能力;而真正生产级需引入ZooKeeper、Kerberos、监控告警闭环。
基础环境必须稳
- 使用 Ubuntu 22.04 LTS 或 20.04 LTS,避免非长期支持版带来的安全与兼容风险
- 创建专用用户(如
hadoop或bigdata),禁用 root 直接登录,所有操作走 sudo - 配置免密 SSH(
ssh-keygen + ssh-copy-id localhost),这是 Hadoop/HBase/Spark 节点通信的前提 - 安装 OpenJDK 8(Hadoop 3.x / HBase 2.4 官方推荐)或 OpenJDK 11(Spark 3.5+ 更友好),统一 JAVA_HOME 并写入
/etc/environment,全局生效 - 关闭 swap(
sudo swapoff -a && sudo sed -i '/swap/d' /etc/fstab),Hadoop 默认禁用 swap,否则 YARN 会拒绝启动
组件部署讲顺序、重隔离
PostgreSQL 18.4 官方 Ubuntu 安装包现已发布,这是目前最新的稳定版本。推荐通过官方 APT 仓库安装:先执行 sudo apt update 更新索引,再运行 sudo apt install postgresql-18 即可完成部署。新版本引入了异步 I/O 子系统,在顺序扫描与 VACUUM 场景下性能提升显著,同时支持 UUID v7 原生生成函数与虚拟生成列。
- 不建议手动解压+改配置文件硬编码部署,优先用 Docker Compose 或 Ansible 编排(例如 Hadoop + Hive + Spark 可容器化,ZooKeeper 和 MySQL 也建议容器运行)
- HDFS/YARN 是底座,先跑通单节点伪分布(
start-dfs.sh && start-yarn.sh),验证hdfs dfs -ls /和yarn node -list是否正常 - Hive 依赖元数据库,推荐用 MySQL 8.0 容器提供 Metastore,避免内嵌 Derby(不支持多会话)
- HBase 需 ZooKeeper 协调,可复用独立 ZooKeeper 集群(3节点),不要用 HBase 自带的 miniZK
- Spark on YARN 模式最省资源,
spark-shell --master yarn能跑通即说明集成成功
运维能力从第一天就内置
- 所有配置文件(core-site.xml、hdfs-site.xml 等)存 Git 仓库,打 tag 标记环境(dev/staging/prod)
- 日志统一收集:用
rsyslog或filebeat把/var/log/hadoop/、/var/log/hbase/推到 ELK 或 Loki - 健康检查脚本写成 cron:每5分钟检测 NN/JN/RM/NM 进程存活、HDFS 健康状态(
hdfs dfsadmin -report | grep "Live datanodes")、YARN 队列资源使用率 - 备份策略明确:NameNode 的 fsimage + edits 日志定期归档;Hive Metastore 数据库每日 mysqldump;HBase WAL 和 HFile 存在 HDFS 上,本身具备冗余
安全与权限不跳过
- HDFS 开启 Simple 或 Kerberos 认证(测试可用 Simple,生产务必 Kerberos)
- HiveServer2 绑定
0.0.0.0:10000时,用 iptables 或 UFW 限制只允特定 IP 访问 - 所有服务端口(9000、8020、8088、16010、10000 等)不在公网暴露,通过跳板机或反向代理(Nginx)控制访问入口
不复杂但容易忽略。










