需启用系统内置健康自检与诊断功能,包括:一、通过麒麟管家图形化启用设备健康检测;二、使用systemd-journal与healthd服务实现日志级健康轮询;三、调用kylin-diagnose-cli执行专项诊断;四、启用内核级hedr机制捕获底层硬件错误。

如果您希望在麒麟操作系统中主动掌握系统运行状况,及时发现潜在软硬件异常,则需启用系统内置的健康自检与诊断功能。以下是启用该功能的具体方法:
一、通过麒麟管家启用设备健康检测
麒麟管家是桌面环境集成的系统管理工具,提供图形化界面下的硬件状态监控与基础诊断能力,适用于普通用户快速查看设备健康概况。
1、点击屏幕左下角“开始菜单”,在应用列表中找到并点击麒麟管家图标启动程序。
2、在左侧导航栏中选择设备管理选项卡。
3、在右侧主界面中,点击顶部工具栏的健康检测按钮(若按钮为灰色不可用,说明当前未授权或驱动未就绪)。
4、首次运行时,系统将提示授权访问硬件传感器,点击允许并输入管理员密码完成授权。
5、检测启动后,界面将实时显示CPU温度、磁盘SMART状态、内存错误计数、电源健康度等关键指标,并对异常项标红提示。
二、使用systemd-journal与healthd服务启用日志级健康轮询
麒麟OS预置healthd守护进程,可周期性采集内核日志、硬件事件及驱动告警,并写入journal日志系统,适用于运维人员开展深度状态追踪。
1、打开终端(快捷键 Ctrl+Alt+T)。
2、执行命令启用healthd服务:sudo systemctl enable --now healthd.service。
3、确认服务已激活:sudo systemctl is-active healthd,返回active表示运行正常。
4、查看最近一轮健康扫描日志:sudo journalctl -u healthd -n 50 --no-pager,重点关注含“ERROR”、“WARN”、“SMART_FAIL”字样的条目。
5、如需调整轮询间隔,编辑配置文件:sudo nano /etc/healthd.conf,修改scan_interval_sec参数值(单位:秒),保存后执行sudo systemctl restart healthd生效。
三、调用kylin-diagnose-cli命令行工具执行专项诊断
kylin-diagnose-cli是麒麟OS官方提供的轻量级诊断套件,支持按模块触发硬件自检、固件一致性校验及驱动兼容性验证,无需图形界面即可运行。
1、在终端中确认工具是否已安装:which kylin-diagnose-cli,若无输出则需先安装:sudo apt install kylin-diagnose-tools。
2、执行全模块快速诊断:sudo kylin-diagnose-cli --mode quick,该模式耗时约90秒,输出包含主板、内存、存储、显卡四类核心部件状态摘要。
3、针对存储设备执行深度SMART检测:sudo kylin-diagnose-cli --module storage --action smart-full。
4、检查BIOS/UEFI固件版本与麒麟OS兼容性清单匹配情况:sudo kylin-diagnose-cli --module firmware --action verify。
5、所有诊断结果默认保存至/var/log/kylin-diagnose/目录,以时间戳命名的.tar.gz压缩包形式存在。
四、启用内核级硬件错误报告(HEDR)机制
该方法直接激活Linux内核的Hardware Error Reporting子系统,可捕获PCIe链路错误、内存ECC纠错事件、CPU机器检查异常(MCE)等底层硬件故障信号,适用于高可靠性场景。
1、检查当前内核是否启用HEDR支持:zcat /proc/config.gz | grep CONFIG_HARDWARE_ERRORS,输出CONFIG_HARDWARE_ERRORS=y表示已编译进内核。
2、加载必需内核模块:sudo modprobe ras-core mce-inject edac_mce_amd(AMD平台)或edac_mce_intel(Intel平台)。
3、启用自动错误日志收集:echo 'options rasdaemon load_on_boot=1' | sudo tee /etc/modprobe.d/ras.conf。
4、启动rasdaemon服务:sudo systemctl enable --now rasdaemon。
5、实时监控硬件错误事件:sudo ras-mc-ctl --summary,该命令将列出最近24小时内所有被内核捕获的硬件错误类型、发生次数及关联设备路径。










