对于linux用户来说,无论是排查散热故障、监控服务器运行负载,还是折腾diy硬件超频调试,查看具体硬件的实时工作温度都是一项必备技能。和windows不同,linux没有默认预装温度监控工具,但只需要简单几步就能获取准确的温度数据。

通用方案:通过lm-sensors查看全硬件温度
lm-sensors是linux下最主流的开源温度监控工具,兼容绝大多数主板、cpu和硬件传感器,适合绝大多数场景使用。安装方式十分简单,debian/ubuntu系发行版执行`sudo apt install lm-sensors`,centos/rhel系发行版执行`sudo dnf install lm_sensors`即可完成安装。安装后首先执行`sudo sensors-detect`扫描主板上的硬件传感器,全程按回车选择默认选项即可,工具会自动加载对应驱动模块。扫描完成后直接输入`sensors`命令,就能看到所有硬件的温度数据:标注core的是cpu各核心温度,标注nvme的是固态硬盘温度,标注amdgpu/nvidia的是独立显卡温度,还会同步显示温度告警阈值,方便快速判断硬件是否过热。
精准查询:特定硬件的专属查询方式
如果需要获取nvme固态硬盘的精准温度,可以使用nvme-cli工具,安装后执行`nvme list`找到目标设备,再输入`sudo nvme smart-log /dev/nvme0n1`,输出中的temperature字段就是硬盘当前工作温度,数据比通用传感器更准确。nvidia独立显卡可以直接调用官方驱动自带的`nvidia-smi`命令,一键输出显卡核心、显存温度,同时显示功耗与负载,是深度学习服务器最常用的监控方式。

图形化方案:适合桌面用户的可视化监控
普通桌面用户更适合可视化工具,安装psensor即可实现实时监控,启动后就能看到各硬件温度的变化曲线,还支持设置过热提醒。喜欢桌面美化的用户也可以通过conky把温度信息嵌在桌面,随时查看。整体来看,linux查看硬件温度的方案灵活适配不同场景,用户可以按需选择,轻松掌握硬件运行状态。(全文约612字)































