矿场监控:指标与可执行告警
把worker对应到实体矿机,并为每类告警指定处理步骤。
ASIC.tools · 核查日期

保持稳定设备标识
为每台设备分配独立worker,并关联序列号、型号与机架位置。多台共用worker时,矿池只能看到汇总结果。地址或账户变更后仍保留原资产标识。缺少映射时,离线通知只能说明收入减少,却不能指出该检查哪台设备。
结合本地与外部观察
采集支持的本地算力、板卡状态、温度、风扇和运行时间,再配合矿池接受工作估算以及独立供电、网络状态。本地哈希计算不证明工作到达矿池,短期矿池估算也可能正常波动。保留时间戳和采样区间以便核对。
从基线设定阈值
先测量获准配置的正常行为,再设告警。考虑启动、调优和维护,避免把短暂下降都当故障。硬件安全限值独立于统计性能阈值;低worker算力和过温保护应有不同紧急程度。主动调整功率或硬件后复核阈值。
让告警带有下一步
通知应包含资产、症状、首次时间和下一项安全检查。指定接收者及无人响应时的升级路径。将相关故障分组,避免一条上游断网产生数百张独立维修单,同时保留受影响清单。用计划事件测试通知和恢复闭环。
用历史改进运营
按设备、机架及共享设施分析重复故障,分别统计发现与恢复耗时。把维护记录放在指标旁,区分计划停机。监控工具只授予所需权限,并保护导出数据。目标是更快准确地恢复有效生产时间,而不是堆积最多图表。


