01

把“可用”拆成多个层次

第一层是进程和端口,第二层是健康端点,第三层是真实推理,第四层是指标和采集目标。每层都有独立证据。

  • 进程是否存活
  • 健康端点是否返回预期状态
  • 真实请求是否产生有效回答
  • 指标是否被 Prometheus 成功采集
02

使用固定请求减少变量

诊断阶段使用固定模型名、固定短提示词和明确超时。先确认最简单请求成功,再逐步恢复真实参数。

03

让结果可以被复查

把检查时间、请求目标、状态码、延迟和失败原因写入结构化报告,比只保留终端截图更容易复盘。