← 返回全部项目

PROJECT 01 / LLM 服务验收与可观测性

ModelOps Sentinel

面向 vLLM OpenAI 兼容服务的部署验证与可观测性审计工具,覆盖健康检查、对话响应、指标采集、Prometheus 目标状态与结构化验收报告。

STATUSACTIVEXK3 WORK
01

要解决的问题

服务进程启动并不等于模型服务真正可用。模型加载、接口响应、监控指标和采集链路中的任一环节都可能悄悄失败。

02

我的方法

  1. 01

    依次检查健康端点、对话接口和 /metrics,避免只依据端口判断。

  2. 02

    核对 Prometheus targets,并组合 Grafana、Node Exporter 与可选 DCGM 指标。

  3. 03

    把每一步结果汇总为 JSON 与 Markdown 报告,便于复查和交付。

RESULT

把零散的上线检查变成一条可重复执行、能留下证据的服务验收流程。

查看 GitHub 仓库 ↗