01

先证明模型能够稳定加载

固定模型文件、运行版本和最少参数,让模型先在本机稳定完成一次推理。这个阶段不追求速度,只确认格式兼容、显存足够、输出正常。

  • 记录模型与量化版本
  • 保存可复现的启动参数
  • 观察加载时间与基础显存占用
02

再把推理变成标准接口

命令行能生成文本后,再开启 OpenAI 兼容服务,用固定请求验证模型列表、对话接口和错误响应。

03

最后才扩大能力边界

长上下文、并发和公网接入都可能引入新的资源与安全问题。我会一次只改变一类变量,并保留上一个可工作的配置作为回退点。