先按任务选择模型
本地模型没有绝对的越大越好。聊天、代码、长上下文和速度对模型的要求不同。建议先用小参数量或量化版本完成一组真实任务,再决定是否升级。
安装与首次测试
- 记录操作系统、显卡、内存和可用磁盘空间。
- 选择 Ollama、Transformers 或官方推荐的运行方式。
- 下载与运行框架匹配的模型和量化版本。
- 依次测试中文问答、代码生成、长文本总结和上下文保持。
- 记录首 token 延迟、生成速度和显存占用。
调优思路
显存不足时依次降低上下文长度、改用量化、减少 GPU 层数;长文档应分段并保留标题;代码任务要提供目录结构、运行命令和验收条件。不要同时运行多个大型模型。
本地服务安全
本地运行也要设置边界:限制模型可访问的目录,只监听必要地址,为 API 增加认证,不要把密钥、客户资料和隐私文件直接交给模型。升级模型前先备份配置并保留旧版本。
建议做一组基准测试
准备 10 个真实问题,覆盖中文问答、代码生成、长文摘要和多轮追问。分别记录首 token 延迟、每秒生成速度、内存占用和回答准确性。不要只用跑分判断模型,真实工作流的稳定性更重要。
迁移与回滚
升级模型前备份配置和提示词,保留旧模型一段时间。若新版本出现速度或质量回退,可以切回旧版本,而不会影响已有项目。