工具内容站

Qwen 开源模型本地部署入门

从模型选择、量化到 Ollama 运行,完成第一次本地推理。

Qwen 本地部署教程封面

先按任务选择模型

本地模型没有绝对的越大越好。聊天、代码、长上下文和速度对模型的要求不同。建议先用小参数量或量化版本完成一组真实任务,再决定是否升级。

安装与首次测试

  1. 记录操作系统、显卡、内存和可用磁盘空间。
  2. 选择 Ollama、Transformers 或官方推荐的运行方式。
  3. 下载与运行框架匹配的模型和量化版本。
  4. 依次测试中文问答、代码生成、长文本总结和上下文保持。
  5. 记录首 token 延迟、生成速度和显存占用。

调优思路

显存不足时依次降低上下文长度、改用量化、减少 GPU 层数;长文档应分段并保留标题;代码任务要提供目录结构、运行命令和验收条件。不要同时运行多个大型模型。

本地服务安全

本地运行也要设置边界:限制模型可访问的目录,只监听必要地址,为 API 增加认证,不要把密钥、客户资料和隐私文件直接交给模型。升级模型前先备份配置并保留旧版本。

建议做一组基准测试

准备 10 个真实问题,覆盖中文问答、代码生成、长文摘要和多轮追问。分别记录首 token 延迟、每秒生成速度、内存占用和回答准确性。不要只用跑分判断模型,真实工作流的稳定性更重要。

迁移与回滚

升级模型前备份配置和提示词,保留旧模型一段时间。若新版本出现速度或质量回退,可以切回旧版本,而不会影响已有项目。