模型量化与本地部署:把大模型"搬"回你的机器
模型量化与本地部署:把大模型“搬”回你的机器
云端 API 方便,但有三点硬伤:数据要出网、按量付费、依赖网络。当场景涉及隐私数据、固定高频调用、或离线环境,本地部署就是必选项。
一、量化的本质
模型权重默认是 FP16(16 位浮点)。量化就是把它压成更低精度,换显存/内存与速度:
| 精度 | 相对体积 | 质量损失 | 适用 |
|---|---|---|---|
| FP16 | 1× | 无 | 云端、有卡 |
| INT8 | ~0.5× | 极小 | 服务端推理 |
| INT4 | ~0.25× | 轻微 | 消费级显卡 / 端侧 |
| 更激进 | 更小 | 明显 | 极致省资源 |
4-bit(INT4)量化下,一个 70B 模型从 140GB 压到 ~35GB,单张 24G/48G 卡就能跑——这就是“人人本地大模型”成为可能的原因。
二、GGUF + llama.cpp
- GGUF:主流本地模型格式,单文件、自带元数据、跨平台。
- llama.cpp:纯 C++ 推理引擎,CPU/GPU 通吃,Apple Silicon 用 Metal 加速极快。
- Ollama:把 llama.cpp 包成“一行命令跑模型”的体验,自带模型仓库与 REST API。
# 拉起一个本地模型(示意)
ollama run qwen2.5:7b
# 它暴露 http://localhost:11434/v1,OpenAI 兼容
我本地就跑着 Qwen3.8-27B(Apple Silicon 32G,Metal GPU 加速),聊天、代码补全都在本机完成,数据零外传。
三、本地 vs 云端的取舍
| 维度 | 本地 | 云端 API |
|---|---|---|
| 数据隐私 | ✅ 不出机 | ⚠️ 出网 |
| 成本 | 一次性硬件 | 持续按 token |
| 时延 | 受本机算力限制 | 弹性、快 |
| 模型上限 | 受显存限制 | 可用超大模型 |
| 运维 | 自己管 | 厂商管 |
经验法则:隐私/固定高频 → 本地;偶尔/需最强模型 → 云端。两者也能混部——简单任务本地小模型,难题走云端大模型(即“模型路由”,下一篇会讲)。
四、端侧推理
手机、车机、IoT 上跑 1B–3B 量化模型已成现实。好处是零延迟、零流量、隐私不出设备,适合语音唤醒、本地翻译、离线助手。代价是能力上限低,常与云端大模型配合(端侧预处理,云端精算)。
五、踩坑提醒
- 量化不是越狠越好:INT4 对 7B/13B 友好,对 <3B 可能崩坏。
- 本地模型要支持工具调用:不是所有本地模型都支持 function calling,部分需加
--jinja等参数或专用模板,否则 Agent 退化成纯聊天(血泪教训)。 - 显存≠内存:Mac 统一内存友好,但 Windows 独显机器要注意 VRAM 上限。
把模型搬回家,不是为了炫技,而是拿回“数据主权”和“成本主权”。
下一篇进入更酷的方向:多模态大模型。