模型量化与本地部署:把大模型"搬"回你的机器

模型量化与本地部署:把大模型“搬”回你的机器

云端 API 方便,但有三点硬伤:数据要出网、按量付费、依赖网络。当场景涉及隐私数据、固定高频调用、或离线环境,本地部署就是必选项。

一、量化的本质

模型权重默认是 FP16(16 位浮点)。量化就是把它压成更低精度,换显存/内存与速度:

精度 相对体积 质量损失 适用
FP16 1× 无 云端、有卡
INT8 ~0.5× 极小 服务端推理
INT4 ~0.25× 轻微 消费级显卡 / 端侧
更激进 更小 明显 极致省资源

4-bit(INT4)量化下,一个 70B 模型从 140GB 压到 ~35GB,单张 24G/48G 卡就能跑——这就是“人人本地大模型”成为可能的原因。

二、GGUF + llama.cpp

  • GGUF:主流本地模型格式,单文件、自带元数据、跨平台。
  • llama.cpp:纯 C++ 推理引擎,CPU/GPU 通吃,Apple Silicon 用 Metal 加速极快。
  • Ollama:把 llama.cpp 包成“一行命令跑模型”的体验,自带模型仓库与 REST API。
# 拉起一个本地模型(示意)
ollama run qwen2.5:7b
# 它暴露 http://localhost:11434/v1,OpenAI 兼容

我本地就跑着 Qwen3.8-27B(Apple Silicon 32G,Metal GPU 加速),聊天、代码补全都在本机完成,数据零外传。

三、本地 vs 云端的取舍

维度 本地 云端 API
数据隐私 ✅ 不出机 ⚠️ 出网
成本 一次性硬件 持续按 token
时延 受本机算力限制 弹性、快
模型上限 受显存限制 可用超大模型
运维 自己管 厂商管

经验法则:隐私/固定高频 → 本地;偶尔/需最强模型 → 云端。两者也能混部——简单任务本地小模型,难题走云端大模型(即“模型路由”,下一篇会讲)。

四、端侧推理

手机、车机、IoT 上跑 1B–3B 量化模型已成现实。好处是零延迟、零流量、隐私不出设备,适合语音唤醒、本地翻译、离线助手。代价是能力上限低,常与云端大模型配合(端侧预处理,云端精算)。

五、踩坑提醒

  1. 量化不是越狠越好:INT4 对 7B/13B 友好,对 <3B 可能崩坏。
  2. 本地模型要支持工具调用:不是所有本地模型都支持 function calling,部分需加 --jinja 等参数或专用模板,否则 Agent 退化成纯聊天(血泪教训)。
  3. 显存≠内存:Mac 统一内存友好,但 Windows 独显机器要注意 VRAM 上限。

把模型搬回家,不是为了炫技,而是拿回“数据主权”和“成本主权”。

下一篇进入更酷的方向:多模态大模型。

← 返回首页