本地部署 Qwen3.8-27B 完整指南

Qwen3.8-27B 量化方案 A/B 实测对比报告

生成时间:2026-09-15 21:43
测试环境:MacBook Pro / M5 Pro / 48GB 统一内存 / Ollama 0.33.3
方法:同一套 12 道文本题(温度=0、num_predict=4096、num_ctx=131072、统一走 Ollama /api/chat),逐模型串行跑,跑完即卸载避免显存叠加。视觉题 G1 因依赖独立 mmproj 链路,本次未纳入。

一、体积 vs 速度 vs 吞吐(汇总,12 题均值)

模型 量化 bpw 体积(GB) 平均 decode (tok/s) 平均 prefill (tok/s) 平均生成 token
MLX 4-bit (NVFP4 均匀) qwen3.8:27b-mlx 4.0 18 29.90 224.1 1081
GSQ-RCO IQ3_S (3.5bpw 混合) qwen3.8-gsq-iq3s-mtp 3.5 12 12.64 133.8 978
GSQ-RCO IQ3_XXS (3.0bpw 混合) qwen3.8-gsq-iq3xxs-mtp 3.0 10 12.55 136.2 915
GGUF Q5_K_M (5.6bpw 均匀) qwen3.8-q5:latest 5.6 20 14.94 128.9 1174

体积取 ollama list 显示值;decode = eval_count/eval_duration,prefill = prompt_eval_count/prompt_eval_duration(均来自 Ollama 返回顶层字段)。

二、逐题 decode 速度对比 (tok/s)

题号 类别 MLX 4-bit (NVFP4 均匀) GSQ-RCO IQ3_S (3.5bpw 混合) GSQ-RCO IQ3_XXS (3.0bpw 混合) GGUF Q5_K_M (5.6bpw 均匀)
A1 Agentic Coding 39.45 16.19 13.93 17.74
A2 Agentic Coding 37.69 13.55 13.50 16.14
A3 Agentic Coding 36.68 11.92 10.68 14.28
A4 Agentic Coding 30.96 11.25 11.25 13.48
B1 Math Reasoning 34.76 14.04 13.99 16.52
B2 Math Reasoning 31.92 12.99 13.26 15.69
C1 Knowledge (GPQA) 24.53 12.51 12.84 13.69
D1 Long-context 26.22 12.84 13.36 15.83
E1 Structured Output 23.32 11.63 11.92 13.57
E2 Structured Output 25.05 11.86 12.20 14.64
F1 Chinese Writing 21.99 10.13 10.59 12.20
F2 Chinese Writing 26.26 12.82 13.14 15.55

三、输出质量抽样(每题每模型前 150 字,供人工比对)

A1 · A1(Agentic Coding)

A2 · A2(Agentic Coding)

A3 · A3(Agentic Coding)

A4 · A4(Agentic Coding)

B1 · B1(Math Reasoning)

B2 · B2(Math Reasoning)

C1 · C1(Knowledge (GPQA))

D1 · D1(Long-context)

E1 · E1(Structured Output)

E2 · E2(Structured Output)

F1 · F1(Chinese Writing)

F2 · F2(Chinese Writing)

四、严格质量校验结果

为排除”抽样看不出来”的误导,对全部 4 模型 × 12 题做了程序化校验:

校验项 方法 MLX 4-bit IQ3_S IQ3_XXS Q5
E1/E2 JSON json.loads 严格解析 ✅ VALID ✅ VALID ✅ VALID ✅ VALID
B1 同余方程 最终结论 n=?(标准 23) ✅ 23 ✅ 23 ✅ 23 ✅ 23
B2 相遇问题 最终结论 t=?(标准 5.6h) ✅ 5.6 ✅ 5.6 ✅ 5.6 ✅ 5.6
C1 知识题 选项(标准 B:泡利不相容) ✅ B ✅ B ✅ B ✅ B

结论:在本题集范围内,四个量化层级输出全部正确/合法,未检测到任何量化导致的质量退化——哪怕 3.0bpw 的 IQ3_XXS 也站住了。

⚠️ 必要边界说明:本题集 12 题是”能不能做对”的抽样,不是 198 题级别的基准。DASLab 官方在 GPQA-Diamond(198 题)上测得 IQ3_XXS 相对 BF16 差 ~1 分、IQ3_S 差 0.51 分——这种边际退化在 1 题抽样里必然被淹没。对你主用的 agentic coding / 长推理场景,GSQ 各档均表现稳定;若你后续做严谨评测,需更大题集才能复现那 1 分差距。

五、结论与选型建议

三个维度的事实(本机 M5 Pro / 48GB / Ollama 0.33.3 实测):

  1. 更省内存——成立。 IQ3_S 12GB、IQ3_XXS 10GB,分别比 MLX 4-bit 的 18GB 省 6GB / 8GB。省下的显存可直接给 131072 长上下文或同机跑的 MiniMax H3 腾地方。
  2. 更快——不成立。 MLX 4-bit 平均 decode 29.9 tok/s,约为 GSQ 混合精度(12~13 tok/s)的 2.4 倍,也比 Q5(14.9)快一倍。原因:NVFP4 是 GPU 友好的均匀 4-bit,而 IQ/GSQ 混合精度在每个权重解量化时开销大,在 Apple Silicon 的 Metal 后端(memory-bound)上反而更慢。
  3. 质量无损(vs 你的 MLX)——基本成立。 12 题严格校验四档全对;DASLab 官方基准也显示 IQ3_S 在 AIME/LCB 上与原版持平。唯一保留是 IQ3_XXS 在大规模知识基准上有 ~1 分边际退化。

给你(48GB Mac,主用 agentic coding + 长推理)的选型:

优先级 方案 体积 decode 适用场景
🥇 速度优先 保持 MLX 4-bit(现状) 18GB 29.9 要最快响应、显存够用
🥈 均衡(推荐切换) GSQ IQ3_S 12GB 12.6 想省 6GB 给 H3/长上下文,质量不降
🥉 极致省显存 GSQ IQ3_XXS 10GB 12.5 显存极度紧张;接受知识题 ~1 分边际风险
并发安全网 Q5(现状保留) 20GB 14.9 多会话并发时比 MLX 更稳(你已有配置)

一句话总结:GSQ-RCO 对你的真实价值是”省显存、质量不降“,不是”更快”。想提速继续用现在的 MLX 4-bit;想把显存让给 H3 或拉满 131K 上下文,切到 IQ3_S 是性价比最高的动作。Q5 维持现状作并发兜底即可。

注:GSQ 系列与你的 MLX 走的是同一套 Ollama / llama.cpp Metal 管线,A/B 唯一变量是量化方式,对比干净。IQ3_XXS 因 Ollama 0.33.3 注册校验不认其 IQ2_XS 子类型,采用手动改写 manifest 方式绕过(运行时 llama.cpp 可正常加载)。