# Qwen3.8-27B 部署模板（生产在用，M5 Pro 48GB / Ollama 0.33.3）
# 重建：ollama create qwen3.8:27b-mlx -f Modelfile
#
# 模型：官方 MLX 原生版 qwen3.8:27b-mlx（18GB，nvfp4 量化）
#   - 自带多模态模板 + vision projector + 内嵌 MTP 投机解码头
#   - 因此无需第二行 FROM mmproj、也无需手写 TEMPLATE（GGUF 路线才需要）
#
# 并发说明（2026-09-10 A/B 实测）：
#   - MLX 单跑 131k + MTP 在 48GB 上稳定（10/10 全过，零 OOM）
#   - 多个会话/进程同时调同一个 MLX 模型时，KV 缓存显存叠加会 OOM
#   - 长 agent 多会话并发场景，改用 qwen3.8-q5（GGUF + llama.cpp，并发更稳）

FROM qwen3.8:27b-mlx

# 上下文窗口：131072 是实测最佳平衡（28GB 内存、100% GPU、单跑稳定）
# 131072 单跑稳定；此前 OOM 由多会话并发调用导致，与上下文长度无关
PARAMETER num_ctx 131072

# MTP 投机解码：Qwen3.8 内嵌 MTP 头，但默认 draft=0（关闭），必须显式开启
# 实测代码生成 ~11.7 → ~37.8 tok/s（约 3.9×），无损
PARAMETER draft_num_predict 3

# 采样参数（官方推荐）
PARAMETER temperature 0.7
PARAMETER top_p 0.95
PARAMETER top_k 20
PARAMETER min_p 0.0
