CMP
对照
5 组同一台机器、同一套提示词,只改一个条件 —— 差多少一目了然
Qwen3-30B-A3B-Instruct-2507
量化档对照只换量化档(权重 15.25 GB → 17.28 GB):速度 67.8 → 57.0 tok/s(-16%);CPU 溢出层 25.4% → 32.8%
IQ4_XS(Ollama 原生)
权重15.25 GB速度67.8 tok/s峰值显存15377 MB94.3%CPU 溢出25.4%
Q4_K_M(Ollama 原生)
权重17.28 GB速度57.0 tok/s峰值显存15388 MB94.3%CPU 溢出32.8%
Huihui-Qwen3.8-27B-abliterated
运行时对照同一个模型:Docker 容器里比 Ollama 原生慢 13%(10.8 → 9.4 tok/s)
Q4_K_M(Docker 容器)
权重15.41 GB速度9.4 tok/s峰值显存14553 MB89.2%CPU 溢出23.2%
Q4_K_M(Ollama 原生)
权重15.41 GB速度10.8 tok/s峰值显存14507 MB88.9%CPU 溢出23.2%
Ornith-1.5-9B-uncensored
运行时对照同一个模型:Docker 容器里比 Ollama 原生慢 13%(69.1 → 59.9 tok/s)
Q4_K_M(Docker 容器)
权重5.24 GB速度59.9 tok/s峰值显存6830 MB41.9%CPU 溢出0.0%
Q4_K_M(Ollama 原生)
权重5.24 GB速度69.1 tok/s峰值显存6772 MB41.5%CPU 溢出0.0%
Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive
运行时对照同一个模型:Docker 容器里比 Ollama 原生慢 35%(65.5 → 42.4 tok/s)
Q4_K_M(Docker 容器)
权重19.71 GB速度42.4 tok/s峰值显存14736 MB90.3%CPU 溢出34.2%
Q4_K_M(Ollama 原生)
权重19.71 GB速度65.5 tok/s峰值显存14697 MB90.1%CPU 溢出34.1%
Wan2.1-I2V-14B-480P
分辨率对照换原生分辨率:耗时 3.9 倍(197.2 秒 → 763.4 秒),峰值显存 13679 MB → 15091 MB
864×480 · 5.06 秒 · FP8(ComfyUI)
耗时197.2 秒峰值显存13679 MB83.9%
1344×768 · 5.06 秒 · FP8(ComfyUI)
耗时763.4 秒峰值显存15091 MB92.5%
留言所有留言都公开可见(审核通过后)。默认先审后发:挡的是广告和机器人,不是你的不同意见。
还没有人留言。
写两句(公开,提交后需审核)
你的昵称:带静电的示波器 21
不接受广告、引流与人身攻击;可要求删除自己的评论。