tuiceday
← 回到实测
LAB

Huihui-Qwen3.8-27B-abliterated · Q4_K_M(Ollama 原生)

勉强能跑文本2026-10-09

Huihui-Qwen3.8-27B-abliterated · Q4_K_M(Ollama 原生)

权重体积
15.41 GB
峰值显存
14507 MB(占卡 88.9%) num_ctx 32768
CPU 溢出
23.2% 的层在 CPU num_ctx 32768
速度
10.8 tok/s(首 token 15.69s) num_ctx 32768
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
用户要求用一句话解释什么是显存带宽。需要中文回答,简洁一句话。定义:显存带宽是显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示,影响数据吞吐和图形/计算性能。需要一句话。 </think> 显存带宽是指显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示。
中文写作摘录(前 150 字)该模型是思考型,输出的开头是推理过程
用户要求:用三句话说明为什么小模型在消费级显卡上更实用。需要中文回答,严格三句话。需要简洁。 </think> 小模型参数量少,显存占用更低,消费级显卡更容易完整加载并稳定运行。 推理速度更快,延迟更低,更适合本地实时交互和高并发场景。 部署成本更低,普通用户也能用现有硬件获得可用性能,实
代码摘录(前 150 字)
We need answer user: "写一个 Python 函数,把秒数格式化成 1h2m3s 的形式。只要代码。" Means write a Python function to format seconds into 1h2m3s form. Only code. Need final
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 88.9%,剩 1.76 GB 余量
来源:本机实测 2026-10-09 00:02:18

本页是该条实测的独立页面;完整列表见 实测。