LAB
Huihui-Qwen3.8-27B-abliterated · Q4_K_M(Docker 容器)
勉强能跑文本2026-10-09
Huihui-Qwen3.8-27B-abliterated · Q4_K_M(Docker 容器)
- 权重体积
- 15.41 GB
- 峰值显存
- 14553 MB(占卡 89.2%) num_ctx 32768
- CPU 溢出
- 23.2% 的层在 CPU num_ctx 32768
- 速度
- 9.4 tok/s(首 token 0.80s) num_ctx 32768
- 容器内 ollama
- ollama version is 0.40.1
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
用户要求用一句话解释什么是显存带宽。需要中文回答,简洁一句话。定义:显存带宽是显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示,影响数据吞吐和图形/计算性能。一句话即可。 </think> 显存带宽是显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示,决定了数据在显存
中文写作摘录(前 150 字)
我们需要回答用户:“用三句话说明为什么小模型在消费级显卡上更实用。” 需要三句话。中文。需要简洁。分析完成。 </think> 小模型参数量少,显存占用更低,消费级显卡更容易完整加载。 推理速度更快,延迟更低,适合本地实时生成和日常使用。 部署成本更低,普通用户也能用现有硬件稳定运行,不需
代码摘录(前 150 字)
We need answer user: "写一个 Python 函数,把秒数格式化成 1h2m3s 的形式。只要代码。" Chinese: Write a Python function to format seconds into 1h2m3s form. Only code. Need pro
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 89.2%,剩 1.72 GB 余量
来源:本机实测 2026-10-09 01:18:20
本页是该条实测的独立页面;完整列表见 实测。