tuiceday
← 回到实测
LAB

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive(MoE) · Q4_K_M(Docker 容器)

能跑文本2026-10-09

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive(MoE) · Q4_K_M(Docker 容器)

权重体积
19.71 GB
峰值显存
14736 MB(占卡 90.3%) num_ctx 32768
CPU 溢出
34.2% 的层在 CPU num_ctx 32768
速度
42.4 tok/s(首 token 8.46s) num_ctx 32768
容器内 ollama
ollama version is 0.40.1
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Input:** - **Topic:** 显存带宽 (VRAM bandwidth / Memory bandwidth) - **Requirement:** 用一句话解释 (Explain
中文写作摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Input:** - **Topic:** Small language models (SLMs) vs. consumer-grade GPUs - **Requirement:** Exp
代码摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Request:** - **Input:** Number of seconds (integer or float, presumably non-negative) - **Output:
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 90.3%,剩 1.54 GB 余量
来源:本机实测 2026-10-09 01:04:05

本页是该条实测的独立页面;完整列表见 实测。