LAB
Qwen3-30B-A3B-Instruct-2507(MoE) · Q4_K_M(Ollama 原生)
能跑文本2026-10-09
Qwen3-30B-A3B-Instruct-2507(MoE) · Q4_K_M(Ollama 原生)
- 权重体积
- 17.28 GB
- 峰值显存
- 15388 MB(占卡 94.3%) num_ctx 32768
- CPU 溢出
- 32.8% 的层在 CPU num_ctx 32768
- 速度
- 57.0 tok/s(首 token 0.33s) num_ctx 32768
短问答
显存带宽是指显卡显存与GPU之间数据传输的最大速率,决定了GPU能多快地读取或写入显存中的数据。
中文写作
小模型参数量少,对显存需求低,能在消费级显卡(如GTX 3060、RTX 4070等)的有限显存下流畅运行。
它们计算量小,推理速度快,适合实时应用如语音助手、智能客服等日常场景。
相比大模型,小模型训练和部署成本更低,更易于在普通用户设备上实现本地化、隐私保护的AI体验。
代码
```python
def format_seconds(seconds):
hours = seconds // 3600
minutes = (seconds % 3600) // 60
secs = seconds % 60
parts = []
if hours > 0:
parts.append(f"{hours}h")
if minutes > 0:
parts.append(f"{minutes}m")
if secs > 0:
parts.append(f"{secs}s")
return "".join(parts)
```
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 94.3%,剩 0.90 GB 余量
来源:本机实测 2026-10-09 20:50:26
本页是该条实测的独立页面;完整列表见 实测。