tuiceday
← 回到实测
LAB

Qwen3-30B-A3B-Instruct-2507(MoE) · IQ4_XS(Ollama 原生)

能跑文本2026-10-09

Qwen3-30B-A3B-Instruct-2507(MoE) · IQ4_XS(Ollama 原生)

权重体积
15.25 GB
峰值显存
15377 MB(占卡 94.3%) num_ctx 32768
CPU 溢出
25.4% 的层在 CPU num_ctx 32768
速度
67.8 tok/s(首 token 0.32s) num_ctx 32768
短问答
显存带宽是指显卡显存每秒能够传输数据的最大速率,决定了GPU与显存之间数据交换的快慢。
中文写作
小模型参数量少,对显存和计算资源需求低,能在消费级显卡(如GTX 3060、RTX 4070)上流畅运行。 它们加载速度快,推理延迟低,适合实时应用如聊天机器人、语音助手等日常场景。 相比大模型,小模型训练和部署成本更低,更适合个人开发者和中小企业快速落地使用。
代码
```python def format_seconds(seconds): h = seconds // 3600 m = (seconds % 3600) // 60 s = seconds % 60 parts = [] if h > 0: parts.append(f"{h}h") if m > 0: parts.append(f"{m}m") if s > 0 or not parts: parts.append(f"{s}s") return "".join(parts) ```
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 94.3%,剩 0.91 GB 余量
来源:本机实测 2026-10-09 20:05:42

本页是该条实测的独立页面;完整列表见 实测。