tuiceday
← 回到首页
LAB

实测

15 条

两个榜单谁都能抓,这一栏抄不走:都是在这台机器上真跑出来的数字,包括跑不动的那种。

主战场是 14–18 GB 的权重:全进显存太舒服、超过 20 GB 本机没戏 —— 边界带才有别人给不出的数字。

基准台:RTX 5060 Ti 16 GB · i7-14700F · 32 GB 本地推理最常见的档位之一;所有数字都署这个基准,读者一眼知道跟自己像不像。
今日模型2026-10-09
能跑文本2026-10-09

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive(MoE) · Q4_K_M(Docker 容器)

权重体积
19.71 GB
峰值显存
14736 MB(占卡 90.3%) num_ctx 32768
CPU 溢出
34.2% 的层在 CPU num_ctx 32768
速度
42.4 tok/s(首 token 8.46s) num_ctx 32768
容器内 ollama
ollama version is 0.40.1
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Input:** - **Topic:** 显存带宽 (VRAM bandwidth / Memory bandwidth) - **Requirement:** 用一句话解释 (Explain
中文写作摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Input:** - **Topic:** Small language models (SLMs) vs. consumer-grade GPUs - **Requirement:** Exp
代码摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Request:** - **Input:** Number of seconds (integer or float, presumably non-negative) - **Output:
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 90.3%,剩 1.54 GB 余量
来源:本机实测 2026-10-09 01:04:05
历史归档

文本8

能跑文本2026-10-09

Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive(MoE) · Q4_K_M(Ollama 原生)

权重体积
19.71 GB
峰值显存
14697 MB(占卡 90.1%) num_ctx 32768
CPU 溢出
34.1% 的层在 CPU num_ctx 32768
速度
65.5 tok/s(首 token 9.24s) num_ctx 32768
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Input:** - **Topic:** 显存带宽 (VRAM bandwidth / Video memory bandwidth) - **Requirement:** 用一句话解释 (E
中文写作摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Input:** - **Topic:** Why small models are more practical on consumer-grade GPUs. - **Constraint:
代码摘录(前 150 字)该模型是思考型,输出的开头是推理过程
1. **Analyze User Request:** - **Input:** Seconds (integer or float, presumably non-negative) - **Output:** Formatt
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 90.1%,剩 1.58 GB 余量
来源:本机实测 2026-10-09 01:00:36
勉强能跑文本2026-10-09

Huihui-Qwen3.8-27B-abliterated · Q4_K_M(Docker 容器)

权重体积
15.41 GB
峰值显存
14553 MB(占卡 89.2%) num_ctx 32768
CPU 溢出
23.2% 的层在 CPU num_ctx 32768
速度
9.4 tok/s(首 token 0.80s) num_ctx 32768
容器内 ollama
ollama version is 0.40.1
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
用户要求用一句话解释什么是显存带宽。需要中文回答,简洁一句话。定义:显存带宽是显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示,影响数据吞吐和图形/计算性能。一句话即可。 </think> 显存带宽是显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示,决定了数据在显存
中文写作摘录(前 150 字)
我们需要回答用户:“用三句话说明为什么小模型在消费级显卡上更实用。” 需要三句话。中文。需要简洁。分析完成。 </think> 小模型参数量少,显存占用更低,消费级显卡更容易完整加载。 推理速度更快,延迟更低,适合本地实时生成和日常使用。 部署成本更低,普通用户也能用现有硬件稳定运行,不需
代码摘录(前 150 字)
We need answer user: "写一个 Python 函数,把秒数格式化成 1h2m3s 的形式。只要代码。" Chinese: Write a Python function to format seconds into 1h2m3s form. Only code. Need pro
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 89.2%,剩 1.72 GB 余量
来源:本机实测 2026-10-09 01:18:20
勉强能跑文本2026-10-09

Huihui-Qwen3.8-27B-abliterated · Q4_K_M(Ollama 原生)

权重体积
15.41 GB
峰值显存
14507 MB(占卡 88.9%) num_ctx 32768
CPU 溢出
23.2% 的层在 CPU num_ctx 32768
速度
10.8 tok/s(首 token 15.69s) num_ctx 32768
短问答摘录(前 150 字)该模型是思考型,输出的开头是推理过程
用户要求用一句话解释什么是显存带宽。需要中文回答,简洁一句话。定义:显存带宽是显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示,影响数据吞吐和图形/计算性能。需要一句话。 </think> 显存带宽是指显卡在单位时间内从显存读写数据的最大速率,通常以 GB/s 表示。
中文写作摘录(前 150 字)该模型是思考型,输出的开头是推理过程
用户要求:用三句话说明为什么小模型在消费级显卡上更实用。需要中文回答,严格三句话。需要简洁。 </think> 小模型参数量少,显存占用更低,消费级显卡更容易完整加载并稳定运行。 推理速度更快,延迟更低,更适合本地实时交互和高并发场景。 部署成本更低,普通用户也能用现有硬件获得可用性能,实
代码摘录(前 150 字)
We need answer user: "写一个 Python 函数,把秒数格式化成 1h2m3s 的形式。只要代码。" Means write a Python function to format seconds into 1h2m3s form. Only code. Need final
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 88.9%,剩 1.76 GB 余量
来源:本机实测 2026-10-09 00:02:18
能跑文本2026-10-09

Ornith-1.5-9B-uncensored · Q4_K_M(Docker 容器)

权重体积
5.24 GB
峰值显存
6830 MB(占卡 41.9%) num_ctx 32768
CPU 溢出
0.0% 的层在 CPU num_ctx 32768
速度
59.9 tok/s(首 token 11.00s) num_ctx 32768
容器内 ollama
ollama version is 0.40.1
短问答摘录(前 150 字)
用户问的是"用一句话解释什么是显存带宽"。这是一个技术问题,需要简洁地解释显存带宽的概念。 显存带宽(VRAM Bandwidth / Memory Bandwidth)是显卡/显存的一个重要性能指标。让我想想怎么用最简洁准确的一句话来解释。 显存带宽指的是显存每秒钟能够传输的数据量,通常以GB
中文写作摘录(前 150 字)
The user is asking me to explain in three sentences why small models are more practical on consumer-grade GPUs. This is a technical question about AI/
代码摘录(前 150 字)
The user wants a Python function that formats seconds into the format "1h2m3s". They said "只要代码" (just code only). Let me write a clean function. Th
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 41.9%,剩 9.26 GB 余量
来源:本机实测 2026-10-09 00:31:44
能跑文本2026-10-09

Qwen3-30B-A3B-Instruct-2507(MoE) · IQ4_XS(Ollama 原生)

权重体积
15.25 GB
峰值显存
15377 MB(占卡 94.3%) num_ctx 32768
CPU 溢出
25.4% 的层在 CPU num_ctx 32768
速度
67.8 tok/s(首 token 0.32s) num_ctx 32768
短问答
显存带宽是指显卡显存每秒能够传输数据的最大速率,决定了GPU与显存之间数据交换的快慢。
中文写作
小模型参数量少,对显存和计算资源需求低,能在消费级显卡(如GTX 3060、RTX 4070)上流畅运行。 它们加载速度快,推理延迟低,适合实时应用如聊天机器人、语音助手等日常场景。 相比大模型,小模型训练和部署成本更低,更适合个人开发者和中小企业快速落地使用。
代码
```python def format_seconds(seconds): h = seconds // 3600 m = (seconds % 3600) // 60 s = seconds % 60 parts = [] if h > 0: parts.append(f"{h}h") if m > 0: parts.append(f"{m}m") if s > 0 or not parts: parts.append(f"{s}s") return "".join(parts) ```
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 94.3%,剩 0.91 GB 余量
来源:本机实测 2026-10-09 20:05:42
能跑文本2026-10-09

Qwen3-30B-A3B-Instruct-2507(MoE) · Q4_K_M(Ollama 原生)

权重体积
17.28 GB
峰值显存
15388 MB(占卡 94.3%) num_ctx 32768
CPU 溢出
32.8% 的层在 CPU num_ctx 32768
速度
57.0 tok/s(首 token 0.33s) num_ctx 32768
短问答
显存带宽是指显卡显存与GPU之间数据传输的最大速率,决定了GPU能多快地读取或写入显存中的数据。
中文写作
小模型参数量少,对显存需求低,能在消费级显卡(如GTX 3060、RTX 4070等)的有限显存下流畅运行。 它们计算量小,推理速度快,适合实时应用如语音助手、智能客服等日常场景。 相比大模型,小模型训练和部署成本更低,更易于在普通用户设备上实现本地化、隐私保护的AI体验。
代码
```python def format_seconds(seconds): hours = seconds // 3600 minutes = (seconds % 3600) // 60 secs = seconds % 60 parts = [] if hours > 0: parts.append(f"{hours}h") if minutes > 0: parts.append(f"{minutes}m") if secs > 0: parts.append(f"{secs}s") return "".join(parts) ```
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 94.3%,剩 0.90 GB 余量
来源:本机实测 2026-10-09 20:50:26
能跑文本2026-10-09

Qwen3-VL-30B-A3B-Instruct(MoE) · Q4_K_M(Ollama 原生)

权重体积
17.28 GB
峰值显存
15384 MB(占卡 94.3%) num_ctx 32768
CPU 溢出
32.9% 的层在 CPU num_ctx 32768
速度
56.1 tok/s(首 token 0.44s) num_ctx 32768
短问答
显存带宽是指显存与GPU之间数据传输的最大速率,单位通常是GB/s,它决定了GPU能多快地读取和写入图形数据。
中文写作
小模型参数量较小,对显存和计算资源的需求低,能够在消费级显卡上流畅运行。相比大模型,小模型推理速度更快,响应更及时,适合日常应用。此外,小模型部署门槛低,易于在手机、笔记本等设备上实现本地化运行,提升使用便捷性。
代码
```python def format_seconds(seconds): h = seconds // 3600 m = (seconds % 3600) // 60 s = seconds % 60 parts = [] if h > 0: parts.append(f"{h}h") if m > 0: parts.append(f"{m}m") if s > 0: parts.append(f"{s}s") return "".join(parts) ```
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 94.3%,剩 0.91 GB 余量
来源:本机实测 2026-10-09 20:03:29
能跑文本2026-10-08

Ornith-1.5-9B-uncensored · Q4_K_M(Ollama 原生)

权重体积
5.24 GB
峰值显存
6772 MB(占卡 41.5%) num_ctx 32768
CPU 溢出
0.0% 的层在 CPU num_ctx 32768
速度
69.1 tok/s(首 token 0.14s) num_ctx 32768
短问答摘录(前 150 字)
用户问的是"用一句话解释什么是显存带宽"。这是一个关于计算机硬件/显卡的技术问题。 让我思考一下显存带宽的定义: 显存带宽(Memory Bandwidth)是指显存(VRAM,视频随机存取存储器)在单位时间内能够传输的数据量,通常以GB/s(GB per second)为单位。 显存带宽的计
中文写作摘录(前 150 字)
The user is asking me to explain in three sentences why small models are more practical on consumer-grade GPUs. This is a technical question about AI/
代码摘录(前 150 字)
The user wants a Python function that formats seconds into the format "1h2m3s". They said "只要代码" (just code only). Let me write a clean function. Th
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
短问答
用一句话解释什么是显存带宽。
中文写作
用三句话说明为什么小模型在消费级显卡上更实用。
代码
用 Python 写一个函数,把秒数格式化成 1h2m3s 的形式。只要代码。
坑:峰值占卡 41.5%,剩 9.32 GB 余量
来源:本机实测 2026-10-08 23:00:03

出图3

没跑成出图2026-10-09

Qwen-Image · Q5_K_M(ComfyUI)

权重体积
13.91 GB
峰值显存
14746 MB(占卡 90.4%)
单张耗时
16.1 秒
温度 / 功耗
34°C / 48W
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
中文海报排版
一张干净的平面设计海报:暖米色纸面背景,正中央是四个黑色粗体汉字「边界测试」,字形清晰、笔画完整不缺笔;下方一行较小的灰色小字「本地生成 2026」。画面留白充足,四角有极简墨线装饰,整体像丝网印刷,纸张质感细腻。
size=1024 · steps=25 · sampler=euler · cfg=1
坑:失败原因:未知
来源:本机实测 2026-10-09 20:53:47
能跑出图2026-10-08

Qwen-Image-2.1-Uncensored · Q4_K_M(ComfyUI)

权重体积
4.29 GB
峰值显存
14306 MB(占卡 87.7%)
单张耗时
56.5 秒
温度 / 功耗
65°C / 163W
lab_00001_.png
测试输出:lab_00001_.png
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
中文海报排版
一张干净的平面设计海报:暖米色纸面背景,正中央是四个黑色粗体汉字「边界测试」,字形清晰、笔画完整不缺笔;下方一行较小的灰色小字「本地生成 2026」。画面留白充足,四角有极简墨线装饰,整体像丝网印刷,纸张质感细腻。
size=1024 · steps=25 · sampler=euler · cfg=1
坑:峰值占卡 87.7%,剩 1.96 GB 余量
来源:本机实测 2026-10-08 22:13:53
能跑出图2026-10-08

Z-Image-Turbo · Q4_K_M(ComfyUI)

权重体积
4.67 GB
峰值显存
11745 MB(占卡 72.0%)
单张耗时
20.2 秒
温度 / 功耗
53°C / 154W
lab_00002_.png
测试输出:lab_00002_.png
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
中文海报排版
一张干净的平面设计海报:暖米色纸面背景,正中央是四个黑色粗体汉字「边界测试」,字形清晰、笔画完整不缺笔;下方一行较小的灰色小字「本地生成 2026」。画面留白充足,四角有极简墨线装饰,整体像丝网印刷,纸张质感细腻。
size=1024 · steps=25 · sampler=euler · cfg=1
坑:峰值占卡 72.0%,剩 4.46 GB 余量
来源:本机实测 2026-10-08 23:09:22
相关榜单条目:unsloth/Z-Image-Turbo-GGUF

出视频3

勉强能跑出视频2026-10-09

MiniMax-H3 · 864×480 · 5.17 秒(ComfyUI)

分辨率
864 × 480
时长
5.17 秒(124 帧 @ 24 fps)
采样
8 步 · res_multistep · LoRA 已加载
单条耗时
157.6 秒(2.6 分钟)
峰值显存
15742 MB(占卡 96.5%)
温度 / 功耗
74°C / 181W
测试输出:lab_h3_i2v_00001_.mp4
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
图生视频 · 描述式(I2V 用这条)
A tactile paper poster coming alive: warm cream paper fills the frame with a subtle grain that shimmers as soft studio light sweeps across it; the bold black ink strokes flex and settle like fresh print drying, faint fibre texture drifting at the edges; slow cinematic push-in, shallow depth of field, silkscreen print, warm daylight, gentle ambient room tone.
size=864×480 · frames=124 · fps=24 · seconds=5.17 · steps=8 · sampler=res_multistep
坑:峰值占卡 96.5%,剩 0.56 GB 余量
来源:本机实测 2026-10-09 06:43:25
能跑出视频2026-10-09

Wan2.1-I2V-14B-480P · 864×480 · 5.06 秒 · FP8(ComfyUI)

分辨率
864 × 480
时长
5.06 秒(81 帧 @ 16.0 fps)
采样
4 步 · euler · LoRA 已加载
单条耗时
197.2 秒(3.3 分钟)
峰值显存
13679 MB(占卡 83.9%)
温度 / 功耗
74°C / 160W
测试输出:lab_wan21_i2v_00001_.mp4
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
图生视频 · 描述式(I2V 用这条)
A tactile paper poster coming alive: warm cream paper fills the frame with a subtle grain that shimmers as soft studio light sweeps across it; the bold black ink strokes flex and settle like fresh print drying, faint fibre texture drifting at the edges; slow cinematic push-in, shallow depth of field, silkscreen print, warm daylight, gentle ambient room tone.
size=864×480 · frames=124 · fps=24 · seconds=5.17 · steps=8 · sampler=res_multistep
坑:峰值占卡 83.9%,剩 2.57 GB 余量
来源:本机实测 2026-10-09 20:31:37
能跑出视频2026-10-09

Wan2.1-I2V-14B-480P · 1344×768 · 5.06 秒 · FP8(ComfyUI)

分辨率
1344 × 768
时长
5.06 秒(81 帧 @ 16.0 fps)
采样
4 步 · euler · LoRA 已加载
单条耗时
763.4 秒(12.7 分钟)
峰值显存
15091 MB(占卡 92.5%)
温度 / 功耗
75°C / 175W
测试输出:lab_wan21_i2v_00002_.mp4
本次固定提示词(展开)
提示词是实验条件:换一套 prompt,同一个模型的产出可能完全不同。所以本栏把 prompt 和结果一起给。
图生视频 · 描述式(I2V 用这条)
A tactile paper poster coming alive: warm cream paper fills the frame with a subtle grain that shimmers as soft studio light sweeps across it; the bold black ink strokes flex and settle like fresh print drying, faint fibre texture drifting at the edges; slow cinematic push-in, shallow depth of field, silkscreen print, warm daylight, gentle ambient room tone.
size=864×480 · frames=124 · fps=24 · seconds=5.17 · steps=8 · sampler=res_multistep
坑:峰值占卡 92.5%,剩 1.19 GB 余量
来源:本机实测 2026-10-09 20:36:21
留言所有留言都公开可见(审核通过后)。默认先审后发:挡的是广告和机器人,不是你的不同意见。
还没有人留言。
写两句(公开,提交后需审核)
你的昵称:冷静的扳手 53
不接受广告、引流与人身攻击;可要求删除自己的评论。