之前把Qwen3.6-35B-A3B本地部署给跑通了,然后又试了试 Gemma4-26B 这个模型,稳定在25 tok/s 以上。另外就是最近这两天有消息说deepseek在研发 小模型 ,主流消费级显卡可以运行在30 t/s,找deepseek确认一下说是大概率真的【这个传闻大概率是真的。根据多家科技媒体的报道,DeepSeek 创始人梁文锋在近期的投资人会议上确认,公司正在内部测试一款轻量级模型,目标是让它在普通消费级显卡上就能流畅运行】
根据最新披露的内容,梁文锋确认这款轻量级模型旨在具备在主流消费级显卡上稳定运行的能力,并有效支撑绝大多数日常应用场景。当前开源小模型最火的就属qwen27b了,但是这个模型在主流消费级显卡上完全处于不能用的状态,所以还是期待一下deepseek这个小模型
Gemma4-26B
站点水印:www.onemuggle.com
电脑配置(笔记本)
- AMD Ryzen 7 5800H
- 32G 内存 DDR4
- 3070显卡8G
- Windows 11
使用AI部署
- 模型是无审查的:gemma-4-26B-A4B-heretic-APEX-I-Compact.gguf
- mtp推理加速:mtp-gemma-4-26B-A4B-it-Q8_0.gguf
- DSH + V4.1 实现的,可参考之前的文章
- 模型配置如下:
version = 1
[*]
parallel = 1
predict = 8192
n-gpu-layers = all
flash-attn = on
cache-type-k = q8_0
cache-type-v = q8_0
threads = 8
threads-batch = 16
batch-size = 1024
ubatch-size = 512
jinja = true
reasoning = off
load-on-startup = false
stop-timeout = 10
load-mode = none
[gemma4-heretic-apex-i-compact-64k]
model = C:Desktop\gemma26b\mode\gemma-4-26B-A4B-heretic-APEX-I-Compact.gguf
ctx-size = 65536
load-on-startup = true
n-cpu-moe = 24
spec-type = draft-mtp
spec-draft-model = C:Desktop\gemma26b\mode\mtp-gemma-4-26B-A4B-it-Q8_0.gguf
spec-draft-n-max = 3
spec-draft-device = CUDA0
spec-draft-ngl = all
cache-type-k-draft = q8_0
cache-type-v-draft = q8_0
测试结果
模型配置 ctx-size 控制上下文窗口大小。
上下文64K,22t/s左右
OneMuggle