之前把Qwen3.6-35B-A3B本地部署给跑通了,然后又试了试 Gemma4-26B 这个模型,稳定在25 tok/s 以上。另外就是最近这两天有消息说deepseek在研发 小模型 ,主流消费级显卡可以运行在30 t/s,找deepseek确认一下说是大概率真的【这个传闻大概率是真的。根据多家科技媒体的报道,DeepSeek 创始人梁文锋在近期的投资人会议上确认,公司正在内部测试一款轻量级模型,目标是让它在普通消费级显卡上就能流畅运行】

根据最新披露的内容,梁文锋确认这款轻量级模型旨在具备在主流消费级显卡上稳定运行的能力,并有效支撑绝大多数日常应用场景。当前开源小模型最火的就属qwen27b了,但是这个模型在主流消费级显卡上完全处于不能用的状态,所以还是期待一下deepseek这个小模型 2026-09-25_16-41-29.png

Gemma4-26B

站点水印:www.onemuggle.com

电脑配置(笔记本)

  • AMD Ryzen 7 5800H
  • 32G 内存 DDR4
  • 3070显卡8G
  • Windows 11

使用AI部署

  • 模型是无审查的:gemma-4-26B-A4B-heretic-APEX-I-Compact.gguf
  • mtp推理加速:mtp-gemma-4-26B-A4B-it-Q8_0.gguf
  • DSH + V4.1 实现的,可参考之前的文章

  • 模型配置如下:
version = 1

[*]
parallel = 1
predict = 8192
n-gpu-layers = all
flash-attn = on
cache-type-k = q8_0
cache-type-v = q8_0
threads = 8
threads-batch = 16
batch-size = 1024
ubatch-size = 512
jinja = true
reasoning = off
load-on-startup = false
stop-timeout = 10
load-mode = none

[gemma4-heretic-apex-i-compact-64k]
model = C:Desktop\gemma26b\mode\gemma-4-26B-A4B-heretic-APEX-I-Compact.gguf
ctx-size = 65536
load-on-startup = true
n-cpu-moe = 24
spec-type = draft-mtp
spec-draft-model = C:Desktop\gemma26b\mode\mtp-gemma-4-26B-A4B-it-Q8_0.gguf
spec-draft-n-max = 3
spec-draft-device = CUDA0
spec-draft-ngl = all
cache-type-k-draft = q8_0
cache-type-v-draft = q8_0

测试结果

模型配置 ctx-size 控制上下文窗口大小。

上下文64K,22t/s左右

2026-09-25_14-57-21.png 2026-09-25_14-57-59.png

上下文120K,2t/s左右

2026-09-25_17-11-38.png

END
本文作者: 文章标题:8G显卡也能跑!Gemma4-26B本地部署实测:流畅运行达20-30 tok/s
本文地址:https://www.onemuggle.com/archives/2389.html
版权说明:若无注明,本文皆OneMuggle原创,转载请保留文章出处。
如果觉得我的文章对你有用, 请我喝杯咖啡吧 ☕