8f99e18ca50191419453fcb652db4b4250ea8fcb
- Author
- TheEdgeOfRage <git@theedgeofrage.com>
- Committer
- TheEdgeOfRage <git@theedgeofrage.com>
- Date
Message
Readd gemma4 model to llama-server
Diff
1diff --git a/dot_config/llama-server/models.ini b/dot_config/llama-server/models.ini
2index b26aff5f62069e0ebd8dccf320e5ea3fc05d8b78..c381bdcc0b1113241cadc0780fe62d1dc8b8eafc 100644
3--- a/dot_config/llama-server/models.ini
4+++ b/dot_config/llama-server/models.ini
5@@ -46,22 +46,22 @@ top-k = 64
6 fit = off
7 reasoning = auto
8
9-# [gemma4-26b]
10-# hf = unsloth/gemma-4-26B-A4B-it-GGUF:UD-Q4_K_M
11-# hf-draft = unsloth/gemma-4-26B-A4B-it-GGUF:Q8_0-MTP
12-# alias = gemma4-26B-A4B
13-# n-gpu-layers = 99
14-# n-gpu-layers-draft = 99
15-# flash-attn = on
16-# ctx-size = 65536
17-# temp = 0.9
18-# top-p = 0.95
19-# top-k = 64
20-# spec-type = draft-mtp
21-# spec-draft-n-max = 2
22-# fit = off
23-# reasoning = on
24-#
25+[gemma4-26b]
26+hf = unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL
27+alias = gemma4-26B
28+n-gpu-layers = 99
29+n-gpu-layers-draft = 99
30+ngl=999
31+flash-attn = on
32+ctx-size = 65536
33+temp = 1.0
34+top-p = 0.95
35+top-k = 64
36+spec-type = draft-mtp
37+spec-draft-n-max = 4
38+fit = off
39+reasoning = auto
40+
41 # [lfm2-24b]
42 # hf = LiquidAI/LFM2-24B-A2B-GGUF:Q4_K_M
43 # n-gpu-layers = 99
44diff --git a/dot_config/systemd/user/llama-server.service b/dot_config/systemd/user/llama-server.service
45index e7efb49eee82e9cdb87d85cd506b55def1c5f9b2..e6164132f1e525fae3aca9c67d4ca42358d303f6 100644
46--- a/dot_config/systemd/user/llama-server.service
47+++ b/dot_config/systemd/user/llama-server.service
48@@ -1,5 +1,5 @@
49 [Unit]
50-Description=llama-server (PKGBUILD reviewer)
51+Description=llama-server
52 After=network.target
53
54 [Service]