f4462e4bb8bd78cbb7d3055f3675c569b4cd402b
- Author
- TheEdgeOfRage <git@theedgeofrage.com>
- Committer
- TheEdgeOfRage <git@theedgeofrage.com>
- Date
Message
Add gemma 4 12B model for japanese game
Diff
1diff --git a/dot_config/llama-server/models.ini b/dot_config/llama-server/models.ini
2index 5ea32f3f29505711d40cb3ade2c573fd9972a629..869982cea7feeda8ceee2acde014afe3cb178e9a 100644
3--- a/dot_config/llama-server/models.ini
4+++ b/dot_config/llama-server/models.ini
5@@ -14,7 +14,8 @@ embedding = true
6 [unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S]
7 hf = unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S
8 alias = qwen3.8-27b-q3,reviewer
9-n-gpu-layers = 99
10+n-gpu-layers = auto
11+fit = off
12 flash-attn = on
13 jinja = true
14 ctx-size = 131072
15@@ -30,6 +31,25 @@ presence-penalty = 1.5
16 reasoning = on
17 chat-template-kwargs = {"reasoning_effort":"low"}
18
19+[unsloth/gemma-4-12B-it-qat-GGUF:UD-Q4_K_XL]
20+hf = unsloth/gemma-4-12B-it-qat-GGUF:UD-Q4_K_XL
21+alias = gemma4-12b,jp
22+n-gpu-layers = 99
23+n-gpu-layers-draft = 99
24+fit = off
25+flash-attn = on
26+np = 2
27+kv-unified = on
28+ctx-size = 32768
29+batch-size = 1024
30+ubatch-size = 1024
31+temp = 1.0
32+top-p = 0.95
33+top-k = 64
34+spec-type = draft-mtp
35+spec-draft-n-max = 4
36+reasoning = off
37+
38 [unsloth/gemma-4-26B-A4B-it-qat-GGUF:Q4_K_XL]
39 hf = unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL
40 alias = gemma4-26b-a4b