f4462e4bb8bd78cbb7d3055f3675c569b4cd402b

Author
TheEdgeOfRage <git@theedgeofrage.com>
Committer
TheEdgeOfRage <git@theedgeofrage.com>
Date

Message

Add gemma 4 12B model for japanese game

Diff

 1diff --git a/dot_config/llama-server/models.ini b/dot_config/llama-server/models.ini
 2index 5ea32f3f29505711d40cb3ade2c573fd9972a629..869982cea7feeda8ceee2acde014afe3cb178e9a 100644
 3--- a/dot_config/llama-server/models.ini
 4+++ b/dot_config/llama-server/models.ini
 5@@ -14,7 +14,8 @@ embedding = true
 6 [unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S]
 7 hf = unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S
 8 alias = qwen3.8-27b-q3,reviewer
 9-n-gpu-layers = 99
10+n-gpu-layers = auto
11+fit = off
12 flash-attn = on
13 jinja = true
14 ctx-size = 131072
15@@ -30,6 +31,25 @@ presence-penalty = 1.5
16 reasoning = on
17 chat-template-kwargs = {"reasoning_effort":"low"}
18 
19+[unsloth/gemma-4-12B-it-qat-GGUF:UD-Q4_K_XL]
20+hf = unsloth/gemma-4-12B-it-qat-GGUF:UD-Q4_K_XL
21+alias = gemma4-12b,jp
22+n-gpu-layers = 99
23+n-gpu-layers-draft = 99
24+fit = off
25+flash-attn = on
26+np = 2
27+kv-unified = on
28+ctx-size = 32768
29+batch-size = 1024
30+ubatch-size = 1024
31+temp = 1.0
32+top-p = 0.95
33+top-k = 64
34+spec-type = draft-mtp
35+spec-draft-n-max = 4
36+reasoning = off
37+
38 [unsloth/gemma-4-26B-A4B-it-qat-GGUF:Q4_K_XL]
39 hf = unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL
40 alias = gemma4-26b-a4b