Diff
1diff --git a/dot_config/llama-server/models.ini b/dot_config/llama-server/models.ini
2index 4e52a8f5844b82a0a28fba55f07d82300335794b..4f1bdc868fa5cc2808a194e20ccb50bdfd9ad500 100644
3--- a/dot_config/llama-server/models.ini
4+++ b/dot_config/llama-server/models.ini
5@@ -1,12 +1,9 @@
6-[qwen3.5-4b]
7-hf = unsloth/Qwen3.5-4B-MTP-GGUF:UD-Q4_K_XL
8+[embeddinggemma-300m]
9+hf = ggml-org/embeddinggemma-300M-GGUF:Q8_0
10+alias = embeddinggemma-300m
11 n-gpu-layers = 99
12-ctx-size = 8192
13-flash-attn = on
14-parallel = 1
15-spec-type = draft-mtp
16-spec-draft-n-max = 6
17-reasoning = on
18+ctx-size = 2048
19+embedding = true
20
21 [ministral3-8b]
22 hf = unsloth/Ministral-3-8B-Instruct-2512-GGUF:UD-Q4_K_XL
23@@ -23,7 +20,7 @@ alias = qwen3.6-27b
24 n-gpu-layers = 99
25 flash-attn = on
26 jinja = true
27-ctx-size = 262144
28+ctx-size = 65536
29 temp = 0.9
30 top-p = 0.95
31 top-k = 20
32@@ -34,17 +31,20 @@ spec-draft-n-max = 2
33 repeat-penalty = 1.0
34 reasoning = on
35
36-[supergemma4-26b]
37-hf = Jiunsong/supergemma4-26b-uncensored-gguf-v2:Q4_K_M
38-alias = supergemma4-26b
39+[qwen3.6-35b-a3b]
40+hf = unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q4_K_S
41+alias = qwen3.6-35b-a3b
42 n-gpu-layers = 99
43 flash-attn = on
44-ctx-size = 131072
45-temp = 1.1
46+jinja = true
47+ctx-size = 65536
48+temp = 0.9
49 top-p = 0.95
50-top-k = 64
51-fit = off
52-reasoning = auto
53+top-k = 20
54+min-p = 0.0
55+parallel = 1
56+repeat-penalty = 1.0
57+reasoning = on
58
59 [gemma4-26b]
60 hf = unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL
61@@ -62,8 +62,18 @@ spec-draft-n-max = 4
62 fit = off
63 reasoning = auto
64
65-# [lfm2-24b]
66-# hf = LiquidAI/LFM2-24B-A2B-GGUF:Q4_K_M
67-# n-gpu-layers = 99
68-# ctx-size = 16384
69-# flash-attn = on
70+[muse-glimmer-30b]
71+hf = unsloth/Muse-Glimmer-30B-GGUF:UD-Q4_K_XL
72+alias = muse-glimmer
73+n-gpu-layers = 99
74+flash-attn = on
75+jinja = true
76+ctx-size = 131072
77+temp = 1.0
78+top-p = 0.95
79+top-k = 64
80+reasoning = auto
81+spec-type = draft-dflash
82+spec-draft-n-max = 4
83+hf-repo-draft = meta-models/Muse-Glimmer-30B-GGUF:dflash-Muse-Glimmer-30B-Q4_K_M
84+n-gpu-layers-draft = 99