63d78580561faee7ba670378484519e89b9db0b4
- Author
- TheEdgeOfRage <git@theedgeofrage.com>
- Committer
- TheEdgeOfRage <git@theedgeofrage.com>
- Date
Message
Use qwen3.8 27B Q2 as reviewer model
Diff
1diff --git a/dot_config/llama-server/models.ini b/dot_config/llama-server/models.ini
2index 92fb83ed721c897ebbf6bb1628ae46d1010e9cc8..6145205034bfc7dac195c91b9a99d13ecf0abe88 100644
3--- a/dot_config/llama-server/models.ini
4+++ b/dot_config/llama-server/models.ini
5@@ -11,37 +11,27 @@ alias = f2llm-v2-330m
6 n-gpu-layers = 99
7 embedding = true
8
9-[ibm-granite/granite-4.2-8b-GGUF:Q6_K]
10-hf = ibm-granite/granite-4.2-8b-GGUF:Q6_K
11-alias = granite4.2-8b
12+[unsloth/Qwen3.8-27B-GGUF:UD-Q2_K_XL]
13+hf = unsloth/Qwen3.8-27B-GGUF:UD-Q2_K_XL
14+alias = qwen3.8-27b-q2,reviewer
15 n-gpu-layers = 99
16-ctx-size = 16384
17-n-predict = 4096
18 flash-attn = on
19 jinja = true
20-temp = 0.2
21-top-p = 0.95
22-parallel = 1
23-reasoning = on
24-reasoning-effort = low
25-reasoning-budget = 2048
26-
27-[unsloth/LFM2.5-8B-A1B-GGUF:UD-Q6_K_XL]
28-hf = unsloth/LFM2.5-8B-A1B-GGUF:UD-Q6_K_XL
29-alias = lfm2.5-8b-a1b,reviewer
30-n-gpu-layers = 99
31 ctx-size = 16384
32-n-predict = 4096
33-flash-attn = on
34-jinja = true
35-temp = 0.2
36+temp = 0.6
37 top-p = 0.95
38-top-k = 80
39-repeat-penalty = 1.05
40+top-k = 20
41+min-p = 0.0
42 parallel = 1
43+spec-type = draft-mtp
44+spec-draft-n-max = 2
45+repeat-penalty = 1.0
46+presence-penalty = 1.5
47+reasoning = on
48+chat-template-kwargs = {"reasoning_effort":"low"}
49
50-[unsloth/Qwen3.8-27B-GGUF:Q4_K_XL]
51-hf = unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_XL
52+[unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_S]
53+hf = unsloth/Qwen3.8-27B-GGUF:UD-Q4_K_S
54 alias = qwen3.8-27b
55 n-gpu-layers = 99
56 flash-attn = on