models.ini
1070 bytes
1[ggml-org/embeddinggemma-300M-GGUF:Q8_0]
2hf = ggml-org/embeddinggemma-300M-GGUF:Q8_0
3alias = embeddinggemma-300m
4n-gpu-layers = 99
5ctx-size = 2048
6embedding = true
7
8[F2LLM-v2-330M-GGUF:Q8_0]
9model = /home/pavle/.local/share/llama-server/models/f2llm-v2-330m-q8_0.gguf
10alias = f2llm-v2-330m
11n-gpu-layers = 99
12embedding = true
13
14[unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S]
15hf = unsloth/Qwen3.8-27B-GGUF:UD-IQ3_S
16alias = qwen3.8-27b-q3,reviewer
17n-gpu-layers = auto
18fit = off
19flash-attn = on
20jinja = true
21ctx-size = 131072
22temp = 0.6
23top-p = 0.95
24top-k = 20
25min-p = 0.0
26parallel = 1
27spec-type = draft-mtp
28spec-draft-n-max = 2
29repeat-penalty = 1.0
30presence-penalty = 1.5
31reasoning = on
32chat-template-kwargs = {"reasoning_effort":"low"}
33
34[unsloth/gemma-4-26B-A4B-it-qat-GGUF:Q4_K_XL]
35hf = unsloth/gemma-4-26B-A4B-it-qat-GGUF:UD-Q4_K_XL
36alias = gemma4-26b-a4b
37n-gpu-layers = 99
38n-gpu-layers-draft = 99
39ngl=999
40flash-attn = on
41ctx-size = 131072
42batch-size = 2048
43ubatch-size = 2048
44temp = 0.85
45top-p = 0.9
46top-k = 32
47spec-type = draft-mtp
48spec-draft-n-max = 4
49fit = off
50reasoning = auto