diff --git a/containers/llamacpp/preset.ini b/containers/llamacpp/preset.ini index 0c187de..b4830b6 100644 --- a/containers/llamacpp/preset.ini +++ b/containers/llamacpp/preset.ini @@ -2,14 +2,12 @@ # # Il server gira in router mode (nessun modello fisso): ogni sezione [nome] # definisce un modello, e il nome della sezione e' il valore da passare nel -# campo "model" dell'API, es. { "model": "qwen36-mtp", "messages": [...] }. +# campo "model" dell'API, es. { "model": "unsloth/DeepSeek-V4-Flash-0731-GGUF:IQ3_XXS", ... }. # -# Sezione [*]: parametri di tuning globali condivisi da tutti i modelli. -# I parametri per-modello (es. MTP, ctx-size dedicato) vanno NEL sezione del -# modello, NON in [*]. -# -# Hf tag: usa il quant ESATTO del repo (prefisso UD- incluso), es. UD-IQ4_NL, -# altrimenti llama.cpp potrebbe non individuare il file. +# IMPORTANTE: il nome della sezione deve coincidere ESATTAMENTE con l'id che +# la sorgente "cache" mostra in /v1/models (repo:quant SENZA prefisso UD-, +# es. :IQ4_NL). Cosi' la voce del preset e quella della cache si fondono in +# un'unica entry. Il tag "hf" invece usa il quant ESATTO del file (con UD-). # # Esempi per-modello: # [chat] @@ -30,7 +28,7 @@ cache-reuse = 256 # MTP nativo (layers MTP nel GGUF): ~1.5-2x piu' veloce. # Nota: MTP richiede -np 1 (parallel non supportato) e -fa on. -[qwen36-mtp] +[unsloth/Qwen3.6-35B-A3B-MTP-GGUF:IQ4_NL] hf = unsloth/Qwen3.6-35B-A3B-MTP-GGUF:UD-IQ4_NL spec-type = draft-mtp spec-draft-n-max = 2 @@ -38,14 +36,14 @@ spec-draft-n-max = 2 # Gemma 4 (MTP tramite file draft separato "MTP Q8_0"/"MTP BF16"): # da configurare esplicitamente con il draft model se serve; senza spec si # carica senza speculative decoding. -[gemma4] +[unsloth/gemma-4-26B-A4B-it-GGUF:IQ4_NL] hf = unsloth/gemma-4-26B-A4B-it-GGUF:UD-IQ4_NL # DeepSeek V4 Flash: speculative decoding via DSpark (spec-type draft-dspark), # NON draft-mtp. Il draft module e' un GGUF separato (dspark-...-Q8_0.gguf), # auto-scaricato da HF tramite hf-repo-draft (il tag :Q8_0 individua univocamente # il file draft, essendo il solo file "Q8_0" del repo). -[deepseek] +[unsloth/DeepSeek-V4-Flash-0731-GGUF:IQ3_XXS] hf = unsloth/DeepSeek-V4-Flash-0731-GGUF:UD-IQ3_XXS hf-repo-draft = unsloth/DeepSeek-V4-Flash-0731-GGUF:Q8_0 spec-type = draft-dspark @@ -55,7 +53,7 @@ n-gpu-layers-draft = 99 # Modello di embedding multilingua (per /v1/embeddings, es. RAG). # embeddings=true rende l'istanza embedding-only; pooling=last come da card; # ctx-size ridotto fa override del [*] (131072). -[embedding] +[Qwen/Qwen3-Embedding-0.6B-GGUF:Q8_0] hf = Qwen/Qwen3-Embedding-0.6B-GGUF:Q8_0 embeddings = true pooling = last