parametri llama.cpp

Aggiornato 2026-09-17 •Italiano • •
Scarica PDF
In questa pagina

Guida ai Parametri di llama-server


1. Common Params (Parametri Generali e Risorse)

Informazioni e Utilizzo

Parametro Descrizione
-h, --help, --usage Mostra il messaggio di aiuto ed esce dal programma.
--version Mostra la versione del binario e le informazioni sulla compilazione.
-cl, --cache-list Elenca i modelli attualmente salvati nella cache locale.
--completion-bash Genera lo script Bash per abilitare l'autocompletamento dei comandi da terminale.

Gestione Processori e Thread (CPU principali)

Parametro Descrizione
-t, --threads N Numero di thread CPU da usare durante la generazione (default: -1).
-tb, --threads-batch N Numero di thread CPU da usare durante l'elaborazione del batch e del prompt (default: uguale a --threads).
-C, --cpu-mask M Maschera esadecimale di affinità CPU per limitare l'esecuzione a core specifici.
-Cr, --cpu-range lo-hi Intervallo di core CPU per l'affinità (es. 0-7).
--cpu-strict <0|1> Se impostato su 1, forza il posizionamento rigido sui core assegnati (default: 0).
--prio N Imposta la priorità del processo/thread: -1 (low), 0 (normal), 1 (medium), 2 (high), 3 (realtime).
--poll <0...100> Grado di polling (attesa attiva) sui thread per ridurre la latenza (default: 50).

Gestione Processori e Thread (Per la fase Batch)

Parametro Descrizione
-Cb, --cpu-mask-batch M Maschera CPU specifica per l'elaborazione batch.
-Crb, --cpu-range-batch lo-hi Intervallo di CPU specifico per l'elaborazione batch.
--cpu-strict-batch <0|1> Posizionamento CPU rigido per la fase batch.
--prio-batch N Priorità dei thread durante la fase batch (0-3).
--poll-batch <0|1> Abilita o disabilita il polling durante la fase batch.

Memoria del Modello e Contesto

Parametro Descrizione
-c, --ctx-size N Dimensione della finestra di contesto in token (0 = caricato dal modello).
-n, --predict, --n-predict N Numero di token da predire (-1 = infinito).
-b, --batch-size N Dimensione massima logica del batch (default: 2048).
-ub, --ubatch-size N Dimensione massima fisica del batch / micro-batch (default: 512).
--keep N Numero di token del prompt iniziale da mantenere in memoria (-1 = tutti).
--swa-full Utilizza la cache a dimensione intera per i modelli con Sliding Window Attention.
-fa, --flash-attn [on|off|auto] Abilita o disabilita Flash Attention (on, off, auto).
--perf, --no-perf Abilita o disabilita i tempi delle prestazioni interne di libllama.
-e, --escape, --no-escape Abilita la conversione delle sequenze di escape (\n, \t, ecc.).

Scaling del Contesto (RoPE e YaRN)

Parametro Descrizione
--rope-scaling {none,linear,yarn} Metodo di scaling della frequenza RoPE.
--rope-scale N Estende il contesto di un fattore $N$.
--rope-freq-base N Frequenza base RoPE usata dallo scaling NTK-aware.
--rope-freq-scale N Fattore di scala della frequenza RoPE (estende il contesto di $1/N$).
--yarn-orig-ctx N Dimensione del contesto originale di addestramento del modello per l'algoritmo YaRN.
--yarn-ext-factor N Fattore di miscela per l'estrapolazione in YaRN.
--yarn-attn-factor N Scala la magnitudo dell'attenzione o $\sqrt{t}$ in YaRN.
--yarn-beta-slow N Parametro per la correzione delle dimensioni ad alte frequenze in YaRN.
--yarn-beta-fast N Parametro per la correzione delle dimensioni a basse frequenze in YaRN.

Gestione Memoria di Sistema e Cache KV

Parametro Descrizione
-kvo, --kv-offload, -nkvo, --no-kv-offload Abilita o disabilita il caricamento offload della cache KV.
--repack, -nr, --no-repack Abilita o disabilita il riimpacchettamento dei pesi in memoria.
--no-host Bypassa il buffer host consentendo l'uso di buffer extra.
-ctk, --cache-type-k TYPE Tipo di dati per la chiave (K) nella cache KV (f32, f16, bf16, q8_0, q4_0, ecc.).
-ctv, --cache-type-v TYPE Tipo di dati per il valore (V) nella cache KV (f32, f16, bf16, q8_0, q4_0, ecc.).
-dt, --defrag-thold N (DEPRECATO) Soglia di deframmentazione della cache KV.
--mlock (DEPRECATO) Forza il sistema a mantenere il modello in RAM senza swapping.
--mmap, --no-mmap (DEPRECATO) Abilita o disabilita la mappatura della memoria per il modello.
-dio, --direct-io, -ndio, --no-direct-io (DEPRECATO) Utilizza DirectIO se disponibile.
-lm, --load-mode MODE Modalità di caricamento del modello: auto, none, mmap, mlock, mmap+mlock, dio.
--numa TYPE Ottimizzazioni per architetture NUMA: distribute, isolate, numactl.

Gestione GPU e Offload Hardware

Parametro Descrizione
-dev, --device <dev1,dev2,..> Elenco di dispositivi da utilizzare per l'offloading (none per disabilitare).
--list-devices Stampa l'elenco dei dispositivi disponibili ed esce.
-ot, --override-tensor ... Sovrascrive il tipo di buffer per uno specifico pattern di tensore.
-cmoe, --cpu-moe Mantiene tutti i pesi dei modelli Mixture of Experts (MoE) nella CPU.
-ncmoe, --n-cpu-moe N Mantiene i pesi MoE dei primi $N$ layer nella CPU.
-ngl, --gpu-layers N Numero massimo di layer da memorizzare nella VRAM (auto, all o un numero).
-sm, --split-mode ... Modalità di suddivisione su più GPU: none, layer, row, tensor.
-ts, --tensor-split N0,N1... Frazione del modello da allocare su ciascuna GPU (es. 3,1).
-mg, --main-gpu INDEX GPU principale usata per i calcoli intermedi o con --split-mode row.
-fit [on|off] Regola automaticamente i parametri non definiti per rientrare nella memoria del dispositivo.
-fitt, --fit-target MiB0,MiB1... Margine di memoria libero target per ciascun dispositivo per l'opzione --fit.
-fitc, --fit-ctx N Dimensione minima del contesto impostabile tramite l'opzione --fit.

Modifiche, LoRA e Modelli

Parametro Descrizione
--check-tensors Controlla i dati dei tensori del modello per individuare valori non validi.
--override-kv KEY=TYPE:VALUE Sovrascrive i metadati interni del modello per chiave (tipi: int, float, bool, str).
--op-offload, --no-op-offload Abilita o disabilita l'offload delle operazioni sui tensori host al dispositivo.
--lora FNAME Percorso dell'adattatore LoRA (valori separati da virgola per caricarne più di uno).
--lora-scaled FNAME:SCALE Carica adattatori LoRA con un fattore di scala personalizzato.
--control-vector FNAME Aggiunge uno o più Control Vector al modello.
--control-vector-scaled FNAME:SCALE Aggiunge Control Vector con un fattore di scala personalizzato.
--control-vector-layer-range START END Intervallo inclusivo di layer su cui applicare i Control Vector.

Download e Sorgente del Modello

Parametro Descrizione
-m, --model FNAME Percorso del file locale del modello da caricare.
-mu, --model-url MODEL_URL URL diretto per il download del modello.
-dr, --docker-repo ... Repository di modelli Docker Hub (es. gemma3).
-hf, --hf-repo <user>/<model>[:quant] Repository di Hugging Face (es. ggml-org/GLM-4.7-Flash-GGUF:Q4_K_M).
-hff, --hf-file FILE Nome del file del modello da scaricare da Hugging Face.
-hft, --hf-token TOKEN Access Token di Hugging Face per modelli privati o protetti.

Logging

Parametro Descrizione
--log-disable Disabilita completamente i log.
--log-file FNAME Reindirizza l'output dei log su un file specificato.
--log-colors [on|off|auto] Abilita o disabilita i log a colori nel terminale.
-v, --verbose, --log-verbose Imposta il livello di dettaglio dei log al massimo per il debugging.
--offline Forza la modalità offline prevenendo qualsiasi accesso alla rete.
-lv, --verbosity N Imposta la soglia di verbosità (0 = generico, 1 = error, 2 = warning, 3 = info, 4 = trace, 5 = debug).
--log-prefix, --no-log-prefix Abilita o disabilita il prefisso nei messaggi di log.
--log-timestamps, --no-log-timestamps Abilita o disabilita il timestamp nei messaggi di log.

Cache KV per Modello Draft

Parametro Descrizione
--spec-draft-type-k, -ctkd Tipo di dati della chiave (K) nella cache KV per il modello draft.
--spec-draft-type-v, -ctvd Tipo di dati del valore (V) nella cache KV per il modello draft.

2. Sampling Params (Parametri di Campionamento)

Campionatori Generali

Parametro Descrizione
--samplers SAMPLERS Elenco di campionatori da usare ordinati e separati da ;.
-s, --seed SEED Seme per il generatore di numeri casuali (-1 = seme casuale).
--sampler-seq SEQUENCE Sequenza abbreviata per definire la catena dei campionatori (default: edskypmxt).
--ignore-eos Ignora il token di fine sequenza (EOS) e continua la generazione.
--temp, --temperature N Controlla la casualità dell'output (default: 0.80).
--top-k N Campionamento Top-K (0 = disabilitato).
--top-p N Campionamento Top-P / Nucleus (1.0 = disabilitato).
--min-p N Campionamento Min-P (0.0 = disabilitato).
--top-nsigma N Campionamento Top-N-Sigma (-1.0 = disabilitato).
--xtc-probability N Probabilità per l'algoritmo XTC (0.0 = disabilitato).
--xtc-threshold N Soglia per l'algoritmo XTC (1.0 = disabilitato).
--typical, --typical-p N Campionamento Locally Typical, parametro p (1.0 = disabilitato).
--repeat-last-n N Ultimi $N$ token da considerare per l'applicazione delle penalità (default: 64).
--repeat-penalty N Penalità per la sequenza di token ripetuti (1.0 = disabilitato).
--presence-penalty N Penalità di presenza per la ripetizione dei token (0.0 = disabilitato).
--frequency-penalty N Penalità di frequenza per la ripetizione dei token (0.0 = disabilitato).

Algoritmo DRY (Don't Repeat Yourself)

Parametro Descrizione
--dry-multiplier N Moltiplicatore per il campionamento DRY (0.0 = disabilitato).
--dry-base N Valore base del campionamento DRY (default: 1.75).
--dry-allowed-length N Lunghezza massima di sequenza consentita prima che scatti la penalità DRY.
--dry-penalty-last-n N Numero di token recenti a cui applicare la penalità DRY (0 = disabilita).
--dry-sequence-breaker STRING Stringa per resettare il controllo del DRY (sostituisce i breaker di default \n, :, ", *).

Campionatori Avanzati

Parametro Descrizione
--adaptive-target N Adaptive-P: seleziona i token prossimi a questa probabilità (0.0 a 1.0).
--adaptive-decay N Adaptive-P: tasso di decadimento per l'adattamento del target nel tempo (0.0 a 0.99).
--dynatemp-range N Intervallo per la temperatura dinamica (0.0 = disabilitato).
--dynatemp-exp N Esponente per il calcolo della temperatura dinamica (default: 1.00).
--mirostat N Attiva il campionamento Mirostat (0 = disattivato, 1 = Mirostat, 2 = Mirostat 2.0).
--mirostat-lr N Tasso di apprendimento per Mirostat (parametro eta).
--mirostat-ent N Entropia target per Mirostat (parametro tau).
-l, --logit-bias TOKEN_ID(+/-)BIAS Modifica manualmente la probabilità di comparsa di uno specifico token.

Vincoli Strutturati e Backend

Parametro Descrizione
--grammar GRAMMAR Grammatica in formato tipo BNF per vincolare la generazione del testo.
--grammar-file FNAME File contenente la grammatica da applicare.
-j, --json-schema SCHEMA Schema JSON da applicare come vincolo alla generazione.
-jf, --json-schema-file FILE File contenente uno schema JSON da applicare come vincolo.
-bs, --backend-sampling Delega le operazioni di campionamento al backend hardware (sperimentale).

3. Speculative Params (Decodifica Speculativa)

Configurazione Modello Draft e Hardware

Parametro Descrizione
--spec-draft-hf ... Repository Hugging Face da cui scaricare il modello draft.
--spec-draft-threads N Thread CPU da usare durante la generazione del modello draft.
--spec-draft-threads-batch N Thread CPU per il batch processing del modello draft.
--spec-draft-cpu-mask M Maschera CPU di affinità per il modello draft.
--spec-draft-cpu-range lo-hi Intervallo di CPU per l'affinità del modello draft.
--spec-draft-cpu-strict <0|1> Posizionamento rigido delle CPU per il modello draft.
--spec-draft-prio N Priorità del processo/thread del modello draft (0-3).
--spec-draft-poll <0|1> Polling per l'attesa del lavoro del modello draft.
--spec-draft-cpu-mask-batch M Maschera CPU batch per il modello draft.
--spec-draft-cpu-strict-batch <0|1> Posizionamento rigido CPU batch per il modello draft.
--spec-draft-prio-batch N Priorità processore per la fase batch del draft.
--spec-draft-poll-batch <0|1> Polling per l'attesa del lavoro batch del draft.
--spec-draft-override-tensor ... Sovrascrive il buffer di un tensore per il modello draft.
--spec-draft-cpu-moe Mantiene tutti i pesi MoE del modello draft sulla CPU.
--spec-draft-n-cpu-moe N Mantiene i pesi MoE dei primi $N$ layer del draft sulla CPU.
--spec-draft-device ... Dispositivi/GPU da usare per l'offloading del modello draft.
--spec-draft-ngl N Numero massimo di layer del modello draft da salvare in VRAM.
--spec-draft-model FNAME Percorso del file del modello draft per il campionamento speculativo.

Parametri di Algoritmo Speculativo

Parametro Descrizione
--spec-draft-n-max N Numero massimo di token da proporre ad ogni passo (default: 3).
--spec-draft-n-min N Numero minimo di token draft da utilizzare (default: 0).
--spec-draft-p-split P Probabilità di split nella decodifica speculativa (default: 0.10).
--spec-draft-p-min P Probabilità minima per accettare la proposta speculativa (default: 0.00).
--spec-draft-backend-sampling Attiva o disattiva l'offload del campionamento draft sul backend hardware.
--spec-type ... Tipi di decodifica speculativa da attivare (es. draft-simple, ngram-simple, ngram-map-k, draft-eagle3).

Parametri N-Gram Speculativi

Parametro Descrizione
--spec-ngram-mod-n-min N Numero minimo di token per la decodifica speculativa basata su N-Grammi (default: 48).
--spec-ngram-mod-n-max N Numero massimo di token per la decodifica speculativa basata su N-Grammi (default: 64).
--spec-ngram-mod-n-match N Lunghezza di ricerca dell'algoritmo ngram-mod (default: 24).
--spec-ngram-simple-size-n N Lunghezza dell'N-gramma di ricerca per ngram-simple (default: 12).
--spec-ngram-simple-size-m N Lunghezza dell'M-gramma bozza per ngram-simple (default: 48).
--spec-ngram-simple-min-hits N Numero minimo di match richiesti per ngram-simple (default: 1).
--spec-ngram-map-k-size-n N Lunghezza dell'N-gramma di ricerca per ngram-map-k (default: 12).
--spec-ngram-map-k-size-m N Lunghezza dell'M-gramma bozza per ngram-map-k (default: 48).
--spec-ngram-map-k-min-hits N Numero minimo di match richiesti per ngram-map-k (default: 1).
--spec-ngram-map-k4v-size-n N Lunghezza dell'N-gramma di ricerca per ngram-map-k4v (default: 12).
--spec-ngram-map-k4v-size-m N Lunghezza dell'M-gramma bozza per ngram-map-k4v (default: 48).
--spec-ngram-map-k4v-min-hits N Numero minimo di match richiesti per ngram-map-k4v (default: 1).

Comandi Rimosso / Deprecati

Parametro Obsoleto Sostituto Consigliato
--draft, --draft-n, --draft-max --spec-draft-n-max oppure --spec-ngram-mod-n-max
--draft-min, --draft-n-min --spec-draft-n-min oppure --spec-ngram-mod-n-min
--spec-ngram-size-n Opzioni specifiche --spec-ngram-*-size-n o --spec-ngram-mod-n-match
--spec-ngram-size-m Opzioni specifiche --spec-ngram-*-size-m
--spec-ngram-min-hits Opzioni specifiche --spec-ngram-*-min-hits

4. Example-Specific Params (Parametri del Server)

Parametro Descrizione
-lcs, --lookup-cache-static FNAME Percorso della cache di ricerca statica per la decodifica speculativa senza modello (non aggiornata durante la generazione).
-lcd, --lookup-cache-dynamic FNAME Percorso della cache di ricerca dinamica (aggiornata in tempo reale durante la generazione del testo).
-ctxcp, --ctx-checkpoints, --swa-checkpoints N Numero massimo di punti di ripristino (checkpoint) del contesto creati per ogni slot di sessione utente (default: 32).