ollama e modelli hugging face

Aggiornato 2026-09-18 •Italiano •
Scarica PDF
In questa pagina

Ollama e modelli Hugging Face: installazione, download e test

Passi pratici per installare la CLI hf, scaricare i modelli GGUF, creare un Modelfile e testare velocità e modelli installati. Ambiente Linux con NVIDIA.

1. Installare la CLI Hugging Face (hf)

Se hf non è ancora presente:

curl -LsSf https://hf.co/cli/install.sh | bash

2. Vedere le dimensioni di un modello PRIMA di scaricarlo

Tecnica --dry-run: mostra i file e le dimensioni senza scaricare nulla.

# Elenca tutto il contenuto del repo
hf download \
  unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \
  --include "*.gguf" \
  --exclude "BF16/*" \
  --dry-run

# Forma corta equivalente
hf download \
  unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF --dry-run

# Un altro modello di esempio
hf download \
  llmfan46/gemma-4-26B-A4B-it-ultra-uncensored-heretic-GGUF --dry-run

3. Scaricare un singolo file GGUF in una cartella locale

# modalità ad alte prestazioni xet
export HF_XET_HIGH_PERFORMANCE=1

hf download \
  unsloth/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-GGUF \
  NVIDIA-Nemotron-3.5-Lightning-30B-A3B-MXFP4_MOE.gguf \
  --local-dir /localIA/llamacpp/models/Nemotron-3.5-Lightning-30B-A3B_MXFP4
# esempio Gemma 4 26B it qat
mkdir -p /localIA/llamacpp/models/gemma4-26b-a4b-qat

HF_XET_HIGH_PERFORMANCE=1 hf download \
  unsloth/gemma-4-26B-A4B-it-qat-GGUF \
  gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf \
  --local-dir /localIA/llamacpp/models/gemma4-26b-a4b-qat

4. Creare un modello Ollama da un GGUF locale (Modelfile)

Crea il file Modelfile puntando alla cartella di download:

FROM /localIA/llamacpp/models/gemma4-26b-a4b-qat/gemma-4-26B-A4B-it-qat-UD-Q4_K_XL.gguf

PARAMETER num_ctx 8192
PARAMETER num_batch 2048
PARAMETER num_predict 4096

Registra il modello in Ollama:

ollama create gemma4-q4xl-local \
  -f /localIA/llamacpp/models/gemma4-26b-a4b-qat/Modelfile.ollama

5. Misurare la velocità di un modello

ollama run qwen3.6:35b-a3b --verbose

6. Usare llama-server in alternativa a Ollama

Installazione CLI llama.cpp:

curl -LsSf https://llama.app/install.sh | sh
llama --version
llama serve --list-devices

Per fermare Ollama e lasciare la GPU a llama-server:

sudo systemctl stop ollama
systemctl is-active ollama     # atteso: inactive
nvidia-smi                     # la GPU deve risultare libera

Esempio di avvio di llama serve con un GGUF locale:

FABLE_GGUF="/localIA/ollama_models/qwen36-fable/Qwen3.6-27B-Fable-Fus-711-UnHeretic-NM-DAU-NEO-MAX-NEO-Q4_K_M.gguf"

llama serve \
  -m "$FABLE_GGUF" \
  --no-mmproj \
  --host 0.0.0.0 \
  --port 8080 \
  --ctx-size 8192 \
  --parallel 1 \
  --flash-attn on \
  --cache-type-k q8_0 \
  --cache-type-v q8_0 \
  --fit on \
  --fit-target 1024 \
  --batch-size 2048 \
  --ubatch-size 512 \
  --reasoning off \
  --jinja \
  --perf

7. Tabella di confronto modelli (riferimento)

# Modello Active Dimensione Note
1 Qwen3.6-28B REAP ~3B 17,3 GB Baseline attuale
2 Gemma 4 26B-A4B-it 4B 17,0 GB Miglior candidato non-Qwen
3 GLM-4.7-Flash 30B-A3B 3B 18,5 GB Ragionamento e coding
4 Qwen3.6-35B-A3B completo 3B 22,3 GB Probabile tetto qualitativo
5 GPT-OSS-20B 3,6B 12,1 GB Riferimento di velocità
6 Nemotron 3.5 Lightning 30B-A3B 3B 25,5 GB Esperimento più pesante

8. Verificare i modelli installati (e le loro capacità)

ollama list | awk 'NR > 1 {print $1}' |
while read -r model; do
  printf '%-25s ' "$model"
  ollama show "$model" |
    awk '/Capabilities/{p=1; next} p && NF==0{exit} p{printf "%s ", $1} END{print ""}'
done

9. Vedere il Modelfile di un modello

ollama list
ollama show qwen3.8:27b --modelfile