Salta al contenuto
geekandhackGH

AI & Agenti · dal video

Ollama sul PC: come lo installo e lo uso io (guida pratica)

Ti porto passo passo a installare Ollama sul tuo PC come faccio io: download, verifica, scelta del modello, prima chat e limiti onesti di RAM e GPU.

Di Manu · Pubblicato il

Video collegato

Ollama cambia: proviamo i nuovi Decision Models sul PC →

Ti dico subito come la penso io: Ollama sul PC ha senso quando vuoi un modello sempre pronto, senza abbonamenti e senza mandare i tuoi prompt in giro. Io lo uso per provare idee, farmi aiutare col codice e testare i Decision Models. Ma ti dico anche l'altra faccia: se il tuo PC ha poca RAM o una GPU datata, devi scegliere modelli piccoli, altrimenti diventa tutto lento. In questa guida ti porto passo passo dal download alla prima chat, con i controlli che faccio io ogni volta.

Scarica, installa e verifica

Io parto sempre dal sito ufficiale di Ollama e scarico la versione per il mio sistema. Su Windows eseguo l'installer e poi apro un terminale nuovo — questo passaggio sembra banale, ma se usi un terminale già aperto le variabili d'ambiente potrebbero non essere aggiornate. Poi lancio il comando di versione per verificare che tutto funzioni. Se vedi il numero di versione, sei a posto; se vedi un errore, chiudi e riapri il terminale prima di impazzire con altre soluzioni.

ollama --version

Scaricare il primo modello senza sbagliare taglia

L'errore che ho fatto io la prima volta? Scaricare il modello più grosso sperando che entrasse in memoria. Il PC si è inginocchiato. Ora ragiono così: guardo quanta RAM e VRAM ho davvero libere, parto da un modello da 6-12 miliardi di parametri e salgo solo se il compromesso velocità-qualità regge. Un modello piccolo che gira fluido ti serve più di un gigante che si pianta.

La prima chat e il primo test di codice

Io faccio sempre due prove: una conversazione normale per capire se il modello segue le istruzioni in italiano, e una richiesta di codice semplice — ad esempio una funzione Python — per vedere se produce qualcosa di eseguibile. Se il modello farnetica o tronca, prima di cambiare modello provo a semplificare il prompt: spesso il problema è la mia richiesta, non il modello.

GPU, CPU e aspettative oneste

Ti dico onestamente come stanno le cose sul mio banco di prova: con una GPU discreta i modelli medi girano bene, con sola CPU integrata devi avere pazienza o restare su modelli piccoli. La velocità dipende da modello, quantizzazione, lunghezza del contesto e hardware — non esiste un numero valido per tutti. Se qualcuno ti promette prestazioni senza dirti hardware e modello esatti, non fidarti.

Quando Ollama non basta (e cosa uso al suo posto)

Ollama oggi mi basta per chattare, scrivere codice e far decidere i Decision Models. Ma non basta per avere memoria tra sessioni o per orchestrare un intero progetto software: per quello uso RooCode con LM Studio e Qdrant, di cui ti parlo nelle guide sul coding agentico. Strumento giusto per il compito giusto, sempre.

I 3 errori che vedo fare a tutti

  • Scaricare il modello più grosso sperando che entri in memoria: parti piccolo e cresci solo se regge.
  • Pretendere contesto infinito con 8 GB di RAM: i contesti enormi del cloud non girano su un PC normale.
  • Chiedere a un Decision Model di ragionare come un chatbot: i Decision Models servono a decidere in JSON, non a chiacchierare.

Fonti ufficiali e approfondimenti

Fonte: Documentazione ufficiale di Ollama

Fonte: Guida correlata: Decision Models sul PC