AI & Agenti · dal video
Ollama sul PC: installazione, prove reali e Decision Models
Installiamo Ollama da zero su un PC normale, lo proviamo in chat e codice, poi testiamo i Decision Models: risposte in JSON in meno di un secondo, senza cloud.
Di Manu · Pubblicato il · Aggiornato il

Ollama cambia: proviamo i nuovi Decision Models sul PC →
In questo video installiamo Ollama su un PC e proviamo chat, codice e Decision Models. Dopo aver scaricato software e modelli, una configurazione locale può eseguire l'inferenza offline; telemetria e comportamento degli altri componenti dipendono dal sistema usato.
Installare Ollama da zero
Si parte da ollama.com/download: scegli il comando per la tua piattaforma, incollalo nel terminale o in PowerShell e parte l'installazione. Dopo aver scaricato software e modello, il prompt può essere elaborato dal modello sul computer senza inviarlo al provider cloud. Questo non verifica la telemetria del sistema operativo, delle estensioni o degli altri servizi eventualmente configurati.
ollama run <modello-da-6-12B>Il modello deve entrare nella tua VRAM e nella tua RAM, quindi niente giganti: il consiglio del video è restare tra 6 e 12 miliardi di parametri e crescere solo finché l'hardware regge il compromesso.
Le prove reali: chat, codice, benchmark
Una volta scaricato il modello si passa alle prove pratiche: conversazione in chat, generazione di codice Python e un benchmark per capire cosa può fare davvero il modello in locale, incluso il confronto onesto con il cloud.
I Decision Models: Nimble e Tev1
Prima, per far decidere un modello, dovevi chiedergli in chat e lui rispondeva con un sì, un no o un elenco di ipotesi: un disastro quando un'automazione doveva ricevere la risposta e compilare campi o funzioni. I Decision Models nascono per questo: Nimble da 9 miliardi di parametri o Tev1, sotto il miliardo di parametri, tanto leggero da girare su qualsiasi dispositivo, anche edge.
Nel test mostrato Manu invia all'endpoint systemone un ticket già preparato in JSON e riceve score sulle alternative; il workflow può poi classificarle con regole deterministiche. È il risultato della prova registrata nel video, non una garanzia di latenza, formato o assenza di errori per ogni modello e input.
curl http://localhost:11434/v1/systemone \
-H "Content-Type: application/json" \
-d @ticket.jsonI 3 errori che fanno tutti
- Scaricare il modello più grosso sperando che entri in memoria: il PC si inginocchia. Parti piccolo e cresci fino al compromesso accettabile.
- Pretendere contesto infinito con 8 GB di RAM: niente contesti da un milione di token come sul cloud.
- Chiedere a un Decision Model di ragionare e scriverti un testo: strumento giusto per il compito giusto.
Il limite onesto: la memoria
Ollama oggi basta per chattare, scrivere codice e — da qualche giorno — per scegliere e decidere in meno di un secondo. Ma non basta per avere memoria: niente codice lunghissimo, piattaforme agentiche o siti con un singolo prompt dopo la sola installazione. Nella prossima puntata della serie: memoria con RooCode e Qdrant, poi IDE, OpenCode, RAG, skill, MCP e flussi agentici.