Salta al contenuto
geekandhackGH

AI & Agenti · dal video

Ollama sul PC: installazione, prove reali e Decision Models

Installiamo Ollama da zero su un PC normale, lo proviamo in chat e codice, poi testiamo i Decision Models: risposte in JSON in meno di un secondo, senza cloud.

Di Manu · Pubblicato il · Aggiornato il

Video collegato

Ollama cambia: proviamo i nuovi Decision Models sul PC →

In questo video installiamo Ollama su un PC e proviamo chat, codice e Decision Models. Dopo aver scaricato software e modelli, una configurazione locale può eseguire l'inferenza offline; telemetria e comportamento degli altri componenti dipendono dal sistema usato.

Installare Ollama da zero

Si parte da ollama.com/download: scegli il comando per la tua piattaforma, incollalo nel terminale o in PowerShell e parte l'installazione. Dopo aver scaricato software e modello, il prompt può essere elaborato dal modello sul computer senza inviarlo al provider cloud. Questo non verifica la telemetria del sistema operativo, delle estensioni o degli altri servizi eventualmente configurati.

ollama run <modello-da-6-12B>

Il modello deve entrare nella tua VRAM e nella tua RAM, quindi niente giganti: il consiglio del video è restare tra 6 e 12 miliardi di parametri e crescere solo finché l'hardware regge il compromesso.

Le prove reali: chat, codice, benchmark

Una volta scaricato il modello si passa alle prove pratiche: conversazione in chat, generazione di codice Python e un benchmark per capire cosa può fare davvero il modello in locale, incluso il confronto onesto con il cloud.

I Decision Models: Nimble e Tev1

Prima, per far decidere un modello, dovevi chiedergli in chat e lui rispondeva con un sì, un no o un elenco di ipotesi: un disastro quando un'automazione doveva ricevere la risposta e compilare campi o funzioni. I Decision Models nascono per questo: Nimble da 9 miliardi di parametri o Tev1, sotto il miliardo di parametri, tanto leggero da girare su qualsiasi dispositivo, anche edge.

Nel test mostrato Manu invia all'endpoint systemone un ticket già preparato in JSON e riceve score sulle alternative; il workflow può poi classificarle con regole deterministiche. È il risultato della prova registrata nel video, non una garanzia di latenza, formato o assenza di errori per ogni modello e input.

curl http://localhost:11434/v1/systemone \
  -H "Content-Type: application/json" \
  -d @ticket.json

I 3 errori che fanno tutti

  • Scaricare il modello più grosso sperando che entri in memoria: il PC si inginocchia. Parti piccolo e cresci fino al compromesso accettabile.
  • Pretendere contesto infinito con 8 GB di RAM: niente contesti da un milione di token come sul cloud.
  • Chiedere a un Decision Model di ragionare e scriverti un testo: strumento giusto per il compito giusto.

Il limite onesto: la memoria

Ollama oggi basta per chattare, scrivere codice e — da qualche giorno — per scegliere e decidere in meno di un secondo. Ma non basta per avere memoria: niente codice lunghissimo, piattaforme agentiche o siti con un singolo prompt dopo la sola installazione. Nella prossima puntata della serie: memoria con RooCode e Qdrant, poi IDE, OpenCode, RAG, skill, MCP e flussi agentici.