Fai girare l’IA in locale sul tuo portatile: il tuo primo servizio IA personale

Un portatile risponde a una domanda senza alcuna connessione a internet. Poi, senza che tu debba modificare nulla, una seconda app sullo stesso computer invia al portatile la stessa identica domanda e riceve una risposta. È questo secondo passaggio a rendere il portatile che già usi un piccolo servizio IA personale a cui altre app e script possono inviare richieste.

Qui eseguiamo un modello scaricato, non ne addestriamo uno. Se non hai ancora verificato che il tuo portatile abbia RAM o VRAM sufficienti per eseguire il modello, leggi prima quanta RAM serve al portatile per l’IA in locale. Se sai già che ha i requisiti, prosegui.

I quattro livelli di ogni configurazione IA in locale

Ogni configurazione IA in locale comprende quattro livelli distinti. Sapere a cosa serve ciascuno ti aiuta a seguire i passaggi della guida.

I pesi del modello sono contenuti nel file che scarichi, per esempio una versione quantizzata da 3,4 GB di un modello piccolo. Quella cifra indica lo spazio occupato dal file sul disco, non quanta RAM serve mentre il modello è in esecuzione.

Il motore di inferenza è il programma che carica i pesi del modello e risponde alle richieste. Qui usiamo Ollama, che con la propria API HTTP locale permette al portatile di rispondere anche alle richieste di altre app.

L’interfaccia invia la richiesta: può essere la chat integrata di Ollama, un breve script o un’app separata. La scelta dell’interfaccia determina se il prompt resta sul portatile o viene inviato altrove.

Un indice dei documenti facoltativo permette a un modello per la chat di cercare nei tuoi file, usando un modello separato per gli embedding e uno spazio di archiviazione dedicato. L’indice non si crea automaticamente e non ne parleremo qui.

In sintesi, un’app o uno script invia una richiesta a Ollama all’indirizzo 127.0.0.1:11434; il motore carica il modello che hai scaricato. La cronologia delle chat salvata dall’interfaccia non si cancella se elimini quel modello: è archiviata separatamente.

Prima dell’installazione, confronta il tuo portatile con questi due modelli

Prima di installare qualsiasi cosa, prenditi due minuti per annotare le caratteristiche del tuo portatile: quanta RAM ha, il sistema operativo, il processore, la quantità di memoria grafica dedicata (VRAM), se presente, e lo spazio libero sull’SSD. Per capire nel dettaglio quanta RAM e VRAM servono per l’IA in locale, leggi quanta RAM serve al portatile per l’IA in locale.

I due portatili qui sotto sono attualmente disponibili su refurbed: sono stati controllati, puliti e ricondizionati da professionisti e sono coperti da una garanzia di 12 mesi. Il primo è un Mac di fascia d’ingresso con Apple Silicon; il secondo è un portatile Windows con memoria grafica dedicata. Con entrambi puoi seguire tutti i passaggi della guida.

Installare Ollama su macOS, Windows e Linux

Su macOS o Windows, installa l’app ufficiale di Ollama; su Linux, segui le istruzioni di installazione. Al termine, avvia Ollama; su Linux, se non c’è già un server in ascolto, esegui ollama serve.

L’app, nella versione attuale, offre sia l’uso in locale sia opzioni cloud. Scegli il tag di un modello locale da scaricare: per usarlo sul tuo portatile non devi effettuare l’accesso.

Per seguire la guida, scarica il modello con il tag esatto qwen3.5:4b-q4_K_M: il download è di 3,4 GB. Usa proprio quel tag: uno generico come «latest» può indicare, senza alcun avviso, un modello molto più grande di quello che hai provato. Quei 3,4 GB indicano lo spazio occupato dal download sul disco, non quanta RAM servirà al modello per rispondere alle richieste.

Scarica il tuo primo modello e avvia una chat

Per iniziare a chattare con il modello bastano due comandi:

ollama pull qwen3.5:4b-q4_K_M

ollama run qwen3.5:4b-q4_K_M

Il primo scarica il modello; il secondo apre una chat interattiva. Non fermarti a un saluto generico: affidagli un compito piccolo ma concreto, per esempio: «Trasforma queste tre note di riunione in un elenco di attività. Non inventare date.»

Quando hai finito, digita /bye per uscire dalla chat.

Chiama l’API: l’IA gira in locale sul tuo portatile

Nella chat del terminale, l’interfaccia invia le richieste al motore. Ora puoi chiamare direttamente lo stesso motore, come farebbe un’altra app.

Su macOS o Linux:

curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Definisci l’inferenza locale in una frase."}],"stream":false,"options":{"num_ctx":4096}}'

Su Windows, in PowerShell:

Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"Definisci l’inferenza locale in una frase."}],"stream":false,"options":{"num_ctx":4096}}'

Nella risposta, cerca message.content. Se imposti stream su false, ricevi la risposta completa in una volta sola, anziché a pezzi. Con num_ctx: 4096, il contesto di questo primo test resta ben al di sotto del limite massimo dichiarato per il modello.

La risposta mostra anche i tempi di elaborazione

Oltre al testo in message.content, Ollama restituisce anche dati utili sui tempi e sul numero di token: load_duration, prompt_eval_count, prompt_eval_duration, eval_count ed eval_duration.

Letti insieme, questi dati ti permettono di distinguere il tempo di caricamento del modello in memoria da quello di generazione della risposta. Un solo valore espresso in «token al secondo», invece, mette insieme i due tempi. Di solito la prima richiesta dopo l’avvio di Ollama è la più lenta: comprende il caricamento del modello, che non va ripetuto per la richiesta successiva.

Qui non indichiamo valori tipici: quelli esatti dipendono interamente dal tuo portatile. Confronta questi dati in due prove sullo stesso computer, anziché fidarti di un’unica cifra sulla velocità.

Controlla i modelli con ps e ls: Ollama li rimuove dalla memoria dopo l’inattività

Ti bastano tre comandi: due per vedere quali modelli sono caricati o scaricati, uno per eliminare un modello che non ti serve più.

ollama ps mostra i modelli caricati in quel momento e dove vengono eseguiti: nella colonna del processore leggi 100% GPU, 100% CPU oppure una ripartizione tra le due.

ollama ls elenca tutti i modelli che hai scaricato.

ollama rm qwen3.5:4b-q4_K_M elimina il modello scaricato che non ti serve più.

Per impostazione predefinita, Ollama rimuove un modello dalla memoria dopo cinque minuti di inattività. Se ollama ps non mostra modelli caricati, invia un’altra richiesta prima di pensare che qualcosa non funzioni.

Collega una seconda app all’API locale compatibile con OpenAI

Ora il portatile può rispondere anche alle richieste di una seconda app, oltre che a quelle della chat usata finora: basta configurare l’app perché si colleghi al tuo computer anziché a un servizio cloud.

La maggior parte delle app che permettono di impostare un endpoint personalizzato compatibile con OpenAI chiede tre dati: l’URL di base, il nome del modello e una chiave API. Imposta http://localhost:11434/v1/ come URL di base e qwen3.5:4b-q4_K_M come nome del modello.

Il campo della chiave API può confondere: alcune app non accettano che resti vuoto. Per questo la documentazione di Ollama usa il segnaposto api_key='ollama' e chiarisce che il server locale richiede un valore non vuoto, ma ignora quello che inserisci. Quella stringa non autentica nulla: serve a compilare il campo, non è una password.

La compatibilità, però, riguarda solo alcune funzioni di ciascuna API. Se vuoi inviare immagini o usare strumenti, prova la funzione che ti interessa con la tua app: non dare per scontato che tutto funzioni.

La prova dell’IA in locale: ripeti la richiesta senza connessione

Finora, almeno in teoria, qualche richiesta potrebbe essere stata inviata via internet senza che tu te ne accorgessi. Per escluderlo, fai questa prova.

Dopo aver scaricato il modello, disattiva il Wi-Fi del portatile o scollega il cavo di rete. Ripeti la stessa richiesta di prima nella chat o tramite l’API: se ottieni una risposta vera e propria senza alcuna connessione, hai la prova che il modello gira in locale.

Non valgono come prova una risposta che ottieni solo quando sei online, una che arriva da https://ollama.com anziché da localhost o l’uso del tag di un modello cloud invece di uno scaricato. Con Ollama, le richieste a un modello locale restano sul tuo computer; quelle ai modelli cloud separati passano invece per server remoti.

IA offline e privacy: le precauzioni per proteggere la tua configurazione

La privacy di questa configurazione non è frutto del caso: vale la pena capire cosa ti protegge e cosa no.

Per impostazione predefinita, Ollama accetta connessioni solo dal tuo portatile, all’indirizzo 127.0.0.1:11434. Mantieni questa impostazione: non impostare OLLAMA_HOST=0.0.0.0 né inoltrare la porta 11434 verso internet. La chiave API segnaposto citata nella sezione precedente non viene verificata: esporre quella porta significa rendere il servizio accessibile senza autenticazione.

Disattivare del tutto le funzioni cloud di Ollama è facoltativo: se usi il tag di un modello locale già scaricato, l’esecuzione avviene comunque sul tuo portatile. Per disattivarle, aggiungi {"disable_ollama_cloud": true} a ~/.ollama/server.json oppure imposta OLLAMA_NO_CLOUD=1. In entrambi i casi, riavvia Ollama perché la modifica abbia effetto.

Collegarti al servizio da un’altra stanza o da un altro dispositivo richiede una configurazione più avanzata: una rete privata e un proxy che richieda l’autenticazione prima di inoltrare le richieste a Ollama. Non spieghiamo qui come farlo; esporre direttamente la porta non è la soluzione.

Se qualcosa non funziona

Ecco i problemi più comuni e i primi controlli da fare.

Connessione rifiutata. Verifica che l’app Ollama o ollama serve sia in esecuzione, poi riprova.

La prima risposta è lenta, le successive più rapide. Il tempo in più dipende dal caricamento del modello, non dalla velocità di generazione. Controlla le metriche della risposta già descritte per distinguere i due tempi.

Tutto sembra molto più lento del previsto. Esegui ollama ps: potrebbe indicare che il modello viene eseguito solo sulla CPU oppure che il carico è ripartito tra CPU e GPU. Controlla se Ollama supporta la tua GPU e i relativi driver sul sistema operativo che usi.

Poca memoria disponibile o arresti improvvisi. Scegli il tag di un modello più piccolo, riduci num_ctx e chiudi le altre app che occupano molta memoria prima di riprovare.

Il disco si riempie. Esegui ollama ls per vedere quali modelli hai scaricato, poi elimina quelli che non usi con ollama rm.

Se questo approccio non fa per te, per esempio perché vuoi esplorare i modelli con un’interfaccia grafica o gestire con più precisione l’uso di CPU e GPU, dai un’occhiata a LM Studio e llama.cpp. Sono motivi per cambiare motore, non per usare due configurazioni in parallelo.

IA in locale sul portatile: domande frequenti

Dopo la configurazione serve ancora internet? No. Una volta scaricato il modello, puoi usarlo in chat e tramite la sua API senza alcuna connessione a internet.

La chiave API usata come segnaposto protegge l’endpoint? No. Il server locale di Ollama accetta qualsiasi valore non vuoto senza verificarne il contenuto: la chiave richiesta da alcune app non è una misura di sicurezza.

Quello che scrivi resta sul portatile? Sì, se scegli il tag di un modello locale già scaricato. Ollama offre anche modelli cloud separati, eseguiti su server esterni: è il tag che scegli a determinare se il prompt resta sul portatile, non un’impostazione predefinita nascosta.

Serve una scheda grafica dedicata? No. Anche un portatile che usa solo la CPU può eseguire un modello piccolo, in genere più lentamente. Con ollama ps vedi con precisione se, per una determinata richiesta, il modello ha usato la CPU, la GPU o entrambe.

Vuoi usare un modello più grande o diverso? Controlla prima quanta RAM e VRAM hai, poi sostituisci il tag nei comandi ollama pull e ollama run. Per capire nel dettaglio quanta memoria serve, leggi quanta RAM serve al portatile per l’IA in locale.

Da ora il modello ricorderà i tuoi documenti? No. Un modello per la chat non memorizza da solo e in modo permanente i file di una cartella. Per cercare tra i tuoi documenti serve un indice separato: è una configurazione facoltativa che qui non trattiamo.

Ora tocca a te: metti al lavoro il tuo servizio IA personale

Scegli un compito concreto e affidalo sia alla chat integrata sia alla seconda app che hai appena collegato. Per esempio, puoi chiedere di riassumere un appunto personale, di suddividere una serie di file in gruppi con un’etichetta ciascuno o di spiegarti in parole semplici un breve frammento di codice.

Qualunque compito tu scelga, annota il tag esatto del modello, la versione del motore, l’impostazione del contesto, l’URL e ciò che hai chiesto di fare. Così il risultato sarà riproducibile anche in futuro, da te o da chiunque voglia fare la stessa prova.

Se hai scoperto che il tuo portatile non ha RAM o VRAM sufficienti per questa configurazione, vale la pena considerare il passaggio a uno con più memoria a disposizione. Nel prossimo articolo della serie vedremo come mettere insieme un piccolo kit di modelli: uno per la chat, uno per il codice e uno per la ricerca.

Portatile ricondizionato adatto a eseguire modelli IA in locale, disponibile su refurbed

Iscriviti per la prima volta alla nostra newsletter e ottieni 15€ di sconto!

Non farti più scappare le migliori offerte.

Per maggiori informazioni sull’uso dei dati personali, visita la nostra Normativa sulla privacy.