Un modello di IA compatto che funziona sul tuo portatile può già interpretare testi e immagini e rispondere alle tue domande, senza bisogno di un account cloud. Stasera scarica qwen3.5:4b-q4_K_M (Qwen), un file da 3,4 GB: il modello può fare esattamente questo su un normale portatile con 16 GB di RAM. È un LLM, o modello linguistico di grandi dimensioni. Lo scarichi con Ollama, gli fai una domanda con un contesto 4K e stai già eseguendo un vero modello IA localmente, sull’hardware che hai già. Legge testo e immagini, e qui si parla di inferenza, non di training: nessuno sta insegnando nulla di nuovo al modello, sta solo rispondendo.
L’etichetta vaga "AI PC" sulla scatola di un laptop non è una specifica. Le specifiche vere sono RAM, memoria che la GPU può usare, spazio di archiviazione e supporto software reale. 16 GB di memoria sono un punto di partenza per i piccoli modelli IA, non una soglia minima da liquidare e nemmeno la promessa di tutto ciò che una scheda tecnica lascia intendere. Più memoria significa più contesto e più margine per il multitasking. Con 16 GB puoi iniziare.
La dimensione del download di un modello e la RAM che occupa mentre è in esecuzione sono due numeri diversi, e confonderli è l’errore più comune quando si cerca un laptop per l’IA. I 3,4 GB che scarichi per qwen3.5:4b-q4_K_M sono il file sul disco. Per caricarlo serve memoria reale. Serve memoria anche per la finestra di contesto, cioè la conversazione in corso che il modello tiene a mente mentre risponde, chiamata KV cache. E poi c’è il motore stesso, più tutto ciò che il sistema operativo e le altre app stanno già usando.
Ollama carica per impostazione predefinita un contesto da 4.096 token, e puoi aumentarlo. Se esegui più richieste insieme, la memoria necessaria per il contesto cresce, all’incirca in base al numero di richieste parallele. La scheda tecnica di un modello può indicare una finestra di contesto da 128K o 256K token: considerala il tetto massimo del modello, non la promessa che il tuo laptop da 16 GB possa permettersi di usarla tutta in una volta.
I chip Apple Silicon usano memoria unificata: CPU e GPU condividono lo stesso pool da 16, 24 o 32 GB, quindi non c’è una memoria grafica separata che può esaurirsi. Un tipico laptop Windows o Linux con GPU NVIDIA dedicata funziona in modo diverso. La RAM di sistema e la VRAM della GPU sono due pool separati, e 16 GB di RAM di sistema più una GPU da 8 GB non formano un unico pool da 24 GB che il modello può usare liberamente.
Quando un modello non entra interamente nella GPU, una parte gira sulla CPU, con un offload parziale che può renderlo tecnicamente avviabile ma sensibilmente più lento. Se lanci , vedi esattamente come si divide tra CPU e GPU qualsiasi modello caricato in quel momento.
La capacità è solo metà della storia. Conta altrettanto anche la velocità con cui quella memoria si muove: Apple dichiara 153 GB/s di larghezza di banda della memoria sul MacBook Air M5, ed è proprio questa larghezza di banda, non solo la quantità, a spiegare perché la memoria unificata risponde con fluidità invece di limitarsi a essere appena sufficiente sulla carta.
La quantizzazione è il meccanismo dietro a quel download da 3,4 GB: memorizzare i pesi del modello con una precisione numerica più bassa riduce le dimensioni del file, e lo stesso modello Qwen3.5 da 9B lo mostra bene. Lo stesso modello da 9B pesa 6,6 GB in download come Q4_K_M, 11 GB come Q8_0 e 19 GB alla precisione piena BF16. Stesso modello, stesso numero di parametri, tre dimensioni di download molto diverse e, ancora una volta, si parla della dimensione del download, non della RAM richiesta durante l’esecuzione.
Una precisione più bassa in genere comporta qualche compromesso nella qualità, ma quanto incida dipende dal tipo di attività, non da una percentuale fissa. C’è poi un dettaglio concreto da sapere prima di scegliere Qwen come primo modello: alcuni utenti segnalano che la sua fase di "thinking" aggiunge un ritardo percepibile prima che arrivi la risposta, rispetto a modelli che rispondono in modo più diretto. Vale la pena provare entrambi gli approcci sui tuoi compiti reali, invece di dare per scontato che uno sia semplicemente migliore.
Se hai già un MacBook da 16 GB, parti con un modello da 2-4B in precisione Q4 e un contesto 4K, prima ancora di pensare a un acquisto. Potrebbe caricarsi anche un modello Q4 da 9B, o qualcosa come Gemma 4 12B QAT. Che succeda dipende da quante altre app sono aperte, da quanto contesto stai usando e da quanto il portatile si è già scaldato, quindi prendila come una prova che vale la pena fare, non come una garanzia.
Vuoi comprare apposta per questo? Il MacBook Air 13-inch with M5 chip arriva di serie con 16 GB di memoria unificata, configurabile fino a 32 GB. E prima di lasciarti tentare dallo schermo più grande come se fosse un vero upgrade, c’è un dettaglio da tenere a mente: il modello Air M5 da 15 pollici parte con le stesse identiche opzioni di memoria da 16, 24 e 32 GB e la stessa larghezza di banda di 153 GB/s del 13 pollici. Scegli la dimensione dello schermo per comodità, non perché pensi di guadagnare più margine per l’IA. Non succede.
Un laptop Windows o Linux da 16 GB senza GPU dedicata può comunque eseguire un piccolo modello. Ollama gira nativamente su Windows, quindi scarica un modello Q4 da 2-4B e provalo sulla CPU o sulla grafica integrata prima di spendere qualcosa. Aspettati più variabilità rispetto ad Apple Silicon: non esiste un numero fisso di token al secondo valido per ogni macchina, perché nessuno ha misurato tutte le configurazioni possibili.
Il Lenovo ThinkPad T14 G2 e l’HP EliteBook x360 1040 G7 montano entrambi 16 GB di RAM con grafica integrata, cioè esattamente questa fascia. C’è però una verifica che conviene fare subito, soprattutto su un modello ricondizionato meno recente come questi due: LM Studio richiede il supporto AVX2 su Windows x64, un set di istruzioni che non tutte le CPU più vecchie includono. Controlla che il tuo processore specifico lo supporti, prima di dare per scontato che qualsiasi laptop di questa categoria riesca a far girare lo strumento che hai scelto.
Le GPU NVIDIA per laptop condividono il nome con le schede desktop, ma quel nome dice meno di quanto sembri. La RTX 5060 Laptop GPU ha 8 GB di memoria GDDR7 e un intervallo di potenza dichiarato da 45 a 100 watt. La RTX 5070 Ti Laptop GPU ha 12 GB di GDDR7 e va da 60 a 115 watt. Un risultato online di una RTX 5070 Ti desktop non equivale a quello di una RTX 5070 Ti per laptop, qualunque cosa lasci intendere il nome.
Nello stesso nome si nasconde anche una seconda trappola. Due laptop possono montare entrambi una "RTX 5070 Ti Laptop GPU" e comportarsi comunque in modo diverso sotto carico prolungato: un telaio sottile e leggero e uno più spesso e pesante gestiscono il calore in modo diverso, e lo stesso nome della GPU non garantisce la stessa velocità reale quando le ventole girano da un po’. Controlla sempre il valore preciso della VRAM e la configurazione di potenza del portatile, non solo il nome della famiglia di GPU.
Se compri un laptop proprio per usare con regolarità l’IA locale, la fascia Apple da 24 a 32 GB di memoria unificata è quella più comoda: lascia un margine reale per un modello più grande, un contesto più lungo o semplicemente per tenere aperte altre app mentre lavori. Punta sui 32 GB se pensi di usarlo spesso e se il budget lo permette.
Il MacBook Pro 13-inch with M2 chip è un esempio concreto di ricondizionato già oltre la soglia iniziale dei 16 GB: abbina una CPU a 8 core e una GPU a 10 core a fino a 24 GB di memoria unificata. Il chip appartiene a una generazione precedente rispetto all’Air M5, quindi qui il riferimento resta il suo limite di 24 GB, non le opzioni separate da 24 e 32 GB del MacBook Air M5.
Per un acquisto Windows o Linux pensato intorno all’IA locale, cerca 32 GB di RAM di sistema insieme a una GPU NVIDIA dedicata per laptop con almeno 8 GB di VRAM propria, o 12 GB se sei disposto ad accettare un portatile un po’ più pesante o più costoso. 8 GB sono un obiettivo plausibile per modelli da 4-7B in precisione Q4 con un contesto moderato, ma non darli per margine automatico: anche il download da 6,6 GB di un modello Q4 da 9B può richiedere più dei soli 8 GB per girare con comodità, mentre 12 GB rendono molto più semplici le prove su questa fascia.
Il Dell Precision 7730 è un esempio concreto di ricondizionato che rende bene l’idea di fondo, anche se non monta esattamente i chip nuovi citati sopra: 32 GB di memoria di sistema si affiancano a una NVIDIA Quadro P3200 dedicata con 6 GB di VRAM propria, una GPU di generazione e categoria diversa rispetto alle attuali RTX 5060 e 5070 Ti Laptop GPU di NVIDIA, ma basata sullo stesso principio dei pool separati.
Il processore AMD Ryzen AI Max+ 395 supporta fino a 128 GB di memoria di sistema LPDDR5x, a seconda di come è configurato il laptop finale. È un’architettura della memoria diversa che vale la pena conoscere, ma con un limite concreto: nella lista di supporto Linux ROCm di Ollama questo chip compare, mentre nella lista ROCm per Windows al momento no.
Questo non è un motivo per scartare il chip a priori, ma per verificare con attenzione memoria installata, sistema operativo, backend GPU, driver e comportamento di Ollama sul laptop specifico prima di consigliarlo. Considera un portatile AMD ad alta memoria come un’architettura alternativa interessante da approfondire con cura, non come il primo acquisto predefinito per chi è alle prime armi con l’IA locale.
Ollama è il modo più semplice per far parlare un modello sul tuo computer: scarichi un modello, lo avvii e hai un server locale che risponde alle richieste, senza bisogno di un account cloud per un modello già scaricato. È lo strumento dietro a tutti gli esempi qui sopra.
LM Studio offre un’alternativa grafica con un proprio browser dei modelli e una finestra chat. Pubblica anche i suoi requisiti minimi: almeno 16 GB di RAM su Mac o Windows, supporto AVX2 richiesto su Windows x64 e 4 GB di VRAM dedicata consigliati su Windows. Configurare bene uno dei due meriterebbe una guida a parte.
Una cautela prima di fidarti di qualsiasi numero di velocità letto online: lo strumento ufficiale llama-bench separa la velocità di elaborazione del prompt da quella di generazione e mostra anche la variazione tra prove ripetute, invece di dare un solo valore. Un post su un forum che cita un unico numero di token al secondo raramente dice quale delle due misure ha rilevato, o quante volte è stato eseguito il test.
Prima di comprare o aggiornare un laptop proprio per l’IA locale, guarda i dettagli concreti, non il marketing.
Modello preciso della GPU e quantità di VRAM. Non basta il nome della famiglia GPU: serve la variante esatta del laptop e la sua dotazione di memoria, perché dietro lo stesso nome possono nascondersi quantità diverse di VRAM.
RAM saldata o aggiornabile. Alcuni laptop ti permettono di aggiungere memoria più avanti, molti modelli moderni sottili e leggeri no. È bene saperlo prima di acquistare.
Spazio libero su SSD. I download dei modelli vanno da meno di un gigabyte a ben oltre dieci, e una raccolta che cresce si fa sentire in fretta accanto agli altri file.
Comportamento termico sotto carico prolungato. Un modello che risponde a una sola domanda e un laptop che gestisce diverse richieste di fila sono due prove diverse: rumore delle ventole e throttling dopo prompt ripetuti raccontano più di una demo veloce.
Supporto di sistema operativo e driver. Controlla che la combinazione precisa tra backend GPU e sistema operativo sia supportata da Ollama o LM Studio, prima di darlo per certo.
Il valore NPU TOPS sulla scatola non garantisce il throughput. È un numero di marketing, non un risultato misurato con il motore che userai. L’etichetta vaga "AI PC" non sostituisce nessuno dei controlli qui sopra.
Serve una GPU dedicata per eseguire modelli IA in locale?
No. Su molti laptop da 16 GB un piccolo modello gira su CPU o grafica integrata, semplicemente con una maggiore variabilità nella velocità rispetto a un portatile con GPU dedicata. Parti da un modello 2-4B prima di dare per scontato che la grafica dedicata ti serva.
8 GB di RAM possono bastare?
Non con un margine comodo per i modelli discussi qui. 16 GB sono il punto di partenza realistico, se consideri che modello, finestra di contesto, motore e sistema operativo condividono tutti la stessa memoria.
Eseguire un modello localmente è la stessa cosa che addestrarlo?
No. Tutto quello che hai letto sopra riguarda l’inferenza: fare domande a un modello già addestrato. Il training costruisce un modello da zero e richiede molto più hardware di qualsiasi laptop citato qui.
Più RAM garantisce risposte più rapide?
No. Più memoria significa più margine per modelli più grandi, contesti più lunghi e più app aperte, ma la velocità reale dipende dalla larghezza di banda della memoria, dal backend GPU e dal modello specifico, non solo dalla quantità di memoria.
I miei dati restano privati quando un modello gira localmente?
Sì, nel senso che i tuoi prompt restano sul tuo computer invece di finire presso un provider cloud. Ollama si collega al tuo laptop per impostazione predefinita e non invia richieste altrove, a meno che tu non configuri volontariamente un accesso cloud.
Hai già un laptop da 16 GB? Installa Ollama stasera e fai girare un piccolo modello prima di spendere un centesimo per qualcosa di nuovo. Vuoi comprare proprio per questo? Parti dalla checklist qui sopra e dai cinque laptop ricondizionati appena visti, invece di affidarti a una scheda tecnica di marketing.
Ogni laptop su refurbed viene testato e classificato prima di essere messo in vendita, quindi la RAM e la configurazione che acquisti sono esattamente quelle che ricevi. La prossima guida di questa serie spiega come collegare la tua prima app al modello che hai appena provato.
Iscriviti per la prima volta alla nostra newsletter e ottieni 15€ di sconto!
Non farti più scappare le migliori offerte.
Per maggiori informazioni sull’uso dei dati personali, visita la nostra Normativa sulla privacy.
Conferma iscrizione
Clicca sul link di conferma nell'e-mail che ti abbiamo inviato per ricevere il tuo codice sconto. Sarà valido su un ordine minimo di 200€.