La scala dell'AI locale: 10 soluzioni per azzerare il tuo conto AI da 200 $ (da 0 $ a 4.700 $)

@RetroChainer
INGLESE2 giorni fa · 19 lug 2026
106K
50
5
8
82

TL;DR

Una guida completa all'hardware per l'AI locale, che classifica 10 opzioni da 0 $ a 4.700 $ in base a memoria e prestazioni. Spiega come sostituire i costosi abbonamenti cloud con configurazioni private e locali utilizzando strumenti come Ollama.

Da qualche parte, in questo momento, uno sviluppatore paga 200 dollari al mese per l'AI e non ha mai fatto i conti. ChatGPT Plus. Claude Pro. Cursor. Costi delle API che salgono silenziosamente ogni mese. Rinnova per sempre, e per sempre è un tempo lungo per affittare qualcosa che potresti possedere.

C'è un altro modo di pensarci. Una scatola che sta in casa tua, esegue l'AI localmente, costa pochi dollari al mese di elettricità, tiene i tuoi dati sulla tua macchina e non invia mai un solo byte al server di qualcun altro.

L'AI locale nel 2026 non è il triste compromesso di due anni fa. Quantizzazione migliore, architetture di modello più snelle e chip con memoria unificata fanno sì che una macchina sulla tua scrivania gestisca ora forse l'80% del lavoro AI quotidiano: scrivere, assistenza alla programmazione, analisi di documenti, riassunti, classificazione, automazioni, rispondere a domande sui tuoi file. L'altro 20%, il ragionamento avanzato e la programmazione all'avanguardia, appartiene ancora al cloud. Ma quel 20% non giustifica un conto da 200 dollari quando una scatola acquistata una volta sola copre il resto.

Questa è la scala. Dieci gradini, dalla macchina che già possiedi a un supercomputer da scrivania, e i compromessi onesti a ogni passo.

L'idea che cambia tutto

Non stai comprando velocità. Stai comprando memoria.

Ogni storia "non funziona" riconduce allo stesso muro: un modello che non entrava nella memoria della scatola. Un modello o si carica o non si carica. La velocità decide solo come ci si sente una volta che è in esecuzione; la memoria decide se funziona del tutto.

Quindi l'intera scala è in realtà una scala di memoria. 8GB eseguono un modello da 7B. 24GB eseguono comodamente un modello da 32B. 128GB eseguono un modello da 70B e iniziano a flirtare con quelli veramente grandi. Leggi ogni gradino qui sotto attraverso questa lente, e nota lo schema: le scatole che arrivano più lontano sono quelle con memoria unificata, dove CPU e GPU condividono un unico grande pool invece di litigare per una piccola porzione di VRAM recintata.

Un avvertimento prima delle specifiche, valido per tutta la lista: una carenza globale di DRAM sta spingendo i prezzi della memoria verso l'alto nel 2026, non verso il basso. Ogni numero qui è approssimativo e in aumento, il che è un argomento per comprare la scatola che userai effettivamente piuttosto che aspettare un calo che potrebbe non arrivare.

La scala

Gradino 1. La macchina che già possiedi ($0)

Prima di spendere qualsiasi cosa, prova il flusso di lavoro su ciò che è già sulla tua scrivania. Qualsiasi laptop con 8GB di RAM esegue un modello da 7B tramite Ollama. Non sarà veloce, ma risponde all'unica domanda che conta: l'AI locale è abbastanza buona per quello che fai veramente? Passa un weekend qui prima di spendere un dollaro altrove.

RetroChainer - inline image

Gradino 2. Raspberry Pi 5, 16GB (circa $120)

Il gradino del smanettone. Un Pi 5 con 16GB eseguirà modelli da 1B a 3B tramite Ollama, lentamente. Questo non è un driver quotidiano, è una prova di concetto che puoi lasciare accesa in un cassetto: un minuscolo assistente sempre attivo, un cervello per l'home automation, un progetto del weekend. Compralo per imparare, non per lavorare.

RetroChainer - inline image

Gradino 3. NVIDIA Jetson Orin Nano Super ($249)

Il punto di ingresso serio più economico. Una vera GPU NVIDIA in una scatola più piccola di un portafoglio.

text
1Prestazioni AI: 67 TOPS
2GPU: Ampere da 1024 core
3RAM: 8GB LPDDR5 (condivisa)
4Consumo: 7-25W
5Funziona bene: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B

67 TOPS eseguono un modello da 7B in modo privato e per sempre. La classe 7B è abbastanza veloce da sembrare istantanea e abbastanza buona per la maggior parte dei compiti quotidiani. Non toccherà nulla sopra i 7B o contesti lunghi che superano gli 8GB, ma a $100/mese di abbonamenti si ripaga in dieci settimane.

RetroChainer - inline image

Gradino 4. Apple Mac mini M4 (da $599)

Il server AI domestico silenzioso predefinito, grazie alla memoria unificata. Su un PC normale, la VRAM della GPU è un muro duro. Apple condivide la memoria tra CPU e GPU, quindi il Mac mini esegue modelli più grandi di quanto suggerisca la sua scheda tecnica, rimane quasi silenzioso e consuma poca energia.

text
1Chip: Apple M4
2Memoria unificata: 16-32GB (CPU + GPU condivisa)
3Consumo: 10-30W sotto carico
4Costo elettrico 24/7: circa $3-8/mese
5Funziona bene: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium

Fa tutto ciò che fa il Jetson, più modelli più grandi, contesto più lungo e diversi servizi contemporaneamente. Questa è la scatola che la gente lascia accesa 24 ore su 24 come backend per le proprie automazioni. I $599 sono la base, però, e Apple fa pagare cara la memoria. Per l'AI locale, la memoria è il punto, quindi prezza la configurazione di cui hai veramente bisogno, non il prezzo di listino.

RetroChainer - inline image

Gradino 5. RTX 3090 usata, 24GB (circa $700 per la scheda)

La leggenda del valore che si rifiuta di morire. Sei anni e ancora la migliore VRAM-per-dollaro sul mercato consumer. Una 3090 usata ti dà 24GB di memoria veloce per circa $700, abbastanza per eseguire modelli da 24B a 32B con throughput reale, con pieno supporto CUDA quindi ogni strumento funziona subito.

text
1VRAM: 24GB GDDR6X
2Banda: ~936 GB/s
3Prezzo usato: ~$600-800 (solo scheda)
4Funziona bene: Qwen 32B, Llama 3.1 8B-70B (quantizzato), la maggior parte della classe 32B

L'onesto asterisco: una GPU non è un computer. Hai bisogno di un PC host intorno, quindi budget altri $400-$600 per il resto della macchina. Ma se hai già un desktop con uno slot libero e un alimentatore abbastanza grande, nient'altro su questa scala ti dà 24GB a così poco prezzo.

RetroChainer - inline image

Gradino 6. AMD Radeon RX 7900 XTX, 24GB (circa $900 per la scheda)

Gli stessi 24GB della 3090, nuova, con garanzia, e il software AMD ha finalmente raggiunto il livello. Su ROCm 7.x, la 7900 XTX esegue Llama 3.1 8B a circa 96 token al secondo, circa tre quarti di una RTX 4090 a una frazione del prezzo. Per pura VRAM-per-dollaro su hardware nuovo, nulla di NVIDIA la tocca a livello consumer.

text
1VRAM: 24GB GDDR6
2Software: ROCm 7.x (supporto di prima classe)
3Prezzo nuovo: ~$899-1.400 (solo scheda)
4Funziona bene: Llama 3.1 8B (~96 tok/s), classe 32B quantizzato

Il problema è lo stesso che segue AMD ovunque: ROCm ha chiuso gran parte del divario con CUDA, ma alcuni strumenti presumono ancora NVIDIA per impostazione predefinita. Per Ollama e Open WebUI funziona bene oggi. Per stack di fine-tuning esotici, aspettati qualche passaggio manuale in più.

RetroChainer - inline image

Gradino 7. AMD Ryzen AI Max+ 395 "Strix Halo," 128GB (circa $1.999)

Il punto di forza del 2026, e la scatola che la maggior parte di queste liste dimentica. Il chip Strix Halo di AMD abbina una CPU Zen 5 a 16 core con una grande iGPU RDNA 3.5 e fino a 128GB di memoria unificata in una scatola piccola, per circa quanto costa un desktop NVIDIA con un quarto della memoria.

text
1Chip: Ryzen AI Max+ 395 (16-core Zen 5)
2GPU: Radeon 8060S (40-core RDNA 3.5)
3NPU: XDNA 2, 50 TOPS (~126 TOPS a livello di sistema)
4Memoria unificata: fino a 128GB LPDDR5X (~96GB utilizzabili come VRAM)
5Prezzo: ~$1.999 per 128GB / 2TB
6Funziona bene: Llama 3.3 70B, Mixtral, la maggior parte dei modelli classe 70B

Lo compri in due modi. Il GMKtec EVO-X2 è un mini PC 128GB già pronto a circa $1.999. Il Framework Desktop è lo stesso chip in un telaio riparabile e aggiornabile, a partire da $1.999 per la scheda e circa $2.850 completamente assemblato. In entrambi i casi carichi un modello da 70B a velocità di conversazione, cosa che nulla sotto questo gradino può fare. La maturità di ROCm è il compromesso, come al Gradino 6.

RetroChainer - inline image

Gradino 8. NVIDIA RTX 5090, 32GB (circa $3.000 per la scheda)

La cosa più veloce che una persona normale può mettere in un normale tower. 32GB della memoria consumer più rapida mai realizzata, e una velocità grezza che lascia indietro tutto ciò che sta sotto. Questo è il gradino per chi vuole inferenza locale di classe frontier e training occasionale, e a cui importa più dei token al secondo che dei dollari per gigabyte.

text
1VRAM: 32GB GDDR7
2Prezzo nuovo: ~$3.000+ (solo scheda)
3Funziona bene: 32B a velocità, 70B quantizzato, modelli di immagini e video

Il calcolo è brutale, però. Costa da tre a quattro volte una 3090 usata per 8GB di memoria in più, più un PC host aggiuntivo. Comprala perché hai bisogno della velocità e del margine extra, non perché è efficiente. Non lo è.

RetroChainer - inline image

Gradino 9. Apple Mac Studio M3 Ultra, 96GB (da $3.999)

La grande workstation silenziosa a memoria unificata. Il Mac Studio raggruppa fino a 96GB tra CPU e GPU con accelerazione Metal, esegue modelli grandi quasi in silenzio e lo fa in una scatola che sta su una scrivania senza una curva di ventola da motore a reazione.

text
1Chip: M3 Ultra (fino a CPU a 32 core / GPU a 80 core)
2Memoria unificata: fino a 96GB
3Prezzo: da $3.999
4Funziona bene: Modelli classe 70B, contesto lungo, servizi multipli

Vale la pena saperlo onestamente: Apple ha ritirato la configurazione da 512GB all'inizio del 2026 quando la carenza di DRAM ha colpito, quindi 96GB è ora il tetto massimo dove prima arrivava molto più in alto. Tuttavia, per una macchina silenziosa che funziona tutto il giorno, esegue modelli grandi e funge anche da tuo computer vero, poche cose sono piacevoli da usare quanto questa.

RetroChainer - inline image

Gradino 10. NVIDIA DGX Spark, 128GB ($3.999 - $4.699)

Il desktop che pensa di essere un datacenter. Per il fine-tuning di modelli aperti, ospitare assistenti da 70B-plus ed eseguire pipeline di inferenza che necessitano di un throughput reale.

text
1Chip: GB10 Grace Blackwell
2Throughput AI: 1 PFLOP
3Memoria unificata: 128GB LPDDR5x
4Archiviazione: 4TB Gen5 NVMe
5Consumo: 150-240W sotto carico
6Ideale per: Modelli 70B-200B, fine-tuning, inferenza di produzione

128GB di memoria unificata caricano modelli che una GPU consumer non può nemmeno aprire, e due unità collegate raggiungono il territorio dei 400B. Onestà sul prezzo: è stato lanciato a $3.999 nell'ottobre 2025 e da allora è stato maggiorato a circa $4.699 a causa della carenza di memoria (Tom's Hardware). Rispetto alla scatola Strix Halo al Gradino 7, costa circa il doppio per gli stessi 128GB. Stai pagando per la maturità di CUDA e il throughput, non per più memoria.

RetroChainer - inline image

Il conto onesto

text
1Spesa AI mensile tipica:
2ChatGPT Plus $20
3Claude Pro $20
4Cursor Pro $20
5Costi API $50-200
6Totale $110-260 / mese
7
8AI locale mensile:
9Hardware $0 (già acquistato)
10Elettricità $2-15
11API $0
12Totale $2-15 / mese

A $100/mese in abbonamenti, un Jetson da $249 si ripaga in dieci settimane, un Mac mini da $599 in sei mesi, un build con 3090 usata in meno di un anno, una scatola Strix Halo da $2.000 in circa diciotto mesi, e i gradini da $4.000-plus solo se stavi già bruciando noleggi di GPU cloud a quattro cifre al mese.

Ora la parte che l'hype salta sempre. La scatola è un costo irrecuperabile, e si "ripaga" solo se avresti genuinamente continuato a pagare l'abbonamento. Comprare una macchina da $2.000 per risparmiare $20 al mese è un affare peggiore dell'abbonamento, non migliore. Il gradino giusto è quello che corrisponde al tuo utilizzo reale, non alla versione fantastica di esso.

Qual è il tuo gradino

Uso quotidiano leggero e curiosità: inizia dal Gradino 1, poi compra il Jetson. Un assistente silenzioso sempre attivo per una casa o una piccola impresa: il Mac mini. Il percorso più economico verso veri 24GB e modelli 32B: una 3090 usata, o la RX 7900 XTX se la vuoi nuova con garanzia e non ti dispiace ROCm. La migliore esperienza 70B senza soldi da datacenter: la scatola Strix Halo. Massima velocità consumer: la RTX 5090. Una workstation silenziosa con tanta memoria in cui vivi anche tu: il Mac Studio. Fine-tuning e pipeline di produzione: il DGX Spark.

La configurazione che richiede un pomeriggio

Il processo è identico su ogni gradino.

1. Installa Ollama. Open source, trasforma qualsiasi modello in un'API locale che parla il linguaggio di OpenAI.

bash
1curl -fsSL https://ollama.com/install.sh | sh

2. Scarica un modello dimensionato per la memoria della tua scatola.

bash
1# Jetson 8GB o Mac mini 16GB:
2ollama pull llama3.2
3
4# 3090 / 7900 XTX 24GB:
5ollama pull qwen2.5:32b
6
7# Strix Halo / DGX Spark 128GB:
8ollama pull llama3.3:70b

3. Cambia una riga nel codice che già hai.

python
1# Prima, pagando per richiesta:
2client = OpenAI(api_key="sk-...")
3
4# Dopo, locale e gratuito:
5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

Il tuo codice funziona allo stesso modo. Niente lascia la macchina, niente costa soldi per richiesta.

4. (Opzionale) Aggiungi un'interfaccia browser con Open WebUI, e avrai un ChatGPT privato su localhost:3000.

bash
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

Cosa eseguirci effettivamente sopra

L'hardware è metà della decisione. Il modello è l'altra metà. Una mappa approssimativa per il 2026:

Piccolo e veloce (sta in 8-16GB): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Ottimo per bozze, classificazione e domande e risposte sui tuoi appunti. Il livello cavallo di battaglia (sta in 24GB): Qwen 2.5 32B e Llama quantizzato, abbastanza potenti per un vero aiuto nella programmazione e nel lavoro con i documenti. Il livello pesante (richiede 64-128GB): Llama 3.3 70B e le grandi varianti Qwen e Mixtral, dove l'output locale inizia a sembrare vicino a un modello cloud per le attività quotidiane.

La quantizzazione è la leva silenziosa alla base di tutto questo. Un modello da 70B con una quantizzazione a 4 bit sta dove la versione a piena precisione non ci entrerebbe mai, con un costo di qualità piccolo e solitamente accettabile. Q4-Q6 è l'intervallo sensato per la maggior parte delle persone. Al di sotto, la qualità cala più velocemente di quanto valgano i risparmi di memoria.

Cosa costruisci una volta che funziona

Per uso personale copre le cose quotidiane per pochi dollari al mese. La parte interessante è l'automazione aziendale, dove colleghi il modello locale a n8n, lo strumento open source che lo collega a Telegram, email, calendario, CRM e centinaia di servizi. Ognuna di queste funziona senza che nulla esca dal tuo edificio e senza alcun costo per token:

text
1Centralinista AI:
2messaggi del cliente su Telegram -> n8n li riceve -> modello locale legge l'intento
3-> calendario controlla la disponibilità -> prenotazione confermata
4
5Analisi di documenti:
6carica 50 PDF -> modello locale li legge tutti -> estrae i fatti chiave
7-> scrive un report strutturato
8
9Brief giornaliero:
10trigger alle 7:00 -> modello legge i tuoi appunti e compiti -> riassume ciò che conta
11-> lo invia al tuo telefono
12
13Arricchimento lead:
14nuova riga in un foglio di calcolo -> modello ricerca l'azienda -> scrive un'apertura su misura
15-> lo mette in coda per la tua revisione
16
17Riciclo di contenuti:
18una lunga registrazione -> modello trascrive e taglia -> scrive i post
19-> salva bozze per la tua approvazione
20
21Smistamento posta:
22nuova email -> modello smista, etichetta e scrive una bozza di risposta -> tu premi invia o modifichi

Per il lavoro sensibile alla privacy, smette di essere una decisione di costo e diventa l'unica possibile. Documenti legali, cartelle cliniche, dati finanziari, qualsiasi cosa sotto NDA non ha nulla a che fare su un'API di terze parti. L'AI locale lo elabora sulla tua macchina e non lo lascia mai.

Cosa va effettivamente storto

Il 20% è reale. I modelli frontier vincono ancora sul ragionamento difficile, la programmazione all'avanguardia e la ricerca dove conta la singola risposta migliore. L'AI locale è il cavallo di battaglia affidabile, privato e sempre acceso per l'altro 80%, non un sostituto per tutto. Tieni un abbonamento cloud per il difficile 20% ed esegui il resto a casa, e avrai entrambi.

La memoria è il tetto, non i TOPS. Compra per la dimensione del modello che vuoi eseguire, e ricorda che le scatole con memoria unificata arrivano più lontano di un PC con specifiche corrispondenti e VRAM separata.

Una GPU non è un computer. I gradini 3090, 7900 XTX e 5090 hanno tutti bisogno di una macchina host intorno. Il prezzo della scheda non è il prezzo del sistema, quindi aggiungi $400-$600 prima di confrontarlo con un mini PC già pronto.

I prezzi stanno salendo. La carenza di DRAM ha già fatto aumentare il DGX Spark del 18% e ha costretto Apple a ritirare il suo Mac Studio da 512GB. Il buon affare di oggi potrebbe costare di più il prossimo trimestre.

AMD fa risparmiare soldi e costa tempo. Strix Halo e la 7900 XTX ti danno la maggior memoria per dollaro, ma ROCm è ancora indietro rispetto a CUDA per quanto riguarda gli strumenti chiavi in mano. Va bene per Ollama oggi, ma serve più pazienza per training pesanti.

Calore, rumore e quantizzazione sono la stampa fine. I build con GPU grandi sono rumorosi e caldi. La quantizzazione aggressiva risparmia memoria ma mangia la qualità se la spingi troppo oltre. Nessuno dei due è un rompicapo, ma nessuno li menziona nel discorso di vendita.

Due cose da fare ora

Prova gratis prima. Installa Ollama sul computer che già possiedi ed esegui un modello da 7B questo weekend. Qualsiasi macchina con 8GB lo fa. Prova il flusso di lavoro prima di spendere un centesimo in hardware.

Poi compra un gradino sopra le tue reali esigenze, non cinque. Le persone che hanno impostato silenziosamente l'AI locale nel 2025 sembreranno molto avanti rispetto alla curva entro il 2027, mentre i prezzi del cloud continueranno a salire e l'hardware locale continuerà a migliorare. La maggior parte delle persone continuerà a pagare $200 al mese per abitudine. Alcuni spenderanno un pomeriggio questa settimana e non invieranno mai più un byte al server di qualcun altro.

Analizzo strumenti AI e i soldi che si fanno con loro regolarmente. Seguimi per il prossimo, e unisciti al mio Telegram: https://t.me/+lzSPoQ0svRU1ZWZi

Rielabora in YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Per i creator

Trasforma il tuo Markdown in un articolo 𝕏 pulito

Quando pubblichi i tuoi testi lunghi, formattare immagini, tabelle e blocchi di codice per 𝕏 è una seccatura. YouMind trasforma un'intera bozza Markdown in un articolo 𝕏 pulito e pronto da pubblicare.

Prova Markdown verso 𝕏

Altri pattern da decodificare

Articoli virali recenti

Esplora altri articoli virali