A Escada da IA Local: 10 Níveis para Eliminar sua Conta de US$ 200 em IA (de US$ 0 a US$ 4.700)

@RetroChainer
INGLÊShá 2 dias · 19/07/2026
106K
50
5
8
82

TL;DR

Um guia abrangente sobre hardware para IA local, classificando 10 opções de US$ 0 a US$ 4.700 com base em memória e desempenho. Explica como substituir assinaturas caras na nuvem por configurações privadas e locais usando ferramentas como o Ollama.

Em algum lugar agora mesmo um desenvolvedor está pagando $200 por mês por IA e nunca fez as contas. ChatGPT Plus. Claude Pro. Cursor. Custos de API que aumentam silenciosamente todo mês. Renova para sempre, e para sempre é muito tempo para alugar algo que você poderia ter.

Existe outra forma de pensar sobre isso. Uma caixa que fica na sua casa, roda IA localmente, custa alguns dólares por mês em eletricidade, mantém seus dados na sua própria máquina e nunca envia um único byte para o servidor de outra pessoa.

IA local em 2026 não é o compromisso ruim que era há dois anos. Quantização melhor, arquiteturas de modelo mais enxutas e chips com memória unificada significam que uma máquina na sua mesa agora lida com talvez 80% do trabalho diário de IA: escrever, ajudar com código, análise de documentos, resumir, classificar, automatizações, responder perguntas sobre seus próprios arquivos. Os outros 20%, o raciocínio de fronteira e a codificação de ponta, ainda pertencem à nuvem. Mas esses 20% não justificam uma conta de $200 quando uma caixa única cobre o resto.

Esta é a escada. Dez degraus, da máquina que você já possui a um supercomputador de mesa, e as compensações honestas em cada etapa.

A ideia que muda tudo

Você não está comprando velocidade. Você está comprando memória.

Toda história de "não vai rodar" volta ao mesmo muro: um modelo que não coube na memória da caixa. Um modelo ou carrega ou não carrega. A velocidade só decide como ele se sente quando está rodando; a memória decide se ele roda ou não.

Então, toda a escada é realmente uma escada de memória. 8GB roda um modelo 7B. 24GB roda um modelo 32B confortavelmente. 128GB roda um modelo 70B e começa a flertar com os realmente grandes. Leia cada degrau abaixo através dessa lente e observe o padrão: as caixas que vão mais longe são aquelas com memória unificada, onde a CPU e a GPU compartilham um grande pool em vez de brigar por um pequeno pedaço murado de VRAM.

Uma ressalva antes das especificações, verdadeira para toda a lista: uma escassez global de DRAM está empurrando os preços da memória para cima ao longo de 2026, não para baixo. Cada número aqui é aproximado e está subindo, o que é um argumento para comprar a caixa que você realmente usará em vez de esperar por uma queda que pode não vir.

A escada

Degrau 1. A máquina que você já possui ($0)

Antes de gastar qualquer coisa, prove o fluxo de trabalho no que já está na sua mesa. Qualquer laptop com 8GB de RAM roda um modelo 7B através do Ollama. Não será rápido, mas responde à única pergunta que importa: a IA local é boa o suficiente para o que você realmente faz? Passe um fim de semana aqui antes de gastar um dólar em qualquer outro lugar.

RetroChainer - inline image

Degrau 2. Raspberry Pi 5, 16GB (cerca de $120)

O degrau do entusiasta. Um Pi 5 com 16GB rodará modelos de 1B a 3B através do Ollama, lentamente. Isso não é um motor diário, é uma prova de conceito que você pode deixar rodando em uma gaveta: um pequeno assistente sempre ativo, um cérebro para automação residencial, um projeto de fim de semana. Compre para aprender, não para trabalhar.

RetroChainer - inline image

Degrau 3. NVIDIA Jetson Orin Nano Super ($249)

O ponto de entrada sério mais barato. Uma GPU NVIDIA real em uma caixa menor que uma carteira.

text
1AI performance: 67 TOPS
2GPU: 1024-core Ampere
3RAM: 8GB LPDDR5 (shared)
4Power: 7-25W
5Runs well: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B

67 TOPS roda um modelo 7B privadamente e para sempre. A classe 7B é rápida o suficiente para parecer instantânea e boa o suficiente para a maioria das tarefas diárias. Não tocará em nada acima de 7B ou qualquer contexto longo que ultrapasse 8GB, mas a $100/mês em assinaturas, ela se paga em dez semanas.

RetroChainer - inline image

Degrau 4. Apple Mac mini M4 (a partir de $599)

O servidor de IA doméstico silencioso padrão, por causa da memória unificada. Em um PC normal, a VRAM da GPU é um muro duro. A Apple compartilha a memória entre CPU e GPU, então o Mac mini roda maior do que sua folha de especificações sugere, permanece quase silencioso e consome pouca energia.

text
1Chip: Apple M4
2Unified memory: 16-32GB (shared CPU + GPU)
3Power: 10-30W under load
424/7 power cost: roughly $3-8/month
5Runs well: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium

Ele faz tudo que o Jetson faz, além de modelos maiores, contexto mais longo e vários serviços ao mesmo tempo. Esta é a caixa que as pessoas deixam ligada 24 horas por dia como backend para suas automações. Os $599 são a base, no entanto, e a Apple cobra caro pela memória. Para IA local, a memória é o ponto, então precifique a configuração que você realmente precisa, não o preço sugerido.

RetroChainer - inline image

Degrau 5. RTX 3090 usada, 24GB (cerca de $700 pela placa)

A lenda do custo-benefício que se recusa a morrer. Seis anos de idade e ainda a melhor relação VRAM por dólar no mercado consumidor. Uma 3090 usada oferece 24GB de memória rápida por cerca de $700, o suficiente para rodar modelos de 24B a 32B com taxa de transferência real, com suporte total a CUDA, então toda ferramenta funciona de fábrica.

text
1VRAM: 24GB GDDR6X
2Bandwidth: ~936 GB/s
3Used price: ~$600-800 (card only)
4Runs well: Qwen 32B, Llama 3.1 8B-70B (quantized), most 32B-class

O asterisco honesto: uma GPU não é um computador. Você precisa de um PC hospedeiro ao redor dela, então reserve outros $400 a $600 para o resto da máquina. Mas se você já tem um desktop com um slot sobrando e uma fonte de alimentação grande o suficiente, nada mais nesta escada oferece 24GB tão barato.

RetroChainer - inline image

Degrau 6. AMD Radeon RX 7900 XTX, 24GB (cerca de $900 pela placa)

Os mesmos 24GB da 3090, nova, com garantia, e o software da AMD finalmente alcançou. No ROCm 7.x, a 7900 XTX roda Llama 3.1 8B a aproximadamente 96 tokens por segundo, cerca de três quartos de uma RTX 4090 por uma fração do preço. Para VRAM pura por dólar em hardware novo, nada da NVIDIA a toca no nível consumidor.

text
1VRAM: 24GB GDDR6
2Software: ROCm 7.x (first-class support)
3New price: ~$899-1,400 (card only)
4Runs well: Llama 3.1 8B (~96 tok/s), 32B-class quantized

A desvantagem é a mesma que acompanha a AMD em todo lugar: o ROCm fechou a maior parte da lacuna com o CUDA, mas algumas ferramentas ainda assumem NVIDIA por padrão. Para Ollama e Open WebUI, funciona bem hoje. Para pilhas de fine-tuning exóticas, espere alguns passos manuais a mais.

RetroChainer - inline image

Degrau 7. AMD Ryzen AI Max+ 395 "Strix Halo", 128GB (cerca de $1.999)

O ponto ideal de 2026, e a caixa que a maioria dessas listas esquece. O chip Strix Halo da AMD combina uma CPU Zen 5 de 16 núcleos com uma grande iGPU RDNA 3.5 e até 128GB de memória unificada em uma caixa pequena, por aproximadamente o que um desktop NVIDIA custa com um quarto da memória.

text
1Chip: Ryzen AI Max+ 395 (16-core Zen 5)
2GPU: Radeon 8060S (40-core RDNA 3.5)
3NPU: XDNA 2, 50 TOPS (~126 TOPS system-wide)
4Unified memory: up to 128GB LPDDR5X (~96GB usable as VRAM)
5Price: ~$1,999 for 128GB / 2TB
6Runs well: Llama 3.3 70B, Mixtral, most 70B-class models

Você compra de duas maneiras. O GMKtec EVO-X2 é um mini PC 128GB completo por cerca de $1.999. O Framework Desktop é o mesmo chip em um chassi reparável e atualizável, a partir de $1.999 pela placa e cerca de $2.850 totalmente montado. De qualquer forma, você carrega um modelo 70B em velocidade de conversação, o que nada abaixo deste degrau pode fazer. A maturidade do ROCm é a compensação, igual ao Degrau 6.

RetroChainer - inline image

Degrau 8. NVIDIA RTX 5090, 32GB (cerca de $3.000 pela placa)

A coisa mais rápida que uma pessoa normal pode colocar em uma torre normal. 32GB da memória de consumo mais rápida já feita, e velocidade bruta que deixa tudo abaixo dela para trás. Este é o degrau para pessoas que querem inferência local de classe de fronteira e treinamento ocasional, e que se importam mais com tokens por segundo do que com dólares por gigabyte.

text
1VRAM: 32GB GDDR7
2New price: ~$3,000+ (card only)
3Runs well: 32B at speed, 70B quantized, image and video models

A matemática é brutal, no entanto. Custa três a quatro vezes mais que uma 3090 usada por 8GB a mais de memória, mais um PC hospedeiro por cima. Compre porque você precisa da velocidade e da margem extra, não porque é eficiente. Não é.

RetroChainer - inline image

Degrau 9. Apple Mac Studio M3 Ultra, 96GB (a partir de $3.999)

A grande estação de trabalho silenciosa de memória unificada. O Mac Studio agrupa até 96GB entre CPU e GPU com aceleração Metal, roda modelos grandes quase silenciosamente e faz isso em uma caixa que cabe em uma mesa sem uma curva de ventilador de motor a jato.

text
1Chip: M3 Ultra (up to 32-core CPU / 80-core GPU)
2Unified memory: up to 96GB
3Price: from $3,999
4Runs well: 70B-class models, long context, multiple services

Vale a pena saber honestamente: a Apple retirou a configuração de 512GB no início de 2026 com a escassez de DRAM, então 96GB é o teto agora onde costumava chegar muito mais alto. Ainda assim, para uma máquina silenciosa de dia inteiro que roda modelos grandes e serve como seu computador real, poucas coisas são tão agradáveis de se conviver.

RetroChainer - inline image

Degrau 10. NVIDIA DGX Spark, 128GB ($3.999 a $4.699)

O desktop que pensa que é um datacenter. Para fine-tuning de modelos abertos, hospedar assistentes de 70B ou mais e executar pipelines de inferência que precisam de taxa de transferência real.

text
1Chip: GB10 Grace Blackwell
2AI throughput: 1 PFLOP
3Unified memory: 128GB LPDDR5x
4Storage: 4TB Gen5 NVMe
5Power: 150-240W under load
6Best for: 70B-200B models, fine-tuning, production inference

128GB de memória unificada carrega modelos que uma GPU de consumo nem consegue abrir, e duas unidades ligadas alcançam território de 400B. Preço honesto: foi lançado a $3.999 em outubro de 2025 e desde então foi marcado para cerca de $4.699 com a escassez de memória (Tom's Hardware). Ao lado da caixa Strix Halo no Degrau 7, custa aproximadamente o dobro pelos mesmos 128GB. Você está pagando pela maturidade do CUDA e pela taxa de transferência, não por mais memória.

RetroChainer - inline image

A matemática honesta

text
1Typical monthly AI spend:
2ChatGPT Plus $20
3Claude Pro $20
4Cursor Pro $20
5API costs $50-200
6Total $110-260 / month
7
8Local AI monthly:
9Hardware $0 (already bought)
10Electricity $2-15
11API $0
12Total $2-15 / month

A $100/mês em assinaturas, um Jetson de $249 se paga em dez semanas, um Mac mini de $599 em seis meses, uma construção com 3090 usada em menos de um ano, uma caixa Strix Halo de $2.000 em cerca de dezoito meses, e os degraus de $4.000 ou mais apenas se você já estivesse queimando aluguel de GPU em nuvem na casa dos quatro dígitos por mês.

Agora a parte que o hype sempre pula. A caixa é um custo irrecuperável, e ela só "se paga" se você realmente tivesse continuado pagando a assinatura. Comprar uma máquina de $2.000 para economizar $20 por mês é um negócio pior do que a assinatura, não melhor. O degrau certo é aquele que corresponde ao seu uso real, não à versão fantasiosa dele.

Qual é o seu degrau

Uso diário leve e curiosidade: comece no Degrau 1, depois compre o Jetson. Um assistente silencioso sempre ativo para uma casa ou pequena empresa: o Mac mini. O caminho mais barato para 24GB reais e modelos 32B: uma 3090 usada, ou a RX 7900 XTX se você quiser nova com garantia e não se importar com ROCm. A melhor experiência 70B sem dinheiro de datacenter: a caixa Strix Halo. Velocidade máxima de consumo: a RTX 5090. Uma estação de trabalho silenciosa de grande memória onde você também vive: o Mac Studio. Fine-tuning e pipelines de produção: o DGX Spark.

A configuração que leva uma tarde

O processo é idêntico em todos os degraus.

1. Instale o Ollama. Código aberto, transforma qualquer modelo em uma API local que fala a linguagem do OpenAI.

bash
1curl -fsSL https://ollama.com/install.sh | sh

2. Baixe um modelo dimensionado para a memória da sua caixa.

bash
1# 8GB Jetson or 16GB Mac mini:
2ollama pull llama3.2
3
4# 24GB 3090 / 7900 XTX:
5ollama pull qwen2.5:32b
6
7# 128GB Strix Halo / DGX Spark:
8ollama pull llama3.3:70b

3. Mude uma linha no código que você já tem.

python
1# Before, paying per request:
2client = OpenAI(api_key="sk-...")
3
4# After, local and free:
5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

Seu código roda igual. Nada sai da máquina, nada custa dinheiro por requisição.

4. (Opcional) Adicione uma interface de navegador com o Open WebUI, e você terá um ChatGPT privado em localhost:3000.

bash
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

O que realmente rodar nele

O hardware é metade da decisão. O modelo é a outra metade. Um mapa aproximado para 2026:

Pequeno e rápido (cabe em 8-16GB): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Ótimo para rascunhos, classificação e perguntas e respostas sobre suas próprias anotações. O nível de trabalho pesado (cabe em 24GB): Qwen 2.5 32B e Llama quantizado, forte o suficiente para ajuda real com código e trabalho com documentos. O nível pesado (precisa de 64-128GB): Llama 3.3 70B e as grandes variantes Qwen e Mixtral, onde a saída local começa a parecer próxima de um modelo de nuvem para tarefas cotidianas.

A quantização é a alavanca silenciosa por baixo de tudo isso. Um modelo 70B em uma quantização de 4 bits cabe onde a versão de precisão total nunca caberia, a um custo de qualidade pequeno e geralmente aceitável. Q4 a Q6 é a faixa sensata para a maioria das pessoas. Abaixo disso, a qualidade cai mais rápido do que a economia de memória vale a pena.

O que você constrói quando ele está rodando

Para uso pessoal, cobre as coisas diárias por alguns dólares por mês. A parte interessante é a automação de negócios, onde você conecta o modelo local ao n8n, a ferramenta de código aberto que o conecta ao Telegram, e-mail, calendário, CRM e centenas de serviços. Cada um desses roda sem que nada saia do seu prédio e sem custo por token:

text
1Recepcionista de IA:
2mensagens de clientes no Telegram -> n8n recebe -> modelo local lê a intenção
3-> calendário verifica disponibilidade -> reserva confirmada
4
5Análise de documentos:
6jogue 50 PDFs -> modelo local lê todos -> extrai fatos principais
7-> escreve um relatório estruturado
8
9Resumo diário:
10gatilho às 7h -> modelo lê suas anotações e tarefas -> resume o que importa
11-> envia para seu celular
12
13Enriquecimento de leads:
14nova linha em uma planilha -> modelo pesquisa a empresa -> escreve uma abertura personalizada
15-> coloca na fila para sua revisão
16
17Reaproveitamento de conteúdo:
18uma gravação longa -> modelo transcreve e corta -> escreve as postagens
19-> salva rascunhos para você aprovar
20
21Triagem de caixa de entrada:
22novo e-mail -> modelo classifica, etiqueta e escreve uma resposta -> você aperta enviar ou edita

Para trabalhos com dados sensíveis, deixa de ser uma decisão de custo e se torna a única opção. Documentos legais, registros médicos, dados financeiros, qualquer coisa sob NDA não tem lugar em uma API de terceiros. A IA local processa na sua máquina e nunca sai dela.

O que realmente dá errado

Os 20% são reais. Modelos de fronteira ainda vencem em raciocínio difícil, codificação de ponta e pesquisa onde a melhor resposta única importa. A IA local é o cavalo de batalha confiável, privado e sempre ativo para os outros 80%, não um substituto para tudo. Mantenha uma assinatura de nuvem para os 20% difíceis e execute o resto em casa, e você terá ambos.

A memória é o teto, não os TOPS. Compre para o tamanho do modelo que você quer rodar e lembre-se de que caixas com memória unificada vão mais longe do que um PC com especificações equivalentes e VRAM separada.

Uma GPU não é um computador. Os degraus 3090, 7900 XTX e 5090 precisam de uma máquina hospedeira ao redor deles. O preço da placa não é o preço do sistema, então adicione $400 a $600 antes de comparar com um mini PC completo.

Os preços estão subindo. A escassez de DRAM já empurrou o DGX Spark para cima 18% e fez a Apple retirar seu Mac Studio de 512GB. O bom negócio de hoje pode custar mais no próximo trimestre.

A AMD economiza dinheiro e custa tempo. Strix Halo e a 7900 XTX oferecem mais memória por dólar, mas o ROCm ainda fica atrás do CUDA em ferramentas prontas para uso. Bom para Ollama hoje, mais paciência necessária para treinamento pesado.

Calor, ruído e quantização são as letras miúdas. Construções com GPU grande são barulhentas e quentes. Quantização agressiva economiza memória, mas come a qualidade se você for longe demais. Nenhum é um impeditivo, mas ninguém menciona no discurso de vendas.

Duas coisas para fazer agora

Experimente grátis primeiro. Instale o Ollama no computador que você já tem e rode um modelo 7B neste fim de semana. Qualquer máquina de 8GB consegue. Prove o fluxo de trabalho antes de gastar um centavo em hardware.

Depois, compre um degrau acima das suas necessidades reais, não cinco. As pessoas que silenciosamente montaram IA local em 2025 vão parecer muito à frente da curva em 2027, à medida que os preços da nuvem continuam subindo e o hardware local continua melhorando. A maioria das pessoas continuará pagando $200 por mês por hábito. Alguns vão passar uma tarde esta semana e nunca mais enviarão outro byte para o servidor de outra pessoa.

Eu analiso ferramentas de IA e o dinheiro que está sendo feito com elas regularmente assim. Siga para a próxima e entre no meu Telegram: https://t.me/+lzSPoQ0svRU1ZWZi

Recriar no YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para criadores

Transforme o seu Markdown num artigo 𝕏 impecável

Quando publica os seus próprios textos longos, formatar imagens, tabelas e blocos de código para o 𝕏 é uma dor de cabeça. O YouMind transforma um rascunho completo em Markdown num artigo 𝕏 impecável e pronto a publicar.

Experimente Markdown para 𝕏

Mais padrões para decifrar

Artigos virais recentes

Explorar mais artigos virais