La escalera de la IA local: 10 opciones para eliminar tu factura de $200 en IA (de $0 a $4,700)

@RetroChainer
INGLÉShace 2 días · 19 jul 2026
106K
50
5
8
82

TL;DR

Una guía completa sobre hardware para IA local, que clasifica 10 opciones desde $0 hasta $4,700 según su memoria y rendimiento. Explica cómo reemplazar costosas suscripciones en la nube por configuraciones privadas y locales utilizando herramientas como Ollama.

En algún lugar, en este momento, un desarrollador está pagando $200 al mes por IA y nunca ha hecho los cálculos. ChatGPT Plus. Claude Pro. Cursor. Costos de API que se acumulan silenciosamente cada mes. Se renueva para siempre, y para siempre es mucho tiempo para alquilar algo que podrías poseer.

Hay otra forma de pensar en esto. Una caja que se queda en tu casa, ejecuta IA localmente, cuesta unos pocos dólares al mes en electricidad, mantiene tus datos en tu propia máquina y nunca envía un solo byte al servidor de otra persona.

La IA local en 2026 no es el triste compromiso que era hace dos años. Mejor cuantización, arquitecturas de modelos más ligeras y chips con memoria unificada significan que una máquina en tu escritorio ahora maneja tal vez el 80% del trabajo diario de IA: escribir, ayuda con código, análisis de documentos, resúmenes, clasificación, automatizaciones, responder preguntas sobre tus propios archivos. El otro 20%, el razonamiento de frontera y la codificación de vanguardia, todavía pertenece a la nube. Pero ese 20% no justifica una factura de $200 cuando una caja de una sola vez cubre el resto.

Esta es la escalera. Diez peldaños, desde la máquina que ya posees hasta una supercomputadora de escritorio, y las compensaciones honestas en cada paso.

La idea que lo cambia todo

No estás comprando velocidad. Estás comprando memoria.

Cada historia de "no funciona" se remonta al mismo muro: un modelo que no cabía en la memoria de la caja. Un modelo o se carga o no se carga. La velocidad solo decide cómo se siente una vez que está funcionando; la memoria decide si funciona en absoluto.

Así que toda la escalera es realmente una escalera de memoria. 8GB ejecuta un modelo de 7B. 24GB ejecuta un modelo de 32B cómodamente. 128GB ejecuta un modelo de 70B y comienza a coquetear con los realmente grandes. Lee cada peldaño a continuación a través de ese lente, y nota el patrón: las cajas que más se estiran son las que tienen memoria unificada, donde la CPU y la GPU comparten un gran grupo en lugar de pelear por un pequeño fragmento aislado de VRAM.

Una advertencia antes de las especificaciones, válida en toda la lista: una escasez global de DRAM está empujando los precios de la memoria al alza durante 2026, no a la baja. Cada número aquí es aproximado y está subiendo, lo cual es un argumento para comprar la caja que realmente usarás en lugar de esperar una baja que quizás no llegue.

La escalera

Peldaño 1. La máquina que ya posees ($0)

Antes de gastar algo, prueba el flujo de trabajo en lo que ya tienes en tu escritorio. Cualquier laptop con 8GB de RAM ejecuta un modelo de 7B a través de Ollama. No será rápido, pero responde la única pregunta que importa: ¿es la IA local lo suficientemente buena para lo que realmente haces? Pasa un fin de semana aquí antes de gastar un dólar en otro lado.

RetroChainer - inline image

Peldaño 2. Raspberry Pi 5, 16GB (~$120)

El peldaño del experimentador. Un Pi 5 con 16GB ejecutará modelos de 1B a 3B a través de Ollama, lentamente. Esto no es un controlador diario, es una prueba de concepto que puedes dejar funcionando en un cajón: un asistente diminuto siempre encendido, un cerebro para automatización del hogar, un proyecto de fin de semana. Cómpralo para aprender, no para trabajar.

RetroChainer - inline image

Peldaño 3. NVIDIA Jetson Orin Nano Super ($249)

El punto de entrada serio más barato. Una GPU NVIDIA real en una caja más pequeña que una cartera.

text
1Rendimiento IA: 67 TOPS
2GPU: 1024 núcleos Ampere
3RAM: 8GB LPDDR5 (compartida)
4Consumo: 7-25W
5Ejecuta bien: Llama 3.2 3B, Mistral 7B, Gemma 2, DeepSeek 1.5B

67 TOPS ejecuta un modelo de 7B de forma privada y para siempre. La clase de 7B es lo suficientemente rápida para sentirse instantánea y lo suficientemente buena para la mayoría de las tareas diarias. No tocará nada por encima de 7B ni ningún contexto largo que supere los 8GB, pero a $100/mes en suscripciones, se paga solo en diez semanas.

RetroChainer - inline image

Peldaño 4. Apple Mac mini M4 (desde $599)

El servidor de IA doméstico silencioso por defecto, gracias a la memoria unificada. En una PC normal, la VRAM de la GPU es un muro duro. Apple comparte memoria entre la CPU y la GPU, por lo que el Mac mini ejecuta más de lo que sugiere su hoja de especificaciones, permanece casi silencioso y consume poca energía.

text
1Chip: Apple M4
2Memoria unificada: 16-32GB (compartida CPU + GPU)
3Consumo: 10-30W bajo carga
4Costo eléctrico 24/7: aproximadamente $3-8/mes
5Ejecuta bien: Llama 3.2, Mistral 7B, Qwen 2.5, Phi-3 Medium

Hace todo lo que hace el Jetson, más modelos más grandes, contexto más largo y varios servicios a la vez. Esta es la caja que la gente deja encendida todo el día como backend para sus automatizaciones. Los $599 son la base, eso sí, y Apple cobra fuerte por la memoria. Para IA local, la memoria es el punto, así que cotiza la configuración que realmente necesitas, no la etiqueta.

RetroChainer - inline image

Peldaño 5. RTX 3090 usado, 24GB (~$700 por la tarjeta)

La leyenda del valor que se niega a morir. Seis años de antigüedad y sigue siendo la mejor VRAM por dólar en el mercado de consumo. Un 3090 usado te da 24GB de memoria rápida por alrededor de $700, suficiente para ejecutar modelos de 24B a 32B con rendimiento real, con soporte completo de CUDA para que todas las herramientas funcionen de inmediato.

text
1VRAM: 24GB GDDR6X
2Ancho de banda: ~936 GB/s
3Precio usado: ~$600-800 (solo tarjeta)
4Ejecuta bien: Qwen 32B, Llama 3.1 8B-70B (cuantizado), la mayoría de clase 32B

El asterisco honesto: una GPU no es una computadora. Necesitas una PC anfitriona alrededor, así que presupuesta otros $400 a $600 para el resto de la máquina. Pero si ya tienes un escritorio con una ranura libre y una fuente de alimentación suficientemente grande, nada más en esta escalera te da 24GB tan barato.

RetroChainer - inline image

Peldaño 6. AMD Radeon RX 7900 XTX, 24GB (~$900 por la tarjeta)

Los mismos 24GB que el 3090, nuevo, con garantía, y el software de AMD finalmente se ha puesto al día. En ROCm 7.x, la 7900 XTX ejecuta Llama 3.1 8B a aproximadamente 96 tokens por segundo, alrededor de tres cuartos de una RTX 4090 a una fracción del precio. Por VRAM pura por dólar en hardware nuevo, nada de NVIDIA lo iguala a nivel de consumo.

text
1VRAM: 24GB GDDR6
2Software: ROCm 7.x (soporte de primera clase)
3Precio nuevo: ~$899-1,400 (solo tarjeta)
4Ejecuta bien: Llama 3.1 8B (~96 tok/s), clase 32B cuantizado

El inconveniente es el mismo que persigue a AMD a todas partes: ROCm ha cerrado la mayor parte de la brecha con CUDA, pero algunas herramientas todavía asumen NVIDIA por defecto. Para Ollama y Open WebUI funciona bien hoy. Para pilas de fine-tuning exóticas, espera algunos pasos manuales adicionales.

RetroChainer - inline image

Peldaño 7. AMD Ryzen AI Max+ 395 "Strix Halo", 128GB (~$1,999)

El punto dulce de 2026, y la caja que la mayoría de estas listas olvida. El chip Strix Halo de AMD combina una CPU Zen 5 de 16 núcleos con una iGPU RDNA 3.5 grande y hasta 128GB de memoria unificada en una caja pequeña, por aproximadamente lo que cuesta una NVIDIA de escritorio con un cuarto de la memoria.

text
1Chip: Ryzen AI Max+ 395 (16 núcleos Zen 5)
2GPU: Radeon 8060S (40 núcleos RDNA 3.5)
3NPU: XDNA 2, 50 TOPS (~126 TOPS en todo el sistema)
4Memoria unificada: hasta 128GB LPDDR5X (~96GB utilizables como VRAM)
5Precio: ~$1,999 para 128GB / 2TB
6Ejecuta bien: Llama 3.3 70B, Mixtral, la mayoría de modelos clase 70B

La compras de dos maneras. El GMKtec EVO-X2 es un mini PC de 128GB terminado por aproximadamente $1,999. El Framework Desktop es el mismo chip en un chasis reparable y actualizable, desde $1,999 por la placa y alrededor de $2,850 completamente ensamblado. De cualquier manera, cargas un modelo de 70B a velocidad conversacional, algo que nada por debajo de este peldaño puede hacer. La madurez de ROCm es la compensación, igual que en el Peldaño 6.

RetroChainer - inline image

Peldaño 8. NVIDIA RTX 5090, 32GB (~$3,000 por la tarjeta)

Lo más rápido que una persona normal puede poner en una torre normal. 32GB de la memoria de consumo más rápida jamás fabricada, y velocidad bruta que deja atrás a todo lo que está debajo. Este es el peldaño para personas que quieren inferencia local de clase fronteriza y entrenamiento ocasional, y que se preocupan más por los tokens por segundo que por los dólares por gigabyte.

text
1VRAM: 32GB GDDR7
2Precio nuevo: ~$3,000+ (solo tarjeta)
3Ejecuta bien: 32B a velocidad, 70B cuantizado, modelos de imagen y video

La matemática es brutal, sin embargo. Cuesta de tres a cuatro veces un 3090 usado por 8GB más de memoria, más una PC anfitriona encima. Cómprala porque necesitas la velocidad y el margen adicional, no porque sea eficiente. No lo es.

RetroChainer - inline image

Peldaño 9. Apple Mac Studio M3 Ultra, 96GB (desde $3,999)

La estación de trabajo grande, silenciosa y de memoria unificada. El Mac Studio agrupa hasta 96GB entre CPU y GPU con aceleración Metal, ejecuta modelos grandes casi en silencio, y lo hace en una caja que cabe en un escritorio sin una curva de ventilador de motor a reacción.

text
1Chip: M3 Ultra (hasta CPU de 32 núcleos / GPU de 80 núcleos)
2Memoria unificada: hasta 96GB
3Precio: desde $3,999
4Ejecuta bien: modelos clase 70B, contexto largo, múltiples servicios

Vale la pena saber honestamente: Apple retiró la configuración de 512GB a principios de 2026 cuando la escasez de DRAM afectó, así que 96GB es el techo ahora donde solía llegar mucho más alto. Aun así, para una máquina silenciosa de todo el día que ejecuta modelos grandes y funciona como tu computadora real, pocas cosas son tan agradables de tener.

RetroChainer - inline image

Peldaño 10. NVIDIA DGX Spark, 128GB ($3,999 a $4,699)

El escritorio que cree que es un centro de datos. Para fine-tuning de modelos abiertos, alojar asistentes de más de 70B y ejecutar pipelines de inferencia que necesitan rendimiento real.

text
1Chip: GB10 Grace Blackwell
2Rendimiento IA: 1 PFLOP
3Memoria unificada: 128GB LPDDR5x
4Almacenamiento: 4TB Gen5 NVMe
5Consumo: 150-240W bajo carga
6Mejor para: modelos de 70B-200B, fine-tuning, inferencia en producción

128GB de memoria unificada cargan modelos que una GPU de consumo ni siquiera puede abrir, y dos unidades enlazadas llegan al territorio de 400B. Honestidad de precio: se lanzó a $3,999 en octubre de 2025 y desde entonces ha subido a aproximadamente $4,699 debido a la escasez de memoria (Tom's Hardware). Al lado de la caja Strix Halo del Peldaño 7, cuesta aproximadamente el doble por los mismos 128GB. Estás pagando por la madurez de CUDA y el rendimiento, no por más memoria.

RetroChainer - inline image

La matemática honesta

text
1Gasto mensual típico en IA:
2ChatGPT Plus $20
3Claude Pro $20
4Cursor Pro $20
5Costos de API $50-200
6Total $110-260 / mes
7
8IA local mensual:
9Hardware $0 (ya comprado)
10Electricidad $2-15
11API $0
12Total $2-15 / mes

A $100/mes en suscripciones, un Jetson de $249 se paga solo en diez semanas, un Mac mini de $599 en seis meses, una construcción con 3090 usado en menos de un año, una caja Strix Halo de $2,000 en aproximadamente dieciocho meses, y los peldaños de $4,000 o más solo si ya estabas quemando alquiler de GPU en la nube por cuatro cifras al mes.

Ahora la parte que el hype siempre omite. La caja es un costo hundido, y solo se "paga" si realmente hubieras seguido pagando la suscripción. Comprar una máquina de $2,000 para ahorrar $20 al mes es un peor negocio que la suscripción, no uno mejor. El peldaño correcto es el que coincide con tu uso real, no con la versión fantástica del mismo.

Cuál es tu peldaño

Uso diario ligero y curiosidad: comienza en el Peldaño 1, luego compra el Jetson. Un asistente silencioso siempre encendido para un hogar o pequeña empresa: el Mac mini. El camino más barato hacia 24GB reales y modelos de 32B: un 3090 usado, o la RX 7900 XTX si quieres nuevo con garantía y no te molesta ROCm. La mejor experiencia de 70B sin dinero de centro de datos: la caja Strix Halo. Máxima velocidad de consumo: la RTX 5090. Una estación de trabajo silenciosa de gran memoria en la que también vives: el Mac Studio. Pipelines de fine-tuning y producción: el DGX Spark.

La configuración que toma una tarde

El proceso es idéntico en cada peldaño.

1. Instala Ollama. Código abierto, convierte cualquier modelo en una API local que habla el lenguaje de OpenAI.

bash
1curl -fsSL https://ollama.com/install.sh | sh

2. Descarga un modelo del tamaño adecuado para la memoria de tu caja.

bash
1# Jetson de 8GB o Mac mini de 16GB:
2ollama pull llama3.2
3
4# 3090 / 7900 XTX de 24GB:
5ollama pull qwen2.5:32b
6
7# Strix Halo / DGX Spark de 128GB:
8ollama pull llama3.3:70b

3. Cambia una línea en el código que ya tienes.

python
1# Antes, pagando por solicitud:
2client = OpenAI(api_key="sk-...")
3
4# Después, local y gratuito:
5client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

Tu código se ejecuta igual. Nada sale de la máquina, nada cuesta dinero por solicitud.

4. (Opcional) Agrega una interfaz de navegador con Open WebUI, y tendrás un ChatGPT privado en localhost:3000.

bash
1docker run -d -p 3000:8080 \
2 --add-host=host.docker.internal:host-gateway \
3 -v open-webui:/app/backend/data \
4 ghcr.io/open-webui/open-webui:main

Qué ejecutar realmente en él

El hardware es la mitad de la decisión. El modelo es la otra mitad. Un mapa aproximado para 2026:

Pequeño y rápido (cabe en 8-16GB): Llama 3.2 3B, Gemma 2, Phi-3, Mistral 7B. Excelente para redacción, clasificación y preguntas y respuestas sobre tus propias notas. El nivel de caballo de batalla (cabe en 24GB): Qwen 2.5 32B y Llama cuantizado, lo suficientemente fuerte para ayuda real con código y trabajo con documentos. El nivel pesado (necesita 64-128GB): Llama 3.3 70B y las variantes grandes de Qwen y Mixtral, donde la salida local comienza a sentirse cercana a un modelo en la nube para tareas cotidianas.

La cuantización es la palanca silenciosa debajo de todo esto. Un modelo de 70B en una cuantización de 4 bits cabe donde la versión de precisión completa nunca lo haría, con una pequeña pérdida de calidad generalmente aceptable. Q4 a Q6 es el rango sensato para la mayoría de las personas. Por debajo de eso, la calidad cae más rápido de lo que vale el ahorro de memoria.

Qué construyes una vez que está funcionando

Para uso personal cubre lo cotidiano por unos pocos dólares al mes. La parte interesante es la automatización empresarial, donde conectas el modelo local a n8n, la herramienta de código abierto que lo enlaza con Telegram, correo electrónico, calendario, CRM y cientos de servicios. Cada uno de estos se ejecuta sin que nada salga de tu edificio y sin costo por token:

text
1Recepcionista IA:
2mensajes del cliente en Telegram -> n8n lo recibe -> modelo local lee la intención
3-> calendario verifica disponibilidad -> reserva confirmada
4
5Análisis de documentos:
6suelta 50 PDFs -> modelo local los lee todos -> extrae datos clave
7-> escribe un informe estructurado
8
9Resumen diario:
10disparador a las 7am -> modelo lee tus notas y tareas -> resume lo importante
11-> lo envía a tu teléfono
12
13Enriquecimiento de leads:
14nueva fila en una hoja -> modelo investiga la empresa -> redacta un mensaje personalizado
15-> lo pone en cola para tu revisión
16
17Reutilización de contenido:
18una grabación larga -> modelo transcribe y la corta -> escribe las publicaciones
19-> guarda borradores para que los apruebes
20
21Clasificación de bandeja de entrada:
22nuevo correo -> modelo clasifica, etiqueta y redacta una respuesta -> tú presionas enviar o editas

Para trabajo sensible a la privacidad, deja de ser una decisión de costo y se convierte en la única opción. Documentos legales, registros médicos, datos financieros, cualquier cosa bajo NDA no tiene cabida en una API de terceros. La IA local lo procesa en tu máquina y nunca sale de ella.

Lo que realmente sale mal

El 20% es real. Los modelos de frontera todavía ganan en razonamiento difícil, codificación de vanguardia e investigación donde la mejor respuesta única importa. La IA local es el caballo de batalla confiable, privado y siempre encendido para el otro 80%, no un reemplazo para todo. Mantén una suscripción en la nube para el 20% difícil y ejecuta el resto en casa, y tendrás ambos.

La memoria es el techo, no los TOPS. Compra para el tamaño de modelo que quieras ejecutar, y recuerda que las cajas con memoria unificada se estiran más que una PC con especificaciones equivalentes y VRAM separada.

Una GPU no es una computadora. Los peldaños 3090, 7900 XTX y 5090 necesitan una máquina anfitriona a su alrededor. El precio de la tarjeta no es el precio del sistema, así que agrega $400 a $600 antes de compararlo con un mini PC terminado.

Los precios están subiendo. La escasez de DRAM ya elevó el DGX Spark un 18% e hizo que Apple retirara su Mac Studio de 512GB. La buena oferta de hoy puede costar más el próximo trimestre.

AMD ahorra dinero y cuesta tiempo. Strix Halo y la 7900 XTX te dan la mayor cantidad de memoria por dólar, pero ROCm todavía está detrás de CUDA en herramientas llave en mano. Bien para Ollama hoy, se necesita más paciencia para entrenamiento pesado.

Calor, ruido y cuantización son la letra pequeña. Las construcciones grandes con GPU son ruidosas y calientes. La cuantización agresiva ahorra memoria pero come calidad si la llevas demasiado lejos. Ninguno es un factor decisivo, pero nadie los menciona en el discurso de venta.

Dos cosas que hacer ahora

Pruébalo gratis primero. Instala Ollama en la computadora que ya posees y ejecuta un modelo de 7B este fin de semana. Cualquier máquina de 8GB lo hace. Prueba el flujo de trabajo antes de gastar un centavo en hardware.

Luego compra un peldaño por encima de tus necesidades reales, no cinco. Las personas que configuraron silenciosamente IA local en 2025 van a verse muy por delante de la curva para 2027, a medida que los precios de la nube sigan subiendo y el hardware local siga mejorando. La mayoría de la gente seguirá pagando $200 al mes por costumbre. Unos pocos dedicarán una tarde esta semana y nunca enviarán otro byte al servidor de otra persona.

Analizo herramientas de IA y el dinero que se genera con ellas regularmente como este. Sígueme para la próxima, y únete a mi Telegram: https://t.me/+lzSPoQ0svRU1ZWZi

Recrear en YouMind

Turn one viral article into a full content workflow

Collect the source, decode the pattern, create assets, draft the story, and distribute from one AI workspace.

Explore YouMind
Para creadores

Convierte tu Markdown en un artículo de 𝕏 impecable

Cuando publicas tus propios textos largos, dar formato en 𝕏 a imágenes, tablas y bloques de código es un fastidio. YouMind convierte un borrador completo en Markdown en un artículo de 𝕏 impecable y listo para publicar.

Prueba Markdown a 𝕏

Más patrones por descifrar

Artículos virales recientes

Explorar más artículos virales