Ordenadores para inteligencia artificial local

Qué hardware hace funcionar qué modelos (texto, imagen, vídeo, voz), a qué velocidad y cuánto cuesta. Con los modelos abiertos del catálogo de Bytgon y una calculadora para tu caso.

La regla de la memoria

Un modelo de lenguaje necesita en memoria de GPU aproximadamente parámetros × bytes por parámetro × 1,2. A 4 bits (lo habitual en local) un modelo de 8B ocupa ~5 GB, uno de 27B ~18 GB y uno de 70B ~46 GB. La velocidad depende del ancho de banda: una RTX 5090 (1.792 GB/s) genera ~20 tokens/s con un 70B a 4 bits; un Mac Studio M3 Ultra (819 GB/s) lo mueve a ~9 tok/s pero puede cargar modelos de 400B que no caben en ninguna gráfica de consumo.

Portátil con NPU (sin gráfica dedicada)

Core Ultra / Ryzen AI / Snapdragon X con 16-32 GB: modelos de 1-8 B a Q4 (Phi-4 mini, Gemma 4 4B, Qwen 8B), Whisper, Kokoro. 10-30 tok/s.

900 € – 1800 €
GPU de 8 GB (RTX 5060 / 4060)

LLM de 7-9 B a Q4 (~40-60 tok/s), SDXL, FLUX NF4, LTX-Video 2B. Para empezar.

900 € – 1300 €
GPU de 16 GB (RTX 5060 Ti 16 GB / 5070 Ti / RX 9070 XT)

LLM de 14-27 B a Q4 (~25-45 tok/s), FLUX.1 FP8, Wan 2.2 5B, HunyuanVideo con descarga. El punto dulce calidad-precio.

1300 € – 2200 €
GPU de 24-32 GB (RTX 4090 / 5090)

LLM de 32 B a Q4 o 70 B a Q3 (RTX 5090 ~20 tok/s), FLUX.2 FP8, Wan 2.2 14B FP8, entrenamiento de LoRA.

2800 € – 5500 €
Memoria unificada grande (Mac Studio / Strix Halo 128 GB)

LLM de 70-120 B a Q4 (M4 Max 128 GB ~8-12 tok/s; M3 Ultra 512 GB corre DeepSeek V4 a Q4 ~6 tok/s). Generación de imagen más lenta que NVIDIA.

2400 € – 12.000 €
Multi-GPU / RTX PRO 6000 96 GB

Modelos de 120-400 B, inferencia para equipos, fine-tuning completo. Pide presupuesto a nuestro taller de montaje.

9000 € – 40.000 €

Modelos de texto abiertos

FamiliaTamañosFuerte enDónde corre
Qwen 3.5 / 3.6 / 3.8
Alibaba (Qwen) · Apache 2.0
0.6B, 1.7B, 4B, 8B, 9B, 14B, 27B, 32B
MoE: Qwen3.5-35B-A3B (3B activos de 35B), Qwen3.5-122B-A10B (10B activos de 122B), Qwen3.5-397B-A17B (17B activos de 397B)
razonamiento, código, multilingüe (español excelente), visión en variantes omniOllama, LM Studio, llama.cpp, vLLM
DeepSeek V4 / R1 (y destilados)
DeepSeek · MIT
1.5B, 7B, 8B, 14B, 32B, 70B
MoE: DeepSeek-V4 Flash (15B activos de 230B), DeepSeek-V4 Pro (37B activos de 671B)
razonamiento profundo y matemáticas; los destilados de 7-32B caben en una gráfica de 8-24 GBOllama, llama.cpp, vLLM, SGLang
Gemma 4
Google · Gemma (uso comercial permitido)
1B, 4B, 12B, 27B, 31B
MoE: Gemma 4 26B-A4B (4B activos de 26B)
muy eficiente por tamaño, visión, 140 idiomas; 27-31B corre en una RTX 5090 o Mac de 48 GBOllama, LM Studio, llama.cpp, MLX
Llama 3.3 / Llama 4
Meta · Llama Community
1B, 3B, 8B, 70B
MoE: Llama 4 Scout (17B activos de 109B), Llama 4 Maverick (17B activos de 400B)
ecosistema enorme, fine-tuning fácil; Llama 4 Scout con 10M de contextoOllama, llama.cpp, vLLM, MLX
Mistral Small / Medium / Devstral
Mistral AI · Apache 2.0 (Small/Devstral)
3B, 8B, 12B, 24Beuropeo, excelente en español y francés, visión y código (Devstral)Ollama, llama.cpp, vLLM
GPT-OSS
OpenAI · Apache 2.0

MoE: gpt-oss-20b (3.6B activos de 21B), gpt-oss-120b (5.1B activos de 117B)
razonamiento ajustable; el 20B corre en 16 GB y el 120B en una sola RTX PRO 6000 o Mac de 96 GBOllama, llama.cpp, vLLM, LM Studio
Phi-4
Microsoft · MIT
3.8B, 14Bpequeño y muy capaz en matemáticas y razonamiento; ideal para portátiles con NPUOllama, ONNX Runtime, llama.cpp
Kimi K2
Moonshot AI · Modified MIT

MoE: Kimi K2 (32B activos de 1000B)
agentes y uso de herramientas; solo en servidores multi-GPU o Mac Studio 512 GB a Q4vLLM, SGLang, llama.cpp

Pesos descargables para ejecutar en tu equipo. Si no tienes el hardware, los mismos modelos están disponibles en la nube en API Bytgon y en el estudio Bytgon AI.

Catálogo Bytgon en vivo: modelos abiertos y qué necesitas para ejecutarlos en casa

550 modelos en api.bytgon.com (210 abiertos, 152 gratuitos). Para cada modelo abierto de texto calculamos la memoria a 4 bits y la gráfica mínima.

ModeloParámetrosMemoria a 4 bitsHardware mínimoContexto
qwen3.8-2.4t-a95b
alibaba
2.4T (95B activos)~1584 GBsolo servidores1049k
nemotron-3-ultra-550b-a55b
nvidia
550B (55B activos)~363 GBMac Studio 512 GB o multi-GPU262k
nemotron-3-ultra-550b-a55b:free
nvidia · gratis en la nube
550B (55B activos)~363 GBMac Studio 512 GB o multi-GPU1000k
qwen3.5-397b-a17b
alibaba
397B (17B activos)~263 GBMac Studio 512 GB o multi-GPU262k
qwen3-vl-235b-a22b-thinking
alibaba
235B (22B activos)~156 GBMac Studio 512 GB o multi-GPU131k
qwen3-vl-235b-a22b-instruct
alibaba
235B (22B activos)~156 GBMac Studio 512 GB o multi-GPU262k
qwen3-235b-a22b-thinking-2507
alibaba
235B (22B activos)~156 GBMac Studio 512 GB o multi-GPU131k
qwen3-235b-a22b-2507
alibaba
235B (22B activos)~156 GBMac Studio 512 GB o multi-GPU262k
qwen3-235b-a22b
alibaba
235B (22B activos)~156 GBMac Studio 512 GB o multi-GPU131k
qwen3.5-122b-a10b
alibaba
122B (10B activos)~81 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000262k
nemotron-3-super-120b-a12b
nvidia
120B (12B activos)~80 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000262k
nemotron-3-super-120b-a12b:free
nvidia · gratis en la nube
120B (12B activos)~80 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000262k
gpt-oss-120b
openai
120B~80 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000131k
qwen3-next-80b-a3b-thinking
alibaba
80B (3B activos)~53 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000262k
qwen3-next-80b-a3b-instruct
alibaba
80B (3B activos)~53 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000262k
qwen2.5-vl-72b-instruct
alibaba
72B~48 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000128k
qwen-2.5-72b-instruct
alibaba
72B~48 GBMac Studio / Strix Halo 128 GB o RTX PRO 600033k
llama-3.3-70b-instruct
meta
70B~47 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000131k
llama-3.1-70b-instruct
meta
70B~47 GBMac Studio / Strix Halo 128 GB o RTX PRO 6000131k
qwen3.6-35b-a3b
alibaba
35B (3B activos)~24 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3.5-35b-a3b
alibaba
35B (3B activos)~24 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3-vl-32b-instruct
alibaba
32B~22 GBRTX 4090 / 5090 o Mac 32 GB131k
qwen3-32b
alibaba
32B~22 GBRTX 4090 / 5090 o Mac 32 GB131k
qwen-2.5-coder-32b-instruct
alibaba
32B~22 GBRTX 4090 / 5090 o Mac 32 GB33k
gemma-4-31b-it
google
31B~21 GBRTX 4090 / 5090 o Mac 32 GB262k
gemma-4-31b-it:free
google · gratis en la nube
31B~21 GBRTX 4090 / 5090 o Mac 32 GB262k
nemotron-3-nano-omni-30b-a3b-reasoning:free
nvidia · gratis en la nube
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB256k
nemotron-3-nano-30b-a3b
nvidia
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3-vl-30b-a3b-thinking
alibaba
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3-vl-30b-a3b-instruct
alibaba
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3-30b-a3b-thinking-2507
alibaba
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB82k
qwen3-coder-30b-a3b-instruct
alibaba
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3-30b-a3b-instruct-2507
alibaba
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3-30b-a3b
alibaba
30B (3B activos)~20 GBRTX 4090 / 5090 o Mac 32 GB131k
qwen3.6-27b
alibaba
27B~18 GBRTX 4090 / 5090 o Mac 32 GB262k
qwen3.8-27b
alibaba
27B~18 GBRTX 4090 / 5090 o Mac 32 GB1000k
qwen3.5-27b
alibaba
27B~18 GBRTX 4090 / 5090 o Mac 32 GB262k
gemma-3-27b-it
google
27B~18 GBRTX 4090 / 5090 o Mac 32 GB131k
gemma-2-27b-it
google
27B~18 GBRTX 4090 / 5090 o Mac 32 GB8k
gemma-4-26b-a4b-it
google
26B (4B activos)~18 GBRTX 4090 / 5090 o Mac 32 GB262k

Imagen

ModeloVRAM fp16 / fp8 / 4 bitsVelocidadLicencia
FLUX.1 [dev] / [schnell]
Black Forest Labs · 12B · ComfyUI, Forge, Diffusers, DrawThings (Mac)
texto en imagen, manos, fotorrealismo
24 / 12 / 8 GBRTX 4090: ~10 s/imagen (dev, 20 pasos); RTX 5090: ~6 s; M4 Max: ~45 sschnell Apache 2.0; dev no comercial
FLUX.2 [dev]
Black Forest Labs · 32B · ComfyUI, Diffusers
edición multirreferencia, coherencia de personajes
64 / 32 / 18 GBRTX 5090 FP8: ~15 s/imagen; necesita 32 GB o descarga por bloquesno comercial (dev)
Stable Diffusion XL
Stability AI · 3.5B · ComfyUI, A1111/Forge, Fooocus, DrawThings
miles de LoRA y checkpoints; corre en casi cualquier GPU de 8 GB
8 / 6 / 4 GBRTX 3060: ~8 s; RTX 5070: ~2,5 s; Mac M4: ~25 sOpenRAIL++
Stable Diffusion 3.5 Large
Stability AI · 8B · ComfyUI, Diffusers
tipografía y adherencia al prompt
18 / 11 / 7 GBRTX 4090: ~6 sCommunity (gratis <1 M $ ingresos)
Qwen-Image
Alibaba · 20B · ComfyUI, Diffusers
texto en imagen (incluido chino/español), edición
40 / 22 / 12 GBRTX 5090 FP8: ~12 sApache 2.0
HiDream-I1
HiDream · 17B · ComfyUI
licencia MIT y calidad fotográfica
34 / 20 / 12 GBRTX 5090 FP8: ~14 sMIT

Vídeo

ModeloVRAM mín. / recomendadaVelocidadLicencia
Wan 2.2 (5B TI2V / 14B A14B MoE)
Alibaba · 14B · 720p (5B) · 720p-1080p (14B) · ComfyUI, Diffusers
la mejor calidad abierta; texto→vídeo e imagen→vídeo
8 / 24 GBRTX 5090: 5 s de vídeo 720p en ~2-4 min (14B FP8); 5B en ~1 min; RTX 4070 12 GB: 5B con descargaApache 2.0
HunyuanVideo 1.5
Tencent · 8.3B · 480p-1080p · ComfyUI, Diffusers
movimiento natural, imagen→vídeo
14 / 24 GBRTX 4090: 5 s 720p en ~3-6 minTencent Community
LTX-2 / LTX-Video 13B
Lightricks · 13B · hasta 4K (LTX-2) · 1216x704 (13B) · ComfyUI, Diffusers
velocidad en tiempo casi real, audio sincronizado (LTX-2)
8 / 16 GBRTX 4090: 5 s en ~20-40 s (distilled); el más rápidoLTXV Open Weights
CogVideoX 1.5 5B
Zhipu AI · 5B · 1360x768 · ComfyUI, Diffusers
ligero y abierto
8 / 16 GBRTX 4090: 5 s en ~3 minApache 2.0
Mochi 1
Genmo · 10B · 848x480 · ComfyUI
movimiento fluido 30 fps
16 / 24 GBRTX 4090: 5 s en ~5 minApache 2.0

Voz y audio

ModeloTareaVRAMVelocidad
Whisper large-v3 / turbo
OpenAI · MIT · whisper.cpp, faster-whisper, MLX
transcripción6 GBRTX 4070: 1 h de audio en ~2 min (turbo); M4: ~6 min; CPU: 30-60 min
Kokoro 82M
hexgrad · Apache 2.0 · kokoro, ONNX
texto a voz · español incluido1 GBtiempo real ×50 en GPU; funciona en CPU
F5-TTS
SWivid · CC-BY-NC (modelo) / MIT (código) · f5-tts, ComfyUI
clonación de voz4 GBtiempo real ×5 en RTX 3060
Chatterbox
Resemble AI · MIT · chatterbox-tts
texto a voz con emoción4 GBtiempo real ×8 en RTX 4070
MusicGen / ACE-Step
Meta / ACE Studio · CC-BY-NC / Apache 2.0 · ComfyUI, audiocraft
música8 GBACE-Step: 4 min de música en ~20 s en RTX 4090

Equipos para IA ordenados por índice

Todos