LOCAL LLM · GPU QUICK REFERENCE

Видеокарты для локального запуска Qwen

Быстрый ориентир по VRAM, пропускной способности памяти, энергопотреблению и реальной скорости генерации. Для каждой карты выбрана модель семейства Qwen, которая разумно помещается в её память без бессмысленного CPU-offload.

Q4_K_Mосновной формат сравнения
1 streamинтерактивная генерация, batch=1
2K–4K ctxкороткий контекст для сравнимости
≈, не SLAскорость зависит от runtime и настроек

Сравнение GPU

Скорость — ориентир generation tok/s, не prompt processing
GPU Класс VRAM Память Bandwidth TDP/TBP Связь GPU Рекомендуемый Qwen Квант ≈ tok/s Комментарий
RTX A4000Ampere WORKSTATION 16 GBGDDR6 ECC448 GB/s140 WPCIe 4.0 Qwen2.5 14BQ4≈ 30–40 Очень экономичная, 32B уже тесно
RTX A5000Ampere WORKSTATION 24 GBGDDR6 ECC768 GB/s230 W2-way NVLink Qwen2.5 32BQ4≈ 24–32 Интересна парами: 48 GB суммарно
RTX A6000Ampere WORKSTATION 48 GBGDDR6 ECC768 GB/s300 W2-way NVLink Qwen2.5 72BQ4≈ 9–14 Большая VRAM важнее пиковой скорости
Tesla V100 SXM2Volta DATACENTER 32 GBHBM2 ECC900 GB/s300 WNVLink 300 GB/s Qwen2.5 32BQ4≈ 18–26 Старая, но HBM2 и NVLink полезны в multi-GPU
GeForce RTX 3090Ampere CONSUMER 24 GBGDDR6X936 GB/s350 WNVLink Qwen2.5 32BQ4≈ 28–37 До сих пор отличный ₽/GB вариант на б/у рынке
GeForce RTX 4090Ada CONSUMER 24 GBGDDR6X1008 GB/s450 WPCIe 4.0 Qwen2.5 32BQ4≈ 34–42 Очень быстрый single-GPU, но VRAM всего 24 GB
GeForce RTX 5090Blackwell CONSUMER 32 GBGDDR71792 GB/s575 WPCIe 5.0 Qwen2.5 32BQ4≈ 58–71 Сильнейший потребительский вариант для dense 32B
NVIDIA L40SAda Datacenter DATACENTER 48 GBGDDR6 ECC864 GB/s350 WPCIe 4.0 Qwen2.5 32B / 72BQ4≈ 28–34* 48 GB дают свободу по контексту и моделям
NVIDIA A100 SXMAmpere Datacenter DATACENTER 80 GBHBM2e ECC≈ 2039 GB/s400 WNVLink / NVSwitch Qwen2.5 72BQ4 / INT8≈ 20–30* Хороша для большой модели и серверного batching
NVIDIA H100 SXMHopper Datacenter DATACENTER 80 GBHBM3 ECC≈ 3350 GB/sдо 700 WNVLink / NVSwitch Qwen2.5 72BINT4 / FP8≈ 40–60+* Дорогая, зато раскрывается в vLLM и batch-нагрузке

Как читать эту таблицу

Для одиночного чата LLM часто упирается не столько в TFLOPS, сколько в пропускную способность памяти. Поэтому 24–32 GB быстрой потребительской VRAM могут дать отличные tok/s на 14–32B, а 48–80 GB профессиональной памяти прежде всего позволяют держать более крупную модель и длинный KV-cache.

≤ 16 GB7B–14B Q4
24–32 GB14B–32B Q4
48–80 GB32B–72B Q4

О скорости

Числа в колонке tok/s — ориентиры для генерации одного потока при коротком контексте. Реальный результат меняют версия llama.cpp/Ollama/vLLM, квантование, FlashAttention, размер контекста, power limit, CPU, PCIe и число параллельных запросов. Значения со звёздочкой для серверных GPU — инженерная оценка по доступным тестам и bandwidth, а не единый apples-to-apples benchmark.