| RTX A4000Ampere |
WORKSTATION |
16 GB | GDDR6 ECC | 448 GB/s | 140 W | PCIe 4.0 |
Qwen2.5 14B | Q4 | ≈ 30–40 |
Очень экономичная, 32B уже тесно |
| RTX A5000Ampere |
WORKSTATION |
24 GB | GDDR6 ECC | 768 GB/s | 230 W | 2-way NVLink |
Qwen2.5 32B | Q4 | ≈ 24–32 |
Интересна парами: 48 GB суммарно |
| RTX A6000Ampere |
WORKSTATION |
48 GB | GDDR6 ECC | 768 GB/s | 300 W | 2-way NVLink |
Qwen2.5 72B | Q4 | ≈ 9–14 |
Большая VRAM важнее пиковой скорости |
| Tesla V100 SXM2Volta |
DATACENTER |
32 GB | HBM2 ECC | 900 GB/s | 300 W | NVLink 300 GB/s |
Qwen2.5 32B | Q4 | ≈ 18–26 |
Старая, но HBM2 и NVLink полезны в multi-GPU |
| GeForce RTX 3090Ampere |
CONSUMER |
24 GB | GDDR6X | 936 GB/s | 350 W | NVLink |
Qwen2.5 32B | Q4 | ≈ 28–37 |
До сих пор отличный ₽/GB вариант на б/у рынке |
| GeForce RTX 4090Ada |
CONSUMER |
24 GB | GDDR6X | 1008 GB/s | 450 W | PCIe 4.0 |
Qwen2.5 32B | Q4 | ≈ 34–42 |
Очень быстрый single-GPU, но VRAM всего 24 GB |
| GeForce RTX 5090Blackwell |
CONSUMER |
32 GB | GDDR7 | 1792 GB/s | 575 W | PCIe 5.0 |
Qwen2.5 32B | Q4 | ≈ 58–71 |
Сильнейший потребительский вариант для dense 32B |
| NVIDIA L40SAda Datacenter |
DATACENTER |
48 GB | GDDR6 ECC | 864 GB/s | 350 W | PCIe 4.0 |
Qwen2.5 32B / 72B | Q4 | ≈ 28–34* |
48 GB дают свободу по контексту и моделям |
| NVIDIA A100 SXMAmpere Datacenter |
DATACENTER |
80 GB | HBM2e ECC | ≈ 2039 GB/s | 400 W | NVLink / NVSwitch |
Qwen2.5 72B | Q4 / INT8 | ≈ 20–30* |
Хороша для большой модели и серверного batching |
| NVIDIA H100 SXMHopper Datacenter |
DATACENTER |
80 GB | HBM3 ECC | ≈ 3350 GB/s | до 700 W | NVLink / NVSwitch |
Qwen2.5 72B | INT4 / FP8 | ≈ 40–60+* |
Дорогая, зато раскрывается в vLLM и batch-нагрузке |