Калькулятор GPU/VRAM для AI
← ИнструментыПодберите видеокарту под Llama 4, Qwen 3.7, DeepSeek V4, GLM-5.2 и image/video модели — или проверьте, хватит ли вашей GPU. Учитываются квантизация, длина контекста, batch и лёгкий fine-tune. Связан с каталогом AI и конструктором.
Контекст8.192k
2.048k8.192k32.768k131.072k1.048576M
Нужно VRAM
7.4 GB
Веса
4.4 GB
KV-cache
1.1 GB
Активации
0.6 GB
Оверхед
0.8 GB
Топ рекомендации
Лучший fit
RTX 3080 10GB
10 GB · ~$400 · Запас 26%
Дешевле
RTX 3060 12GB
12 GB · ~$250 · Запас 38%
Запас VRAM
Mac Studio M2 Ultra 192GB
192 GB · ~$7 000 · Запас 96%
Подходящие GPU
- RTX 5060 Ti 8GB8 GB · Blackwell · ~$380Впритык7%
- RTX 4060 Ti 8GB8 GB · Ada Lovelace · ~$400Впритык7%
- RTX 40608 GB · Ada Lovelace · ~$300Впритык7%
- RTX 3070 Ti8 GB · Ampere · ~$350Впритык7%
- RTX 3080 10GB10 GB · Ampere · ~$400Подходит26%
- RTX 507012 GB · Blackwell · ~$550Подходит38%
- RTX 4070 Super12 GB · Ada Lovelace · ~$600Подходит38%
- RTX 407012 GB · Ada Lovelace · ~$500Подходит38%
- RTX 3080 Ti12 GB · Ampere · ~$500Подходит38%
- RTX 3080 12GB12 GB · Ampere · ~$450Подходит38%
- RTX 3060 12GB12 GB · Ampere · ~$250Подходит38%
- RTX 508016 GB · Blackwell · ~$1 000Подходит54%
- RTX 5070 Ti16 GB · Blackwell · ~$750Подходит54%
- RTX 5060 Ti 16GB16 GB · Blackwell · ~$430Подходит54%
- RTX 4080 Super16 GB · Ada Lovelace · ~$1 000Подходит54%
- RTX 4070 Ti Super16 GB · Ada Lovelace · ~$800Подходит54%
- RTX 4060 Ti 16GB16 GB · Ada Lovelace · ~$450Подходит54%
- RTX 409024 GB · Ada Lovelace · ~$1 600Подходит69%
- RTX 309024 GB · Ampere · ~$800Подходит69%
- RTX 3090 Ti24 GB · Ampere · ~$900Подходит69%
- RTX 509032 GB · Blackwell · ~$2 000Подходит77%
- MacBook Pro M4 36GB36 GB · Apple Silicon · ~$2 200Подходит79%
- A100 40GB40 GB · Ampere (Pro) · ~$10 000Подходит82%
- L40S48 GB · Ada Lovelace (Pro) · ~$7 000Подходит85%
- RTX A600048 GB · Ampere (Pro) · ~$4 500Подходит85%
- RTX 6000 Ada48 GB · Ada Lovelace (Pro) · ~$6 800Подходит85%
- MacBook Pro M4 Pro 48GB48 GB · Apple Silicon · ~$3 000Подходит85%
- A100 80GB80 GB · Ampere (Pro) · ~$15 000Подходит91%
- H100 80GB80 GB · Hopper (Pro) · ~$30 000Подходит91%
- MacBook Pro M4 Max 128GB128 GB · Apple Silicon · ~$5 000Подходит94%
- MacBook Pro M3 Max 128GB128 GB · Apple Silicon · ~$4 500Подходит94%
- H200 141GB141 GB · Hopper (Pro) · ~$35 000Подходит95%
- Mac Studio M4 Ultra 192GB192 GB · Apple Silicon · ~$8 000Подходит96%
- Mac Studio M2 Ultra 192GB192 GB · Apple Silicon · ~$7 000Подходит96%
Оценка ±15–20%. Реальный расход зависит от runtime (llama.cpp, vLLM, Ollama) и драйверов. Данные проверены: 2026-07-23.
Популярные связки модель × квант × GPU
Готовые примеры для индексации и быстрого старта. Цифры посчитаны формулой калькулятора (inference, batch 1).
Датасет GPU/моделей проверен: 2026-07-23
| Модель | Квант | Контекст | VRAM | Мин. GPU | |
|---|---|---|---|---|---|
| Llama 3.1 8B | GGUF Q4 | 8.192k | 7.4 GB | RTX 3080 10GB (10 GB) | Открыть |
| Mistral 7B | GGUF Q4 | 8.192k | 6.8 GB | RTX 4060 (8 GB) | Открыть |
| Llama 3.1 70B | INT4 / GPTQ / AWQ | 4.096k | 41.4 GB | A100 80GB (80 GB) | Открыть |
| Llama 4 Maverick | GGUF Q4 | 8.192k | 64.5 GB | A100 80GB (80 GB) | Открыть |
| Qwen 3.7 | GGUF Q4 | 8.192k | 23 GB | RTX 5090 (32 GB) | Открыть |
| GLM-5.2 | INT4 / GPTQ / AWQ | 8.192k | 59.1 GB | A100 80GB (80 GB) | Открыть |
| FLUX.1 Dev | FP16 (full) | 2.048k | 27.2 GB | RTX 5090 (32 GB) | Открыть |
FAQ по VRAM и локальному запуску
- Сколько VRAM нужно для модели 70B?
- В FP16 только веса 70B занимают порядка 140 ГБ. В INT4 / AWQ / GPTQ при умеренном контексте (4k–8k) часто получается 35–50 ГБ — реалистичны A100 40GB (впритык) или карты класса 48–80 ГБ. Считайте с учётом длины контекста: KV-cache растёт с числом токенов.
- Чем GGUF Q4 отличается от INT4?
- Оба варианта около 4 бит на параметр. INT4 обычно означает GPTQ/AWQ в CUDA-стеках (vLLM, transformers). GGUF Q4 — формат llama.cpp / Ollama, удобный для потребительских GPU и Apple Silicon. Качество и точный расход VRAM зависят от runtime; у Q4_K запас чуть больше «голой» оценки 0.5 байта/параметр.
- Хватит ли 8 ГБ VRAM для локальных LLM?
- Да для небольших моделей: 7–8B в GGUF Q4 на контексте 2k–8k обычно влезают в 8 ГБ с небольшим запасом. 13–14B Q4 уже впритык. 70B на 8 ГБ без тяжёлого offload не запустить. Image-модели вроде FLUX.1 Dev в FP16 обычно просят 12–24 ГБ.
- Почему длинный контекст ест больше VRAM?
- KV-cache растёт пропорционально длине последовательности × числу слоёв × KV-голов. Удвоение контекста почти удваивает вклад KV при тех же весах. Поэтому 8B Q4 может быть ~5–6 ГБ на 2k и заметно больше на 32k–128k.
- Насколько точен этот калькулятор?
- Ориентир ±15–20%. Реальный расход зависит от runtime (llama.cpp, vLLM, Ollama), CUDA graphs, квантизации KV и драйверов. Лучше брать карту с запасом, а не идеальный «впритык».