Калькулятор GPU/VRAM для AI
← ИнструментыПодберите видеокарту под Llama 4, Qwen 3.7, DeepSeek V4, GLM-5.2 и image/video модели — или проверьте, хватит ли вашей GPU. Учитываются квантизация, длина контекста, batch и лёгкий fine-tune. Связан с каталогом AI и конструктором.
Контекст8.192k
2.048k8.192k32.768k131.072k1.048576M
Нужно VRAM
59.1 GB
Веса
50 GB
KV-cache
2.7 GB
Активации
1.2 GB
Оверхед
0.8 GB
Топ рекомендации
Лучший fit
A100 80GB
80 GB · ~$15 000 · Запас 26%
Дешевле
MacBook Pro M3 Max 128GB
128 GB · ~$4 500 · Запас 54%
Запас VRAM
Mac Studio M2 Ultra 192GB
192 GB · ~$7 000 · Запас 69%
Подходящие GPU
- A100 80GB80 GB · Ampere (Pro) · ~$15 000Подходит26%
- H100 80GB80 GB · Hopper (Pro) · ~$30 000Подходит26%
- MacBook Pro M4 Max 128GB128 GB · Apple Silicon · ~$5 000Подходит54%
- MacBook Pro M3 Max 128GB128 GB · Apple Silicon · ~$4 500Подходит54%
- H200 141GB141 GB · Hopper (Pro) · ~$35 000Подходит58%
- Mac Studio M4 Ultra 192GB192 GB · Apple Silicon · ~$8 000Подходит69%
- Mac Studio M2 Ultra 192GB192 GB · Apple Silicon · ~$7 000Подходит69%
Оценка ±15–20%. Реальный расход зависит от runtime (llama.cpp, vLLM, Ollama) и драйверов. Данные проверены: 2026-07-23.
Популярные связки модель × квант × GPU
Готовые примеры для индексации и быстрого старта. Цифры посчитаны формулой калькулятора (inference, batch 1).
Датасет GPU/моделей проверен: 2026-07-23
| Модель | Квант | Контекст | VRAM | Мин. GPU | |
|---|---|---|---|---|---|
| Llama 3.1 8B | GGUF Q4 | 8.192k | 7.4 GB | RTX 3080 10GB (10 GB) | Открыть |
| Mistral 7B | GGUF Q4 | 8.192k | 6.8 GB | RTX 4060 (8 GB) | Открыть |
| Llama 3.1 70B | INT4 / GPTQ / AWQ | 4.096k | 41.4 GB | A100 80GB (80 GB) | Открыть |
| Llama 4 Maverick | GGUF Q4 | 8.192k | 64.5 GB | A100 80GB (80 GB) | Открыть |
| Qwen 3.7 | GGUF Q4 | 8.192k | 23 GB | RTX 5090 (32 GB) | Открыть |
| GLM-5.2 | INT4 / GPTQ / AWQ | 8.192k | 59.1 GB | A100 80GB (80 GB) | Открыть |
| FLUX.1 Dev | FP16 (full) | 2.048k | 27.2 GB | RTX 5090 (32 GB) | Открыть |
FAQ по VRAM и локальному запуску
- Сколько VRAM нужно для модели 70B?
- В FP16 только веса 70B занимают порядка 140 ГБ. В INT4 / AWQ / GPTQ при умеренном контексте (4k–8k) часто получается 35–50 ГБ — реалистичны A100 40GB (впритык) или карты класса 48–80 ГБ. Считайте с учётом длины контекста: KV-cache растёт с числом токенов.
- Чем GGUF Q4 отличается от INT4?
- Оба варианта около 4 бит на параметр. INT4 обычно означает GPTQ/AWQ в CUDA-стеках (vLLM, transformers). GGUF Q4 — формат llama.cpp / Ollama, удобный для потребительских GPU и Apple Silicon. Качество и точный расход VRAM зависят от runtime; у Q4_K запас чуть больше «голой» оценки 0.5 байта/параметр.
- Хватит ли 8 ГБ VRAM для локальных LLM?
- Да для небольших моделей: 7–8B в GGUF Q4 на контексте 2k–8k обычно влезают в 8 ГБ с небольшим запасом. 13–14B Q4 уже впритык. 70B на 8 ГБ без тяжёлого offload не запустить. Image-модели вроде FLUX.1 Dev в FP16 обычно просят 12–24 ГБ.
- Почему длинный контекст ест больше VRAM?
- KV-cache растёт пропорционально длине последовательности × числу слоёв × KV-голов. Удвоение контекста почти удваивает вклад KV при тех же весах. Поэтому 8B Q4 может быть ~5–6 ГБ на 2k и заметно больше на 32k–128k.
- Насколько точен этот калькулятор?
- Ориентир ±15–20%. Реальный расход зависит от runtime (llama.cpp, vLLM, Ollama), CUDA graphs, квантизации KV и драйверов. Лучше брать карту с запасом, а не идеальный «впритык».