Подписывайся на Telegram-канал — пишем про нейросети и ИИ сервисыПодписаться

Калькулятор GPU/VRAM для AI

← Инструменты

Подберите видеокарту под Llama 4, Qwen 3.7, DeepSeek V4, GLM-5.2 и image/video модели — или проверьте, хватит ли вашей GPU. Учитываются квантизация, длина контекста, batch и лёгкий fine-tune. Связан с каталогом AI и конструктором.

Контекст8.192k
2.048k8.192k32.768k131.072k1.048576M
Нужно VRAM
64.5 GB
Веса
55 GB
KV-cache
2.7 GB
Активации
1.2 GB
Оверхед
0.8 GB

Топ рекомендации

Лучший fit
A100 80GB
80 GB · ~$15 000 · Запас 19%
Дешевле
MacBook Pro M3 Max 128GB
128 GB · ~$4 500 · Запас 50%
Запас VRAM
Mac Studio M2 Ultra 192GB
192 GB · ~$7 000 · Запас 66%

Подходящие GPU

  • A100 80GB
    80 GB · Ampere (Pro) · ~$15 000
    Подходит19%
  • H100 80GB
    80 GB · Hopper (Pro) · ~$30 000
    Подходит19%
  • MacBook Pro M4 Max 128GB
    128 GB · Apple Silicon · ~$5 000
    Подходит50%
  • MacBook Pro M3 Max 128GB
    128 GB · Apple Silicon · ~$4 500
    Подходит50%
  • H200 141GB
    141 GB · Hopper (Pro) · ~$35 000
    Подходит54%
  • Mac Studio M4 Ultra 192GB
    192 GB · Apple Silicon · ~$8 000
    Подходит66%
  • Mac Studio M2 Ultra 192GB
    192 GB · Apple Silicon · ~$7 000
    Подходит66%

Оценка ±15–20%. Реальный расход зависит от runtime (llama.cpp, vLLM, Ollama) и драйверов. Данные проверены: 2026-07-23.

Популярные связки модель × квант × GPU

Готовые примеры для индексации и быстрого старта. Цифры посчитаны формулой калькулятора (inference, batch 1).

Датасет GPU/моделей проверен: 2026-07-23

МодельКвантКонтекстVRAMМин. GPU
Llama 3.1 8BGGUF Q48.192k7.4 GBRTX 3080 10GB (10 GB)Открыть
Mistral 7BGGUF Q48.192k6.8 GBRTX 4060 (8 GB)Открыть
Llama 3.1 70BINT4 / GPTQ / AWQ4.096k41.4 GBA100 80GB (80 GB)Открыть
Llama 4 MaverickGGUF Q48.192k64.5 GBA100 80GB (80 GB)Открыть
Qwen 3.7GGUF Q48.192k23 GBRTX 5090 (32 GB)Открыть
GLM-5.2INT4 / GPTQ / AWQ8.192k59.1 GBA100 80GB (80 GB)Открыть
FLUX.1 DevFP16 (full)2.048k27.2 GBRTX 5090 (32 GB)Открыть

FAQ по VRAM и локальному запуску

Сколько VRAM нужно для модели 70B?
В FP16 только веса 70B занимают порядка 140 ГБ. В INT4 / AWQ / GPTQ при умеренном контексте (4k–8k) часто получается 35–50 ГБ — реалистичны A100 40GB (впритык) или карты класса 48–80 ГБ. Считайте с учётом длины контекста: KV-cache растёт с числом токенов.
Чем GGUF Q4 отличается от INT4?
Оба варианта около 4 бит на параметр. INT4 обычно означает GPTQ/AWQ в CUDA-стеках (vLLM, transformers). GGUF Q4 — формат llama.cpp / Ollama, удобный для потребительских GPU и Apple Silicon. Качество и точный расход VRAM зависят от runtime; у Q4_K запас чуть больше «голой» оценки 0.5 байта/параметр.
Хватит ли 8 ГБ VRAM для локальных LLM?
Да для небольших моделей: 7–8B в GGUF Q4 на контексте 2k–8k обычно влезают в 8 ГБ с небольшим запасом. 13–14B Q4 уже впритык. 70B на 8 ГБ без тяжёлого offload не запустить. Image-модели вроде FLUX.1 Dev в FP16 обычно просят 12–24 ГБ.
Почему длинный контекст ест больше VRAM?
KV-cache растёт пропорционально длине последовательности × числу слоёв × KV-голов. Удвоение контекста почти удваивает вклад KV при тех же весах. Поэтому 8B Q4 может быть ~5–6 ГБ на 2k и заметно больше на 32k–128k.
Насколько точен этот калькулятор?
Ориентир ±15–20%. Реальный расход зависит от runtime (llama.cpp, vLLM, Ollama), CUDA graphs, квантизации KV и драйверов. Лучше брать карту с запасом, а не идеальный «впритык».

Связанные материалы