Коротко о главном
Запустить языковую модель локально в 2026 году можно на обычном игровом ПК — вопрос только в том, какого размера модель и с каким качеством. Ключевой параметр — объём видеопамяти (VRAM), а не частота процессора и не объём оперативной памяти. Но здесь есть нюанс, который часто упускают: реальная потребность в VRAM зависит от квантования модели, а не только от числа параметров. Модель на 7 млрд параметров в полной точности FP16 требует около 14 ГБ VRAM, а та же модель в стандартном для Ollama 4-битном квантовании — уже 4–5 ГБ. Разница принципиальная для выбора видеокарты. По сути, компьютер для локального ИИ и компьютер для LLM — это одна и та же задача: расчёты и требования к железу совпадают. Ниже — как это работает и какую сборку взять под свои задачи.
Почему обычный игровой ПК может не подойти: дело в VRAM
Игровая сборка, оптимизированная под FPS, и сборка под локальные LLM расходятся в одном ключевом месте: во время игры видеокарта рендерит кадры, и 8–12 ГБ видеопамяти для этого достаточно даже в 2026 году. Языковая модель работает иначе — все её веса должны целиком поместиться в видеопамять, чтобы генерация текста шла быстро. Если модель не помещается в VRAM, часть слоёв выгружается в обычную оперативную память или вовсе на процессор — скорость генерации падает в разы, с десятков токенов в секунду до одного-двух. Именно поэтому для локальных LLM решает не топовый процессор и не 64 ГБ оперативной памяти сами по себе, а конкретное число гигабайт видеопамяти на видеокарте.
Комплектующие для LLM-сборки
Видеокарта — главный компонент
В актуальном поколении NVIDIA RTX 50 (архитектура Blackwell, память GDDR7) объём VRAM растёт ступенями: RTX 5060 — 8 ГБ, RTX 5060 Ti — 8 или 16 ГБ, RTX 5070 — 12 ГБ, RTX 5070 Ti и RTX 5080 — по 16 ГБ, RTX 5090 — 32 ГБ, подробные характеристики — на официальной странице NVIDIA. Для локальных LLM это напрямую определяет потолок доступных моделей — подробная таблица VRAM по размеру модели и квантованию будет дальше в статье.
Видеокарты AMD и ROCm — рабочая альтернатива
Ещё недавно AMD для локальных LLM была скорее компромиссом, чем выбором — драйверная платформа ROCm заметно отставала от CUDA по стабильности. С выходом ROCm 7.2 в марте 2026 года ситуация изменилась: появилась официальная поддержка RDNA 4, а Ollama, LM Studio, llama.cpp и vLLM заработали «из коробки» без танцев с бубном — Ollama сам определяет видеокарту AMD при установке и подтягивает нужный рантайм. Референсная модель для локальных LLM в 2026 году, по данным RunLocalModel, — Radeon RX 7900 XTX с 24 ГБ GDDR6: на квантованном Llama 3 70B она выдаёт 14–18 токенов/с и стоит примерно на 50% дешевле RTX-видеокарты с таким же объёмом VRAM. Расплата — скорость: на сопоставимых моделях llama.cpp через ROCm выдаёт примерно 75–85% от токенов в секунду, которые даёт NVIDIA той же ценовой категории. Отдельный нюанс — платформа: лучшие результаты ROCm показывает на Linux, а на Windows пока стабильнее вариант через Vulkan в LM Studio, хотя HIP SDK для Windows тоже уже поддерживается.
Оперативная память — от 32 ГБ
Оперативная память для LLM вторична по сравнению с VRAM, но не бесполезна: в неё выгружается часть слоёв модели, если она не помещается в видеокарту целиком (так называемый offloading), и на ней держится сама операционная система с фоновыми процессами. Разумный минимум — 32 ГБ, для работы с несколькими моделями одновременно или offloading крупных моделей — 64 ГБ и больше: здесь как раз тот случай, когда «чем больше, тем лучше» без верхнего предела разумности. Разбор, чем вообще отличаются форматы памяти и на что смотреть при выборе конкретного комплекта, — в статье «DDR4 или DDR5: что выбрать в 2026 году».
Процессор — важен, но вторичен
Процессор почти не участвует в генерации текста, если модель целиком помещается в VRAM — там всю работу делает видеокарта. Его роль заметно растёт только при offloading части слоёв на CPU: тогда современный процессор с высокой частотой на ядро (AMD Ryzen 7000/9000, Intel Core Ultra 200S) даёт заметно более высокий token/s, чем бюджетный. Для сборки, где вся модель остаётся в видеопамяти, переплачивать за топовый процессор ради LLM-задач смысла нет.
Накопитель — NVMe SSD
Файлы моделей весят от нескольких гигабайт до сотен гигабайт, а загружаются в память при каждом запуске или переключении между моделями. NVMe SSD сокращает время загрузки модели в разы по сравнению с HDD или даже SATA SSD — подробнее о разнице между накопителями разобрали в статье «Как выбрать накопитель для компьютера». Для домашнего сервера с несколькими моделями стоит закладывать от 1–2 ТБ.
Сколько VRAM реально нужно: полная точность против квантования
Здесь и находится главная неточность большинства общих рекомендаций в интернете: они считают VRAM по полной точности FP16 — примерно 2 ГБ на 1 млрд параметров. Но почти никто не запускает модели локально в FP16: инструменты вроде Ollama по умолчанию скачивают модель в 4-битном GGUF-квантовании (Q4_K_M), которое занимает уже около 0,56 ГБ на 1 млрд параметров — и почти не теряет в качестве ответов для повседневных задач.
| Размер модели | VRAM, FP16 (полная точность) | VRAM, Q4 (стандарт для Ollama) |
|---|---|---|
| 7–8B | ~14 ГБ | 4–5 ГБ |
| 14B | ~28 ГБ | ~9 ГБ |
| 27–32B | ~56–64 ГБ | ~19 ГБ |
| 70B | ~140 ГБ | ~40 ГБ (+4–8 ГБ на контекст) |
Цифры для Q4 приведены только под веса модели, а сверху нужно закладывать ещё несколько компонентов, подробная методика расчёта — у 9bench:
- KV-кэш. Память модели о текущем разговоре, растёт вместе с длиной контекста — на моделях с эффективной архитектурой внимания это порядка 0,5 ГБ на 32K токенов контекста и около 1,8 ГБ на 128K, но у моделей попроще расход может быть заметно выше.
- Вычислительные буферы. Рабочее пространство для самого прямого прохода вычислений — размер меняется от модели к модели, но именно поэтому нельзя закладывать только вес файла и ждать, что он весь поместится без остатка.
- Энкодер зрения. Если модель мультимодальная (понимает изображения) — добавляет ещё около 2 ГБ поверх текстовой части.
- Операционная система. На Mac особенно критично: macOS ограничивает «прошитую» под GPU память примерно 75% от общего объёма RAM — на 32-гигабайтной машине это около 24 ГБ реального манёвра, не 32.
Практическое правило: закладывайте размер файла модели плюс 20–30% на всё перечисленное выше, и проверяйте, что итог укладывается в доступный потолок. Это же объясняет разницу между комфортной и проблемной квантизацией одной и той же модели на Mac с 32 ГБ памяти: файл на 15,9 ГБ с запасом укладывается в те самые ~24 ГБ, а файл на 21,8 ГБ — уже нет, память заканчивается посреди работы. Есть и более агрессивное квантование — 2-битное и даже 1-битное — которое ужимает те же 27B в 8–12 ГБ ценой заметной, но не катастрофической потери качества; это уже вариант для тех, кто целенаправленно выжимает максимум из ограниченной видеокарты, а не стандартная практика.
Реальная загрузка VRAM во время работы модели — цифра из жизни против расчёта по таблице
Отдельно стоит научиться читать имя файла квантованной модели — оно не случайное.
Например, Model-30B-UD-Q4_K_XL.gguf расшифровывается так: UD
(Unsloth Dynamic) означает смешанную точность с калибровкой по важности слоёв, а не единое
квантование по всей модели; Q против IQ — это два разных
метода квантования (Q — классический блочный, IQ — с кодовой книгой, обычно чуть компактнее
при той же точности); цифра (например, 4) — среднее число бит на параметр; последняя буква
или буквы (XXS, XS, S, M, L, XL) — позиция внутри этого битового уровня, от самого сжатого
до самого качественного. Проще говоря: чем больше буквы справа, тем выше качество и тем
больше файл при одной и той же битности.
Разные квантования одной модели — видно, как размер файла растёт вместе с буквой в конце имени
Модель для прикидки скорости: генерация текста упирается в пропускную способность памяти, а не в чистую вычислительную мощность — грубо говоря, скорость в токенах в секунду примерно равна пропускной способности видеопамяти, делённой на размер задействованной части модели в гигабайтах. Большинство моделей раньше были dense (плотными) — в них при генерации каждого токена участвуют вообще все параметры. Здесь и кроется главный плюс альтернативной архитектуры MoE (mixture of experts, смесь экспертов): общее число параметров определяет, сколько нужно памяти для хранения модели целиком, а вот скорость генерации зависит только от активных параметров — той части, которая реально считается на каждый токен. Экономии по памяти MoE не даёт (хранить приходится всех экспертов), зато ощутимо ускоряет генерацию: модель Qwen3-30B-A3B, например, хранится как 30 млрд параметров, а по скорости ведёт себя как модель на 3 млрд. Похожая логика у Llama 4 Scout от Meta — 109 млрд параметров всего, но активны только 17 млрд, то есть по скорости генерации она ближе к обычной компактной модели, а по объёму хранения — уже ощутимо крупнее.
Именно поэтому на рынке уже есть открытые модели на 2–3 триллиона параметров — Qwen3.8-2.4T-A95B (2,4 трлн всего, активны 95 млрд) и Kimi K3 от Moonshot AI (2,8 трлн, активны 104 млрд): даже при таком масштабе скорость генерации остаётся в пределах разумного. Из российских разработок похожим путём пошёл GigaChat3-702B от Сбера — тоже MoE, с результатом на уровне мировых лидеров в бенчмарке HumanEval+. Честности ради: даже 95–104 млрд активных параметров — это всё ещё серверные кластеры, а не домашний ПК, где для полноценной работы модели нужно где-то хранить все её экспертные веса целиком. Для дома актуальны модели в диапазоне до 70B, о которых и вся статья, а Llama 4 Scout с её 109 млрд общих параметров как раз на границе — потянуть её в квантовании реалистично на сборке уровня «Продвинутый» с offloading в оперативную память.
Бюджетные сценарии
Входной уровень. RTX 5060 8 ГБ или RTX 5070 12 ГБ + 32 ГБ RAM. Комфортно для моделей 7–8B в Q4 — актуальных Qwen3.8, Llama 3.x, Gemma 4 в этом размере хватает для чатов, суммаризации и простого кода.
Оптимальный. RTX 5070 Ti / 5080 16 ГБ + 64 ГБ RAM. Модели 14B в Q4 с комфортным запасом под контекст, вплоть до 27–32B в более агрессивном квантовании.
Продвинутый. RTX 5090 32 ГБ (или связка из двух видеокарт меньшего объёма) + 64–128 ГБ RAM. Модели 27–32B в Q4 без компромиссов по контексту, для 70B понадобится либо вторая видеокарта, либо более агрессивное квантование.
Профессиональный. Для моделей 70B и крупнее без агрессивного квантования выбор уже не сводится к одной видеокарте — на рынке несколько конкурирующих подходов с унифицированной памятью, и они не взаимозаменяемы.
| Устройство | Память | Сильная сторона | Слабое место |
|---|---|---|---|
| NVIDIA DGX Spark и партнёры (ASUS Ascent GX10, HP ZGX Nano — чип GB10) | 128 ГБ, 273 ГБ/с | Обработка промпта (prefill) — на уровне 3×RTX 3090 | Генерация текста медленная: 70B выдаёт около 2,7 токена/с |
| AMD Ryzen AI Max+ 395/495 | до 128–192 ГБ, 256 ГБ/с | Mini-ПК форм-фактор, до 96–160 ГБ можно отдать под GPU | Пропускная способность ниже, чем у дискретной видеокарты |
| Mac mini M4 Pro | до 64 ГБ, 273 ГБ/с | Комфортные 12–18 токенов/с на моделях 30B — лучшая живая интерактивность в этом классе | Потолок памяти ниже — для 70B+ не хватит |
| Mac Studio M5 Ultra | до 512 ГБ, 1,2 ТБ/с | Память и пропускная способность на голову выше остальных — хватит и на 70B+, и на модели покрупнее | Старт от $5499, а конфигурация с 512 ГБ — уже далеко за $10 000 |
Важная оговорка про DGX Spark: заявленные 128 ГБ памяти и поддержка моделей до 200 млрд параметров в FP4 — это про то, что модель поместится, а не про то, что с ней комфортно будет общаться в реальном времени. Независимые замеры показывают сильный разрыв между скоростью обработки промпта и скоростью генерации ответа: причина — пропускная способность памяти всего 273 ГБ/с, ощутимо ниже, чем у дискретной видеокарты того же класса, подробный разбор — у Apertus. На практике DGX Spark лучше всего проявляет себя в пакетной обработке и работе с длинным контекстом, а не в живом чате с моделью на 70B — там комфортнее AMD Ryzen AI Max+ или Mac mini, если размер модели укладывается в их память. Mac Studio на новом чипе M5 Ultra — уже другая весовая категория: анонсирован в конце августа 2026 года, до 512 ГБ единой памяти и 1,2 ТБ/с пропускной способности, подробности — в официальном анонсе Apple. Это снимает саму проблему пропускной способности, из-за которой буксует DGX Spark, но и цена другая — топовая конфигурация с 512 ГБ памяти стоит уже далеко за $10 000. Специализированные системы такого класса — это уже не апгрейд игрового ПК, а отдельный сегмент стоимостью от 400 000–450 000 ₽ на входе, подробности о самом DGX Spark — у PNY.
Независимое практическое тестирование (обзор канала PRO Hi-Tech) добавляет ещё один штрих: в типичном сценарии с одним пользователем DGX Spark не показал ощутимого преимущества перед мини-ПК на AMD Ryzen AI Max+ 395 — притом что у Spark есть аппаратное ускорение FP4, которого нет у конкурента. Разница проявляется в основном в пакетных сценариях с большим числом параллельных запросов, но и здесь есть практический потолок: по независимым оценкам, обслуживать больше примерно 50 параллельных запросов на одном Spark уже нерентабельно. Показательное сравнение из этого же теста: пропускная способность памяти у RTX 5090 больше чем в 6 раз выше, чем у Spark или мини-ПК на AMD — ровно то, о чём говорилось выше: если модель помещается в VRAM дискретной видеокарты целиком, она отработает быстрее любой унифицированной памяти того же объёма.
Где скачать модели
Основной источник официальных открытых весов — Hugging Face: там модели публикуют сами разработчики (Meta, Google, Alibaba, Moonshot AI, Сбер) в исходном формате SafeTensors, а сообщество быстро выкладывает рядом конвертации в GGUF — формат, с которым работают Ollama и llama.cpp. У SafeTensors и GGUF разное назначение: SafeTensors — это только веса, требует питоновскую экосистему transformers и подходит для дообучения, а GGUF — самодостаточный файл с уже встроенными токенизатором и шаблоном чата, заточенный именно под инференс на C++-рантаймах. Для практического локального запуска нужен именно GGUF. Проверять стоит, что модель выложена от верифицированного аккаунта организации (значок официального профиля), а не случайного загрузчика — веса можно незаметно подменить.
Значок Verified у официальной организации на Hugging Face
Альтернативы Hugging Face: собственная библиотека Ollama (ollama.com/library) — там уже отобранные, готовые к скачиванию одной командой модели без необходимости искать подходящий GGUF-файл самостоятельно; ModelScope — китайский аналог Hugging Face, где новые модели вроде Qwen или GLM иногда появляются даже раньше; официальные страницы моделей на сайтах самих разработчиков (ai.google.dev для Gemma, github.com/moonshotai для Kimi) — там же обычно и самая точная документация по системным требованиям конкретной модели.
Как запустить LLM локально
Программная часть в 2026 году не требует навыков программирования. Ollama — самый простой вход: одна команда устанавливает модель в готовом Q4-квантовании и поднимает локальный API, совместимый с форматом OpenAI. LM Studio даёт то же самое, но с графическим интерфейсом — удобно для тех, кто не хочет работать через терминал. Для максимальной скорости, особенно на MoE-моделях (смесь экспертов), опытные пользователи переходят на llama.cpp напрямую — в отдельных сценариях он даёт прирост в 2–3 раза быстрее, чем Ollama, за счёт более гибкой настройки распределения слоёв между GPU и CPU, но требует ручной сборки параметров запуска.
Так выглядит запущенная модель — терминал с Ollama или окно LM Studio с живым чатом
Готовые сборки для ИИ-задач
Если не хочется подбирать баланс видеокарты, памяти и охлаждения самостоятельно — в каталоге Роботкомп есть сборки с видеокартами от 8 до 16 ГБ VRAM под разные бюджеты. Вот конкретные модели по уровням из этой статьи — актуальные конфигурации на сайте могут немного отличаться, поэтому рядом с каждой сборкой добавлена ссылка на все варианты с той же видеокартой.
| Уровень | Сборка | Что потянет в Q4 |
|---|---|---|
| Входной | Посейдон (RTX 5070 12 ГБ, 32 ГБ RAM) — другие сборки с RTX 5060 и RTX 5070 | 7–8B свободно, 14B впритык |
| Оптимальный | Анаконда 3.0 (RTX 5070 Ti 16 ГБ, 32 ГБ RAM) или Юпитер (RTX 5080 16 ГБ, 64 ГБ RAM — с запасом под офлоадинг) — другие варианты с RTX 5080 | 14B свободно, 27–32B в агрессивном квантовании |
| Продвинутый | Для сборки с RTX 5090 нужна консультация и индивидуальная конфигурация | 27–32B в Q4 без компромиссов по контексту |
| Профессиональный | Отдельные устройства NVIDIA, AMD и Apple напрямую от производителей и их партнёров | 70B и крупнее |
Если собираете такую систему самостоятельно, после сборки стоит прогнать её через стресс-тест — под длительной нагрузкой на видеокарту во время генерации разница между стабильной сборкой и нестабильной проявляется быстрее, чем в играх. Как это сделать — в статье «Как провести стресс-тест процессора и видеокарты».
Заключение
Область развивается быстро, и это стоит учитывать при планировании железа наперёд. Новые архитектурные приёмы меняют требования к памяти и скорости чуть ли не с каждым крупным релизом: например, предварительная версия архитектуры будущего Qwen4 — Qwen3.8-Flash-Next — совмещает гибридное внимание, новый оптимизатор обучения и таблицу N-грамм прямо в оперативной памяти вместо VRAM, за счёт чего разгоняет обработку длинного контекста в разы по сравнению с предыдущим поколением той же линейки. Модель, которая сегодня кажется требовательной, через полгода-год может получить более эффективного преемника с теми же возможностями, но заметно меньшими аппетитами к памяти.
Но и гнаться за самой свежей архитектурой ради самой свежести не стоит: она не всегда ровно лучше предыдущей во всём. У той же Qwen3.8-Flash-Next, например, заметно просело качество русского языка по сравнению с более старыми моделями линейки. Собирая компьютер под локальные LLM, разумнее ориентироваться на актуальный диапазон моделей и брать запас по VRAM и RAM, а не пытаться угадать архитектуру следующего поколения.
Компьютер для локального запуска LLM в 2026 году — это в первую очередь видеокарта с нужным объёмом VRAM, а не топовый процессор или огромный объём оперативной памяти. Прежде чем ориентироваться на таблицы VRAM для полной точности FP16, стоит посчитать реальную потребность под квантованную модель — разница может быть в три раза, и во столько же раз дешевле окажется подходящая видеокарта.
Смотреть готовые сборки в каталоге Роботкомп
Получить консультацию по сборке под локальные LLM
С уважением, Команда Роботкомп!
