Локальная нейросеть звучит как задача для человека с серверной стойкой в гараже. На деле это одна команда в терминале и полчаса ожидания, пока скачаются файлы. Qwen — семейство моделей китайской Alibaba, и часть из них выложена в открытый доступ, поэтому её можно поставить на свой компьютер и работать без интернета, без ключей, без оплаты и без отправки единого символа на чужие серверы.
Здесь пошаговая инструкция на сентябрь 2026: какую версию Qwen качать, сколько нужно видеопамяти, как поставить Ollama на Windows, macOS и Linux, что делать, когда памяти не хватает, и почему статьи в выдаче предлагают вам скачать модель, которой не существует.
Если вы вообще впервые слышите про эту модель, начните с обзора «Qwen: что это за нейросеть от Alibaba». А если хочется сперва понять, как языковые модели устроены внутри, есть разбор «Языковые модели простыми словами».
Инструкция рассчитана на человека, который умеет открыть терминал и скопировать туда строку. Программировать не требуется вообще: работа с моделью идёт в обычном чате, только чат этот живёт у вас на диске.
Если хочется разобраться в теме глубже, чем «поставил и запустил», у нас собрана подборка курсов по нейросетям и искусственному интеллекту: там больше тысячи программ от коротких интенсивов до годовых.
Зачем вообще запускать модель у себя

Три причины, ради которых люди возятся с локальным запуском.
Данные никуда не уходят. Когда вы пишете в облачный чат, текст улетает на чужой сервер. Локальная модель работает на вашем железе: можно спокойно грузить в неё договоры, медицинские выписки, переписку с клиентами и внутренние регламенты. Для юристов, бухгалтеров и всех, кто работает с персональными данными, это часто единственный вариант вообще использовать нейросеть в работе.
Нет ключей, оплаты и региональных ограничений. Не нужен API-ключ, не нужна зарубежная карта, не нужно проверять, поддерживается ли ваша страна. Скачали файл, запустили, работаете. Для тех, кто упирался в это с другими провайдерами, разница ощутимая: локальные модели закрывают этот вопрос целиком.
Работает без интернета. Самолёт, дача, командировка, отключили провайдера. Модель лежит на диске и отвечает так же, как отвечала вчера.
Чего ждать не стоит. Локальная модель на домашней видеокарте слабее облачного флагмана. Она хорошо пишет тексты, переводит, разбирает документы и помогает с кодом, но на олимпиадной математике и длинных многошаговых задачах проиграет. Это рабочая лошадь, а не рекордсмен.
Что такое Ollama и почему начинать стоит с неё
Ollama — бесплатная программа, которая берёт на себя всю техническую возню: скачивает модель, распаковывает её, загружает в память, договаривается с видеокартой и даёт вам простое окно для общения. Примерно как медиаплеер: вы не думаете о кодеках, вы нажимаете «play».
Альтернативы есть. LM Studio удобнее тем, кто не любит терминал вообще: там графический интерфейс и каталог моделей в один клик. vLLM быстрее на потоке запросов, но он рассчитан на серверы и настраивается заметно дольше. Для первого знакомства Ollama выигрывает по одной причине: от установки до первого ответа проходит меньше получаса, и всё это две команды.
Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединитьсяКакую версию Qwen качать
Здесь начинается место, где почти все инструкции в выдаче врут, и врут по-разному.
Первое, что нужно понимать: открыты не все модели Qwen. Alibaba развернулась в сторону закрытых флагманов, и свежие Qwen3.7 и Qwen3.8 работают только через платный API, весов у них нет. Последние открытые модели общего назначения — линейка Qwen3.6, выпущенная в апреле 2026 года под лицензией Apache 2.0. Эта лицензия разрешает и личное, и коммерческое использование.
В открытой линейке две модели, между которыми и предстоит выбирать. Если хочется сравнить их с закрытыми версиями Qwen, у нас есть отдельный разбор «Какую модель Qwen выбрать».
| Модель | Тег в Ollama | Скачать | Что это |
|---|---|---|---|
| Qwen3.6 27B | qwen3.6:27b |
18 ГБ | Плотная модель: работают все 27 млрд параметров сразу |
| Qwen3.6 35B-A3B | qwen3.6:35b |
23 ГБ | Модель со смесью экспертов: из 35 млрд на каждое слово включаются только 3 млрд |
| Версии для Mac | qwen3.6:27b-mlx, qwen3.6:35b-mlx |
19 и 24 ГБ | Сборки под чипы Apple, работают заметно быстрее обычных |
Контекстное окно у обеих моделей — 256 тысяч токенов. Токен — это кусочек текста, на которые модель режет ваш запрос, для русского языка ориентир примерно полтора-два токена на слово. Подробнее мы разбирали это в статье «Что такое токен в нейросети». Практически 256 тысяч означают, что в один разговор помещается книга среднего размера.
Почему модель на 35 миллиардов быстрее модели на 27
Выглядит нелогично, но так и есть, и понимать это полезно при выборе.
Обычная модель при генерации каждого слова прогоняет через себя все свои параметры. Модель со смесью экспертов устроена иначе: внутри неё много небольших специализированных блоков, и на каждое слово включается лишь малая их часть. У Qwen3.6 35B-A3B из 35 миллиардов параметров на каждом шаге работают около трёх миллиардов.
Отсюда практический вывод: место на диске и в памяти она занимает как большая модель, а считает как маленькая. Загрузить в память надо все 35 миллиардов, поэтому 23 ГБ никуда не денутся. Зато отвечать она будет ощутимо бодрее, чем плотная 27B.
Что брать, если не хочется разбираться. Есть 24 ГБ видеопамяти или Mac с 32 ГБ единой памяти, берите
qwen3.6:35b. Видеопамяти 16 ГБ, беритеqwen3.6:27b. Меньше, смотрите таблицу железа ниже, там есть варианты и для скромных конфигураций.
Требования к железу

Главный ресурс здесь — видеопамять (VRAM), собственная память видеокарты. Если модель целиком помещается в неё, вы получаете быстрые ответы. Если не помещается, часть работы уходит на процессор и обычную оперативную память, и скорость падает в разы, хотя работать всё равно будет.
У компьютеров Apple на чипах M-серии память общая для процессора и графики, поэтому там считается вся память устройства целиком, и это большое преимущество: Mac с 32 ГБ тянет модели, для которых на Windows нужна видеокарта верхнего сегмента.
| Ваше железо | Что запустится | Чего ждать |
|---|---|---|
| 8 ГБ ОЗУ, без видеокарты | Мелкие модели на 3–4 млрд параметров | Медленно, для простых задач |
| 16 ГБ ОЗУ + 8 ГБ VRAM | Модели на 7–8 млрд | Комфортная скорость, Qwen3.6 не потянет |
| 32 ГБ ОЗУ + 16 ГБ VRAM | qwen3.6:27b в сжатии Q4 |
Влезает впритык, короткие диалоги |
| 32 ГБ ОЗУ + 24 ГБ VRAM | Обе модели Qwen3.6 свободно | Рабочий вариант без компромиссов |
| Mac с 32 ГБ единой памяти | Обе модели, версии mlx | Быстро и тихо, лучший вариант за свои деньги |
| Mac с 16 ГБ единой памяти | qwen3.6:27b в сильном сжатии |
Работает, но памяти под другие программы почти не остаётся |
Про сжатие стоит сказать отдельно, потому что от него зависит, влезет модель или нет. Квантизация — это упрощение внутренних чисел модели: вместо точных значений хранятся округлённые, файл ужимается в несколько раз, а качество ответов проседает незначительно. Ollama по умолчанию скачивает вариант Q4_K_M, и для большинства задач это удачный баланс. Замеры показывают около 17 ГБ памяти для 27B в этом режиме и около 22 ГБ для 35B-A3B.
Если памяти не хватает пары гигабайт, есть более сильное сжатие Q3: та же 35B-A3B ужимается примерно до 16,6 ГБ. Отвечать модель станет чуть менее аккуратно, но запустится.
Места на диске нужно примерно вдвое больше размера модели: сам файл плюс запас на распаковку и кеш.
Ставим Ollama и запускаем Qwen
Шаг 1: устанавливаем Ollama
Идём на ollama.com и качаем установщик под свою систему.
- Windows и macOS — обычный установщик, запускаете и жмёте «далее». После установки в трее появится значок, программа работает фоном.
- Linux — одна строка в терминале:
curl -fsSL https://ollama.com/install.sh | sh
Проверяем, что всё встало. Открываем терминал (в Windows это PowerShell, в macOS — «Терминал») и пишем:
ollama --version
Ответом должен быть номер версии. Если терминал говорит, что команда не найдена, перезапустите его: путь к программе подхватывается при старте.
Шаг 2: скачиваем модель
ollama pull qwen3.6:27b
Пойдёт загрузка на 18 ГБ. На обычном домашнем интернете это от двадцати минут до часа. Модель кладётся в системную папку, повторно качать её не придётся.
Шаг 3: разговариваем
ollama run qwen3.6:27b
Через несколько секунд появится приглашение, и дальше это обычный чат: пишете вопрос, получаете ответ. Русский язык модели Qwen понимают хорошо, это одна из их сильных сторон. Выйти из чата — команда /bye или сочетание Ctrl+D.
Полезные команды на каждый день:
ollama list— какие модели уже скачаны и сколько занимаютollama ps— что сейчас загружено в памятьollama rm qwen3.6:27b— удалить модель и освободить диск
Шаг 4: если терминал неудобен
Постоянно жить в терминале необязательно. У Ollama есть собственное приложение с обычным окном чата, а из сторонних решений популярен Open WebUI — интерфейс в браузере, похожий на привычные облачные чаты, с историей переписки и переключением моделей.
Если слово «сервер» тут смущает, помогает базовый разбор «Что такое API простыми словами». Для программ Ollama поднимает локальный сервер по адресу localhost:11434, совместимый по формату с популярными API. Практически это значит, что готовый код, написанный под облачного провайдера, часто заводится с локальной моделью после смены одного адреса.
Почему в выдаче попадаются инструкции с несуществующими командами
Отдельное предупреждение, которое сэкономит вам вечер.
По запросам про локальный запуск Qwen в топе стоят сайты, созданные ради трафика, и команды там сгенерированы автоматически. Живой пример из выдачи: строка вида ollama run qwen-3.ru, где вместо имени модели подставлено доменное имя самого сайта. Такой модели не существует, Ollama ответит ошибкой, а начинающий решит, что у него сломан компьютер.
Как отличить рабочую инструкцию от сгенерированной. Настоящий тег модели выглядит как имя:размер, например qwen3.6:27b. В нём нет доменных зон, нет пробелов и нет флагов вроде --port у команды run. Сверить любой тег можно за десять секунд на ollama.com/library: если модели там нет, команда нерабочая.
Сверяться с актуальным поколением моделей полезно и за пределами Qwen: мы держим для этого отдельный разбор открытых и бесплатных альтернатив. Второй маркер устаревшей статьи — модели Qwen 2.5 или Qwen 3 без уточнения версии. Это поколения 2024–2025 годов, они всё ещё скачиваются, но открытая линейка ушла вперёд.
Если что-то пошло не так
Модель не влезает в память
Симптом: Ollama ругается на нехватку памяти либо модель запускается, но отвечает мучительно медленно. Три решения по порядку. Взять сжатие сильнее (Q3 вместо Q4). Взять модель поменьше. Уменьшить размер контекста, потому что длинный диалог сам по себе съедает память сверх веса модели.
Отвечает медленно, хотя видеокарта мощная
Скорее всего, модель частично ушла на процессор. Команда ollama ps покажет, сколько процентов модели лежит на видеокарте. Если там не 100 %, значит памяти не хватило и часть слоёв считает процессор. Помогает то же: меньше модель, сильнее сжатие, короче контекст.
Занят порт 11434
Обычно это вторая копия Ollama, запущенная фоном. Закройте программу из трея и запустите заново.
Кончилось место на диске
Проверьте, сколько занято, через ollama list, и удалите лишние модели командой ollama rm. Люди легко набирают пять-шесть моделей «на попробовать» и теряют сотню гигабайт. Разобраться, чем они между собой отличаются, помогает статья про токены и контекст.
Пять задач, ради которых держат модель на своём компьютере
Абстрактное «работать с нейросетью локально» плохо помогает понять, зачем это лично вам. Вот сценарии, которые встречаются чаще всего.
Разбор документов, которые нельзя показывать наружу. Договор на сорок страниц, выписка, внутренний регламент. Кидаете файл в чат, просите пересказать суть, найти условия расторжения, сравнить с прошлой редакцией. Ничего из этого не уходит с вашего диска, поэтому вопрос «а можно ли грузить туда персональные данные» просто не возникает.
Черновики и переписка. Письма, ответы клиентам, описания вакансий, посты. Задача, где качество локальной модели практически неотличимо от облачной, потому что сложных рассуждений тут не требуется. Формулировкам запросов стоит поучиться отдельно: подборку рабочих шаблонов мы собрали в статье «Промпты для учёбы», они одинаково работают и с локальной моделью.
Помощь с кодом. Объяснить чужую функцию, набросать скрипт, найти ошибку в логах. Модели Qwen традиционно сильны в программировании, и на бытовых задачах разработчика 27B справляется уверенно.
Перевод. Локальная модель переводит целыми документами, не упирается в лимиты и не спрашивает оплату. Для языков основной пары качество ближе к хорошему переводчику, чем к машинному подстрочнику.
Обучение и эксперименты. Когда вы разбираетесь, как устроены запросы к модели, локальный запуск снимает страх «а вдруг накапает счёт». Экспериментируйте сколько угодно, платите только электричеством.
Чего локальная модель не заменит: свежих новостей и фактов о сегодняшнем дне (она знает мир на момент обучения и в интернет не ходит), длинных цепочек рассуждений уровня флагманов и работы с картинками, если вы скачали текстовую версию.
Что происходит с вашими данными

Это причина номер один, по которой локальный запуск вообще интересует компании, поэтому стоит разобрать точно.
Когда модель работает через Ollama на вашем компьютере, текст запроса не покидает устройство. Программа не отправляет ваши диалоги ни Alibaba, ни разработчикам Ollama. Единственный момент, когда компьютер выходит в сеть, это скачивание самой модели и проверка обновлений. После загрузки интернет можно отключить полностью, и всё продолжит работать.
Отсюда важное различие, которое часто путают. Опасения по поводу китайского происхождения модели относятся к облачному сервису, где запросы уходят на серверы Alibaba. К файлу с весами, который лежит у вас на диске, это отношения не имеет: он не может ничего никуда отправить, потому что это набор чисел, а не программа со связью. Отдельно тему приватности и российского законодательства мы разбирали в статье «Безопасно ли использовать Qwen».
Лицензия Apache 2.0 у линейки Qwen3.6 разрешает и личное, и коммерческое использование, включая встраивание модели в свой продукт. Это редкость среди сильных открытых моделей и отдельный аргумент в пользу именно этой линейки.
Единственная реальная утечка. Она случается, когда поверх локальной модели ставят сторонний веб-интерфейс с облачной синхронизацией истории. Тогда сама модель работает локально, а переписка уезжает в чужое хранилище. Проверяйте настройки интерфейса, а не только то, где считает модель.
Qwen или другие открытые модели
Qwen не единственная модель, которую можно поставить локально. Выбор в 2026 году сводится к четырём семействам, и у каждого своя сильная сторона.
| Семейство | Кто выпускает | В чём сильна |
|---|---|---|
| Qwen 3.6 | Alibaba, Китай | Русский язык, код, длинный контекст, свободная лицензия |
| Llama | Meta, США | Огромное сообщество и готовые дообученные версии под задачи |
| Gemma | Маленькие модели, которые сносно работают на слабом железе | |
| DeepSeek | DeepSeek, Китай | Рассуждения и математика в открытых версиях |
Для русскоязычных задач Qwen обычно оказывается сильнее сверстников своего размера. Причина простая: китайские команды с самого начала тренировали модели на многоязычных данных, тогда как часть западных открытых моделей заметно проседает за пределами английского. Если ваша работа идёт на русском, начинать разумно именно с Qwen.
Второй практический критерий — лицензия. Открытые веса не означают автоматически «делай что хочешь»: у части популярных моделей лицензия ограничивает коммерческое применение или требует упоминания правообладателя. У линейки Qwen3.6 стоит Apache 2.0, одна из самых свободных лицензий вообще, и для встраивания модели в коммерческий продукт это заметно упрощает жизнь.
Третий критерий, о котором вспоминают позже всех, это наличие версий разного размера в одном семействе. Удобно, когда на рабочем компьютере крутится модель побольше, а на ноутбуке в поездке та же линейка, но поменьше: манера ответов и формат промптов остаются знакомыми, переучиваться не приходится.
Обновления и как не остаться на старой версии
Открытые модели выходят часто, и скачанная сегодня версия через полгода будет средней. Проверять обновления просто: ollama list покажет, что у вас стоит, а страница каталога на сайте Ollama — что появилось нового. Скачивание новой версии не затирает старую, поэтому можно спокойно попробовать и сравнить, а лишнее потом удалить.
Ориентир такой: раз в квартал имеет смысл заглянуть, не вышло ли следующее поколение. Чаще смысла нет, реже рискуете сидеть на модели, которую обогнали вдвое меньшие по размеру конкуренты.
Первая неделя с локальной моделью
Модель установлена, чат открыт, и тут выясняется, что непонятно, о чём с ней говорить. Знакомое состояние: инструмент есть, привычки нет. План на первую неделю, который помогает эту привычку собрать.
День первый: проверьте потолок. Задайте пять вопросов из своей настоящей работы, а не тестовых. Пусть ответы будут кривыми, вам нужно увидеть, где модель уверенно справляется, а где выдумывает. Локальная модель ошибается заметнее облачной, и лучше узнать её слабые места сразу.
День второй: научитесь давать контекст. Главная ошибка новичка — короткий запрос вроде «напиши письмо клиенту». Модель не знает ни клиента, ни историю, ни ваш тон. Сравните с запросом на три предложения: кому пишем, что случилось раньше, какого результата хотим, в каком стиле. Разница в качестве ответа больше, чем разница между двумя моделями.
День третий: попробуйте длинные документы. Ради контекста в 256 тысяч токенов всё и затевалось. Загрузите большой файл и попросите найти конкретное: противоречия, сроки, условия, повторы. Пересказ модели даются легко, поиск по смыслу полезнее.
День четвёртый: соберите свои заготовки. Запросы, которые сработали, складывайте в отдельный файл. Через неделю у вас будет личная библиотека, и работа ускорится сильнее, чем от апгрейда видеокарты. Тем, кому эта часть работы понравится больше остального, стоит посмотреть на профессию промпт-инженера.
Дальше: решите, что остаётся в облаке. К концу недели станет видно, какие задачи локальная модель тянет, а какие стоит отдавать флагманам. Это и есть рабочая схема, а не выбор «или-или».
Ожидание, которое стоит поправить сразу. Локальная модель не помнит вчерашний разговор, если вы закрыли чат. История живёт в интерфейсе, а не в самой модели, поэтому важные вводные придётся давать заново или хранить в своём файле с заготовками.
И ещё про скорость. Первые секунды после запроса модель может думать дольше обычного: она подгружается в память. Второй и третий вопросы пойдут заметно живее, поэтому судить о скорости по самому первому ответу не стоит.
Локально или в облаке: как выбрать
Локальный запуск не отменяет облако, у них разные роли.
| Критерий | Локально | Облако |
|---|---|---|
| Данные | Не покидают компьютер | Уходят к провайдеру |
| Стоимость | Бесплатно после покупки железа | Оплата за токены |
| Качество на сложных задачах | Ниже флагманов | Выше |
| Скорость | Зависит от вашей видеокарты | Стабильно быстро |
| Доступ | Без ключей и интернета | Ключ, регион, оплата |
Рабочая схема у большинства выглядит так: рутина и всё, что касается чувствительных данных, уходит на локальную модель, а тяжёлые разовые задачи отправляются в облако. Одно другому не мешает, и переключение занимает секунду. Тем, кто хочет собрать из этого профессию, пригодится карта развития из статьи «Как стать AI-разработчиком».
Где научиться работать с нейросетями системно
Поставить модель — полчаса. Дальше начинается ремесло: как формулировать запросы, чтобы получать стабильный результат, как подключить модель к своим документам, как понять, где она выдумывает. По разрозненным инструкциям это собирается долго.
Мы сравнили программы по нейросетям от разных школ, от коротких интенсивов до годовых курсов с проектами в портфолио.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Нейросети для изображений и видео Перейти на сайт курса | 47 504 ₽ | 3958 ₽/мес. | 2 месяца | Обзор курса | |
| Нейросети для рабочих задач Перейти на сайт курса | 31 290 ₽ | 2608 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети. Практический курс Перейти на сайт курса | 74 900 ₽ | 6242 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для каждого: как решать рабочие задачи быстрее Перейти на сайт курса | 57 000 ₽ | 2763 ₽/мес. | 6 недель | Обзор курса | |
| Продуктовый маркетолог + Нейросети для маркетинга Перейти на сайт курса | 110 200 ₽ | 3875 ₽/мес. | 5 месяцев | Обзор курса | |
| Нейросети для дизайнера Перейти на сайт курса | 84 272 ₽ | 3831 ₽/мес. | 4 месяца | Обзор курса | |
| Нейросети для работы | 44 690 ₽ | 5477 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для каждого Перейти на сайт курса | 39 900 ₽ | 3325 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для начинающих Перейти на сайт курса | 42 000 ₽ | 2333 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети для маркетинга Перейти на сайт курса | 29 800 ₽ | 4967 ₽/мес. | 1 месяц | Обзор курса |
Больше программ — в полном каталоге курсов по нейросетям и искусственному интеллекту
А если интересно, как модели устроены изнутри и почему они иногда уверенно ошибаются, посмотрите разбор «Как нейросети думают».




