Qwen локально через Ollama: пошаговая инструкция и требования к железу в 2026

Локальная нейросеть звучит как задача для человека с серверной стойкой в гараже, а на деле это одна команда в терминале. Разобрали по шагам, как поставить Qwen на свой компьютер: какую из открытых версий качать в 2026, сколько нужно видеопамяти под каждую, что делать, когда её не хватает, и почему половина инструкций в выдаче предлагает скачать модель, которой не существует. Ни ключей, ни оплаты, ни отправки ваших документов на чужие серверы.
Статью написал:
Ваня Буявец, продюсер, основатель Checkroi
Ваня Буявец
Основатель Checkroi, продюсер, эксперт в выборе онлайн-курсов
Все 2418 статей автора Подписаться на Телеграм-канал
Одобрено экспертом:
Наташа Буявец, основатель Checkroi, эксперт по онлайн-курсам
Наташа Буявец
Основательница Checkroi, продюсер Youtube-каналов, эксперт по онлайн-курсам
Все 3078 экспертных мнений Подписаться на Телеграм-канал
Обложка: Qwen локально через Ollama: пошаговая инструкция и требования к железу в 2026

Локальная нейросеть звучит как задача для человека с серверной стойкой в гараже. На деле это одна команда в терминале и полчаса ожидания, пока скачаются файлы. Qwen — семейство моделей китайской Alibaba, и часть из них выложена в открытый доступ, поэтому её можно поставить на свой компьютер и работать без интернета, без ключей, без оплаты и без отправки единого символа на чужие серверы.

Здесь пошаговая инструкция на сентябрь 2026: какую версию Qwen качать, сколько нужно видеопамяти, как поставить Ollama на Windows, macOS и Linux, что делать, когда памяти не хватает, и почему статьи в выдаче предлагают вам скачать модель, которой не существует.

CheckroiCheckroiПодборка курсов по Ollama14 курсов • 6 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Если вы вообще впервые слышите про эту модель, начните с обзора «Qwen: что это за нейросеть от Alibaba». А если хочется сперва понять, как языковые модели устроены внутри, есть разбор «Языковые модели простыми словами».

Инструкция рассчитана на человека, который умеет открыть терминал и скопировать туда строку. Программировать не требуется вообще: работа с моделью идёт в обычном чате, только чат этот живёт у вас на диске.

Если хочется разобраться в теме глубже, чем «поставил и запустил», у нас собрана подборка курсов по нейросетям и искусственному интеллекту: там больше тысячи программ от коротких интенсивов до годовых.

CheckroiCheckroiПодборка курсов по Qwen10 курсов • 7 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Зачем вообще запускать модель у себя

Рой запускает нейросеть на своём домашнем компьютере

Три причины, ради которых люди возятся с локальным запуском.

Данные никуда не уходят. Когда вы пишете в облачный чат, текст улетает на чужой сервер. Локальная модель работает на вашем железе: можно спокойно грузить в неё договоры, медицинские выписки, переписку с клиентами и внутренние регламенты. Для юристов, бухгалтеров и всех, кто работает с персональными данными, это часто единственный вариант вообще использовать нейросеть в работе.

Нет ключей, оплаты и региональных ограничений. Не нужен API-ключ, не нужна зарубежная карта, не нужно проверять, поддерживается ли ваша страна. Скачали файл, запустили, работаете. Для тех, кто упирался в это с другими провайдерами, разница ощутимая: локальные модели закрывают этот вопрос целиком.

Работает без интернета. Самолёт, дача, командировка, отключили провайдера. Модель лежит на диске и отвечает так же, как отвечала вчера.

Чего ждать не стоит. Локальная модель на домашней видеокарте слабее облачного флагмана. Она хорошо пишет тексты, переводит, разбирает документы и помогает с кодом, но на олимпиадной математике и длинных многошаговых задачах проиграет. Это рабочая лошадь, а не рекордсмен.

Что такое Ollama и почему начинать стоит с неё

Ollama — бесплатная программа, которая берёт на себя всю техническую возню: скачивает модель, распаковывает её, загружает в память, договаривается с видеокартой и даёт вам простое окно для общения. Примерно как медиаплеер: вы не думаете о кодеках, вы нажимаете «play».

Альтернативы есть. LM Studio удобнее тем, кто не любит терминал вообще: там графический интерфейс и каталог моделей в один клик. vLLM быстрее на потоке запросов, но он рассчитан на серверы и настраивается заметно дольше. Для первого знакомства Ollama выигрывает по одной причине: от установки до первого ответа проходит меньше получаса, и всё это две команды.

Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединиться

Какую версию Qwen качать

Здесь начинается место, где почти все инструкции в выдаче врут, и врут по-разному.

Первое, что нужно понимать: открыты не все модели Qwen. Alibaba развернулась в сторону закрытых флагманов, и свежие Qwen3.7 и Qwen3.8 работают только через платный API, весов у них нет. Последние открытые модели общего назначения — линейка Qwen3.6, выпущенная в апреле 2026 года под лицензией Apache 2.0. Эта лицензия разрешает и личное, и коммерческое использование.

В открытой линейке две модели, между которыми и предстоит выбирать. Если хочется сравнить их с закрытыми версиями Qwen, у нас есть отдельный разбор «Какую модель Qwen выбрать».

Модель Тег в Ollama Скачать Что это
Qwen3.6 27B qwen3.6:27b 18 ГБ Плотная модель: работают все 27 млрд параметров сразу
Qwen3.6 35B-A3B qwen3.6:35b 23 ГБ Модель со смесью экспертов: из 35 млрд на каждое слово включаются только 3 млрд
Версии для Mac qwen3.6:27b-mlx, qwen3.6:35b-mlx 19 и 24 ГБ Сборки под чипы Apple, работают заметно быстрее обычных

Контекстное окно у обеих моделей — 256 тысяч токенов. Токен — это кусочек текста, на которые модель режет ваш запрос, для русского языка ориентир примерно полтора-два токена на слово. Подробнее мы разбирали это в статье «Что такое токен в нейросети». Практически 256 тысяч означают, что в один разговор помещается книга среднего размера.

Почему модель на 35 миллиардов быстрее модели на 27

Выглядит нелогично, но так и есть, и понимать это полезно при выборе.

Обычная модель при генерации каждого слова прогоняет через себя все свои параметры. Модель со смесью экспертов устроена иначе: внутри неё много небольших специализированных блоков, и на каждое слово включается лишь малая их часть. У Qwen3.6 35B-A3B из 35 миллиардов параметров на каждом шаге работают около трёх миллиардов.

Отсюда практический вывод: место на диске и в памяти она занимает как большая модель, а считает как маленькая. Загрузить в память надо все 35 миллиардов, поэтому 23 ГБ никуда не денутся. Зато отвечать она будет ощутимо бодрее, чем плотная 27B.

Что брать, если не хочется разбираться. Есть 24 ГБ видеопамяти или Mac с 32 ГБ единой памяти, берите qwen3.6:35b. Видеопамяти 16 ГБ, берите qwen3.6:27b. Меньше, смотрите таблицу железа ниже, там есть варианты и для скромных конфигураций.

Требования к железу

Комплектующие компьютера аккуратно разложены на столе

Главный ресурс здесь — видеопамять (VRAM), собственная память видеокарты. Если модель целиком помещается в неё, вы получаете быстрые ответы. Если не помещается, часть работы уходит на процессор и обычную оперативную память, и скорость падает в разы, хотя работать всё равно будет.

У компьютеров Apple на чипах M-серии память общая для процессора и графики, поэтому там считается вся память устройства целиком, и это большое преимущество: Mac с 32 ГБ тянет модели, для которых на Windows нужна видеокарта верхнего сегмента.

Ваше железо Что запустится Чего ждать
8 ГБ ОЗУ, без видеокарты Мелкие модели на 3–4 млрд параметров Медленно, для простых задач
16 ГБ ОЗУ + 8 ГБ VRAM Модели на 7–8 млрд Комфортная скорость, Qwen3.6 не потянет
32 ГБ ОЗУ + 16 ГБ VRAM qwen3.6:27b в сжатии Q4 Влезает впритык, короткие диалоги
32 ГБ ОЗУ + 24 ГБ VRAM Обе модели Qwen3.6 свободно Рабочий вариант без компромиссов
Mac с 32 ГБ единой памяти Обе модели, версии mlx Быстро и тихо, лучший вариант за свои деньги
Mac с 16 ГБ единой памяти qwen3.6:27b в сильном сжатии Работает, но памяти под другие программы почти не остаётся

Про сжатие стоит сказать отдельно, потому что от него зависит, влезет модель или нет. Квантизация — это упрощение внутренних чисел модели: вместо точных значений хранятся округлённые, файл ужимается в несколько раз, а качество ответов проседает незначительно. Ollama по умолчанию скачивает вариант Q4_K_M, и для большинства задач это удачный баланс. Замеры показывают около 17 ГБ памяти для 27B в этом режиме и около 22 ГБ для 35B-A3B.

Если памяти не хватает пары гигабайт, есть более сильное сжатие Q3: та же 35B-A3B ужимается примерно до 16,6 ГБ. Отвечать модель станет чуть менее аккуратно, но запустится.

Места на диске нужно примерно вдвое больше размера модели: сам файл плюс запас на распаковку и кеш.

CheckroiCheckroiПодборка курсов по Нейросетям899 курсов • 62 школыСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Ставим Ollama и запускаем Qwen

Шаг 1: устанавливаем Ollama

Идём на ollama.com и качаем установщик под свою систему.

  • Windows и macOS — обычный установщик, запускаете и жмёте «далее». После установки в трее появится значок, программа работает фоном.
  • Linux — одна строка в терминале: curl -fsSL https://ollama.com/install.sh | sh

Проверяем, что всё встало. Открываем терминал (в Windows это PowerShell, в macOS — «Терминал») и пишем:

ollama --version

Ответом должен быть номер версии. Если терминал говорит, что команда не найдена, перезапустите его: путь к программе подхватывается при старте.

Шаг 2: скачиваем модель

ollama pull qwen3.6:27b

Пойдёт загрузка на 18 ГБ. На обычном домашнем интернете это от двадцати минут до часа. Модель кладётся в системную папку, повторно качать её не придётся.

Шаг 3: разговариваем

ollama run qwen3.6:27b

Через несколько секунд появится приглашение, и дальше это обычный чат: пишете вопрос, получаете ответ. Русский язык модели Qwen понимают хорошо, это одна из их сильных сторон. Выйти из чата — команда /bye или сочетание Ctrl+D.

Полезные команды на каждый день:

  • ollama list — какие модели уже скачаны и сколько занимают
  • ollama ps — что сейчас загружено в память
  • ollama rm qwen3.6:27b — удалить модель и освободить диск

Шаг 4: если терминал неудобен

Постоянно жить в терминале необязательно. У Ollama есть собственное приложение с обычным окном чата, а из сторонних решений популярен Open WebUI — интерфейс в браузере, похожий на привычные облачные чаты, с историей переписки и переключением моделей.

Если слово «сервер» тут смущает, помогает базовый разбор «Что такое API простыми словами». Для программ Ollama поднимает локальный сервер по адресу localhost:11434, совместимый по формату с популярными API. Практически это значит, что готовый код, написанный под облачного провайдера, часто заводится с локальной моделью после смены одного адреса.

Почему в выдаче попадаются инструкции с несуществующими командами

Отдельное предупреждение, которое сэкономит вам вечер.

По запросам про локальный запуск Qwen в топе стоят сайты, созданные ради трафика, и команды там сгенерированы автоматически. Живой пример из выдачи: строка вида ollama run qwen-3.ru, где вместо имени модели подставлено доменное имя самого сайта. Такой модели не существует, Ollama ответит ошибкой, а начинающий решит, что у него сломан компьютер.

Как отличить рабочую инструкцию от сгенерированной. Настоящий тег модели выглядит как имя:размер, например qwen3.6:27b. В нём нет доменных зон, нет пробелов и нет флагов вроде --port у команды run. Сверить любой тег можно за десять секунд на ollama.com/library: если модели там нет, команда нерабочая.

Сверяться с актуальным поколением моделей полезно и за пределами Qwen: мы держим для этого отдельный разбор открытых и бесплатных альтернатив. Второй маркер устаревшей статьи — модели Qwen 2.5 или Qwen 3 без уточнения версии. Это поколения 2024–2025 годов, они всё ещё скачиваются, но открытая линейка ушла вперёд.

Ваня БуявецКанал основателя Checkroi Вани БуявцаЗабирайте промпты и обучение по нейросетям в моём Телеграм-каналеБольше 3 700 человек уже применяют Claude Code, ChatGPT и другие нейросети в работе, учёбе, бизнесе и жизниПерейти в канал

Если что-то пошло не так

Модель не влезает в память

Симптом: Ollama ругается на нехватку памяти либо модель запускается, но отвечает мучительно медленно. Три решения по порядку. Взять сжатие сильнее (Q3 вместо Q4). Взять модель поменьше. Уменьшить размер контекста, потому что длинный диалог сам по себе съедает память сверх веса модели.

Отвечает медленно, хотя видеокарта мощная

Скорее всего, модель частично ушла на процессор. Команда ollama ps покажет, сколько процентов модели лежит на видеокарте. Если там не 100 %, значит памяти не хватило и часть слоёв считает процессор. Помогает то же: меньше модель, сильнее сжатие, короче контекст.

Занят порт 11434

Обычно это вторая копия Ollama, запущенная фоном. Закройте программу из трея и запустите заново.

Кончилось место на диске

Проверьте, сколько занято, через ollama list, и удалите лишние модели командой ollama rm. Люди легко набирают пять-шесть моделей «на попробовать» и теряют сотню гигабайт. Разобраться, чем они между собой отличаются, помогает статья про токены и контекст.

Пять задач, ради которых держат модель на своём компьютере

Абстрактное «работать с нейросетью локально» плохо помогает понять, зачем это лично вам. Вот сценарии, которые встречаются чаще всего.

Разбор документов, которые нельзя показывать наружу. Договор на сорок страниц, выписка, внутренний регламент. Кидаете файл в чат, просите пересказать суть, найти условия расторжения, сравнить с прошлой редакцией. Ничего из этого не уходит с вашего диска, поэтому вопрос «а можно ли грузить туда персональные данные» просто не возникает.

Черновики и переписка. Письма, ответы клиентам, описания вакансий, посты. Задача, где качество локальной модели практически неотличимо от облачной, потому что сложных рассуждений тут не требуется. Формулировкам запросов стоит поучиться отдельно: подборку рабочих шаблонов мы собрали в статье «Промпты для учёбы», они одинаково работают и с локальной моделью.

Помощь с кодом. Объяснить чужую функцию, набросать скрипт, найти ошибку в логах. Модели Qwen традиционно сильны в программировании, и на бытовых задачах разработчика 27B справляется уверенно.

Перевод. Локальная модель переводит целыми документами, не упирается в лимиты и не спрашивает оплату. Для языков основной пары качество ближе к хорошему переводчику, чем к машинному подстрочнику.

Обучение и эксперименты. Когда вы разбираетесь, как устроены запросы к модели, локальный запуск снимает страх «а вдруг накапает счёт». Экспериментируйте сколько угодно, платите только электричеством.

Чего локальная модель не заменит: свежих новостей и фактов о сегодняшнем дне (она знает мир на момент обучения и в интернет не ходит), длинных цепочек рассуждений уровня флагманов и работы с картинками, если вы скачали текстовую версию.

Что происходит с вашими данными

Рой спокойно охраняет папку с документами возле домашнего сервера

Это причина номер один, по которой локальный запуск вообще интересует компании, поэтому стоит разобрать точно.

Когда модель работает через Ollama на вашем компьютере, текст запроса не покидает устройство. Программа не отправляет ваши диалоги ни Alibaba, ни разработчикам Ollama. Единственный момент, когда компьютер выходит в сеть, это скачивание самой модели и проверка обновлений. После загрузки интернет можно отключить полностью, и всё продолжит работать.

Отсюда важное различие, которое часто путают. Опасения по поводу китайского происхождения модели относятся к облачному сервису, где запросы уходят на серверы Alibaba. К файлу с весами, который лежит у вас на диске, это отношения не имеет: он не может ничего никуда отправить, потому что это набор чисел, а не программа со связью. Отдельно тему приватности и российского законодательства мы разбирали в статье «Безопасно ли использовать Qwen».

Лицензия Apache 2.0 у линейки Qwen3.6 разрешает и личное, и коммерческое использование, включая встраивание модели в свой продукт. Это редкость среди сильных открытых моделей и отдельный аргумент в пользу именно этой линейки.

Единственная реальная утечка. Она случается, когда поверх локальной модели ставят сторонний веб-интерфейс с облачной синхронизацией истории. Тогда сама модель работает локально, а переписка уезжает в чужое хранилище. Проверяйте настройки интерфейса, а не только то, где считает модель.

Qwen или другие открытые модели

Qwen не единственная модель, которую можно поставить локально. Выбор в 2026 году сводится к четырём семействам, и у каждого своя сильная сторона.

Семейство Кто выпускает В чём сильна
Qwen 3.6 Alibaba, Китай Русский язык, код, длинный контекст, свободная лицензия
Llama Meta, США Огромное сообщество и готовые дообученные версии под задачи
Gemma Google Маленькие модели, которые сносно работают на слабом железе
DeepSeek DeepSeek, Китай Рассуждения и математика в открытых версиях

Для русскоязычных задач Qwen обычно оказывается сильнее сверстников своего размера. Причина простая: китайские команды с самого начала тренировали модели на многоязычных данных, тогда как часть западных открытых моделей заметно проседает за пределами английского. Если ваша работа идёт на русском, начинать разумно именно с Qwen.

Второй практический критерий — лицензия. Открытые веса не означают автоматически «делай что хочешь»: у части популярных моделей лицензия ограничивает коммерческое применение или требует упоминания правообладателя. У линейки Qwen3.6 стоит Apache 2.0, одна из самых свободных лицензий вообще, и для встраивания модели в коммерческий продукт это заметно упрощает жизнь.

Третий критерий, о котором вспоминают позже всех, это наличие версий разного размера в одном семействе. Удобно, когда на рабочем компьютере крутится модель побольше, а на ноутбуке в поездке та же линейка, но поменьше: манера ответов и формат промптов остаются знакомыми, переучиваться не приходится.

Обновления и как не остаться на старой версии

Открытые модели выходят часто, и скачанная сегодня версия через полгода будет средней. Проверять обновления просто: ollama list покажет, что у вас стоит, а страница каталога на сайте Ollama — что появилось нового. Скачивание новой версии не затирает старую, поэтому можно спокойно попробовать и сравнить, а лишнее потом удалить.

Ориентир такой: раз в квартал имеет смысл заглянуть, не вышло ли следующее поколение. Чаще смысла нет, реже рискуете сидеть на модели, которую обогнали вдвое меньшие по размеру конкуренты.

Первая неделя с локальной моделью

Модель установлена, чат открыт, и тут выясняется, что непонятно, о чём с ней говорить. Знакомое состояние: инструмент есть, привычки нет. План на первую неделю, который помогает эту привычку собрать.

День первый: проверьте потолок. Задайте пять вопросов из своей настоящей работы, а не тестовых. Пусть ответы будут кривыми, вам нужно увидеть, где модель уверенно справляется, а где выдумывает. Локальная модель ошибается заметнее облачной, и лучше узнать её слабые места сразу.

День второй: научитесь давать контекст. Главная ошибка новичка — короткий запрос вроде «напиши письмо клиенту». Модель не знает ни клиента, ни историю, ни ваш тон. Сравните с запросом на три предложения: кому пишем, что случилось раньше, какого результата хотим, в каком стиле. Разница в качестве ответа больше, чем разница между двумя моделями.

День третий: попробуйте длинные документы. Ради контекста в 256 тысяч токенов всё и затевалось. Загрузите большой файл и попросите найти конкретное: противоречия, сроки, условия, повторы. Пересказ модели даются легко, поиск по смыслу полезнее.

День четвёртый: соберите свои заготовки. Запросы, которые сработали, складывайте в отдельный файл. Через неделю у вас будет личная библиотека, и работа ускорится сильнее, чем от апгрейда видеокарты. Тем, кому эта часть работы понравится больше остального, стоит посмотреть на профессию промпт-инженера.

Дальше: решите, что остаётся в облаке. К концу недели станет видно, какие задачи локальная модель тянет, а какие стоит отдавать флагманам. Это и есть рабочая схема, а не выбор «или-или».

Ожидание, которое стоит поправить сразу. Локальная модель не помнит вчерашний разговор, если вы закрыли чат. История живёт в интерфейсе, а не в самой модели, поэтому важные вводные придётся давать заново или хранить в своём файле с заготовками.

И ещё про скорость. Первые секунды после запроса модель может думать дольше обычного: она подгружается в память. Второй и третий вопросы пойдут заметно живее, поэтому судить о скорости по самому первому ответу не стоит.

Локально или в облаке: как выбрать

Локальный запуск не отменяет облако, у них разные роли.

Критерий Локально Облако
Данные Не покидают компьютер Уходят к провайдеру
Стоимость Бесплатно после покупки железа Оплата за токены
Качество на сложных задачах Ниже флагманов Выше
Скорость Зависит от вашей видеокарты Стабильно быстро
Доступ Без ключей и интернета Ключ, регион, оплата

Рабочая схема у большинства выглядит так: рутина и всё, что касается чувствительных данных, уходит на локальную модель, а тяжёлые разовые задачи отправляются в облако. Одно другому не мешает, и переключение занимает секунду. Тем, кто хочет собрать из этого профессию, пригодится карта развития из статьи «Как стать AI-разработчиком».

Где научиться работать с нейросетями системно

Поставить модель — полчаса. Дальше начинается ремесло: как формулировать запросы, чтобы получать стабильный результат, как подключить модель к своим документам, как понять, где она выдумывает. По разрозненным инструкциям это собирается долго.

Мы сравнили программы по нейросетям от разных школ, от коротких интенсивов до годовых курсов с проектами в портфолио.

КурсШколаСтоимость со скидкойВ рассрочкуДлитель­ностьОбзор курса от Checkroi
Нейросети для изображений и видео
Перейти на сайт курса
Академия ЭдюсонЭдюсон47 504 ₽3958 ₽/мес.2 месяцаОбзор курса
Нейросети для рабочих задач
Перейти на сайт курса
SkillboxSkillbox31 290 ₽2608 ₽/мес.1 месяцОбзор курса
Нейросети. Практический курс
Перейти на сайт курса
SkillboxSkillbox74 900 ₽6242 ₽/мес.3 месяцаОбзор курса
Нейросети для каждого: как решать рабочие задачи быстрее
Перейти на сайт курса
НетологияНетология57 000 ₽2763 ₽/мес.6 недельОбзор курса
Продуктовый маркетолог + Нейросети для маркетинга
Перейти на сайт курса
НетологияНетология110 200 ₽3875 ₽/мес.5 месяцевОбзор курса
Нейросети для дизайнера
Перейти на сайт курса
SkillboxSkillbox84 272 ₽3831 ₽/мес.4 месяцаОбзор курса
Нейросети для работыSkyproSkypro44 690 ₽5477 ₽/мес.3 месяцаОбзор курса
Нейросети для каждого
Перейти на сайт курса
Академия СинергияАкадемия Синергия39 900 ₽3325 ₽/мес.3 месяцаОбзор курса
Нейросети для начинающих
Перейти на сайт курса
SF EducationSF Education42 000 ₽2333 ₽/мес.1 месяцОбзор курса
Нейросети для маркетинга
Перейти на сайт курса
SkillboxSkillbox29 800 ₽4967 ₽/мес.1 месяцОбзор курса

Больше программ — в полном каталоге курсов по нейросетям и искусственному интеллекту

А если интересно, как модели устроены изнутри и почему они иногда уверенно ошибаются, посмотрите разбор «Как нейросети думают».

Часто задаваемые вопросы

Какую версию Qwen можно скачать бесплатно?

Открытые веса есть у линейки Qwen3.6 от апреля 2026 года: модели qwen3.6:27b и qwen3.6:35b под лицензией Apache 2.0, которая разрешает и личное, и коммерческое использование. Более свежие Qwen3.7 и Qwen3.8 работают только через платный API, весов у них нет.

Сколько нужно видеопамяти для Qwen локально?

Для qwen3.6:27b в стандартном сжатии Q4_K_M нужно около 17 ГБ, для qwen3.6:35b — около 22 ГБ. Комфортный минимум на Windows и Linux — видеокарта на 24 ГБ. На 16 ГБ 27B влезает впритык. Если не хватает пары гигабайт, помогает более сильное сжатие Q3.

Можно ли запустить Qwen на Mac?

Да, и часто это лучший вариант за свои деньги. У чипов Apple память общая для процессора и графики, поэтому Mac с 32 ГБ тянет модели, для которых на ПК нужна видеокарта верхнего сегмента. В Ollama есть отдельные сборки под Apple: qwen3.6:27b-mlx и qwen3.6:35b-mlx, они работают заметно быстрее обычных.

Уходят ли мои данные в Китай при локальном запуске?

Нет. Модель на вашем компьютере — это набор чисел на диске, он ничего никуда не отправляет. Компьютер выходит в сеть только когда скачивает саму модель и проверяет обновления, после этого интернет можно отключить совсем. Опасения по поводу передачи данных относятся к облачному сервису Qwen, а не к локальному файлу.

Что делать, если Qwen работает медленно?

Скорее всего модель не поместилась в видеопамять и часть слоёв считает процессор. Команда ollama ps покажет, какой процент модели лежит на видеокарте: если не 100 %, памяти не хватило. Помогает более сильное сжатие, модель поменьше или укорочение диалога, потому что длинный контекст сам съедает память.

Нужен ли КВН или API-ключ для локального Qwen?

Нет. Ни ключа, ни оплаты, ни проверки региона: вы скачиваете файл модели и работаете с ним офлайн. Это главное отличие локального запуска от облачных сервисов, где почти у всех провайдеров есть ограничения по странам и способам оплаты.

Почему модель на 35 млрд параметров быстрее модели на 27 млрд?

Потому что у 35B-A3B архитектура со смесью экспертов: внутри много небольших блоков, и на каждое слово включаются только около 3 млрд параметров из 35. Загрузить в память надо все 35 млрд, поэтому места она занимает больше, а считает быстрее плотной 27B, где на каждом шаге работают все параметры.

Чем Ollama отличается от LM Studio?

Ollama работает через терминал и ставится двумя командами, у неё есть своё приложение и локальный сервер на порту 11434 для подключения программ. LM Studio — графическая программа с каталогом моделей в один клик, она дружелюбнее к тем, кто не любит командную строку. Для первого запуска обе подходят, разница в привычках.

Читайте Checkroi первым в Google
Добавьте Checkroi в избранные источники — и наши разборы курсов и обзоры школ будут показываться выше в вашей выдаче Google.
Оставить комментарий
0 комментариев
Форма комментария

Оставьте комментарий

Напишите, что думаете. Нам важно ваше мнение!