В феврале 2025 года Андрей Карпаты написал твит, из которого выросло слово «вайбкодинг». В оригинале там была деталь, которую почти все потом потеряли: он не печатал запросы в Cursor. Он их наговаривал голосом через приложение SuperWhisper и, по собственным словам, едва касался клавиатуры.
За полтора года голосовой вайбкодинг превратился из причуды одного исследователя в обычный рабочий инструмент. В марте 2026 Anthropic встроила диктовку прямо в Claude Code командой /voice, и платить за неё отдельно не нужно. Разберём, как программировать голосом на практике, сколько это стоит, что делать с русско-английской кашей в речи и как настроить всё за один вечер.
Если само слово «вайбкодинг» вам пока мало о чём говорит, начните с обзорной статьи «Вайбкодинг: что это, как работает и с чего начать». Там разобрана база: что за подход, какие инструменты нужны и почему он вообще заработал.
Статья пригодится не только программистам. Диктовать промпты (запросы к нейросети) одинаково полезно маркетологу, аналитику и редактору: наши сценарии для не-разработчиков собраны в материале «Вайбкодинг для маркетолога».
А если хочется освоить ремесло по порядку, а не наощупь, посмотрите нашу подборку курсов по вайбкодингу: там программы от коротких интенсивов до полноценных профессий.
Что такое голосовой кодинг простыми словами

Голосовой кодинг — это когда вы объясняете задачу вслух, а код пишет AI-агент. Вы говорите «добавь в футер форму подписки, чтобы имя и почта складывались в файл, а человеку показывалось спасибо». Приложение переводит вашу речь в текст, текст уходит в нейросеть, нейросеть правит файлы.
Тут важно развести две вещи, которые новички постоянно путают, потому что словом «диктовка кода» называют два совершенно разных занятия.
Первое: синтаксис диктовать не нужно. Существует старая школа голосового программирования (инструменты вроде Talon), где человек надиктовывает саму структуру кода: «открыть скобку», «двоеточие», «новая строка с отступом». Это отдельная дисциплина со своим языком команд, её осваивают месяцами, и придумана она была в первую очередь для людей, которым тяжело печатать физически.
Второе: современный голосовой кодинг устроен проще. Диктовать код в буквальном смысле не нужно: вы говорите обычными человеческими предложениями, как объясняли бы задачу коллеге. Никаких команд заучивать не надо. Всю грязную работу делает языковая модель, которой всё равно, надиктовали вы запрос или напечатали.
Короткая формула. Голосовой ввод заменяет клавиатуру на этапе «объяснить задачу», а не на этапе «написать код». Код по-прежнему пишет агент.
Отсюда следует главное: уметь программировать для этого не обязательно. Если вы уже пользуетесь Cursor или Claude Code и печатаете туда запросы, вы уже готовы. Меняется только способ ввода.
Откуда это взялось и почему выстрелило именно сейчас
История короткая и показательная. В начале февраля 2025 Андрей Карпаты, один из основателей OpenAI, опубликовал короткую заметку о новом способе работы: он перестал читать код и начал просто разговаривать с редактором. Слово «вайбкодинг» родилось именно там.
Дальше произошла забавная вещь. Термин разошёлся по всему миру, а голосовая часть из него выпала. Большинство статей описывали вайбкодинг как «просто пишите запросы нейросети», хотя в первоисточнике речь шла о диктовке. Голос вернулся в повестку только через год, когда инструменты дозрели.
Что изменилось за это время и почему теперь работает:
- Агенты научились переваривать многословие. Раньше длинный сбивчивый запрос путал модель, теперь лишний контекст идёт только на пользу.
- Распознавание подешевело и ускорилось. Задержка упала до долей секунды, а локальные модели стали помещаться в обычный ноутбук.
- Появились словари для разработчиков. Системы перестали ошибаться на
OAuthиlocalhost, а это половина речи программиста. - Диктовку встроили в сами инструменты. Пока это была сторонняя программа за деньги, порог входа отпугивал. С появлением
/voiceпробовать стало нечего терять.
Зачем говорить, если печатаешь быстро
Аргумент «я печатаю сто знаков в минуту, мне не нужно» звучит логично ровно до того момента, пока не посмотришь на цифры.
Средняя скорость печати по исследованию Университета Аалто (168 тысяч участников) составляет 52 слова в минуту. У людей, которые печатают профессионально, около 70. Обычная разговорная речь идёт со скоростью 150–180 слов в минуту. Разница примерно втрое, и она никак не зависит от того, насколько хорошо вы владеете слепым методом.
Но выигрыш во времени — это только половина истории, и не самая интересная.
Вторая половина истории про объём контекста. Когда вы печатаете, то бессознательно экономите усилия и пишете коротко: «почини форму». Когда говорите, за то же время успеваете рассказать втрое больше: что именно ломается, при каких условиях, что вы уже пробовали, чего делать точно не надо. Для AI-агента это разные задачи. На первую он ответит наугад, на вторую — по делу с первого раза.
Именно поэтому голосовой ввод так хорошо лёг на агентные инструменты. Хороший промпт для агента — это два-три абзаца текста, а не строчка. Печатать столько лень почти всем, а наговорить получается за тридцать секунд. Если вы ещё не уверены, что такое хороший запрос, загляните в материал «Что такое промпт-инжиниринг простыми словами»: формула оттуда работает и для устных запросов.
Наблюдение редакции. Самый заметный эффект даёт не скорость, а то, что перестаёшь лениться объяснять. Задачи, которые раньше формулировались в пять слов, теперь формулируются в пять предложений, и агент попадает в цель гораздо чаще.
Главная боль русскоязычного разработчика

Вот тут начинается то, чего нет в англоязычных обзорах. Русский разработчик говорит не по-русски и не по-английски, а на смеси: «запушь в мастер», «сделай пул-реквест», «поправь роутинг и задеплой на стейджинг».
Для системы распознавания речи это тяжёлый случай. Она настроена на один язык за раз и на границе языков начинает угадывать: «деплой» превращается в «для я», «Whisper» в «виспер», «commit» в «комит» или вообще в «комитет».
Насколько всё плохо, показывает метрика WER (word error rate, доля неверно распознанных слов). На чистой русской речи цифры такие:
| Модель распознавания | Размер | Ошибок на русском | Где работает |
|---|---|---|---|
| GigaAM v3 (Сбер) | 220 млн параметров | ≈3,3 % | Локально, открытые веса |
| Whisper large-v3-turbo | 809 млн | ≈5–7,7 % | Локально и в облаке |
| Whisper large-v3 | 1,55 млрд | ≈7,9 % | Локально и в облаке |
Сам Whisper OpenAI выложила с открытым кодом ещё в 2022 году, и на нём сегодня работает большинство приложений диктовки. Парадокс в том, что самая точная на русском модель хуже всего подходит для кода. GigaAM обучали на русском, и английские термины она разбирает заметно слабее универсального Whisper. А в речи программиста этих терминов половина.
Что с этим делать на практике, три работающих приёма:
- Ставить язык распознавания английским, если терминов много. Русские слова тогда превратятся в транслитерацию, но нейросеть-адресат поймёт и такое: она читает смысл, а не орфографию.
- Держать русский, если вы объясняете задачу словами, а не командами. «Сделай так, чтобы при нажатии кнопки открывалось окно с настройками». Тут английских слов нет вовсе.
- Пользоваться словарём проекта. Почти во всех приложениях есть список слов, которые надо распознавать особым образом. Туда заносят названия ваших файлов, библиотек и веток.
Проверьте на себе. Продиктуйте одну и ту же фразу дважды: сначала с русским языком распознавания, потом с английским. Разница в качестве обычно решает вопрос выбора за минуту.
Команда /voice в Claude Code
Самый простой вход в голосовой кодинг сегодня даёт встроенная диктовка Claude Code. Anthropic выкатила её 3 марта 2026 сначала небольшой доле пользователей, а затем открыла всем.
Включается одной командой прямо в терминале:
/voice
После этого удерживаете пробел, говорите, отпускаете, и распознанный текст появляется прямо в строке запроса, там, где стоит курсор. Голос и печать можно смешивать в одном сообщении: начало набрать руками, середину наговорить, конец дописать.
Режимов два, и выбор между ними чаще всего дело привычки:
/voice hold: удерживаете клавишу во время речи, отпускаете для завершения. Стоит по умолчанию./voice tap: нажали один раз для старта, сказали, нажали снова, и запрос сразу уходит агенту. Удобнее для длинных задач, но требует версии 2.1.116 или новее (проверить:claude --version).
Что важно знать по официальной документации Anthropic:
- Русский поддерживается. Всего в списке 20 языков, язык диктовки берётся из настройки
languageв/config. По умолчанию стоит английский, так что русский надо включить руками. - Доплаты нет. Расшифровка речи в текст не тратит токены (единицы, которыми считается ваш расход на общение с нейросетью) и не учитывается в лимитах, которые показывает
/usage. - Словарь разработчика уже зашит. Термины вроде
regex,OAuth,JSONиlocalhostраспознаются правильно, а имя вашего проекта и название текущей ветки в git (версия проекта, над которой вы сейчас работаете) автоматически подставляются как подсказки для распознавания. - Нужен аккаунт Claude.ai. Если вы подключили Claude Code не обычным входом, а через ключ разработчика, Amazon Bedrock или облако Google, голос не заработает.
- Только локальный микрофон. По SSH и в веб-версии Claude Code диктовка недоступна: микрофон физически находится на вашем компьютере.
Запись останавливается сама после 15 секунд тишины или двух минут речи. Клавишу можно переназначить в файле ~/.claude/keybindings.json, действие называется voice:pushToTalk. Полезно, если пробел вам нужен для другого. Заодно посмотрите наш разбор всех команд Claude Code, там собраны остальные слэш-команды.
Ограничение, которое обзоры обычно пропускают. Аудио уходит на серверы Anthropic и локально не обрабатывается. Для личных проектов это ничего не меняет, а вот в закрытом контуре вопрос придётся согласовывать.
SuperWhisper и Wispr Flow: что выбрать
Встроенный /voice хорош, но живёт он только внутри Claude Code. Реальный рабочий день по одному окну не проходит: запрос агенту, сообщение в мессенджере, описание задачи в таск-трекере, коммит в терминале, вопрос в браузере. Каждый раз переучивать пальцы под новый способ ввода неудобно, поэтому опытные пользователи ставят один общесистемный слой диктовки, который работает всюду, где есть поле для текста.
Два главных игрока тут как раз SuperWhisper и Wispr Flow. Отличаются они принципиально.
| Параметр | SuperWhisper | Wispr Flow | Claude Code /voice |
|---|---|---|---|
| Где обрабатывается голос | На вашем компьютере | В облаке | На серверах Anthropic |
| Работает офлайн | Да | Нет | Нет |
| Задержка | 1–2 с на крупных моделях | ≈700 мс | Потоковая |
| Платформы | Mac, Windows, iOS | Mac, Windows, iPhone, Android | Везде, где стоит Claude Code |
| Бесплатный тариф | Локальные модели без лимита | 2000 слов в неделю | Полностью бесплатно |
| Платный тариф | $8,49/мес, $84,99/год, $249,99 навсегда | $15/мес или $12/мес при оплате за год | Входит в подписку |
| Скидка студентам | −40 % | ≈−50 % и 90 дней пробного | Нет |
| Работает вне Claude Code | Да, в любом приложении | Да, в любом приложении | Нет |
Что выбрать, если не хочется разбираться. Начните со встроенного /voice: он бесплатный и включается за десять секунд. Понравится и захочется того же в остальных программах, ставьте SuperWhisper: у него есть бесплатный тариф без ограничения по словам, а голос не покидает компьютер. Wispr Flow берите, если для вас критична скорость отклика и нужен телефон на Android.
Отдельно про пожизненную лицензию SuperWhisper за $249,99: она окупается относительно помесячной оплаты примерно за два с половиной года. Брать её на старте, ещё не понимая, приживётся ли у вас голос вообще, смысла мало.
Один слой диктовки на все приложения

Отдельно стоит объяснить, зачем вообще ставить стороннюю программу, если голос уже встроен в Claude Code. Причина простая: рабочий процесс не помещается в одно окно.
Типичные десять минут разработчика выглядят так: задача агенту в Cursor, команда в терминале, описание изменений на GitHub, ответ в рабочем чате, вопрос в ChatGPT. Пять программ. Если диктовка живёт только в одной из них, привычка не закрепляется: мозг не успевает запомнить, где голос есть, а где нет, и по умолчанию тянется к клавиатуре.
Общесистемное приложение решает это одной клавишей, которая работает в любом текстовом поле. SuperWhisper и Wispr Flow оба работают именно так: они не интегрируются с программами по отдельности, а подставляют распознанный текст туда, где сейчас стоит курсор. Плагины ставить не нужно, поддержка редактора со стороны разработчика не требуется.
Для Cursor это особенно заметно. Своей встроенной диктовки у него нет, а окно Composer, где ставятся задачи агенту, устроено ровно под наговаривание длинных постановок. Как раз этой связкой пользовался Карпаты, когда придумывал термин. Что умеет сам редактор, мы подробно разбирали в обзоре Cursor AI, а выбор между ним и конкурентами разобран в сравнении Cursor, Windsurf и Claude Code.
Практический вывод. Встроенный голос попробуйте первым, чтобы понять, ваш это способ работы или нет. Общесистемный ставьте вторым, когда захотите того же во всех остальных окнах.
Бесплатные варианты, если платить не хочется
Диктовка доступна и без единого рубля, просто с оговорками.
Системная диктовка. В Windows работает по сочетанию Win + H, в macOS включается в настройках клавиатуры. Ставить ничего не нужно, но и качество соответствующее: технические термины она путает регулярно, а знаки препинания приходится проговаривать вслух.
Открытые проекты. Handy и OpenWhispr — бесплатные приложения с открытым кодом, которые запускают модели Whisper прямо на вашей машине. Качество на уровне платных, но за это придётся заплатить временем настройки и наличием приличной видеокарты: на процессоре крупные модели считают дольше, чем длится сама запись.
Бесплатные тарифы платных сервисов. У SuperWhisper локальные модели работают без лимита по словам, у Wispr Flow дают 2000 слов в неделю. Для того чтобы понять, ваш это способ работы или нет, хватит с запасом.
Как диктовать, чтобы поняли с первого раза
Голосовой ввод не телепат, и первые дни у всех получается хуже, чем хотелось. Несколько приёмов сокращают этот период до пары вечеров.
Говорите целыми предложениями
Привычка печатать коротко переносится на голос и всё портит. «Форма футер подписка почта». Модель распознавания не поймёт, где кончается одна мысль и начинается другая, а агент получит кашу. Полное предложение распознаётся точнее: у модели появляется грамматический контекст, по которому она восстанавливает сомнительные слова.
Проговаривайте регистр там, где он важен
Если нужно конкретное имя переменной, скажите его вслух так, как оно пишется: «камелкейс user ID» или «снейк-кейс max retries». Агент разберёт эту подсказку без проблем. Само собой угадать, слитно вы имели в виду или через подчёркивание, он не может.
Заведите словарь проекта
В Claude Code имя проекта и текущая ветка подставляются в подсказки распознавания сами. В SuperWhisper и Wispr Flow список слов заполняется руками: внесите туда названия своих библиотек, сервисов и папок. Это разовая работа на десять минут, которая убирает большую часть повторяющихся ошибок.
Не бойтесь оговорок
Современные приложения вычищают из расшифровки «э-э-э», «так, стоп» и прочий мусор живой речи. Можно спокойно передумывать вслух посреди фразы, в текст это не попадёт. Привычка говорить гладко, как диктор, только замедляет.
Держите режим удержания клавиши
Push-to-talk (запись только пока зажата клавиша) избавляет от случайно записанных разговоров с домашними и от реплик в созвоне, улетевших в промпт. Это же решает половину вопросов приватности.
Настройка за один вечер
Порядок шагов, который экономит время новичку.
- Начните со встроенного. Запустите Claude Code, наберите
/voice, разрешите доступ к микрофону, когда система спросит. Зажмите пробел и скажите любую задачу. - Переключите язык. По умолчанию стоит английский. В
/configпоменяйтеlanguageна русский, если собираетесь диктовать по-русски. - Продиктуйте пять настоящих задач. Не тестовых фраз, а реальных: так вы сразу увидите, какие слова система стабильно путает.
- Проверьте микрофон. Встроенный в ноутбук годится, но уменьшите усиление в настройках звука и включите шумоподавление: механическая клавиатура и вентилятор попадают в запись и ухудшают распознавание сильнее акцента.
- Через неделю решайте про общесистемный слой. Если поймали себя на том, что тянетесь диктовать в мессенджере, ставьте SuperWhisper или Wispr Flow. Не поймали, значит вам хватает встроенного, и деньги тратить незачем.
Пять ошибок, на которых спотыкаются в первую неделю

Ошибка 1: ждать, что голос заменит клавиатуру полностью. Не заменит и не должен. Диктовка выигрывает на длинных объяснениях и проигрывает на правках в одно слово. Нормальный режим смешанный: наговорили задачу, руками поправили пару символов.
Ошибка 2: диктовать в открытом офисе без подготовки. Соседи слышат ваши запросы, а микрофон слышит соседей. Тут спасает либо гарнитура с направленным микрофоном, либо честное признание, что голос остаётся инструментом для дома и отдельного кабинета.
Ошибка 3: бросить на второй день. Первые ощущения почти у всех неприятные: говорить в пустоту непривычно, ошибки распознавания раздражают. Перелом обычно наступает на третий-четвёртый день, когда мозг перестаёт сочинять фразу заранее и начинает думать вслух.
Ошибка 4: доверять расшифровке не глядя. Особенно опасно с числами и названиями файлов: «удали user_old» и «удали users» звучат почти одинаково. Перечитывайте запрос перед отправкой, это единственная страховка. Что бывает, когда агенту дают волю без проверки, мы разбирали в материале «7 опасностей вайбкодинга в проде».
Ошибка 5: сразу покупать пожизненную лицензию. Голос подходит не всем: часть людей формулирует мысли только через пальцы, и это нормально. Неделя на бесплатном тарифе стоит дешевле, чем 250 долларов за неудачный эксперимент.
Приватность: куда уходит ваш голос
Вопрос звучит редко, а значение имеет большое, потому что вслух вы произносите куда больше, чем печатаете.
Облачные сервисы (Wispr Flow, встроенный /voice) отправляют запись на сервер и возвращают текст. Быстро и точно, но аудио покидает ваш компьютер. У Wispr Flow есть сертификаты SOC 2 Type II и ISO 27001, Anthropic описывает, что делает с данными, в своей политике конфиденциальности, и для личных проектов этого достаточно.
Локальные решения (SuperWhisper, Handy, OpenWhispr) считают модель прямо на вашей машине, и наружу не уходит ничего. Это единственный рабочий вариант, если у вас NDA, закрытый контур или отраслевые требования к данным. Взамен получаете чуть большую задержку и нагрузку на железо.
Простое правило. Если бы вы не отправили этот текст в обычный чат нейросети, не диктуйте его и в облачное приложение. Для всего остального выбирайте по удобству, а не по паранойе.
Кому голосовой кодинг подходит
Честный список, чтобы не тратить вечер зря.
Скорее подойдёт, если вы много работаете с AI-агентами и пишете им длинные запросы; если формулируете мысли вслух легче, чем на бумаге; если у вас болят запястья или вы работаете из дома, где можно говорить свободно; если вы не программист и объясняете задачи обычными словами: тут голос выигрывает сильнее всего.
Скорее не подойдёт, если вы сидите в открытом офисе без гарнитуры; если ваша работа состоит из точечных правок существующего кода, а не из постановки задач; если вы думаете медленнее, чем говорите, и вам нужна пауза на обдумывание посреди фразы.
Отдельно про карьеру: голосовой ввод — это удобство, а не профессия. Работодателя интересует не то, чем вы вводите текст, а умеете ли вы ставить задачи агенту и проверять результат. Как это осваивают по шагам, разобрано в статье «Как стать вайбкодером с нуля», а денежная сторона вопроса разобрана в материале «Сколько зарабатывает вайбкодер».
Где научиться работать с нейросетями
Голос решает вопрос ввода, но не вопрос содержания: продиктованная ерунда останется ерундой. Основная работа в другом: внятно поставить задачу и проверить то, что вернул агент. Этому быстрее учиться по программе, чем собирать по статьям.
Готовые формулировки, от которых можно отталкиваться, мы собрали в подборке «50 промптов для программистов в Cursor, Claude Code и Codex»: их удобно наговаривать почти дословно.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Нейросети для изображений и видео Перейти на сайт курса | 48 455 ₽ | 4037 ₽/мес. | 2 месяца | Обзор курса | |
| Нейросети для рабочих задач Перейти на сайт курса | 31 290 ₽ | 2608 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети. Практический курс Перейти на сайт курса | 74 900 ₽ | 6242 ₽/мес. | 3 месяца | Обзор курса | |
| Продуктовый маркетолог + Нейросети для маркетинга Перейти на сайт курса | 110 200 ₽ | 3875 ₽/мес. | 5 месяцев | Обзор курса | |
| Нейросети для работы | 44 690 ₽ | 5477 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для дизайнера Перейти на сайт курса | 84 272 ₽ | 3831 ₽/мес. | 4 месяца | Обзор курса | |
| Нейросети для каждого Перейти на сайт курса | 39 900 ₽ | 3325 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для начинающих Перейти на сайт курса | 42 000 ₽ | 2333 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети для бизнеса Перейти на сайт курса | 97 632 ₽ | 2712 ₽/мес. | Обзор курса | ||
| Нейросети для маркетинга Перейти на сайт курса | 29 800 ₽ | 4967 ₽/мес. | 1 месяц | Обзор курса |
Больше программ — в полном каталоге курсов по нейросетям и искусственному интеллекту
Если хочется точечно и без общей теории, посмотрите профильную подборку курсов по вайбкодингу: там программы именно про работу с AI-агентами, а не про классическую разработку.




