Представьте, что вы наняли на редкость способного стажёра. Он прочитал полбиблиотеки, пишет быстрее вас и почти никогда не устаёт. Одна проблема: он не всегда понимает, где проходит граница между «помочь» и «натворить дел». Можно стоять у него за спиной и поправлять каждый ответ. А можно один раз объяснить принципы, по которым он будет сам себя проверять. Второй путь и есть Constitutional AI.
Constitutional AI (по-русски часто говорят «конституционный ИИ») — это метод обучения нейросетей, который придумала компания Anthropic, создатель Claude. Идея в том, чтобы дать модели письменный набор ценностей, «конституцию», и научить её сверять свои ответы с этими ценностями без круглосуточного надзора людей.
В этой статье разберём простыми словами: что такое Constitutional AI, чем он отличается от старого способа обучения, что вообще написано в «конституции» Claude, почему модель иногда отказывается отвечать и как всё это связано с галлюцинациями (выдумками нейросети). Если с основами нейросетей вы ещё не знакомы, начните с обзорной статьи «Что такое нейросети простыми словами», а сюда вернитесь за деталями.
Материал для новичка. Никакого кода и формул: только человеческие объяснения на бытовых примерах. Пригодится всем, кто пользуется чат-ботами и хочет понимать, почему один ИИ отвечает так, а другой иначе.
А если после статьи захочется перейти от понимания к практике и научиться работать с нейросетями всерьёз, у нас собрана большая подборка курсов по нейросетям и искусственному интеллекту с оплатой из России. Но сначала разберёмся в сути.
КурсыСравнение 841 курса нейросетей и искусственного интеллектаЦены, школы, длительность, рассрочка
Constitutional AI за один абзац

Constitutional AI, или конституционный ИИ, устроен так. Разработчики пишут для модели документ с принципами поведения: будь полезной, будь честной, не помогай причинять вред. Дальше нейросеть учат читать собственные черновики ответов, находить в них места, которые нарушают эти принципы, и переписывать их самостоятельно. Плюс отдельная копия модели сравнивает пары ответов и выбирает тот, что лучше соответствует конституции. Люди при этом задают правила и проверяют результат, но не размечают вручную каждый ответ. Именно так обучают Claude, самого известного представителя этого подхода.
Если запомнить одно. Constitutional AI не запрещает модели что-то делать списком «нельзя». Он даёт ей ценности и учит применять их самой, даже в ситуациях, которых авторы правил не предвидели.
Зачем ИИ вообще воспитывать
Большая языковая модель (LLM — программа, которую обучили на гигантских объёмах текста предсказывать следующее слово) сама по себе не знает, что такое «хорошо». Она знает, какие слова обычно идут за какими. Если её ничему не «воспитывать», она с одинаковой готовностью напишет и рецепт борща, и инструкцию, которая кому-то навредит. Текста в интернете хватает на оба варианта.
Задача сделать так, чтобы поведение модели совпадало с человеческими ценностями, называется выравниванием (по-английски alignment). Звучит абстрактно, поэтому переведём на бытовой язык. Выравнивание — это разница между «ИИ, который технически умеет всё» и «ИИ, которому можно дать в руки миллионам людей и не бояться последствий».
У выравнивания три классические цели, их часто называют тремя H по первым буквам английских слов:
- Helpful (полезный): модель решает задачу пользователя, а не отписывается общими словами.
- Harmless (безвредный): не помогает навредить людям и не выдаёт опасных инструкций.
- Honest (честный): не выдумывает факты и признаёт, когда чего-то не знает.
Проблема в том, что эти цели тянут в разные стороны. Максимально полезная модель ответит на любой вопрос, включая опасный. Максимально безвредная начнёт отказывать по любому поводу и станет бесполезной. Хорошее обучение ищет баланс. Именно такой баланс и ищет Constitutional AI, а дальше мы посмотрим, чем он отличается от того, что было раньше.
Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединитьсяКак ИИ учили до этого: RLHF простыми словами
До Constitutional AI главным способом «воспитания» чат-ботов был метод с длинным названием RLHF (обучение с подкреплением на основе обратной связи от людей). Разберём его по частям, потому что без него не понять, что именно улучшила Anthropic.
Работает RLHF так. Модель выдаёт на один запрос несколько вариантов ответа. Живые люди, нанятые разметчики, читают эти варианты и отмечают, какой лучше. Из тысяч таких оценок собирается «модель вознаграждения»: отдельная программа, которая научилась предсказывать, какой ответ понравится людям. Дальше основную нейросеть дообучают так, чтобы она чаще выдавала ответы с высокой оценкой. Дообучение под награду и называется обучением с подкреплением (по аналогии с дрессировкой: за нужное поведение даётся поощрение).
RLHF отлично сработал, именно на нём выехал первый ChatGPT. Но у метода есть три больных места:
КурсыСравнение 553 курсов по ChatGPTЦены, школы, длительность, рассрочка
- Дорого и медленно. Людям надо платить за каждую оценку, а нужны их сотни тысяч.
- Тяжело для самих разметчиков. Чтобы научить модель не выдавать жуткий контент, людям приходится этот контент читать и помечать. Работа выматывающая.
- Правила живут в головах. Оценки основаны на чутье конкретных людей. Почему один ответ забраковали, а другой нет, нигде не записано и не проверяемо.
Суть претензии. В RLHF ценности модели спрятаны в тысячах разрозненных человеческих оценок. Их нельзя открыть, прочитать и обсудить. Anthropic захотела вынести эти ценности наружу, в один документ.
Что придумала Anthropic: две фазы обучения

В конце 2022 года Anthropic выпустила исследование с говорящим названием «Constitutional AI: безвредность из обратной связи ИИ». Главная мысль: пусть основную часть проверок делает не человек, а сама модель, сверяясь с письменной конституцией. Обучение разбили на две фазы.
Фаза первая: самокритика и переписывание
Модели дают потенциально проблемный запрос и её же черновой ответ. Потом просят: «Посмотри на свой ответ через призму такого-то принципа конституции. Есть тут что-то вредное или нечестное? Если да, перепиши». Модель находит слабое место и правит сама себя. Такую пару «плохой черновик → исправленная версия» повторяют много раз на разных примерах, а потом дообучают модель на исправленных версиях. По сути нейросеть учится сразу выдавать то, к чему раньше приходила через самокритику.
Бытовая аналогия: это как привить человеку привычку спрашивать себя «а это точно нормально?» перед тем, как что-то сказать. Навык остаётся с ним и в новых ситуациях.
Фаза вторая: RLAIF вместо RLHF
Вторая фаза похожа на старый RLHF, но с одной заменой. Помните разметчиков, которые выбирали лучший ответ? Здесь их место занимает сам ИИ. Метод так и называется: RLAIF (обучение с подкреплением на основе обратной связи от ИИ). Модель генерирует два ответа на запрос, а отдельная копия ИИ выбирает лучший, опираясь на принцип из конституции. Этот выбор и становится сигналом «так лучше», по которому модель дообучают.
Важно не запутаться в терминах, поэтому запомним разницу простым правилом. RLAIF — это общая идея: обратную связь для обучения даёт не человек, а ИИ. Constitutional AI — это частный случай RLAIF, где ИИ судит не по своему вкусу, а по конкретному письменному документу с принципами. Проще говоря, RLAIF это категория, а Constitutional AI это её самый известный представитель.
Что это дало на практике: обучение стало дешевле и быстрее (не нужна армия разметчиков), люди перестали часами читать токсичный контент, а ценности модели переехали из чьих-то голов в открытый документ, который можно прочитать и обсудить.
Что за конституция у Claude и что в ней написано

«Конституция» звучит громко, но по факту это обычный текстовый документ с принципами. Первую версию Anthropic собрала из нескольких источников, и список довольно неожиданный:
- Всеобщая декларация прав человека ООН: базовые принципы про достоинство и свободу.
- Правила доверия и безопасности, вдохновлённые пользовательскими соглашениями крупных IT-компаний вроде Apple.
- Принципы Sparrow от лаборатории DeepMind: наработки коллег по безопасному диалогу.
- Ценности, учитывающие не только западный взгляд на мир, чтобы модель не была однобокой.
Дальше конституция заметно эволюционировала, и это важный момент, потому что многие статьи в интернете застряли на старой версии.
Как менялась конституция
- 2022 год. Первый прототип конституции внутри исследования про Constitutional AI.
- 2023 год. Anthropic публикует конституцию Claude открыто: список примерно из 75 принципов, около 2700 слов. Короткие правила в духе «выбирай самый безобидный ответ».
- Январь 2026 года. Выходит полностью новая конституция, уже около 23 000 слов. Это не просто расширенный список. Изменился сам подход.
Смысл обновления 2026 года стоит объяснить подробнее, потому что он меняет картину. Раньше конституция давала правила: делай так, не делай эдак. Новая версия вместо голых правил объясняет причины: почему стоит вести себя определённым образом. Логика простая: если модель понимает «почему», она сможет применить принцип в новой ситуации, которую авторы не предусмотрели. А если она просто заучила список «нельзя», то в непредвиденном случае растеряется.
Ещё новая конституция задаёт чёткую иерархию приоритетов на случай, когда принципы конфликтуют между собой. Порядок такой:
- Быть безопасной и поддерживать контроль человека над ИИ.
- Вести себя этично.
- Следовать правилам самой Anthropic.
- Быть максимально полезной.
Читается так. Полезность стоит на последнем месте по простой причине: ею нельзя жертвовать ради безопасности. Если помочь можно только ценой вреда, модель выбирает не помогать.
Кстати, наша обзорная статья про Claude упоминает «конституцию из 75 принципов». Теперь вы знаете нюанс: 75 принципов это версия 2023 года, а с января 2026 у Claude действует новая, куда более развёрнутая конституция.
Когда и почему Claude отказывается отвечать

Здесь мы подходим к тому, что новички замечают первым делом: Claude иногда отказывается выполнять запрос. Разберёмся, откуда это растёт и где проходят границы.
В конституции есть яркая формулировка: модель должна вести себя как отказник по убеждениям (по-английски conscientious objector). То есть отклонять по-настоящему вредные запросы, даже если бы их прислала сама Anthropic. Это встроенный тормоз, а не настройка, которую легко открутить.
Вот реальные примеры, где Claude уходит в отказ:
- Оружие массового поражения. Модель не помогает с созданием биологического или химического оружия. Это красная линия без исключений.
- Массовая слежка. Anthropic отдельно оговаривает, что Claude нельзя использовать для тотального наблюдения за гражданами.
- Автономное летальное оружие. Системы, которые сами решают, кого атаковать, тоже под запретом.
- Узкие юридические и медицинские детали. Общий обзор темы Claude даст, но от конкретных схем ухода от налогов или юридических лазеек под вашу ситуацию уклонится.
Отсюда и типичная боль: «Почему Claude мне отказал, а другой чат-бот спокойно ответил?». Причина как раз в конституции. У Claude планка осторожности выше, потому что так его обучили. Иногда это раздражает на безобидных запросах, которые модель приняла за опасные. Но у медали есть вторая сторона: тот же механизм не даёт модели помочь мошеннику или навредить вам чужими руками.
Честно про перегибы. Да, конституционная модель иногда осторожничает там, где не надо. Anthropic это признаёт и подкручивает баланс. Хорошая новость: по её замерам дополнительные защиты повышают долю отказов меньше чем на процент, то есть на обычных задачах вы разницы почти не заметите.
При чём тут галлюцинации: честный разбор
Отдельно стоит разобрать модный тезис «Claude галлюцинирует реже, чем ChatGPT». Галлюцинация — это когда нейросеть уверенно выдаёт выдумку за факт: несуществующий закон, фальшивую цитату, ссылку на статью, которой нет. Для того, кто пишет диплом или рабочий отчёт, это главный страх при работе с ИИ.
Сразу расставим точки, потому что тут много маркетинга. Constitutional AI придуман в первую очередь про безопасность и ценности, а не про фактическую точность. Напрямую он галлюцинации не лечит. Связь есть, но косвенная: среди ценностей конституции стоит честность, и Claude специально учат говорить «я не уверен» или «я не знаю» вместо того, чтобы сочинять правдоподобный ответ. Модель, которая не боится признать незнание, реже выдаёт красивую ложь. Вот здесь конституция и помогает.
Теперь про сравнение с ChatGPT честно, по цифрам. Есть независимый рейтинг галлюцинаций от компании Vectara (по-научному такой тест называют бенчмарком, а набор проверочных текстов для него — датасетом). Там модели заставляют пересказывать документы и считают, как часто они добавляют отсебятину. И картина зависит от теста:
| Тест | Что показал |
|---|---|
| Более простые ранние бенчмарки | Claude около 4 %, GPT около 6 % (здесь аккуратнее Claude) |
| Новый жёсткий датасет Vectara (февраль 2026, длинные документы по юр., мед., финансам) | GPT-5.4-nano 3,1 %, Gemini 2.5 Flash-Lite 3,3 %, Claude Haiku 4.5 9,8 %, Claude Opus 4.6 12,2 % (здесь впереди GPT) |
Вывод трезвый: универсального «Claude всегда галлюцинирует меньше» нет. На одних задачах аккуратнее Claude, на других GPT или Gemini. А на сложных длинных текстах даже топовые модели ошибаются больше 10 % времени. Так что любой ответ ИИ про важные факты нужно перепроверять по первоисточнику, какой бы бренд на нём ни стоял. Конституция делает Claude честнее в признании незнания, но не превращает его в непогрешимый справочник.
КурсыСравнение 17 курсов по GeminiЦены, школы, длительность, рассрочка
Constitutional AI против RLHF: короткое сравнение
Соберём разницу двух подходов в одну таблицу, чтобы всё было перед глазами.
| Критерий | RLHF (обратная связь от людей) | Constitutional AI (конституция + ИИ) |
|---|---|---|
| Кто оценивает ответы | Нанятые люди-разметчики | Сам ИИ, сверяясь с документом |
| Где живут ценности | В головах разметчиков, неявно | В открытой письменной конституции |
| Стоимость и скорость | Дорого, медленно | Дешевле, быстрее масштабируется |
| Нагрузка на людей | Читают токсичный контент вручную | Пишут принципы, проверяют итог |
| Прозрачность | Трудно проверить логику оценок | Принципы можно прочитать и обсудить |
| Слабое место | Человеческий фактор и усталость | Качество упирается в качество ИИ-судьи |
Отдельно проговорим последнюю строку, потому что это честный минус метода. Раз проверяет ответы сам ИИ, то его собственные слабости и предвзятости могут просочиться в оценки. Если модель-судья чего-то не понимает, она передаст это непонимание ученику. Поэтому Constitutional AI не отменяет людей полностью: люди пишут конституцию, задают приоритеты и проверяют результат. Меняется их роль, но из процесса они не исчезают.
Что Constitutional AI даёт вам как пользователю
Теория теорией, но что с этого обычному человеку, который просто открывает чат и задаёт вопрос? Несколько вполне ощутимых вещей.
Предсказуемость. Поведение модели опирается на записанный документ, а не на настроение. Значит, реакция на похожие запросы будет более-менее стабильной.
Честность про незнание. Claude чаще скажет «точных данных у меня нет», чем сочинит убедительную чушь. Для рабочих задач это ценнее, чем гладкий, но выдуманный ответ.
Защита от чужих рук. Тот же механизм, который иногда раздражает отказом, не даёт злоумышленнику использовать модель против других людей, в том числе против вас.
Прозрачность. Конституцию Claude можно найти и прочитать. Вы в принципе способны узнать, по каким принципам с вами разговаривает ИИ. Для большинства других чат-ботов такого документа просто нет.
Если вы только начинаете разбираться с нейросетями, полезно понимать не только «как обучали Claude», но и как вообще правильно формулировать запросы к любой модели. Про это у нас есть отдельный разбор: «Что такое промпт-инжиниринг простыми словами». А если хотите сравнить сами модели Claude между собой, загляните в статью «Какую модель Claude выбрать».
КурсыСравнение 126 курсов по промпт-инжинирингуЦены, школы, длительность, рассрочка
Где научиться работать с нейросетями
Понять, как устроен Constitutional AI, полезно для общей грамотности. Но если хочется применять нейросети в работе или сменить профессию, одной статьи мало: нужна системная практика. Чтобы не собирать знания по крупицам из десятков видео, проще один раз пройти нормальный курс, где всё разложено по полочкам и есть обратная связь от преподавателя.
Мы собрали и сравнили программы по нейросетям и искусственному интеллекту от разных школ: от коротких интенсивов «для себя» до основательного обучения на новую специальность. Можно отфильтровать по цене, длительности и уровню.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Нейросети для изображений и видео Перейти на сайт курса | 47 504 ₽ | 3958 ₽/мес. | 2 месяца | Обзор курса | |
| Нейросети для рабочих задач Перейти на сайт курса | 31 290 ₽ | 2608 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети. Практический курс Перейти на сайт курса | 74 900 ₽ | 6242 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для каждого: как решать рабочие задачи быстрее Перейти на сайт курса | 41 000 ₽ | 2763 ₽/мес. | 6 недель | Обзор курса | |
| Продуктовый маркетолог + Нейросети для маркетинга Перейти на сайт курса | 110 200 ₽ | 3875 ₽/мес. | 5 месяцев | Обзор курса | |
| Нейросети для дизайнера Перейти на сайт курса | 84 272 ₽ | 3831 ₽/мес. | 4 месяца | Обзор курса | |
| Нейросети для работы Перейти на сайт курса | 44 690 ₽ | 5477 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для каждого Перейти на сайт курса | 39 900 ₽ | 3325 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для начинающих Перейти на сайт курса | 42 000 ₽ | 2333 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети для бизнеса Перейти на сайт курса | 97 632 ₽ | 2712 ₽/мес. | Обзор курса |
Больше программ — в полном каталоге курсов по нейросетям и искусственному интеллекту
Разбираться в том, как обучают ИИ, стоит хотя бы ради одной привычки: не верить нейросети на слово. Модель с конституцией честнее многих, но и она ошибается. Понимаете, как её учили, значит понимаете и границы доверия. А это уже половина цифровой грамотности.




