Пачка фотографий чеков в телефоне, скан договора на 40 страниц, таблица из отчёта, которую прислали картинкой. Всё это надо превратить в текст и цифры, с которыми можно работать. Раньше на такое уходил вечер и программа за деньги.
Сейчас задачу закрывает бесплатный чат нейросети. Qwen3-VL — это «зрячая» модель Alibaba, которая понимает картинки и видео наравне с текстом. Ей можно скинуть фото мятого чека и попросить достать сумму, дату и название магазина, а она вернёт готовую таблицу.
Если про саму нейросеть Qwen вы слышите впервые, начните с обзорной статьи «Qwen: что это и как пользоваться бесплатно». Там разобрали интерфейс, регистрацию и лимиты.
Сориентироваться в линейке моделей поможет отдельный материал «Какую модель Qwen выбрать»: у Alibaba их полтора десятка, и путаются в них все.
Статья пригодится бухгалтерам, которые вручную вбивают первичку, маркетологам с отчётами в скриншотах, специалистам поддержки, юристам и студентам. Программировать не нужно: почти всё делается в браузере мышкой.
А если хочется освоить нейросети системно, загляните в подборку курсов по нейросетям и искусственному интеллекту: там больше тысячи программ, от коротких интенсивов до годовых.
Что такое Qwen3-VL и чем «зрячая» нейросеть отличается от старого OCR

Аббревиатура VL расшифровывается как vision-language, то есть «зрение и язык». Такие модели называют визуальными языковыми моделями (VLM): они принимают на вход картинку и текст одновременно и отвечают текстом.
Классический OCR (optical character recognition, технология распознавания символов, ей больше тридцати лет) работал иначе. Программа находила на картинке буквы, сверяла их с образцами и выдавала строку символов. Смысла в этой строке она не понимала: где сумма, а где номер телефона, решал человек.
Qwen3-VL видит документ целиком: шапку, подписи, колонки, печать, порядок строк. Поэтому ей можно сказать «достань ИНН и итоговую сумму», и она найдёт нужное сама, даже если в чеке пятнадцать строк и половина смазана.
Главное отличие одной фразой. OCR отвечает на вопрос «какие тут символы», а визуальная модель на вопрос «что тут написано и что это значит».
Второе важное свойство: модель понимает нечёткие формулировки. Не нужно настраивать шаблон под каждый тип бланка, достаточно описать словами, что вам нужно достать. Один и тот же запрос работает и для чека «Пятёрочки», и для накладной поставщика, хотя выглядят они по-разному.
Из этого следует и третье отличие, самое приятное на практике. Старый OCR требовал ровного скана: перекос в пять градусов уже ломал разбор колонок. Визуальная модель достраивает структуру по смыслу, поэтому переживает и наклон, и тень от руки, и палец в углу кадра.
Линейка Qwen3-VL собрана из моделей разного размера. Маленькие на 2 и 4 млрд параметров запускаются на ноутбуке, средние на 8 и 32 млрд дают баланс качества и скорости, старшие 30B-A3B и 235B-A22B работают через облако. У старших есть режим Thinking: модель дольше рассуждает перед ответом, что заметно помогает на запутанных таблицах и договорах.
Разработчики заявляют поддержку OCR на 32 языках и устойчивость к плохому свету, размытию, наклону текста и редким символам. Русский среди поддерживаемых, и на практике модель читает кириллицу уверенно, включая рукописную.
Какие документы Qwen читает без подготовки
Короткий ответ: почти любые, если текст физически различим глазом. Ниже типы документов, с которыми к модели идут чаще всего, и что стоит держать в голове по каждому.
| Тип документа | Насколько надёжно | Что учесть |
|---|---|---|
| Печатный скан (договор, справка, приказ) | Очень высоко | Идеальный сценарий, ошибки редки |
| Фото документа с телефона | Высоко | Снимать сверху, без бликов и теней |
| Кассовый чек | Высоко | Термобумага выцветает, мятый чек читается хуже |
| Накладная, счёт, акт | Высоко | Суммы и ИНН всегда перепроверять глазами |
| Таблица из отчёта | Высоко | Просить вывод сразу в CSV или Markdown |
| Рукописный текст | Средне | Разборчивый почерк читается, врачебный как повезёт |
| График, диаграмма, схема | Средне | Читает подписи и тренд, точные значения оценивает |
| Многостраничный PDF | Высоко | Через чат грузится файлом целиком |
| Скриншот интерфейса | Очень высоко | Понимает кнопки и структуру экрана |
В чат Qwen документы загружаются в форматах PDF, DOCX, TXT, EPUB, MOBI и MD, изображения в обычных JPG и PNG. Если исходник в другом формате, проще пересохранить его в PDF.
Отдельно про качество съёмки. Разрешение важнее модели: для уверенного результата хватает 300 DPI при сканировании, а фото лучше делать при дневном свете и держать телефон параллельно листу. Снимок под углом модель вытянет, но на цифрах начнёт ошибаться.
Ещё один момент, который экономит нервы: один документ на один файл. Если сфотографировать три чека одним кадром, модель прочитает все три, но начнёт путать, какая сумма к какому относится. Проще сделать три снимка.
Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединитьсяКак распознать документ в Qwen Chat за пять минут

Весь путь занимает столько же времени, сколько один раз вбить накладную руками. Дальше уже быстрее.
Шаг 1. Откройте chat.qwen.ai. Из России сайт открывается напрямую, КВН не нужен. Это официальный чат Alibaba, не сторонний посредник, поэтому и лимиты, и качество ответов там честные.
Шаг 2. Заведите аккаунт. Регистрация по почте или Google-аккаунту занимает пару минут. Без неё чат тоже работает, но загрузка файлов и история диалогов доступны только зарегистрированным.
Шаг 3. Выберите модель с поддержкой картинок. В выпадающем списке вверху нужна строка с пометкой VL или Vision. Обычные текстовые модели картинку просто не увидят и вежливо ответят, что ничего не получили.
Разница между версиями внутри линейки заметная, и путаться в них нормально. Если не знаете, что выбрать, загляните в разбор «Какую модель Qwen выбрать»: там расписано, какая версия под какие задачи.
Шаг 4. Загрузите файл. Скрепка для документов, иконка фотоаппарата для изображений. За один раз можно приложить несколько файлов.
Шаг 5. Напишите, что нужно достать. Не «распознай текст», а конкретную задачу: какие поля нужны и в каком виде вы хотите ответ. Именно тут решается качество результата, и об этом следующий раздел.
Частая ошибка новичка. Загрузить десять чеков одной пачкой и попросить «посчитай сумму». Модель начнёт складывать сама и может ошибиться. Просите сначала таблицу по каждому чеку, а складывайте уже в Excel.
Бесплатный тариф ограничен количеством сообщений в сутки. Точных цифр Alibaba не публикует, на практике речь о нескольких десятках запросов к старшим моделям. Для разовой пачки документов этого хватает с запасом, а если лимит закончился, он обновляется на следующий день.
Промпты, которые дают чистый результат
Промпт — это ваш запрос к нейросети. От его формулировки результат меняется сильнее, чем от выбора модели.
Главное правило: просите структуру, а не текст. Если сказать «распознай», модель вернёт сплошную простыню, которую придётся разбирать руками. Если задать формат, она отдаст готовые данные, которые можно сразу вставить в таблицу.
Умение формулировать запрос переносится на любые нейросети и окупается быстрее всего остального. Отдельные программы этому и учат: посмотрите подборку курсов по навыку работы с нейросетями.
Рабочий шаблон для чека или накладной:
«Это фото кассового чека. Извлеки данные и верни таблицей с колонками: магазин, дата, время, номер чека, итоговая сумма, НДС. Если поле не читается, пиши: не распознано, ничего не додумывай».
Последняя фраза важнее всех остальных. Нейросети склонны к галлюцинациям: они дописывают правдоподобное вместо того, чтобы признать пробел. Явный запрет догадываться заметно снижает риск получить красивую, но выдуманную сумму.
Для таблицы, которую потом нужно вставить в Excel:
«Перенеси таблицу с изображения в формат CSV с разделителем точка с запятой. Сохрани порядок строк и колонок. Числа оставь как есть, без округления и без пробелов внутри».
Для длинного договора:
«Это скан договора. Составь список: стороны, предмет, срок действия, сумма, порядок оплаты, штрафные санкции. Для каждого пункта укажи номер раздела, откуда взял».
Требование указать источник даёт удобную проверку: по номеру раздела вы за секунду сверите ответ с оригиналом, не перечитывая весь документ.
И приём, который работает почти всегда. Если ответ вышел кривым, не переписывайте запрос с нуля, а уточните в том же диалоге: «во второй строке сумма не сходится, посмотри внимательнее» или «выведи то же самое, но одной таблицей». Модель помнит картинку и поправится быстрее, чем при новой загрузке.
Чеки и первичка: как бухгалтеру разобрать пачку фото

Это самый частый рабочий сценарий, и он же самый выгодный по сэкономленному времени. Схема простая.
Сначала сложите все фото в один диалог по 5–10 штук за раз. Больше грузить не стоит: чем длиннее пачка, тем выше шанс, что модель перепутает строки между документами.
Дальше попросите единую таблицу: «По каждому загруженному чеку отдельной строкой: номер файла, продавец, ИНН, дата, сумма, НДС». Привязка к номеру файла позволяет потом найти оригинал, если цифра вызовет вопросы.
Полученную таблицу скопируйте в Excel или Google Таблицы и там уже считайте итоги формулой. Арифметику нейросети не доверяйте: она отлично читает и плохо складывает, это разные навыки.
Что проверять всегда. Суммы, ИНН и даты. Это три поля, где ошибка стоит дороже всего, а распознавание цифр на мятой термобумаге остаётся самым слабым местом любой модели.
Отдельный приём для авансовых отчётов: попросите модель сразу разложить траты по категориям. Формулировка «добавь колонку категория со значениями: транспорт, питание, проживание, прочее» экономит второй проход по таблице.
Для регулярного потока в сотни документов чат перестаёт подходить: там нужен API и автоматическая выгрузка в 1С или CRM. Про этот вариант ниже. Как встроить нейросеть в рабочие процессы компании, мы разбирали в материале «Qwen для бизнеса».
Таблицы из фото в Excel и Google Таблицы
Отдельная боль возникает, когда данные пришли картинкой: скриншот отчёта, фото распечатки, таблица внутри PDF без текстового слоя. Скопировать оттуда нечего, а перебивать руками жалко.
Порядок действий тот же, что с чеками, но с двумя уточнениями. Первое: просите CSV, а не «таблицу». Markdown-таблица выглядит красиво в чате и разваливается при вставке в Excel, а CSV встаёт по колонкам сразу.
Второе: заранее скажите, что делать с объединёнными ячейками и переносами строк. Формулировка «если ячейка объединяет несколько строк, продублируй её значение в каждой» экономит потом полчаса ручной правки.
Числа отдельно проговорите: «дробную часть отделяй запятой, разряды не разделяй пробелами». Иначе Excel примет «1 250,40» за текст, и формулы по этой колонке не сработают.
Если таблица большая и не поместилась в один ответ, попросите продолжить с конкретной строки: «продолжи с 25-й строки». Это надёжнее, чем просить «дальше», после которого модель иногда начинает сначала.
Маркетологам, которые собирают отчёты из скриншотов кабинетов, пригодится и соседний материал про нейросети для маркетплейсов: там разобрана автоматизация рутины вокруг карточек и аналитики.
Видео, скриншоты и схемы
Qwen3-VL работает не только с картинками. Модель понимает видео и умеет отвечать на вопросы по его содержанию: что происходит на записи, в какой момент появляется нужный объект, что написано на табличке в кадре.
Практическая польза для обычной работы простая. Можно разобрать запись экрана вместо того, чтобы пересматривать её целиком, вытащить текст из видеоинструкции или найти нужный фрагмент по описанию.
Скриншоты интерфейсов модель читает особенно хорошо: распознаёт кнопки, поля, структуру экрана. Это удобно в поддержке, когда клиент прислал скриншот ошибки, и нейросеть сразу описывает, что на нём и куда нажимать. Тот же приём выручает при разборе чужих отчётов из незнакомых кабинетов.
Схемы и графики идут с оговоркой. Подписи, легенду и общий тренд Qwen читает уверенно, а вот точные значения по высоте столбика оценивает приблизительно. Для вывода «выросло или упало» годится, для отчёта с цифрами уже нет: там нужен исходник данных.
Точность: где Qwen силён и где ошибается
Честная картина выглядит так. На чистом печатном скане ошибки единичны и обычно связаны с редкими шрифтами. На хорошем фото документа результат близкий. Проблемы начинаются там, где плохо и человеку: если вы сами не разбираете цифру на чеке, модель тоже угадывает.
Слабые места, которые стоит знать заранее:
- Мятая термобумага. Выцветший чек из кармана даёт больше всего ошибок в суммах
- Похожие символы. Ноль и буква «О», единица и «I», пятёрка и «S» путаются в плохом качестве
- Плотные таблицы. Много колонок мелким шрифтом, строки иногда съезжают на соседние
- Рукописный текст. Аккуратный почерк читается, врачебный непредсказуемо
- Арифметика. Складывать и проверять итоги модель не обязана и делает это ненадёжно
По сравнению с другими нейросетями расклад примерно такой. Флагманы вроде GPT-5.6 и Claude Opus 5 читают документы на сопоставимом уровне, Gemini 3.6 сильна на формулах и чертежах. Заметное преимущество Qwen для российского пользователя лежит не в точности, а в доступе: чат работает без КВН и без зарубежной карты.
Второй аргумент в пользу Qwen: открытые веса младших моделей. Для сценариев с чувствительными документами это решающий фактор, потому что закрытые флагманы поставить внутри компании нельзя в принципе.
Подробное сравнение с ближайшим конкурентом мы собрали в статье «Gemini или Qwen: что лучше».
Правило для любых документов с деньгами. Нейросеть ускоряет ввод данных, но не отменяет проверку. Считайте её быстрым помощником, за которым нужно перечитать итог.
Что нельзя загружать в чат
Это раздел, который пропускают чаще всего, а зря. Qwen Chat остаётся зарубежным сервисом, и файлы уходят на серверы за пределами России.
Как только вы загружаете паспорт, скан трудовой или таблицу с ФИО и телефонами клиентов, начинается обработка персональных данных по 152-ФЗ, причём с трансграничной передачей. Для компании это прямой риск штрафа, и суммы там измеряются миллионами рублей.
Практический минимум, который стоит соблюдать:
- Не грузить паспорта, СНИЛС, ИНН физлиц, медицинские документы
- Не грузить клиентские базы и таблицы с контактами
- Не грузить внутренние документы под NDA и коммерческую тайну
- Обезличивать документ перед загрузкой, если нужна только структура
Чеки от магазина, публичные отчёты, собственные конспекты и учебные материалы попадают в безопасную зону. Всё, где есть чужие персональные данные, в неё не попадает.
Обезличивание работает лучше, чем кажется: закрасьте ФИО и номера в графическом редакторе, и модель спокойно разберёт оставшуюся структуру документа. Для задачи «перенеси таблицу в Excel» имена обычно и не нужны.
Если работать с чувствительными документами нужно регулярно, единственный правильный путь такой: развернуть модель внутри своего контура. Открытые версии Qwen3-VL для этого подходят, инструкция по локальному запуску есть в статье «Qwen локально через Ollama». Юридическую сторону вопроса мы разбирали отдельно в материале «Безопасно ли использовать Qwen».
API и локальный запуск: когда чата уже мало
Чат хорош для разовых задач. Когда документов сотни в неделю и результат должен сам попадать в учётную систему, нужен API, то есть способ обращаться к модели программно из своей программы или сценария автоматизации.
Через агрегатор OpenRouter доступны все размеры линейки, и стоят они недорого. Ориентиры по цене за миллион токенов:
| Модель | Вход | Выход | Кому подходит |
|---|---|---|---|
| Qwen3-VL 8B Instruct | $0,117 | $0,455 | Простые чеки и бланки потоком |
| Qwen3-VL 30B-A3B Instruct | $0,13 | $0,52 | Баланс цены и качества |
| Qwen3-VL 235B-A22B Instruct | $0,20 | $0,88 | Сложные документы и таблицы |
| Qwen3-VL 235B-A22B Thinking | $0,40 | $4,00 | Разбор запутанных договоров |
Чтобы понять масштаб: одна страница документа со средним изображением обходится в центы. Пачка из тысячи чеков на младшей модели укладывается в несколько долларов, что дешевле часа работы человека, который вбивал бы их руками.
Контекстное окно у линейки большое: 256 тысяч токенов нативно, с расширением до миллиона. На практике это значит, что многостраничный договор влезает в один запрос целиком, без нарезки на куски и сшивания результатов.
Второй путь ведёт в локальный запуск. Открытые веса лежат на Hugging Face, поднять модель можно через Ollama, LM Studio или vLLM. Младшие версии на 2 и 4 млрд параметров работают даже на ноутбуке с приличной видеокартой, старшие требуют серверного железа. Плюс очевиден: файлы никуда не уходят, вопрос с персональными данными снимается сам собой.
Выбирать между двумя путями просто. Разовые задачи и десятки документов закрывает чат. Сотни документов в неделю с выгрузкой в учётную систему требуют API. Чувствительные данные и внутренние требования безопасности ведут к локальному запуску.
Пять ошибок, из-за которых распознавание выходит кривым

Почти все жалобы на «нейросеть плохо читает» сводятся к пяти повторяющимся промахам. Ни один из них не связан с моделью.
Ошибка 1: просить «распознай текст». Модель послушно вернёт сплошное полотно, где данные перемешаны с шапкой и рекламой на обороте чека. Разбирать это руками дольше, чем набрать заново. Всегда описывайте, какие поля нужны и в каком формате.
Ошибка 2: грузить всё одной кучей. Двадцать файлов в одном сообщении почти гарантированно дадут смешанные строки: сумма из четвёртого чека уедет к седьмому. Пачками по 5–10 штук результат стабильный.
Ошибка 3: доверять итогам. Модель складывает числа как побочный навык, и ошибается в этом чаще, чем в чтении. Итоги считайте формулой в таблице, а нейросеть используйте только для переноса данных.
Ошибка 4: снимать под углом и в тени. Половина проблем с цифрами лечится пересъёмкой при дневном свете. Телефон параллельно листу, лист целиком в кадре, без бликов от лампы.
Ошибка 5: не оговаривать нечитаемые поля. Без явного запрета додумывать модель поставит правдоподобное значение вместо пропуска, и вы об этом не узнаете. Фраза о том, что нераспознанное нужно помечать прямо, стоит дешевле, чем поиск одной неверной суммы в готовой таблице.
Проверка на здравый смысл. Если результат выглядит подозрительно ровным и все поля заполнены, откройте два случайных документа и сверьте руками. Слишком гладкий ответ чаще означает догадки, чем идеальное чтение.
Где научиться работать с нейросетями
Распознавание документов закрывает лишь одну маленькую задачу из большого набора. Тот же навык грамотно формулировать запрос и проверять результат работает и в аналитике, и в текстах, и в автоматизации отчётов. Собирать его по обрывкам инструкций долго, системнее один раз пройти нормальный курс и дальше применять по своим задачам.
| Курс | Школа | Стоимость со скидкой | В рассрочку | Длительность | Обзор курса от Checkroi |
|---|---|---|---|---|---|
| Нейросети для изображений и видео Перейти на сайт курса | 48 455 ₽ | 4037 ₽/мес. | 2 месяца | Обзор курса | |
| Нейросети для рабочих задач Перейти на сайт курса | 31 290 ₽ | 2608 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети. Практический курс Перейти на сайт курса | 74 900 ₽ | 6242 ₽/мес. | 3 месяца | Обзор курса | |
| Продуктовый маркетолог + Нейросети для маркетинга Перейти на сайт курса | 110 200 ₽ | 3875 ₽/мес. | 5 месяцев | Обзор курса | |
| Нейросети для работы | 44 690 ₽ | 5477 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для дизайнера Перейти на сайт курса | 84 272 ₽ | 3831 ₽/мес. | 4 месяца | Обзор курса | |
| Нейросети для каждого Перейти на сайт курса | 39 900 ₽ | 3325 ₽/мес. | 3 месяца | Обзор курса | |
| Нейросети для начинающих Перейти на сайт курса | 42 000 ₽ | 2333 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети для маркетинга Перейти на сайт курса | 29 800 ₽ | 4967 ₽/мес. | 1 месяц | Обзор курса | |
| Нейросети для бизнеса Перейти на сайт курса | 97 632 ₽ | 2712 ₽/мес. | Обзор курса |
Больше программ — в полном каталоге курсов по нейросетям и искусственному интеллекту
Если интересна именно работа с изображениями и генерация, посмотрите разбор консистентных персонажей в Nano Banana. А общее сравнение чат-моделей между собой есть в статье «ChatGPT или Qwen».




