Qwen3-VL: как распознавать документы, чеки и таблицы нейросетью

Qwen3-VL читает фото чеков, сканы договоров и таблицы из отчётов, а взамен отдаёт готовые данные, которые можно сразу вставить в Excel. Разобрали простыми словами: как загрузить документ в бесплатный чат без КВН, какими запросами получить чистую таблицу вместо простыни текста, где модель ошибается в цифрах и что нельзя грузить туда по 152-ФЗ. После статьи сможете разобрать первую пачку документов за пять минут.
Статью написал:
Ваня Буявец, продюсер, основатель Checkroi
Ваня Буявец
Основатель Checkroi, продюсер, эксперт в выборе онлайн-курсов
Все 2504 статьи автора Подписаться на Телеграм-канал
Одобрено экспертом:
Наташа Буявец, основатель Checkroi, эксперт по онлайн-курсам
Наташа Буявец
Основательница Checkroi, продюсер Youtube-каналов, эксперт по онлайн-курсам
Все 3164 экспертных мнения Подписаться на Телеграм-канал
Обложка: Qwen3-VL: как распознавать документы, чеки и таблицы нейросетью

Пачка фотографий чеков в телефоне, скан договора на 40 страниц, таблица из отчёта, которую прислали картинкой. Всё это надо превратить в текст и цифры, с которыми можно работать. Раньше на такое уходил вечер и программа за деньги.

Сейчас задачу закрывает бесплатный чат нейросети. Qwen3-VL — это «зрячая» модель Alibaba, которая понимает картинки и видео наравне с текстом. Ей можно скинуть фото мятого чека и попросить достать сумму, дату и название магазина, а она вернёт готовую таблицу.

Если про саму нейросеть Qwen вы слышите впервые, начните с обзорной статьи «Qwen: что это и как пользоваться бесплатно». Там разобрали интерфейс, регистрацию и лимиты.

Сориентироваться в линейке моделей поможет отдельный материал «Какую модель Qwen выбрать»: у Alibaba их полтора десятка, и путаются в них все.

Статья пригодится бухгалтерам, которые вручную вбивают первичку, маркетологам с отчётами в скриншотах, специалистам поддержки, юристам и студентам. Программировать не нужно: почти всё делается в браузере мышкой.

А если хочется освоить нейросети системно, загляните в подборку курсов по нейросетям и искусственному интеллекту: там больше тысячи программ, от коротких интенсивов до годовых.

CheckroiCheckroiПодборка курсов по Qwen10 курсов • 7 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Что такое Qwen3-VL и чем «зрячая» нейросеть отличается от старого OCR

Рой изучает скан документа на экране

Аббревиатура VL расшифровывается как vision-language, то есть «зрение и язык». Такие модели называют визуальными языковыми моделями (VLM): они принимают на вход картинку и текст одновременно и отвечают текстом.

Классический OCR (optical character recognition, технология распознавания символов, ей больше тридцати лет) работал иначе. Программа находила на картинке буквы, сверяла их с образцами и выдавала строку символов. Смысла в этой строке она не понимала: где сумма, а где номер телефона, решал человек.

Qwen3-VL видит документ целиком: шапку, подписи, колонки, печать, порядок строк. Поэтому ей можно сказать «достань ИНН и итоговую сумму», и она найдёт нужное сама, даже если в чеке пятнадцать строк и половина смазана.

Главное отличие одной фразой. OCR отвечает на вопрос «какие тут символы», а визуальная модель на вопрос «что тут написано и что это значит».

Второе важное свойство: модель понимает нечёткие формулировки. Не нужно настраивать шаблон под каждый тип бланка, достаточно описать словами, что вам нужно достать. Один и тот же запрос работает и для чека «Пятёрочки», и для накладной поставщика, хотя выглядят они по-разному.

Из этого следует и третье отличие, самое приятное на практике. Старый OCR требовал ровного скана: перекос в пять градусов уже ломал разбор колонок. Визуальная модель достраивает структуру по смыслу, поэтому переживает и наклон, и тень от руки, и палец в углу кадра.

Линейка Qwen3-VL собрана из моделей разного размера. Маленькие на 2 и 4 млрд параметров запускаются на ноутбуке, средние на 8 и 32 млрд дают баланс качества и скорости, старшие 30B-A3B и 235B-A22B работают через облако. У старших есть режим Thinking: модель дольше рассуждает перед ответом, что заметно помогает на запутанных таблицах и договорах.

Разработчики заявляют поддержку OCR на 32 языках и устойчивость к плохому свету, размытию, наклону текста и редким символам. Русский среди поддерживаемых, и на практике модель читает кириллицу уверенно, включая рукописную.

Какие документы Qwen читает без подготовки

Короткий ответ: почти любые, если текст физически различим глазом. Ниже типы документов, с которыми к модели идут чаще всего, и что стоит держать в голове по каждому.

Тип документа Насколько надёжно Что учесть
Печатный скан (договор, справка, приказ) Очень высоко Идеальный сценарий, ошибки редки
Фото документа с телефона Высоко Снимать сверху, без бликов и теней
Кассовый чек Высоко Термобумага выцветает, мятый чек читается хуже
Накладная, счёт, акт Высоко Суммы и ИНН всегда перепроверять глазами
Таблица из отчёта Высоко Просить вывод сразу в CSV или Markdown
Рукописный текст Средне Разборчивый почерк читается, врачебный как повезёт
График, диаграмма, схема Средне Читает подписи и тренд, точные значения оценивает
Многостраничный PDF Высоко Через чат грузится файлом целиком
Скриншот интерфейса Очень высоко Понимает кнопки и структуру экрана

В чат Qwen документы загружаются в форматах PDF, DOCX, TXT, EPUB, MOBI и MD, изображения в обычных JPG и PNG. Если исходник в другом формате, проще пересохранить его в PDF.

Отдельно про качество съёмки. Разрешение важнее модели: для уверенного результата хватает 300 DPI при сканировании, а фото лучше делать при дневном свете и держать телефон параллельно листу. Снимок под углом модель вытянет, но на цифрах начнёт ошибаться.

Ещё один момент, который экономит нервы: один документ на один файл. Если сфотографировать три чека одним кадром, модель прочитает все три, но начнёт путать, какая сумма к какому относится. Проще сделать три снимка.

Канал основателя Checkroi Вани Буявца3 700 человек читают мой Телеграм-канал про нейросетиСобрал промпты для Claude Code и ChatGPT, разборы ИИ-инструментов и лайфхаки по продвижению бизнеса в одном местеПрисоединиться

Как распознать документ в Qwen Chat за пять минут

Рой фотографирует документ на смартфон

Весь путь занимает столько же времени, сколько один раз вбить накладную руками. Дальше уже быстрее.

Шаг 1. Откройте chat.qwen.ai. Из России сайт открывается напрямую, КВН не нужен. Это официальный чат Alibaba, не сторонний посредник, поэтому и лимиты, и качество ответов там честные.

Шаг 2. Заведите аккаунт. Регистрация по почте или Google-аккаунту занимает пару минут. Без неё чат тоже работает, но загрузка файлов и история диалогов доступны только зарегистрированным.

Шаг 3. Выберите модель с поддержкой картинок. В выпадающем списке вверху нужна строка с пометкой VL или Vision. Обычные текстовые модели картинку просто не увидят и вежливо ответят, что ничего не получили.

Разница между версиями внутри линейки заметная, и путаться в них нормально. Если не знаете, что выбрать, загляните в разбор «Какую модель Qwen выбрать»: там расписано, какая версия под какие задачи.

Шаг 4. Загрузите файл. Скрепка для документов, иконка фотоаппарата для изображений. За один раз можно приложить несколько файлов.

Шаг 5. Напишите, что нужно достать. Не «распознай текст», а конкретную задачу: какие поля нужны и в каком виде вы хотите ответ. Именно тут решается качество результата, и об этом следующий раздел.

Частая ошибка новичка. Загрузить десять чеков одной пачкой и попросить «посчитай сумму». Модель начнёт складывать сама и может ошибиться. Просите сначала таблицу по каждому чеку, а складывайте уже в Excel.

Бесплатный тариф ограничен количеством сообщений в сутки. Точных цифр Alibaba не публикует, на практике речь о нескольких десятках запросов к старшим моделям. Для разовой пачки документов этого хватает с запасом, а если лимит закончился, он обновляется на следующий день.

Промпты, которые дают чистый результат

Промпт — это ваш запрос к нейросети. От его формулировки результат меняется сильнее, чем от выбора модели.

Главное правило: просите структуру, а не текст. Если сказать «распознай», модель вернёт сплошную простыню, которую придётся разбирать руками. Если задать формат, она отдаст готовые данные, которые можно сразу вставить в таблицу.

Умение формулировать запрос переносится на любые нейросети и окупается быстрее всего остального. Отдельные программы этому и учат: посмотрите подборку курсов по навыку работы с нейросетями.

Рабочий шаблон для чека или накладной:

«Это фото кассового чека. Извлеки данные и верни таблицей с колонками: магазин, дата, время, номер чека, итоговая сумма, НДС. Если поле не читается, пиши: не распознано, ничего не додумывай».

Последняя фраза важнее всех остальных. Нейросети склонны к галлюцинациям: они дописывают правдоподобное вместо того, чтобы признать пробел. Явный запрет догадываться заметно снижает риск получить красивую, но выдуманную сумму.

CheckroiCheckroiПодборка курсов по Нейросетям898 курсов • 62 школыСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Для таблицы, которую потом нужно вставить в Excel:

«Перенеси таблицу с изображения в формат CSV с разделителем точка с запятой. Сохрани порядок строк и колонок. Числа оставь как есть, без округления и без пробелов внутри».

Для длинного договора:

«Это скан договора. Составь список: стороны, предмет, срок действия, сумма, порядок оплаты, штрафные санкции. Для каждого пункта укажи номер раздела, откуда взял».

Требование указать источник даёт удобную проверку: по номеру раздела вы за секунду сверите ответ с оригиналом, не перечитывая весь документ.

И приём, который работает почти всегда. Если ответ вышел кривым, не переписывайте запрос с нуля, а уточните в том же диалоге: «во второй строке сумма не сходится, посмотри внимательнее» или «выведи то же самое, но одной таблицей». Модель помнит картинку и поправится быстрее, чем при новой загрузке.

Чеки и первичка: как бухгалтеру разобрать пачку фото

Раскладка документов и техники для распознавания

Это самый частый рабочий сценарий, и он же самый выгодный по сэкономленному времени. Схема простая.

Сначала сложите все фото в один диалог по 5–10 штук за раз. Больше грузить не стоит: чем длиннее пачка, тем выше шанс, что модель перепутает строки между документами.

Дальше попросите единую таблицу: «По каждому загруженному чеку отдельной строкой: номер файла, продавец, ИНН, дата, сумма, НДС». Привязка к номеру файла позволяет потом найти оригинал, если цифра вызовет вопросы.

Полученную таблицу скопируйте в Excel или Google Таблицы и там уже считайте итоги формулой. Арифметику нейросети не доверяйте: она отлично читает и плохо складывает, это разные навыки.

Что проверять всегда. Суммы, ИНН и даты. Это три поля, где ошибка стоит дороже всего, а распознавание цифр на мятой термобумаге остаётся самым слабым местом любой модели.

Отдельный приём для авансовых отчётов: попросите модель сразу разложить траты по категориям. Формулировка «добавь колонку категория со значениями: транспорт, питание, проживание, прочее» экономит второй проход по таблице.

Для регулярного потока в сотни документов чат перестаёт подходить: там нужен API и автоматическая выгрузка в 1С или CRM. Про этот вариант ниже. Как встроить нейросеть в рабочие процессы компании, мы разбирали в материале «Qwen для бизнеса».

Таблицы из фото в Excel и Google Таблицы

Отдельная боль возникает, когда данные пришли картинкой: скриншот отчёта, фото распечатки, таблица внутри PDF без текстового слоя. Скопировать оттуда нечего, а перебивать руками жалко.

Порядок действий тот же, что с чеками, но с двумя уточнениями. Первое: просите CSV, а не «таблицу». Markdown-таблица выглядит красиво в чате и разваливается при вставке в Excel, а CSV встаёт по колонкам сразу.

Второе: заранее скажите, что делать с объединёнными ячейками и переносами строк. Формулировка «если ячейка объединяет несколько строк, продублируй её значение в каждой» экономит потом полчаса ручной правки.

Числа отдельно проговорите: «дробную часть отделяй запятой, разряды не разделяй пробелами». Иначе Excel примет «1 250,40» за текст, и формулы по этой колонке не сработают.

Если таблица большая и не поместилась в один ответ, попросите продолжить с конкретной строки: «продолжи с 25-й строки». Это надёжнее, чем просить «дальше», после которого модель иногда начинает сначала.

Маркетологам, которые собирают отчёты из скриншотов кабинетов, пригодится и соседний материал про нейросети для маркетплейсов: там разобрана автоматизация рутины вокруг карточек и аналитики.

Ваня БуявецКанал основателя Checkroi Вани БуявцаЗабирайте промпты и обучение по нейросетям в моём Телеграм-каналеБольше 3 700 человек уже применяют Claude Code, ChatGPT и другие нейросети в работе, учёбе, бизнесе и жизниПерейти в канал

Видео, скриншоты и схемы

Qwen3-VL работает не только с картинками. Модель понимает видео и умеет отвечать на вопросы по его содержанию: что происходит на записи, в какой момент появляется нужный объект, что написано на табличке в кадре.

Практическая польза для обычной работы простая. Можно разобрать запись экрана вместо того, чтобы пересматривать её целиком, вытащить текст из видеоинструкции или найти нужный фрагмент по описанию.

Скриншоты интерфейсов модель читает особенно хорошо: распознаёт кнопки, поля, структуру экрана. Это удобно в поддержке, когда клиент прислал скриншот ошибки, и нейросеть сразу описывает, что на нём и куда нажимать. Тот же приём выручает при разборе чужих отчётов из незнакомых кабинетов.

Схемы и графики идут с оговоркой. Подписи, легенду и общий тренд Qwen читает уверенно, а вот точные значения по высоте столбика оценивает приблизительно. Для вывода «выросло или упало» годится, для отчёта с цифрами уже нет: там нужен исходник данных.

Точность: где Qwen силён и где ошибается

Честная картина выглядит так. На чистом печатном скане ошибки единичны и обычно связаны с редкими шрифтами. На хорошем фото документа результат близкий. Проблемы начинаются там, где плохо и человеку: если вы сами не разбираете цифру на чеке, модель тоже угадывает.

Слабые места, которые стоит знать заранее:

  • Мятая термобумага. Выцветший чек из кармана даёт больше всего ошибок в суммах
  • Похожие символы. Ноль и буква «О», единица и «I», пятёрка и «S» путаются в плохом качестве
  • Плотные таблицы. Много колонок мелким шрифтом, строки иногда съезжают на соседние
  • Рукописный текст. Аккуратный почерк читается, врачебный непредсказуемо
  • Арифметика. Складывать и проверять итоги модель не обязана и делает это ненадёжно

По сравнению с другими нейросетями расклад примерно такой. Флагманы вроде GPT-5.6 и Claude Opus 5 читают документы на сопоставимом уровне, Gemini 3.6 сильна на формулах и чертежах. Заметное преимущество Qwen для российского пользователя лежит не в точности, а в доступе: чат работает без КВН и без зарубежной карты.

CheckroiCheckroiПодборка курсов по Gemini19 курсов • 7 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Второй аргумент в пользу Qwen: открытые веса младших моделей. Для сценариев с чувствительными документами это решающий фактор, потому что закрытые флагманы поставить внутри компании нельзя в принципе.

Подробное сравнение с ближайшим конкурентом мы собрали в статье «Gemini или Qwen: что лучше».

Правило для любых документов с деньгами. Нейросеть ускоряет ввод данных, но не отменяет проверку. Считайте её быстрым помощником, за которым нужно перечитать итог.

Что нельзя загружать в чат

Это раздел, который пропускают чаще всего, а зря. Qwen Chat остаётся зарубежным сервисом, и файлы уходят на серверы за пределами России.

Как только вы загружаете паспорт, скан трудовой или таблицу с ФИО и телефонами клиентов, начинается обработка персональных данных по 152-ФЗ, причём с трансграничной передачей. Для компании это прямой риск штрафа, и суммы там измеряются миллионами рублей.

Практический минимум, который стоит соблюдать:

  • Не грузить паспорта, СНИЛС, ИНН физлиц, медицинские документы
  • Не грузить клиентские базы и таблицы с контактами
  • Не грузить внутренние документы под NDA и коммерческую тайну
  • Обезличивать документ перед загрузкой, если нужна только структура

Чеки от магазина, публичные отчёты, собственные конспекты и учебные материалы попадают в безопасную зону. Всё, где есть чужие персональные данные, в неё не попадает.

Обезличивание работает лучше, чем кажется: закрасьте ФИО и номера в графическом редакторе, и модель спокойно разберёт оставшуюся структуру документа. Для задачи «перенеси таблицу в Excel» имена обычно и не нужны.

Если работать с чувствительными документами нужно регулярно, единственный правильный путь такой: развернуть модель внутри своего контура. Открытые версии Qwen3-VL для этого подходят, инструкция по локальному запуску есть в статье «Qwen локально через Ollama». Юридическую сторону вопроса мы разбирали отдельно в материале «Безопасно ли использовать Qwen».

API и локальный запуск: когда чата уже мало

Чат хорош для разовых задач. Когда документов сотни в неделю и результат должен сам попадать в учётную систему, нужен API, то есть способ обращаться к модели программно из своей программы или сценария автоматизации.

Через агрегатор OpenRouter доступны все размеры линейки, и стоят они недорого. Ориентиры по цене за миллион токенов:

Модель Вход Выход Кому подходит
Qwen3-VL 8B Instruct $0,117 $0,455 Простые чеки и бланки потоком
Qwen3-VL 30B-A3B Instruct $0,13 $0,52 Баланс цены и качества
Qwen3-VL 235B-A22B Instruct $0,20 $0,88 Сложные документы и таблицы
Qwen3-VL 235B-A22B Thinking $0,40 $4,00 Разбор запутанных договоров

Чтобы понять масштаб: одна страница документа со средним изображением обходится в центы. Пачка из тысячи чеков на младшей модели укладывается в несколько долларов, что дешевле часа работы человека, который вбивал бы их руками.

Контекстное окно у линейки большое: 256 тысяч токенов нативно, с расширением до миллиона. На практике это значит, что многостраничный договор влезает в один запрос целиком, без нарезки на куски и сшивания результатов.

Второй путь ведёт в локальный запуск. Открытые веса лежат на Hugging Face, поднять модель можно через Ollama, LM Studio или vLLM. Младшие версии на 2 и 4 млрд параметров работают даже на ноутбуке с приличной видеокартой, старшие требуют серверного железа. Плюс очевиден: файлы никуда не уходят, вопрос с персональными данными снимается сам собой.

CheckroiCheckroiПодборка курсов по Ollama14 курсов • 6 школСравните цены, школы, программу и найдите выгодные предложения по обучениюСравнить

Выбирать между двумя путями просто. Разовые задачи и десятки документов закрывает чат. Сотни документов в неделю с выгрузкой в учётную систему требуют API. Чувствительные данные и внутренние требования безопасности ведут к локальному запуску.

Пять ошибок, из-за которых распознавание выходит кривым

Рой отмечает пункты в чек-листе проверки

Почти все жалобы на «нейросеть плохо читает» сводятся к пяти повторяющимся промахам. Ни один из них не связан с моделью.

Ошибка 1: просить «распознай текст». Модель послушно вернёт сплошное полотно, где данные перемешаны с шапкой и рекламой на обороте чека. Разбирать это руками дольше, чем набрать заново. Всегда описывайте, какие поля нужны и в каком формате.

Ошибка 2: грузить всё одной кучей. Двадцать файлов в одном сообщении почти гарантированно дадут смешанные строки: сумма из четвёртого чека уедет к седьмому. Пачками по 5–10 штук результат стабильный.

Ошибка 3: доверять итогам. Модель складывает числа как побочный навык, и ошибается в этом чаще, чем в чтении. Итоги считайте формулой в таблице, а нейросеть используйте только для переноса данных.

Ошибка 4: снимать под углом и в тени. Половина проблем с цифрами лечится пересъёмкой при дневном свете. Телефон параллельно листу, лист целиком в кадре, без бликов от лампы.

Ошибка 5: не оговаривать нечитаемые поля. Без явного запрета додумывать модель поставит правдоподобное значение вместо пропуска, и вы об этом не узнаете. Фраза о том, что нераспознанное нужно помечать прямо, стоит дешевле, чем поиск одной неверной суммы в готовой таблице.

Проверка на здравый смысл. Если результат выглядит подозрительно ровным и все поля заполнены, откройте два случайных документа и сверьте руками. Слишком гладкий ответ чаще означает догадки, чем идеальное чтение.

Где научиться работать с нейросетями

Распознавание документов закрывает лишь одну маленькую задачу из большого набора. Тот же навык грамотно формулировать запрос и проверять результат работает и в аналитике, и в текстах, и в автоматизации отчётов. Собирать его по обрывкам инструкций долго, системнее один раз пройти нормальный курс и дальше применять по своим задачам.

КурсШколаСтоимость со скидкойВ рассрочкуДлитель­ностьОбзор курса от Checkroi
Нейросети для изображений и видео
Перейти на сайт курса
Академия ЭдюсонЭдюсон48 455 ₽4037 ₽/мес.2 месяцаОбзор курса
Нейросети для рабочих задач
Перейти на сайт курса
SkillboxSkillbox31 290 ₽2608 ₽/мес.1 месяцОбзор курса
Нейросети. Практический курс
Перейти на сайт курса
SkillboxSkillbox74 900 ₽6242 ₽/мес.3 месяцаОбзор курса
Продуктовый маркетолог + Нейросети для маркетинга
Перейти на сайт курса
НетологияНетология110 200 ₽3875 ₽/мес.5 месяцевОбзор курса
Нейросети для работыSkyproSkypro44 690 ₽5477 ₽/мес.3 месяцаОбзор курса
Нейросети для дизайнера
Перейти на сайт курса
SkillboxSkillbox84 272 ₽3831 ₽/мес.4 месяцаОбзор курса
Нейросети для каждого
Перейти на сайт курса
Академия СинергияАкадемия Синергия39 900 ₽3325 ₽/мес.3 месяцаОбзор курса
Нейросети для начинающих
Перейти на сайт курса
SF EducationSF Education42 000 ₽2333 ₽/мес.1 месяцОбзор курса
Нейросети для маркетинга
Перейти на сайт курса
SkillboxSkillbox29 800 ₽4967 ₽/мес.1 месяцОбзор курса
Нейросети для бизнеса
Перейти на сайт курса
SkillFactorySkillFactory97 632 ₽2712 ₽/мес.Обзор курса

Больше программ — в полном каталоге курсов по нейросетям и искусственному интеллекту

Если интересна именно работа с изображениями и генерация, посмотрите разбор консистентных персонажей в Nano Banana. А общее сравнение чат-моделей между собой есть в статье «ChatGPT или Qwen».

Часто задаваемые вопросы

Может ли Qwen распознать текст с фото на русском языке?

Да. Разработчики заявляют поддержку OCR на 32 языках, русский среди них. Модель уверенно читает кириллицу в печатных документах, чеках и таблицах, а при разборчивом почерке справляется и с рукописным текстом. Качество зависит в первую очередь от снимка: чёткое фото при дневном свете даёт заметно меньше ошибок, чем скан под углом.

Qwen для распознавания документов бесплатный?

Базовый чат на chat.qwen.ai бесплатный и открывается из России без КВН. Есть суточный лимит на количество сообщений, точных цифр Alibaba не публикует. Для разовой пачки документов бесплатного тарифа хватает; для потока в сотни файлов в неделю используют платный доступ через API.

Как распознать чек нейросетью и получить таблицу?

Загрузите фото чека в чат с моделью VL и попросите не «распознать текст», а вернуть данные таблицей с нужными колонками: магазин, дата, номер чека, сумма, НДС. Добавьте условие помечать нераспознанные поля вместо того, чтобы додумывать значения. Готовую таблицу скопируйте в Excel и там считайте итоги формулой.

Можно ли загружать в Qwen паспорт и другие персональные данные?

Не стоит. Qwen Chat — зарубежный сервис, файлы уходят на серверы за пределами России, и загрузка паспортов, СНИЛС, медицинских документов или клиентских баз попадает под 152-ФЗ вместе с трансграничной передачей данных. Для компаний это прямой риск штрафа. Если работать с такими документами нужно регулярно, модель разворачивают локально, внутри своего контура.

Что лучше распознаёт документы: Qwen или ChatGPT?

По качеству чтения документов флагманские модели держатся примерно на одном уровне, и разница чаще заметна на краевых случаях вроде мятых чеков или плотных таблиц. Практическое преимущество Qwen для российского пользователя лежит в доступе: чат работает без КВН и без зарубежной карты. Второй аргумент в его пользу — открытые веса младших моделей, которые можно поставить на своё железо.

Почему нейросеть ошибается в цифрах на чеках?

Основных причин три: выцветшая термобумага, схожие символы (ноль и буква «О», единица и «I») и попытка модели посчитать итог самостоятельно. Первые две лечатся качеством снимка, третья — правилом не поручать нейросети арифметику. Суммы, ИНН и даты стоит перепроверять глазами всегда: это поля, где ошибка обходится дороже всего.

Как перевести таблицу с фото в Excel?

Попросите модель вернуть данные в формате CSV с разделителем точка с запятой, а не просто «таблицей»: Markdown-таблица красиво выглядит в чате и разваливается при вставке в Excel. Отдельно оговорите, что делать с объединёнными ячейками и как оформлять числа, иначе Excel примет значения с пробелами внутри за текст и формулы не сработают.

Какие требования к железу для локального запуска Qwen3-VL?

Зависит от размера модели. Младшие версии на 2 и 4 млрд параметров запускаются на ноутбуке с приличной видеокартой через Ollama или LM Studio. Средние на 8 и 32 млрд требуют десктопной видеокарты с хорошим объёмом памяти, а старшие 30B-A3B и 235B-A22B рассчитаны на серверное железо или облако. Открытые веса опубликованы на Hugging Face.

Читайте Checkroi первым в Google
Добавьте Checkroi в избранные источники — и наши разборы курсов и обзоры школ будут показываться выше в вашей выдаче Google.
Оставить комментарий
0 комментариев
Форма комментария

Оставьте комментарий

Напишите, что думаете. Нам важно ваше мнение!