Как нейросети читают скриншоты от OCR до визуальных моделей

Классический OCR годился для сканов документов и разваливался на обычном скриншоте, терял колонки таблиц, путал сглаженный шрифт, склеивал ячейки. Визуальные модели изменили всё - картинка стала таким же входом, как текст. Автор разбирает на своей практике, что распознавание экрана даёт вебмастеру, почему ассистенты переехали из вкладки браузера в оверлей поверх окон и в каких местах модели по-прежнему нельзя верить на слово.
Как нейросети читают скриншоты от OCR до визуальных моделей

За прошлую неделю я сделал сто восемьдесят скриншотов. Посчитал специально, стало интересно. Ошибка в консоли хостинга, кусок таблицы из отчёта рекламной сети, переписка с подрядчиком, панель одного сервиса, куда меня занесло за плагином. Скриншот давно стал моим основным способом что-то запомнить и кому-то показать.

Дальше начиналось скучное. Текст с картинки руками не перенесёшь, его надо перепечатывать. Я держал для этого отдельную утилиту с классическим OCR — оптическим распознаванием символов, той самой технологией, которая с девяностых превращает изображение с буквами в набор символов. Работала она посредственно. Сглаженный шрифт на тёмной теме превращался в кашу, таблица теряла колонки, любая иконка внутри строки сбивала распознавание целиком.

Прошлой осенью я полез смотреть, чем люди заменили такие утилиты, и наткнулся на целый класс программ, которые живут поверх окон и срабатывают по горячей клавише. Выделяешь область, программа снимает её, распознаёт и отдаёт ответ модели в полупрозрачной панели. Тот же chimate.ai устроен именно так: портативное приложение под Windows, хоткей, захват куска экрана, ответ в оверлее поверх текущего окна, оплата кредитами по числу запросов. Мне понравилась сама идея: перестать прыгать между окнами ради одного вопроса.

Почему старый OCR спотыкался именно на скриншотах

Классические движки вроде Tesseract затачивали под сканы документов. Белый лист, чёрные буквы, ровные строки, один шрифт на всю страницу. Скриншот устроен иначе: субпиксельное сглаживание размывает края символов, интерфейс мешает текст с иконками, половина строк — подписи к кнопкам, фон бывает любого цвета. Движок честно ищет строки там, где их нет, и выдаёт обрывки.

Отдельная боль — таблицы. Классический OCR читает их построчно и склеивает соседние ячейки в одну фразу. Я однажды перенёс так отчёт по позициям и полдня потом искал, почему цифры не сходятся с выгрузкой.

Что поменяли визуальные модели

Сдвиг случился, когда картинку начали подавать прямо на вход большой языковой модели. Такие модели называют визуальными или мультимодальными: изображение для них такой же вход, как текст, и разбирают они его целиком, вместе с расположением блоков. GPT-4o, Gemini , Claude , открытые Qwen -VL умеют описать структуру страницы — где заголовок, где таблица, где мелкая подпись внизу.

Разница ощущается сразу. Скриншот таблицы возвращается таблицей, с сохранёнными колонками. Кусок кода возвращается кодом, и заодно модель объясняет, где в нём ошибка. Интерфейс на незнакомом языке переводится вместе с логикой: «эта кнопка отправляет счёт на оплату, соседняя отменяет подписку».

Обратная сторона тоже появилась. Классический OCR при неудаче выдавал мусор, и это было видно с первого взгляда. Визуальная модель уверенно допишет то, чего на картинке нет: подставит правдоподобную цифру вместо смазанной, достроит обрезанное слово до знакомого. Ошибка выглядит аккуратно, поэтому её труднее поймать.

Почему ассистенты переезжают из браузера на рабочий стол

Год назад работа с моделью означала вкладку в браузере. Скопировал, вставил, прочитал, вернулся. Каждый такой цикл стоит секунд тридцать и обрыв внимания, а за рабочий день их набегает два десятка.

Десктопные оверлеи этот цикл убирают. Программа висит над любым окном, видит то же, что вижу я, и отвечает, не забирая фокус. Крупные игроки пришли к тому же: Microsoft встроила в Windows режим, где Copilot смотрит на открытое окно, настольное приложение OpenAI умеет работать с содержимым запущенных программ. Мелкие утилиты просто добрались туда раньше.

Где это экономит мне часы

Чужие админки. Клиент присылает скриншот панели своего хостинга с вопросом «что тут нажать». Раньше я искал этот интерфейс поиском, теперь спрашиваю по картинке и получаю разбор за пару секунд.

Логи и ошибки. Красная простыня из терминала, снятая даже фотографией с чужого монитора, распознаётся и объясняется. Фотография, кстати, читается заметно хуже скриншота: блики и наклон модель путают.

Иностранные интерфейсы. Я работаю с парой европейских сервисов, где локализации нет вовсе. Разбор по скриншоту оказался удобнее браузерного перевода — он объясняет назначение поля вместо дословного перевода подписи.

Чему я такой связке не доверяю

Цифрам. Любую сумму, дату и артикул я перепроверяю глазами по исходной картинке. Модель спокойно вернёт красивое «14 820» там, где на скриншоте «14 320», и звучать это будет одинаково уверенно.

Приватности. Скриншот уходит на сервер поставщика модели, и вместе с ним уходит всё, что случайно попало в кадр: соседняя вкладка, имя клиента в заголовке окна, остаток на счёте. Я приучил себя выделять узкую область экрана — привычка выручала уже дважды.

Юридическим и финансовым документам. Там цена ошибки распознавания выше, чем экономия десяти минут, поэтому я перепечатываю руками и сверяю построчно.

Два приёма, которые ловят выдумки модели

Первый: попросить вернуть распознанный текст дословно, без интерпретации, и только следующим запросом задать вопрос по нему. Если в дословной выдаче цифры совпали с картинкой, дальше можно работать. Если модель сразу прыгает к выводам, она с высокой вероятностью что-то домыслила по пути.

Второй: снимать область чуть шире нужного. Контекст модель понимает лучше, когда видит заголовок колонки вместе с самой ячейкой, а обрезка по границе ячейки превращает распознавание в угадайку.

Меня в этой истории занимает другое. Распознавание экрана тихо превратилось в интерфейс: вместо того чтобы описывать компьютеру задачу словами, я показываю ему то, что вижу сам. Пока это мелкое удобство для тех, кто много скриншотит. Года через два умение правильно показать модели экран будет значить, похоже, не меньше, чем умение сформулировать запрос, и вот к этому повороту я пока не очень готов.

11:05
24
Нет комментариев. Ваш будет первым!