Как отсканировать документ в браузере
- Сфотографируйте документ. Нажмите «Сделать фото», чтобы использовать камеру, или перетащите уже имеющееся фото. Ровная поверхность, хороший свет, и встаньте так, чтобы ваша тень не падала на страницу.
- Настройте углы. Инструмент подсказывает, где находятся края документа. Перетащите любой угол, чтобы поправить его, — появится лупа, чтобы точно попасть на край бумаги.
- Выберите фильтр. Режим «Документ» делает бумагу белой, а текст тёмным, как настоящий сканер. «Оттенки серого» и «Оригинал» доступны, когда они нужны.
- Добавьте страницы и скачайте. Нажимайте «Добавить страницу» для каждого листа, при необходимости измените порядок, затем скачайте всё одним PDF.
Что он делает
- Автоматическое определение краёв (поиск прямых линий плюс моделирование фона), с перетаскиваемой обрезкой по четырём углам и лупой для точной настройки
- Правильно обрабатывает повёрнутые фото с телефона — ориентация EXIF считывается и применяется, в том числе в старых версиях Safari
- Фильтр «Документ», который делает бумагу белой, а текст чётким — плюс режимы «оттенки серого» и «оригинал»
- Многостраничность: добавляйте страницы одну за другой, меняйте их порядок и скачайте один PDF
- Работает с камерой вашего iPhone или любой уже имеющейся фотографией
- Работает полностью в вашем браузере — фото никогда не отправляется на сервер
Сканер, который работает там, где и должны оставаться ваши документы, — на вашем устройстве
Большинство сайтов «бесплатный онлайн-сканер» работают одинаково: вы загружаете фото своего документа на их сервер, их сервер его обрабатывает, а вы скачиваете результат. Для договора аренды, паспорта или медицинского счёта это странный обмен. Этот сканер делает ту же работу — коррекцию перспективы, очистку, сборку PDF — с помощью JavaScript, работающего прямо в вашем браузере. Страница, которую вы фотографируете, никогда не покидает устройство, которым вы её сфотографировали.
Как это работает на самом деле
Когда вы выбираете фото, инструмент ищет контур документа двумя способами сразу: он прослеживает самые сильные прямые края на изображении (так же, как это делают приложения-сканеры) и отдельно моделирует фон по краям фотографии, чтобы найти область, которая не является столом. Когда оба способа совпадают, предложенная обрезка обычно точна до нескольких пикселей; когда фото сложное — пёстрый фон, документ заполняет весь кадр, — инструмент честно об этом говорит и предлагает вам разумное начальное положение. Затем вы вручную поправляете углы — лупа следует за вашим пальцем, чтобы вы могли точно поставить каждый угол на настоящий край бумаги. По этим четырём углам инструмент вычисляет перспективное преобразование (ту же математику используют настоящие приложения-сканеры) и заново проецирует страницу в аккуратный прямоугольник. Фильтр «Документ» сравнивает каждый пиксель с его локальным окружением, поэтому бумага становится белой, а текст остаётся тёмным, даже если освещение по странице было неравномерным. Наконец, страницы встраиваются в PDF, который целиком собирается в браузере библиотекой с открытым кодом.
Как получить скан, который выглядит как скан
Преобразование может исправить перспективу, но не может придумать деталь, которой нет на фото. Разницу дают три привычки: свет из окна, а не от лампы над головой (меньше теней), телефон, удерживаемый ровно над страницей, а не под углом (меньше искажений придётся исправлять), и контрастная поверхность под бумагой (белая страница на белом столе не даёт детектору краёв ничего найти — и заставляет вас больше перетаскивать углы вручную).
Чего этот инструмент не делает
Он не читает текст. PDF, который вы скачиваете, — это набор изображений: отлично подходит для печати, отправки по почте или хранения, но искать внутри него нельзя, и ваш телефон тоже не сможет. Он также ничего не организует: страница 3 вашего договора аренды окажется точно там, куда вы её положите, — в папке «Загрузки». Если вы предпочли бы отсканировать один раз, а потом находить нужное, просто спросив — «сколько был депозит?», — это задача хранилища документов с OCR, для которой и был создан Paperlock.