Cách biến ảnh chụp thành PDF có thể tìm kiếm

  1. Thêm ảnh của bạn. Thả ảnh JPG, PNG hoặc WebP vào công cụ, hoặc chạm để chọn. Mỗi trang hiện thành một thẻ — kéo tay cầm để sắp xếp lại thứ tự, hoặc xoá những trang bạn không cần.
  2. Chọn ngôn ngữ. Chọn ngôn ngữ mà tài liệu được viết. Dữ liệu nhận dạng cho ngôn ngữ đó chỉ tải về một lần (dung lượng hiện cạnh ô chọn) — ảnh của bạn vẫn không bao giờ rời khỏi thiết bị.
  3. Nhận dạng. Nhấn Nhận dạng văn bản và xem thẻ của từng trang chuyển từ đang chờ sang hoàn tất, kèm số từ cập nhật liên tục. Bạn có thể hủy giữa chừng; không có gì được lưu lại.
  4. Kiểm tra và tải xuống. Văn bản nhận dạng được hiển thị theo từng trang để bạn kiểm tra trước khi tin dùng. Đặt tên cho file, sau đó tải PDF có thể tìm kiếm, lấy file .txt thuần, hoặc sao chép toàn bộ vào bộ nhớ tạm.

Công cụ này làm gì

  • OCR thật ngay trong trình duyệt — tệp không bao giờ bị tải lên bất cứ đâu
  • Nhiều ảnh gộp thành một PDF nhiều trang, theo thứ tự bạn chọn
  • Lớp văn bản ẩn: PDF trông giống hệt ảnh chụp nhưng có thể tìm kiếm và sao chép
  • 15 ngôn ngữ nhận dạng, tải về khi cần
  • Cũng xuất văn bản nhận dạng dạng thuần dưới file .txt

PDF có thể tìm kiếm thực chất là gì

Một tấm ảnh chụp hóa đơn chỉ là các điểm ảnh — bạn không thể tìm kiếm nó, bôi đen tổng tiền, hay sao chép tên cửa hàng. Một PDF có thể tìm kiếm thêm vào một lớp thứ hai, vô hình, nằm trên ảnh: văn bản đã nhận dạng, đặt đúng vị trí xuất hiện trong hình. Trang vẫn trông giống hệt ảnh chụp của bạn, nhưng giờ đây Preview, Adobe Reader, Spotlight và mọi hệ thống quản lý tài liệu đều đọc được nó.

Công cụ này tạo ra file đó ngay trong trình duyệt của bạn. Nó giải mã ảnh, chạy engine nhận dạng mã nguồn mở Tesseract được biên dịch sang WebAssembly, và ghép thành PDF bằng pdf-lib — tất cả ngay trên trang bạn đang xem. Không có gì được truyền đi. Đó chính là mục đích: hóa đơn, hợp đồng, thư từ y tế và giấy tờ tùy thân là đúng loại tệp mà bạn không nên giao cho một trang chuyển đổi lạ để đổi lấy OCR miễn phí.

Khi nào nên dùng

  • Ảnh chụp tài liệu giấy mà bạn muốn tìm lại được sau này — hóa đơn, phiếu bảo hành, thư từ, biểu mẫu.
  • Bản scan ra dưới dạng ảnh thuần từ máy quét.
  • Bất cứ thứ gì bạn không muốn dán vào trang web của người lạ.

Vì sao vị trí quan trọng trong lớp văn bản

Các từ được nhận dạng không chỉ đơn giản được gắn thêm vào file — mỗi từ được đặt ẩn tại đúng tọa độ nơi nó xuất hiện trong ảnh. Đó là điều khiến việc bôi đen cảm thấy tự nhiên: kéo qua ảnh và vùng bôi đen bám theo các dòng chữ in, tìm một từ và trình xem sẽ nhảy đến đúng vị trí trên trang. Vị trí chỉ là tương đối, giống như trong các file do máy scan văn phòng tạo ra, và điều đó vẫn ổn cho việc tìm kiếm và sao chép.

Giới hạn cần biết

OCR chạy trên thiết bị chậm hơn một cụm máy chủ, và nó đọc được chữ in chứ không đọc chữ viết tay. Chữ quá nhỏ hoặc mờ có thể ra sai — file xuất .txt giúp bạn dễ dàng kiểm tra lại. Ảnh được giảm xuống khoảng 2.500 px ở cạnh dài để tăng tốc nhận dạng; ảnh trang được nhúng vẫn giữ tới 4.000 px, đủ để in sắc nét ở khổ letter.

Nếu bạn làm việc này thường xuyên

Công cụ này là một trình chuyển đổi dùng một lần. Nếu cuộn ảnh trên điện thoại là nơi giấy tờ của bạn biến mất, đó chính xác là vấn đề mà Paperlock sinh ra để giải quyết: nó quét, đọc và sắp xếp giấy tờ ngay trên iPhone của bạn — với cùng nguyên tắc là không có gì rời khỏi thiết bị mà chưa được mã hóa.