ImgConvert
Về blog
Hướng dẫn

OCR là gì? Giải thích về nhận dạng ký tự quang học

Tác giả ImgConvertCập nhật:
7 phút đọc
OCR là gìNhận dạng ký tự quang họcCông nghệ OCRNhận dạng văn bản
OCR là gì? Giải thích về nhận dạng ký tự quang học

OCR, viết tắt của Optical Character Recognition (nhận dạng ký tự quang học), là công nghệ chuyển ảnh chứa chữ thành văn bản số mà máy có thể đọc. Bài hướng dẫn đầy đủ này giải thích cách OCR hoạt động và vì sao nó trở nên thiết yếu trong thế giới số.

Các phần dưới đây giải thích về công nghệ OCR nói chung. Những tính năng như dựng lại bố cục, dịch, tự động phát hiện ngôn ngữ và mô hình nhận dạng chữ viết tay khác nhau tùy sản phẩm. Công cụ chuyển ảnh thành văn bản của trang web này trích xuất văn bản thuần từ một ảnh với một ngôn ngữ được chọn thủ công; công cụ không cung cấp các tính năng mở rộng đó.

OCR là gì?

OCR (nhận dạng ký tự quang học) là công nghệ có khả năng:

  • Nhận dạng văn bản trong hình ảnh, tài liệu đã quét và ảnh chụp
  • Chuyển chữ trong ảnh thành định dạng số có thể chỉnh sửa
  • Cho phép tìm kiếm trong những ảnh trước đây chưa thể tìm kiếm
  • Tự động hóa nhập liệu từ tài liệu giấy

Công nghệ OCR hoạt động như thế nào

Quy trình OCR gồm bốn bước: thu nhận hình ảnh, tiền xử lý, nhận dạng ký tự và xuất kết quả

Bước 1: Thu nhận hình ảnh

Quy trình bắt đầu bằng việc lấy ảnh:

  • Quét tài liệu giấy
  • Chụp ảnh bằng máy ảnh
  • Chụp màn hình
  • Nhập ảnh có sẵn

Bước 2: Tiền xử lý ảnh

Ảnh được chuẩn bị để phân tích:

  • Nhị phân hóa - Chuyển thành đen trắng
  • Giảm nhiễu - Loại bỏ đốm và lỗi hình ảnh
  • Chỉnh độ nghiêng - Căn thẳng chữ bị nghiêng
  • Phân tích bố cục - Nhận biết các vùng văn bản

Bước 3: Nhận dạng ký tự

Văn bản được nhận biết bằng thuật toán:

  • Đối sánh mẫu - So sánh với các hình dạng ký tự đã biết
  • Phát hiện đặc trưng - Nhận biết đặc điểm riêng
  • Học máy - Mạng nơ-ron được huấn luyện trên hàng triệu ví dụ
  • Phân tích ngữ cảnh - Dùng quy tắc ngôn ngữ để cải thiện độ chính xác

Bước 4: Hậu xử lý

Kết quả được tinh chỉnh:

  • Kiểm tra chính tả - Sửa lỗi rõ ràng
  • Giữ định dạng - Duy trì cấu trúc
  • Chấm điểm độ tin cậy - Cho biết mức độ chắc chắn của kết quả nhận dạng

Các loại OCR

OCR cơ bản

  • Nhận dạng chữ in bằng phông chữ thông dụng
  • Hoạt động với ảnh sạch, chất lượng cao
  • Chính xác nhất với tài liệu đơn giản

Nhận dạng ký tự thông minh (ICR)

  • Xử lý chữ viết tay
  • Dùng học máy để thích ứng
  • Cải thiện qua quá trình huấn luyện

Nhận dạng từ thông minh (IWR)

  • Nhận dạng toàn bộ từ
  • Hiệu quả hơn với chữ viết tay liền nét
  • Xử lý theo ngữ cảnh

Nhận dạng dấu quang học (OMR)

  • Phát hiện dấu đánh và ô chọn
  • Dùng trong khảo sát và bài kiểm tra
  • Phát hiện nhị phân (đã đánh dấu/chưa đánh dấu)

Các yếu tố ảnh hưởng đến độ chính xác của OCR

Yếu tốẢnh hưởng đến độ chính xác
Chất lượng ảnhCao
Loại phông chữTrung bình đến cao
Độ tương phản của chữCao
Tình trạng tài liệuTrung bình
Độ phức tạp của ngôn ngữTrung bình
Chữ viết tay hay chữ inCao

Ứng dụng OCR phổ biến

Sáu ứng dụng OCR phổ biến: số hóa tài liệu, nhập liệu, hỗ trợ tiếp cận, dịch thuật, ngân hàng và pháp lý

Số hóa tài liệu

Chuyển kho lưu trữ giấy thành tệp số có thể tìm kiếm.

Tự động hóa nhập liệu

Trích xuất thông tin từ biểu mẫu, hóa đơn và biên lai.

Khả năng tiếp cận

Giúp trình đọc màn hình tiếp cận nội dung in.

Dịch thuật

Hỗ trợ trích xuất văn bản cho các dịch vụ dịch thuật.

Tra cứu tài liệu phục vụ tố tụng

Tìm kiếm trong tài liệu pháp lý đã quét.

Ngân hàng

Xử lý séc và tài liệu tài chính.

Trải nghiệm công nghệ OCR

Dùng công cụ chuyển ảnh thành văn bản với một ảnh JPG/JPEG, PNG, WebP, GIF, BMP hoặc TIFF. Chọn một trong 15 ngôn ngữ nhận dạng trước khi gửi; tiếng Anh được chọn sẵn ban đầu. Quá trình nhận dạng diễn ra trên máy chủ. So sánh kết quả với ảnh, rồi sao chép hoặc tải văn bản thuần xuống. Công cụ không dịch và không dựng lại bố cục tài liệu.

Công cụ này không nhận tệp PDF đầu vào. Trước tiên dùng công cụ chuyển PDF sang ảnh, rồi nhận dạng riêng từng ảnh trang cần thiết. Giới hạn ảnh là 20 MB, 8192 px cho mỗi chiều và 25 triệu pixel. Tất cả giới hạn áp dụng đồng thời.

OCR và nhập liệu thủ công

Tiêu chíOCRNhập liệu thủ công
Tốc độVài giâyVài phút/vài giờ
Chi phíMiễn phí đến thấpChi phí nhân công
Độ chính xácPhụ thuộc vào ảnh và mô hình nhận dạngPhụ thuộc vào tác vụ và việc soát lại
Khả năng xử lýBị giới hạn bởi tệp, tài nguyên xử lý và giới hạn yêu cầuBị giới hạn bởi thời gian và nhân sự hiện có
Tính nhất quánCaoThay đổi

Giới hạn của OCR

Phụ thuộc vào chất lượng

Ảnh kém chất lượng làm giảm đáng kể độ chính xác.

Khó khăn với chữ viết tay

Sự đa dạng của các kiểu chữ viết tay khiến việc nhận dạng khó hơn.

Bố cục phức tạp

Bảng, cột và nội dung hỗn hợp có thể gây nhầm lẫn cho OCR.

Giới hạn ngôn ngữ

Một số ngôn ngữ và hệ chữ được hỗ trợ tốt hơn các ngôn ngữ, hệ chữ khác.

Tương lai của OCR

Tích hợp AI

Học sâu tiếp tục cải thiện độ chính xác và khả năng xử lý.

Xử lý thời gian thực

Thiết bị di động hiện có thể thực hiện OCR tức thì trong camera.

Nhận dạng đa phương thức

Kết hợp khả năng hiểu hình ảnh, văn bản và bố cục.

Xử lý trên đám mây

Cung cấp OCR mạnh mẽ qua dịch vụ web.

Câu hỏi thường gặp

OCR có chính xác 100% không?

Độ chính xác phụ thuộc vào ảnh nguồn, ngôn ngữ, kiểu chữ và bố cục. Ở đây không có cam kết về một tỷ lệ cố định. Hãy đối chiếu một mẫu tiêu biểu với bản gốc, đặc biệt là tên riêng và số; điểm độ tin cậy của mô hình không phải tỷ lệ chính xác ký tự đã được đo lường.

OCR có đọc được mọi phông chữ không?

Phần lớn phông chữ thông dụng cho kết quả tốt. Phông trang trí hoặc ít gặp có thể có độ chính xác thấp hơn.

OCR có nhận dạng được chữ viết tay không?

Có, nhưng độ chính xác thay đổi nhiều tùy độ rõ ràng của chữ viết tay.

OCR có giống trích xuất văn bản không?

OCR nhận dạng ký tự từ pixel. Trích xuất văn bản có phạm vi rộng hơn: còn có thể đọc văn bản đã được nhúng trong PDF số mà không cần nhận dạng ảnh. Biểu mẫu OCR của trang web này nhận đầu vào là ảnh; hãy chuyển trang PDF đã quét thành ảnh trước.

OCR có nhận dạng được nhiều ngôn ngữ không?

Một số hệ thống OCR hỗ trợ tự động phát hiện hoặc dùng đồng thời nhiều ngôn ngữ nhận dạng. Tại đây, hãy chọn thủ công một trong 15 ngôn ngữ; công cụ không có tính năng tự động phát hiện hay chọn kết hợp nhiều ngôn ngữ. Kiểm tra kỹ văn bản xen kẽ nhiều ngôn ngữ hoặc cắt thành các vùng phù hợp rồi xử lý riêng.

Kết luận

Công nghệ OCR đã thay đổi sâu sắc cách chúng ta tương tác với chữ in và chữ viết tay. Thử công cụ OCR miễn phí của chúng tôi để trực tiếp trải nghiệm công nghệ này.

Thử OCR ngay →


Công cụ liên quan: Chuyển ảnh thành văn bản | Chuyển đổi PDF | Công cụ tài liệu

Thêm công cụ cho lần xử lý ảnh tiếp theo

Khám phá các công cụ ImgConvert để chuyển đổi, xử lý tệp PDF và GIF.

  • Công cụ chuyển đổi ảnh
  • Công cụ PDF
  • Công cụ GIF
Xem tất cả công cụ