ImgConvert

Chuyển ảnh thành văn bản

Trích xuất văn bản từ một ảnh bằng OCR. Chọn ngôn ngữ trong ảnh, rồi kiểm tra và sao chép kết quả hoặc tải tệp văn bản thuần túy. Quá trình nhận dạng chạy trên máy chủ sau khi gửi yêu cầu.

Một ảnh JPG, PNG, WebP, GIF, BMP hoặc TIFF tối đa 20 MB. Mỗi cạnh: tối đa 8.192 px. Chiều rộng × chiều cao: tối đa 25 triệu điểm ảnh. Phải đáp ứng đồng thời tất cả giới hạn.

Ảnh được tải lên ngay khi chọn để nhận dạng OCR trên máy chủ. Ảnh và kết quả văn bản chỉ được lưu tạm thời; hãy sớm sao chép hoặc tải kết quả xuống.

Chọn một ngôn ngữ được dùng trong ảnh. Lựa chọn ban đầu là tiếng Anh, không phụ thuộc ngôn ngữ trang web; thao tác này không dịch văn bản.

Chọn ảnh rõ chữ và ngôn ngữ trong ảnh

Hộp chọn tệp chấp nhận JPG/JPEG, PNG, WebP, GIF, BMP và TIFF. Dung lượng tệp và kích thước điểm ảnh là các giới hạn riêng và phải đồng thời đáp ứng tất cả.

Số lượng và dung lượng tệp

Một ảnh cho mỗi tác vụ, tối đa 20 MB.

Chiều rộng và chiều cao

Mỗi cạnh không được vượt quá 8.192 px.

Tổng số điểm ảnh

Chiều rộng × chiều cao không được vượt quá 25 triệu điểm ảnh. Ví dụ, 6.000×5.000 là 30 triệu điểm ảnh và vượt giới hạn ngay cả khi tệp nhỏ hơn 20 MB.

Ngôn ngữ nhận dạng

Chọn một trong 15 tùy chọn ngôn ngữ. Tiếng Anh được chọn ban đầu, không phụ thuộc ngôn ngữ trang web. Không có bộ chọn tự động nhận diện ngôn ngữ hay kết hợp nhiều ngôn ngữ.

Các tùy chọn gồm tiếng Anh, tiếng Trung giản thể, tiếng Trung phồn thể, tiếng Nhật, tiếng Hàn, tiếng Pháp, tiếng Đức, tiếng Tây Ban Nha, tiếng Ý, tiếng Bồ Đào Nha, tiếng Nga, tiếng Ả Rập, tiếng Hindi, tiếng Thái và tiếng Việt.

Cách trích xuất văn bản từ ảnh

1

Chọn ảnh

Chọn ảnh gốc hoặc ảnh chụp màn hình rõ nét. Chọn ảnh sẽ bắt đầu tải lên và chuẩn bị bản xem trước cục bộ; quá trình nhận dạng văn bản chỉ bắt đầu sau khi nhấp Trích xuất văn bản.

2

Chọn ngôn ngữ và chạy OCR

Chọn ngôn ngữ được dùng trong ảnh và nhấp Trích xuất văn bản. Máy chủ nhận dạng văn bản từ ảnh gốc đã tải lên; đợi kết quả xuất hiện.

3

Kiểm tra, sao chép hoặc tải văn bản

Đối chiếu kết quả với ảnh, đặc biệt là tên riêng, số và dấu câu. Dùng Sao chép văn bản để sao chép nội dung hoặc dùng nút tải xuống của kết quả để lưu tệp TXT mã hóa UTF-8. Ô kết quả chỉ cho phép đọc; dán văn bản vào trình soạn thảo để chỉnh sửa.

Hiểu kết quả OCR

Đầu ra là văn bản được nhận dạng, không phải bản dựng lại bố cục tài liệu gốc.

Văn bản thuần túy

Kết quả văn bản có thể sao chép và tệp TXT để tải xuống. Công cụ không tạo tệp Word, bảng Excel hay PDF có thể tìm kiếm.

Độ tin cậy của mô hình

Ước tính từ bộ máy nhận dạng, không phải tỷ lệ ký tự đã được chứng minh là chính xác. Điểm cao không thay thế việc soát lỗi.

GIF hoặc TIFF nhiều trang

Chỉ khung hình hoặc trang đầu tiên được nhận dạng. Công cụ không xử lý mọi khung hình hay trang trong tệp.

Hãy sớm sao chép hoặc tải kết quả xuống. Ảnh và văn bản đã trích xuất là các tệp tạm thời, nên kết quả có thể không còn khả dụng sau khi dọn dẹp.

Chuẩn bị văn bản dễ đọc hơn

Chữ rõ trong ảnh nguồn và lựa chọn đúng ngôn ngữ giúp OCR có đầu vào tốt hơn.

Ảnh chụp màn hình và phần tài liệu đã cắt

Dùng ảnh chụp màn hình gốc khi có thể. Nếu văn bản chỉ chiếm vùng nhỏ, dùng Cắt ảnh để bỏ phần xung quanh không liên quan mà không cắt mất chữ.

Ảnh chụp và bản quét bị xoay ngang

Dùng Xoay ảnh để đưa chữ bị xoay ngang về đúng chiều. Tránh lóa sáng, bóng đổ đậm và nén lặp lại không cần thiết; kiểm tra các ký tự ở kích thước dễ đọc.

Nếu trình duyệt không xem trước được TIFF, chỉ riêng nhãn trong hộp chọn không xác nhận khả năng xem trước. Để kiểm tra rõ hơn, trước tiên xuất một bản PNG hoặc JPG bằng ứng dụng tương thích.

Câu hỏi về OCR ảnh

Không. Thao tác này chọn ngôn ngữ nhận dạng. Đầu ra vẫn giữ ngôn ngữ gốc; trang này không dịch văn bản.

Quá trình nhận dạng có thể đọc sai chữ viết tay, chữ cách điệu và bố cục phức tạp. Văn bản thuần túy không giữ ô bảng, phông chữ hay thiết kế trang, và thứ tự đọc có thể cần chỉnh lại. Kiểm tra đầu ra trước khi sử dụng.

Trang này nhận một ảnh cho mỗi tác vụ, không nhận PDF hay xử lý hàng loạt. Với các trang PDF, dùng PDF sang ảnh trước, rồi nhận dạng từng ảnh trang cần dùng.

Trích xuất chữ từ ảnh

Chọn một ảnh và ngôn ngữ của ảnh, rồi kiểm tra văn bản đã nhận dạng.