Description
Nội dung tóm tắt báo cáo: Số hóa tài liệu Hán Nôm gặp nhiều thách thức do hệ thống OCR dễ mắc lỗi trước ký tự phức tạp, bản scan xuống cấp và thiếu ngữ cảnh. Bài báo này đề xuất phương pháp hậu xử lý sử dụng mô hình SikuBERT làm giải pháp cốt lõi, kết hợp khảo sát đối chuẩn với các kiến trúc Encoder mới (ModernBERT, NeoBERT, Chinese ModernBERT) nhằm sửa lỗi OCR qua ngữ cảnh câu. Bằng việc tái cấu trúc Tokenizer mở rộng 1.488 token Hán Nôm, loại bỏ lỗi <unk>, SikuBERT nâng độ chính xác cấp câu từ 14,53% lên 19,64% (+5,11%) và độ chính xác ký tự bị che từ 18,69% lên 24,62% so với OCR cơ sở. Nghiên cứu cung cấp cơ sở đối chuẩn và giải pháp hiệu quả cho bảo tồn di sản số.
Thông tin các tác giả
1/Nguyễn Duy Đạt: Học viên cao học, đang học tại Trường Đại học Khoa Học Tự Nhiên ĐHQG HCM, 227 Nguyễn Văn Cừ, Phường Chợ Quán, TP. HCM, email: duydattqta13@gmail.com.
2/Nguyễn Tư Thành Nhân: Học viên cao học, đang học tại Trường Đại học Khoa Học Tự Nhiên ĐHQG HCM, 227 Nguyễn Văn Cừ, Phường Chợ Quán, TP. HCM, email: ngtuthanhan@gmail.com.
Từ khóa
nhận dạng ký tự quang học (OCR), chữ Hán Nôm, mô hình ngôn ngữ BERT, hậu xử lý lỗi, bảo tồn di sản số, Transformer Encoder, Pseudo-Log-Likelihood