27 November 2026
Trường Đại học Ngoại ngữ - Tin học TP.HCM
Asia/Ho_Chi_Minh timezone

Cải thiện mô hình nhận diện ký tự quang học cho văn bản Hán Nôm sử dụng các mô hình Transformer Encoder

Not scheduled
20m
Hội trường lầu 6 (Trường Đại học Ngoại ngữ - Tin học TP.HCM)

Hội trường lầu 6

Trường Đại học Ngoại ngữ - Tin học TP.HCM

828 Sư Vạn Hạnh Quận 10 TP.HCM
Tiểu ban 3: Ngôn ngữ, Công nghệ và Trách nhiệm xã hội

Description

Nội dung tóm tắt báo cáo: Số hóa tài liệu Hán Nôm gặp nhiều thách thức do hệ thống OCR dễ mắc lỗi trước ký tự phức tạp, bản scan xuống cấp và thiếu ngữ cảnh. Bài báo này đề xuất phương pháp hậu xử lý sử dụng mô hình SikuBERT làm giải pháp cốt lõi, kết hợp khảo sát đối chuẩn với các kiến trúc Encoder mới (ModernBERT, NeoBERT, Chinese ModernBERT) nhằm sửa lỗi OCR qua ngữ cảnh câu. Bằng việc tái cấu trúc Tokenizer mở rộng 1.488 token Hán Nôm, loại bỏ lỗi <unk>, SikuBERT nâng độ chính xác cấp câu từ 14,53% lên 19,64% (+5,11%) và độ chính xác ký tự bị che từ 18,69% lên 24,62% so với OCR cơ sở. Nghiên cứu cung cấp cơ sở đối chuẩn và giải pháp hiệu quả cho bảo tồn di sản số.

Thông tin các tác giả

1/Nguyễn Duy Đạt: Học viên cao học, đang học tại Trường Đại học Khoa Học Tự Nhiên ĐHQG HCM, 227 Nguyễn Văn Cừ, Phường Chợ Quán, TP. HCM, email: duydattqta13@gmail.com.

2/Nguyễn Tư Thành Nhân: Học viên cao học, đang học tại Trường Đại học Khoa Học Tự Nhiên ĐHQG HCM, 227 Nguyễn Văn Cừ, Phường Chợ Quán, TP. HCM, email: ngtuthanhan@gmail.com.

Từ khóa

nhận dạng ký tự quang học (OCR), chữ Hán Nôm, mô hình ngôn ngữ BERT, hậu xử lý lỗi, bảo tồn di sản số, Transformer Encoder, Pseudo-Log-Likelihood

Author

Mr Nguyễn Duy Đạt (VNUHCM-University of Science)

Co-author

Presentation materials

There are no materials yet.