Vui lòng dùng định danh này để trích dẫn hoặc liên kết đến tài liệu này: https://dspace.ctu.edu.vn/jspui/handle/123456789/5748
Nhan đề: TÓM TẮT RÚT TRÍCH VĂN BẢN SỬ DỤNG PHƯƠNG PHÁP CENTROID-BASED
Tác giả: Lâm, Nhựt Khang
Trần, Bảo Ngọc
Từ khoá: CÔNG NGHỆ THÔNG TIN
Năm xuất bản: 2018
Nhà xuất bản: Trường Đại học Cần Thơ
Tóm tắt: Luận văn trình bày phương pháp tóm tắt văn bản theo hướng rút trích, áp dụng và cải tiến phương pháp centroid-base trong tóm tắt văn bản tiếng Việt. Luận văn tìm hiểu các xử lý dữ liệu đầu vào với tiếng Việt, xây dựng mô hình word embedding để xác định mối quan hệ về mặt ngữ nghĩa đối với các từ tiếng Việt. Sử dụng trọng số TF-IDF để xác định các từ trọng tâm trong văn bản tóm tắt. Phương pháp thực hiện tóm tắt bằng việc rút trích các câu mang ý chính trong văn bản, được xác định dựa vào mức quan hệ của các từ trong câu với các từ trọng tâm. Phương pháp được đánh giá với ROUGE 1, 2 và ROUGE-L, trên hai tập dữ liệu. Tập dữ liệu dùng để đánh giá thứ nhất gồm 7.950 bài báo được thu thập từ trang vnexpress.net kết quả trung bình(F-core) của đánh giá ROUGE 1, 2 và ROUGE-L lần lượt là 0,503; 0,179 và 0,341. Tập dữ liệu thứ hai là Vietnamese MDS gồm 200 bài báo được xây dựng và tóm tắt thủ công. Kết quả ROUGE lần lượt là 0,717; 0,437 và 0,613.
Mô tả: 48 tr
Định danh: http://dspace.ctu.edu.vn/jspui/handle/123456789/5748
Bộ sưu tập: Trường Công nghệ Thông tin & Truyền thông

Các tập tin trong tài liệu này:
Tập tin Mô tả Kích thước Định dạng  
_file_
  Giới hạn truy cập
2.05 MBAdobe PDF
Your IP: 44.192.53.34


Khi sử dụng các tài liệu trong Thư viện số phải tuân thủ Luật bản quyền.