Skip to main content
Trong quá trình xây dựng kho tri thức, tài liệu có thể được bổ sung từ nhiều nguồn khác nhau như tệp tải lên, website, SharePoint, email, Wiki hoặc tài liệu đào tạo. Do các nguồn dữ liệu thường được quản lý bởi nhiều nhóm hoặc phòng ban khác nhau, việc thêm trùng tài liệu hoặc nội dung là khó tránh khỏi. Sự trùng lặp này có thể làm giảm chất lượng của kho tri thức. Đặc biệt, khi Agent truy xuất dữ liệu (retrieve), các nội dung trùng lặp có thể chiếm nhiều vị trí trong kết quả Top-K, khiến Agent bỏ sót các tài liệu liên quan khác và ảnh hưởng đến độ đầy đủ, chính xác của câu trả lời. Để hỗ trợ người dùng kiểm soát chất lượng dữ liệu, hệ thống bổ sung tính năng Kiểm tra trùng lặp tài liệu. Tính năng này giúp phát hiện các tài liệu hoặc nội dung có mức độ tương đồng cao ngay khi được thêm vào kho tri thức, từ đó người dùng có thể chủ động rà soát và xử lý trước khi sử dụng.

Cơ chế hoạt động

Mỗi khi người dùng thêm mới dữ liệu vào kho tri thức, hệ thống sẽ tự động kiểm tra mức độ tương đồng giữa dữ liệu mới và dữ liệu hiện có. Việc kiểm tra được thực hiện trong các trường hợp:
  • Tải lên tệp mới
  • Thêm URL mới
  • Đồng bộ các tệp mới từ SharePoint
Hệ thống sẽ so sánh nội dung của tài liệu và các chunk được tạo từ tài liệu mới với toàn bộ dữ liệu hiện có trong các nguồn Tài liệu, Websites, SharePoint trong kho tri thức. Nếu phát hiện nội dung có mức độ tương đồng vượt quá ngưỡng cho phép, hệ thống sẽ hiển thị cảnh báo để người dùng xem xét trước khi tiếp tục.
Hệ thống chỉ so sánh giữa các tài liệu mới thêm với các tài liệu hiện có được xử lý từ ngày 04/07/2026. Nếu cần so sánh với tài liệu đã có trước thời điểm này, vui lòng liên hệ FCI AI Agents Support để được hỗ trợ.