> ## Documentation Index
> Fetch the complete documentation index at: https://docs-agents.fpt.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Tạo mới đường dẫn

Khi thêm URL vào kho tri thức, hệ thống cung cấp hai phương thức thu thập dữ liệu:

* **Chỉ crawl các URL đã chỉ định**: Hệ thống chỉ thu thập nội dung chính xác từ những URL được người dùng nhập vào.
* **Crawl các trang con (subpages)**: Hệ thống tự động thu thập cả nội dung trang gốc và các trang con nằm trong cùng miền với URL gốc. Các trang con là các URL mở rộng từ trang gốc, có cấu trúc dạng bổ sung thêm các thành phần phía sau dấu `/`.

> **Ví dụ:** URL `https://fpt.ai/vi/san-pham/fpt-ai-agents/` được coi là trang con của URL `https://fpt.ai/vi/san-pham/`. Khi thêm URL vào kho tri thức, hệ thống cung cấp ba phương thức thu thập dữ liệu:

* **Crawl các URL bằng sitemap**: Hệ thống tự động đọc danh sách URL từ Sitemap (sơ đồ trang web) và thu thập dữ liệu theo đúng cấu trúc được khai báo. Điều này giúp đảm bảo bao phủ đầy đủ các URL hiện có, giảm nguy cơ bỏ sót nội dung trong quá trình crawl.

> **Ví dụ:** Điền sitemap `https://fpt.ai/post-sitemap1.xml`, hệ thống sẽ tự động crawl các URL có trong sitemap này.

***

### Phương thức "Chỉ crawl các URL đã chỉ định"

Phương thức này cho phép người dùng nhập chính xác các URL cần thu thập nội dung, hệ thống sẽ chỉ xử lý và đồng bộ dữ liệu từ các URL được liệt kê.

**Bước 1.** Truy cập mục **Website** trong kho tri thức, chọn tệp muốn thêm mới đường dẫn, hoặc thao tác trực tiếp tại danh sách website.

**Bước 2.** Nhấn **+Tạo** và chọn **URL mới**.

<Frame>
  <img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image89.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=daf07164445a5a029c04e16fa639d1cd" alt="Image89" width="904" height="162" data-path="images/image89.png" />
</Frame>

**Bước 3.** Chọn phương thức **Chỉ crawl các URL đã chỉ định**.

<img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image90.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=1ed0134db1d278227297a43fb125046b" alt="Image90" width="892" height="508" data-path="images/image90.png" />

**Bước 4.** Điền đường dẫn và thông tin cấu hình

Nhập URL cần xử lý và nhấn **Enter** để thêm vào danh sách. Hệ thống cho phép nhập nhiều URL cùng lúc.

> **Lưu ý:** Hệ thống sẽ kiểm tra tự động và hiển thị cảnh báo nếu:
>
> * URL không đúng định dạng.
> * Trùng với URL đã được xử lý trước đó trong bất kỳ mục tri thức nào.
> * Trùng với URL đã nhập trong cửa sổ tạo mới.

**Các cấu hình tùy chọn thêm (không bắt buộc):**

* **Chọn thư mục:** Gán URL vào một thư mục sẵn có để tổ chức dữ liệu theo chủ đề, giúp dễ dàng phân loại quản lý.

<img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image91.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=9496f9e9b159ab08b5f1c2e228ea1eff" alt="Image91" width="936" height="538" data-path="images/image91.png" />

* **Cấu hình nâng cao:** Xác định các trường thông tin nâng cao để hỗ trợ phân tích cấu trúc trang và chia nhỏ nội dung (chunking) chính xác hơn.

| STT | Tên trường            | Mô tả                                                                                                                       |
| --- | --------------------- | --------------------------------------------------------------------------------------------------------------------------- |
| 1   | Main title xpath      | Xác định tiêu đề của URL                                                                                                    |
| 2   | Main content xpath    | Xác định nội dung chính của URL                                                                                             |
| 3   | Ignore HTML tags      | Loại các thẻ HTML, cho phép chọn nhiều thẻ: `header`, `footer`, `nav`, `img`, `link`, `meta`, `noscript`, `script`, `style` |
| 4   | Ignore element xpaths | Loại các cấu phần (element) trong HTML, cho phép điền nhiều giá trị                                                         |

<img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image92.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=c5025229aa394458facdba9eb4679244" alt="Image92" width="906" height="910" data-path="images/image92.png" />

**Bước 5.** Nhấn **Xử lý** để xác nhận thêm URL.

<img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image93.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=970796caa34b9f3947d047b44c2ac4eb" alt="Image93" width="936" height="594" data-path="images/image93.png" />

Các URL sau khi xử lý sẽ hiển thị trong danh sách website hoặc trong danh sách đường dẫn của tệp đã chọn.

***

### Phương thức "Crawl các trang con"

Phương thức này cho phép hệ thống tự động mở rộng phạm vi thu thập, bao gồm cả các trang con nằm trong cùng miền với URL gốc, giúp đồng bộ nội dung toàn diện và cập nhật hơn.

**Bước 1.** Truy cập màn hình quản lý Website hoặc thư mục cần thêm mới URL.

Nếu muốn thêm URL vào một thư mục sẵn có, hãy truy cập thư mục đó trước khi thao tác bước 2.

**Bước 2.** Nhấn **+Tạo** và chọn **URL mới**.

<Frame>
  <img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image94.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=64bda6f33282849ef9e894cca62da1f2" alt="Image94" width="921" height="165" data-path="images/image94.png" />
</Frame>

**Bước 3.** Chọn phương thức **"Crawl các trang con"**.

<img src="https://mintcdn.com/fpt-62e894b4/IPXDNzpjyHdEAVnl/images/image95.png?fit=max&auto=format&n=IPXDNzpjyHdEAVnl&q=85&s=3357f8773ae04a64dccd2bca6127ec40" alt="Image95" width="879" height="702" data-path="images/image95.png" />

**Bước 4.** Điền đường dẫn và thông tin cấu hình

Nhập đường dẫn cần xử lý và nhấn **Enter** để thêm vào danh sách (chỉ nhập được 1 URL).

> **Lưu ý:** Hệ thống sẽ tự động kiểm tra và thông báo nếu URL không hợp lệ do không đúng định dạng.

**Tùy chỉnh nội dung thu thập:** Cho phép giới hạn và lọc nội dung để tối ưu kết quả crawl.

| STT | Tên trường thông tin      | Mô tả                                                                                                                                                                           |
| --- | ------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| 1   | Độ sâu tối đa             | Quy định độ sâu khi thu thập trang con (số cấp trang con sẽ được thu thập)                                                                                                      |
| 2   | Số trang tối đa để crawl  | Số lượng trang tối đa được crawl                                                                                                                                                |
| 3   | Độ dài nội dung tối thiểu | Chỉ giữ lại nội dung có độ dài lớn hơn \[n] ký tự. Bỏ qua các trang có nội dung ngắn hơn \[n] ký tự để tránh thu thập dữ liệu không cần thiết như menu, thông báo, trang lỗi... |

**Tùy chọn thêm (không bắt buộc):**

* **Chọn thư mục:** Gán URL vào một thư mục sẵn có để tổ chức dữ liệu theo chủ đề, giúp dễ dàng phân loại quản lý.
* **Cấu hình nâng cao:** Tương tự như đối với phần "Chỉ crawl các URL đã chỉ định", người dùng có thể thiết lập các trường dữ liệu nâng cao để phục vụ việc phân tích và phân mảnh nội dung.

**Bước 5.** Nhấn **Lấy URL** để hệ thống bắt đầu thu thập (fetching) các trang con.

Trong quá trình thu thập, người dùng có thể nhấn **Dừng lấy dữ liệu** để tạm dừng thao tác, hệ thống sẽ dừng quá trình thu thập.

**Bước 6.** Chọn các URL cần thêm vào danh sách tri thức từ kết quả đã thu thập.

**Bước 7.** Nhấn **Xử lý** để hoàn tất. Các URL được xác nhận sẽ hiển thị trong danh sách tri thức.

***

### Phương thức Crawl các URL bằng sitemap

**Bước 1.** Truy cập kho tri thức, mục **Website**.

**Bước 2.** Ấn **+ Tạo** và chọn **URL mới**.

<Frame>
  <img src="https://mintcdn.com/fpt-62e894b4/2KQBHNQpZ02wDQVq/images/image-(51).png?fit=max&auto=format&n=2KQBHNQpZ02wDQVq&q=85&s=b6733585a19a5821b72154702141f239" alt="Image (51)" width="936" height="444" data-path="images/image-(51).png" />
</Frame>

**Bước 3.** Trong mục **Crawl URL theo sitemap**, điền thông tin cần thiết.

* **Sitemap mong muốn** (bắt buộc)

<img src="https://mintcdn.com/fpt-62e894b4/hbGRYtCporYfVHkr/images/image-(52).png?fit=max&auto=format&n=hbGRYtCporYfVHkr&q=85&s=93917f95a26a93385c24f36548bb8b82" alt="Image (52)" width="936" height="721" data-path="images/image-(52).png" />

<Note>
  Sitemap cần có đuôi `.xml`.
</Note>

* **Chọn thư mục** (không bắt buộc) Chọn thư mục chứa danh sách URL crawl về.

<img src="https://mintcdn.com/fpt-62e894b4/hbGRYtCporYfVHkr/images/image-(54).png?fit=max&auto=format&n=hbGRYtCporYfVHkr&q=85&s=7a8507dc8ed28ed24aabeabb6f0127f7" alt="Image (54)" width="936" height="721" data-path="images/image-(54).png" />

* **Bộ lọc "Bao gồm" và "Loại trừ"** (không bắt buộc)
  * **Bao gồm đường dẫn (Include path):** chỉ thu thập các trang con phù hợp với điều kiện được chỉ định. Cho phép nhập nhiều giá trị.
  * **Loại trừ đường dẫn (Exclude path):** bỏ qua các trang con khớp với điều kiện lọc này, dù nằm trong phạm vi trang chính. Cho phép nhập nhiều giá trị.

<img src="https://mintcdn.com/fpt-62e894b4/hbGRYtCporYfVHkr/images/image-(53)-1.png?fit=max&auto=format&n=hbGRYtCporYfVHkr&q=85&s=82fdd87c90d2741a36bbe894fbc4244d" alt="Image (53) 1" width="936" height="721" data-path="images/image-(53)-1.png" />

* **Cấu hình nâng cao** (không bắt buộc) Tương tự như đối với phần "Chỉ crawl các URL đã chỉ định".

**Bước 4.** Chọn **Xử lý** để xác nhận thu thập.

<img src="https://mintcdn.com/fpt-62e894b4/hbGRYtCporYfVHkr/images/image-(55).png?fit=max&auto=format&n=hbGRYtCporYfVHkr&q=85&s=b53772f7d74944089ec44b56300ce62d" alt="Image (55)" width="936" height="726" data-path="images/image-(55).png" />

Các URL được crawl về sẽ được tổ chức theo cấu trúc thư mục phản ánh đúng cấu trúc của Sitemap.
