Trích Xuất URL Từ Sitemap
Cách sử dụng Trích Xuất URL Từ Sitemap
- 1
Cung cấp sitemap của bạn
Dán XML thô của sitemap vào ô XML, hoặc nhập một URL sitemap để lấy nó tự động.
- 2
Trích xuất các URL
Nhấn 'Extract URLs' với XML đã dán, hoặc 'Fetch and Extract' để tải về và phân tích một sitemap từ URL của nó.
- 3
Xem lại kết quả
Mọi liên kết tìm thấy bên trong các thẻ <loc> được liệt kê ở vùng kết quả cùng với tổng số.
- 4
Sao chép hoặc tải xuống
Dùng 'Copy to Clipboard' hoặc 'Download as Text File' để lưu danh sách URL đã trích xuất.
Làm Việc Với Sitemap XML: Trích Xuất Và Kiểm Tra
Sitemap XML là gì
Sitemap XML là một tệp có cấu trúc liệt kê các URL mà bạn muốn các công cụ tìm kiếm biết đến, được bọc trong một phần tử urlset, nơi mỗi trang là một mục url. Phần tử con bắt buộc duy nhất của mỗi mục là thẻ loc, vốn chứa URL tuyệt đối của trang; các thẻ tùy chọn như lastmod, changefreq và priority cung cấp gợi ý về mức độ mới và độ quan trọng. Các công cụ tìm kiếm xem sitemap như một công cụ hỗ trợ khám phá và một tập hợp các gợi ý chứ không phải mệnh lệnh, nên việc liệt kê một URL không buộc nó phải được thu thập hay lập chỉ mục, nhưng quả thật giúp URL đó dễ được tìm thấy hơn nhiều.
Vì thẻ loc là nơi chứa mọi URL thực sự, việc trích xuất nội dung của tất cả các thẻ loc mang lại cho bạn một danh mục sạch sẽ và đầy đủ về những trang mà một website đang quảng bá với các công cụ tìm kiếm. Danh mục đó là điểm khởi đầu cho hàng loạt tác vụ SEO và di chuyển website, và đó chính xác là thứ mà bộ trích xuất này tạo ra.
Tệp sitemap index và sitemap lồng nhau
Các website lớn hiếm khi dùng một sitemap phẳng duy nhất. Thay vào đó, chúng dùng một tệp sitemap index, tức một phần tử sitemapindex mà mỗi mục đều trỏ đến một tệp sitemap khác chứ không phải đến một trang. Một thiết lập điển hình có thể gồm một index tham chiếu đến các sitemap riêng cho bài viết, trang, sản phẩm và hình ảnh. Khi bạn trích xuất URL từ một tệp index, các thẻ loc bạn nhận lại là URL của các sitemap con chứ không phải của từng trang riêng lẻ, nên bạn có thể cần trích xuất lần lượt từ mỗi sitemap con để tới được các URL trang thật sự.
Nhận ra mình đang xem một tệp index hay một sitemap lá đã là thắng được một nửa. Nếu các URL trích xuất được đều kết thúc bằng .xml hoặc .xml.gz, bạn đang cầm một tệp index và nên đào sâu thêm một cấp. Nếu chúng trỏ đến các trang HTML thông thường, bạn đã chạm tới nội dung thật.
Giới hạn 50,000 URL và 50 MB
Giao thức sitemap giới hạn mỗi tệp sitemap ở mức 50,000 URL và 50 MB khi chưa nén. Những website vượt quá một trong hai giới hạn này phải chia URL của mình ra nhiều tệp sitemap và liên kết chúng lại bằng một sitemap index, đó cũng là lý do chính khiến các website lớn dùng đến tệp index. Biết các giới hạn này giúp bạn kiểm tra tính hợp lý của những gì trích xuất được: nếu một sitemap đơn lẻ trả về nhiều hơn 50,000 URL rất nhiều thì nó bị lỗi định dạng, còn nếu một website lớn chỉ phơi bày một sitemap nhỏ duy nhất thì rất có thể nó chưa đầy đủ và thiếu trang.
Những mức trần này cũng định hình cách bạn kiểm tra. Khi bạn kéo về một danh sách URL đầy đủ mà số lượng lại nằm gần một con số tròn như 50,000 một cách đáng ngờ, đó là tín hiệu rõ ràng rằng website đã chạm giới hạn và còn những URL khác đang mắc kẹt trong các sitemap mà bạn chưa trích xuất.
Sitemap nén gzip
Để giữ kích thước dưới giới hạn và tiết kiệm băng thông, nhiều sitemap được phân phối ở dạng nén gzip với phần mở rộng .xml.gz. Một sitemap nén gzip thực chất chỉ là một sitemap XML thông thường đã được nén; các công cụ tìm kiếm giải nén nó một cách trong suốt. Khi bạn tải một tệp như vậy qua công cụ này, máy chủ sẽ lo phần tải về, nhưng nếu bạn tự mở một tệp .gz bằng tay thì sẽ thấy một mớ ký tự nhị phân khó hiểu thay vì XML đọc được, cho đến khi nó được giải nén. Nếu dán nội dung trực tiếp, hãy dán XML đã giải nén chứ không phải các byte nén thô.
Việc nén thuần túy là một cách tối ưu hóa cho khâu truyền tải và không thay đổi gì về cấu trúc bên trong. Sau khi được giải nén, một sitemap nén gzip có cùng các phần tử urlset, url và loc như bất kỳ sitemap nào khác, và logic trích xuất cũng y như vậy.
Vì sao việc trích xuất URL từ sitemap lại hữu ích đến vậy
Một danh sách phẳng gồm mọi URL mà website công bố chính là xương sống của công việc SEO thực tế. Trong quá trình di chuyển website, bạn trích xuất sitemap của website cũ để dựng nên một bản đồ chuyển hướng đầy đủ, nhờ đó không có URL nào bị bỏ rơi thành lỗi 404. Với một cuộc đánh giá nội dung, danh sách này được đưa vào một trình thu thập dữ liệu hoặc một bảng tính, nơi bạn có thể kiểm tra mã trạng thái, tiêu đề và số từ của từng trang. Với việc kiểm tra lập chỉ mục, bạn có thể so sánh các URL mình gửi đi với những gì Search Console báo cáo là đã được lập chỉ mục, và khoảng chênh lệch sẽ cho bạn biết Google đang bỏ qua những trang nào.
Danh sách này cũng là dữ liệu đầu vào cho các công cụ xử lý hàng loạt. Bạn có thể đưa các URL đã trích xuất vào một trình thu thập dữ liệu như Screaming Frog, vào một công cụ kiểm tra liên kết, vào một công cụ đánh giá hiệu năng, hoặc vào một script dò các tiêu đề HTTP của từng URL. Bắt đầu từ danh sách sitemap chuẩn, thay vì thu thập một cách mù quáng, đảm bảo rằng bạn đang kiểm tra đúng những trang mà website muốn phơi bày.
Những cạm bẫy thường gặp khi trích xuất
Bất ngờ thường gặp nhất là trích xuất một tệp index rồi nghĩ rằng website chỉ có vài trang ít ỏi, trong khi thật ra số ít URL đó là các sitemap con, mỗi cái lại chứa hàng nghìn trang. Hãy luôn kiểm tra xem kết quả của bạn là các sitemap hay là trang thật trước khi rút ra kết luận. Cạm bẫy thứ hai là cho rằng sitemap đã liệt kê đầy đủ: nhiều hệ quản trị nội dung tạo ra sitemap bỏ sót một số loại trang, các kho lưu trữ phân trang, hoặc nội dung vừa mới xuất bản, nên một sitemap chỉ là mức sàn cho các URL của website chứ không phải một bản thống kê toàn bộ.
Những điểm gây vướng khác gồm có các ngày lastmod cũ kỹ không phản ánh thay đổi thực tế, các URL trong sitemap không còn trả về 200 (những trang mồ côi hoặc đã xóa nhưng chưa bao giờ được dọn dẹp), và sự không khớp về giao thức hay tên miền khi sitemap liệt kê các URL http trong khi website đã chuyển sang https. Trích xuất URL là phần dễ; giá trị thật sự đến từ việc đối chiếu danh sách đó với những gì máy chủ thực sự cung cấp.
Đưa việc trích xuất vào quy trình SEO
Một quy trình sạch sẽ và có thể lặp lại trông như thế này: tìm sitemap, vốn thường được liên kết từ robots.txt hoặc nằm ở đường dẫn quy ước /sitemap.xml; trích xuất các URL, đào xuyên qua mọi tệp index cho đến khi tới được các trang thật; xuất danh sách ra một tệp văn bản; rồi đưa nó vào bất kỳ công cụ kiểm tra hay di chuyển nào bạn đang dùng. Vì bộ trích xuất này vừa có thể phân tích XML được dán vào vừa có thể tải một sitemap theo URL, bạn có thể đi từ một sitemap thô đến một danh sách URL dùng được chỉ trong vài giây mà không cần viết một dòng mã nào.
Hãy chạy việc trích xuất định kỳ thay vì chỉ một lần. So sánh danh sách URL hôm nay với danh sách của tháng trước sẽ làm lộ ra những trang mới xuất bản, những trang đã âm thầm bị gỡ bỏ, và những thay đổi về cấu trúc của website, tất cả đều là những tín hiệu sớm hữu ích cho cả sức khỏe SEO lẫn việc quản trị nội dung.
Câu hỏi thường gặp
Bộ trích xuất URL sitemap tìm các liên kết như thế nào?
Tôi có thể dán XML hoặc tải một sitemap từ URL không?
Nếu XML của tôi không hợp lệ hoặc không có URL thì sao?
Tôi có thể xuất các URL đã trích xuất không?
Công cụ có miễn phí không và dữ liệu của tôi có riêng tư không?
Công cụ liên quan
Tiếp tục với những công cụ hữu ích này