T

Text Machine

เครื่องมือข้อความทรงพลัง ในเบราว์เซอร์ของคุณ

เครื่องมือดึง URL จากไซต์แมพ

URL ที่ดึงออกมา

วิธีใช้ เครื่องมือดึง URL จากไซต์แมพ

  1. 1

    ระบุ sitemap ของคุณ

    วาง XML ดิบของ sitemap ลงในช่อง XML หรือป้อน URL ของ sitemap เพื่อดึงโดยอัตโนมัติ

  2. 2

    แยก URL

    คลิก "แยก URL" สำหรับ XML ที่วางไว้ หรือ "ดึงและแยก" เพื่อดาวน์โหลดและแยกวิเคราะห์ sitemap จาก URL ของมัน

  3. 3

    ตรวจดูผลลัพธ์

    ทุกลิงก์ที่พบภายในแท็ก <loc> จะถูกแสดงในพื้นที่ผลลัพธ์พร้อมจำนวนทั้งหมด

  4. 4

    คัดลอกหรือดาวน์โหลด

    ใช้ "คัดลอกไปยังคลิปบอร์ด" หรือ "ดาวน์โหลดเป็นไฟล์ข้อความ" เพื่อบันทึกรายการ URL ที่แยกออกมา

การทำงานกับ XML sitemap: การดึงและการตรวจสอบ

XML sitemap คืออะไร

XML sitemap เป็นไฟล์ที่มีโครงสร้างซึ่งแสดงรายการ URL ที่คุณต้องการให้เครื่องมือค้นหารับรู้ โดยห่อไว้ในเอลิเมนต์ urlset ที่แต่ละหน้าเป็นรายการ url ลูกเดียวที่จำเป็นของแต่ละรายการคือแท็ก loc ซึ่งเก็บ URL แบบสมบูรณ์ของหน้านั้น ส่วนแท็กเสริมอย่าง lastmod, changefreq และ priority ให้คำใบ้เกี่ยวกับความใหม่และความสำคัญ เครื่องมือค้นหาถือว่า sitemap เป็นตัวช่วยการค้นพบและเป็นชุดข้อเสนอแนะ ไม่ใช่คำสั่ง ดังนั้นการแสดง URL จึงไม่ได้บังคับให้มันถูกรวบรวมข้อมูลหรือจัดทำดัชนี แต่ทำให้ค้นหา URL ได้ง่ายขึ้นมาก

เนื่องจากแท็ก loc คือที่ที่ URL จริงทุกตัวอาศัยอยู่ การดึงเนื้อหาของแท็ก loc ทั้งหมดจึงให้บัญชีรายการที่สะอาดและครบถ้วนของหน้าที่เว็บไซต์กำลังโฆษณาต่อเครื่องมือค้นหา บัญชีรายการนั้นเป็นจุดเริ่มต้นของงาน SEO และการย้ายเว็บไซต์หลากหลายประเภท ซึ่งเป็นสิ่งที่เครื่องมือดึงนี้สร้างขึ้นมาให้พอดี

ไฟล์ sitemap index และ sitemap ที่ซ้อนกัน

เว็บไซต์ขนาดใหญ่แทบไม่ใช้ sitemap แบบแบนเดียว แต่ใช้ไฟล์ sitemap index แทน ซึ่งเป็นเอลิเมนต์ sitemapindex ที่แต่ละรายการชี้ไปยังไฟล์ sitemap อีกไฟล์หนึ่งแทนที่จะชี้ไปยังหน้า การตั้งค่าทั่วไปอาจมี index หนึ่งไฟล์ที่อ้างอิง sitemap แยกกันสำหรับโพสต์ หน้า สินค้า และรูปภาพ เมื่อคุณดึง URL จากไฟล์ index แท็ก loc ที่คุณได้กลับมาคือ URL ของ sitemap ลูก ไม่ใช่ของหน้าแต่ละหน้า ดังนั้นคุณอาจต้องดึงจาก sitemap ลูกแต่ละไฟล์ตามลำดับเพื่อเข้าถึง URL ของหน้าจริง

การรู้ว่าคุณกำลังดูไฟล์ index หรือ sitemap ปลายทางคืองานครึ่งหนึ่งแล้ว หาก URL ที่ดึงออกมาทั้งหมดลงท้ายด้วย .xml หรือ .xml.gz แสดงว่าคุณกำลังถือ index อยู่และควรเจาะลึกลงไปอีกหนึ่งระดับ หากพวกมันชี้ไปยังหน้า HTML ปกติ แสดงว่าคุณเข้าถึงเนื้อหาจริงแล้ว

ขีดจำกัด 50,000 URL และ 50 MB

โปรโตคอล sitemap จำกัดไฟล์ sitemap เดียวไว้ที่ 50,000 URL และ 50 MB แบบไม่บีบอัด เว็บไซต์ที่เกินขีดจำกัดใดข้อหนึ่งต้องแบ่ง URL ออกเป็นไฟล์ sitemap หลายไฟล์และผูกพวกมันเข้าด้วยกันด้วย sitemap index ซึ่งเป็นเหตุผลหลักที่เว็บไซต์ขนาดใหญ่ใช้ไฟล์ index เลย การรู้ขีดจำกัดเหล่านี้ช่วยให้คุณตรวจสอบความสมเหตุสมผลของสิ่งที่ดึงออกมา หาก sitemap เดียวคืน URL มากกว่า 50,000 รายการมาก แสดงว่ามันผิดรูปแบบ และหากเว็บไซต์ขนาดใหญ่เปิดเผย sitemap เล็ก ๆ เพียงไฟล์เดียว มันก็น่าจะไม่ครบถ้วนและมีหน้าที่ขาดหายไป

เพดานเหล่านี้ยังกำหนดรูปแบบการตรวจสอบของคุณด้วย เมื่อคุณดึงรายการ URL ทั้งหมดออกมาแล้วจำนวนตกลงใกล้เลขกลม ๆ อย่าง 50,000 อย่างน่าสงสัย นั่นเป็นสัญญาณที่ชัดเจนว่าเว็บไซต์ชนขีดจำกัดแล้ว และ URL เพิ่มเติมยังตกค้างอยู่ใน sitemap ที่คุณยังไม่ได้ดึงออกมา

sitemap ที่ถูกบีบอัดแบบ gzip

เพื่อให้อยู่ใต้ขีดจำกัดขนาดและประหยัดแบนด์วิดท์ sitemap จำนวนมากถูกเสิร์ฟแบบบีบอัด gzip ด้วยนามสกุล .xml.gz sitemap ที่บีบอัด gzip ก็เป็นเพียง XML sitemap ปกติที่ถูกบีบอัด เครื่องมือค้นหาคลายการบีบอัดมันอย่างโปร่งใส เมื่อคุณดึงไฟล์หนึ่งผ่านเครื่องมือนี้ เซิร์ฟเวอร์จะจัดการการดาวน์โหลด แต่หากคุณกำลังตรวจไฟล์ .gz ด้วยตนเอง คุณจะเห็นข้อมูลไบนารีที่อ่านไม่ออกแทน XML ที่อ่านได้จนกว่ามันจะถูกคลายการบีบอัด หากกำลังวางเนื้อหาโดยตรง ให้วาง XML ที่คลายการบีบอัดแล้ว ไม่ใช่ไบต์ที่บีบอัดดิบ

การบีบอัดเป็นเพียงการปรับให้เหมาะสมด้านการขนส่งล้วน ๆ และไม่เปลี่ยนแปลงอะไรเกี่ยวกับโครงสร้างภายในเลย เมื่อคลายการบีบอัดแล้ว sitemap ที่บีบอัด gzip ก็มีเอลิเมนต์ urlset, url และ loc เหมือนกับ sitemap อื่น ๆ และตรรกะการดึงแบบเดียวกันก็ใช้ได้

ทำไมการดึง URL จาก sitemap จึงมีประโยชน์มาก

รายการแบบแบนของทุก URL ที่เว็บไซต์เผยแพร่คือกระดูกสันหลังของงาน SEO เชิงปฏิบัติ ระหว่างการย้ายเว็บไซต์ คุณดึง sitemap ของเว็บไซต์เก่าเพื่อสร้างแผนที่การเปลี่ยนเส้นทางที่ครบถ้วน เพื่อไม่ให้มี URL ใดกลายเป็น 404 สำหรับการตรวจสอบเนื้อหา รายการนี้ป้อนเข้าสู่บ็อตรวบรวมข้อมูลหรือสเปรดชีตที่คุณตรวจสอบรหัสสถานะ ชื่อเรื่อง และจำนวนคำได้ทีละหน้า สำหรับการตรวจการจัดทำดัชนี คุณเปรียบเทียบ URL ที่คุณส่งกับสิ่งที่ Search Console รายงานว่าจัดทำดัชนีแล้วได้ และช่องว่างนั้นบอกคุณว่า Google กำลังเพิกเฉยต่อหน้าใด

รายการนี้ยังเป็นข้อมูลนำเข้าสำหรับเครื่องมือทำงานจำนวนมากด้วย คุณป้อน URL ที่ดึงออกมาเข้าสู่บ็อตรวบรวมข้อมูลอย่าง Screaming Frog เข้าสู่ตัวตรวจสอบลิงก์ เข้าสู่ตัวตรวจสอบประสิทธิภาพ หรือเข้าสู่สคริปต์ที่ตรวจเฮดเดอร์ HTTP ของแต่ละ URL ได้ การเริ่มจากรายการ sitemap ที่เป็นต้นฉบับ แทนการรวบรวมข้อมูลอย่างไร้ทิศทาง ช่วยให้แน่ใจว่าคุณกำลังตรวจสอบหน้าที่เว็บไซต์ตั้งใจจะเปิดเผยพอดี

ข้อผิดพลาดทั่วไปเมื่อทำการดึง

เรื่องที่น่าประหลาดใจบ่อยที่สุดคือการดึงไฟล์ index แล้วคิดว่าเว็บไซต์มีเพียงไม่กี่หน้า ทั้งที่จริงแล้ว URL ไม่กี่ตัวนั้นคือ sitemap ลูกที่แต่ละไฟล์มีหน้านับพัน ตรวจสอบเสมอว่าผลลัพธ์ของคุณเป็น sitemap หรือหน้าจริงก่อนสรุปอะไร ข้อผิดพลาดที่สองคือการสันนิษฐานว่า sitemap ครบถ้วนสมบูรณ์ ระบบจัดการเนื้อหาจำนวนมากสร้าง sitemap ที่ละเว้นหน้าบางประเภท คลังเก็บที่แบ่งหน้า หรือเนื้อหาที่เพิ่งเผยแพร่ ดังนั้น sitemap จึงเป็นขั้นต่ำของ URL ในเว็บไซต์ ไม่ใช่สำมะโนที่สมบูรณ์

ข้อควรระวังอื่น ๆ ได้แก่ วันที่ lastmod ที่ล้าสมัยซึ่งไม่สะท้อนการเปลี่ยนแปลงจริง URL ใน sitemap ที่ไม่คืนค่า 200 อีกต่อไป (หน้ากำพร้าหรือถูกลบที่ไม่เคยถูกตัดออก) และความไม่ตรงกันของโปรโตคอลหรือโฮสต์ที่ sitemap แสดง URL แบบ http ในขณะที่เว็บไซต์ย้ายไปใช้ https แล้ว การดึง URL เป็นส่วนที่ง่าย คุณค่าเกิดจากการตรวจสอบรายการนั้นกับสิ่งที่เซิร์ฟเวอร์เสิร์ฟจริง

การนำการดึงเข้าสู่เวิร์กโฟลว์ SEO

เวิร์กโฟลว์ที่สะอาดและทำซ้ำได้มีลักษณะดังนี้ คือหา sitemap ซึ่งมักลิงก์มาจาก robots.txt หรืออยู่ที่พาธ /sitemap.xml ตามธรรมเนียม จากนั้นดึง URL โดยเจาะผ่านไฟล์ index ใด ๆ จนกว่าจะถึงหน้าจริง แล้วส่งออกรายการเป็นไฟล์ข้อความ จากนั้นป้อนเข้าสู่เครื่องมือตรวจสอบหรือย้ายเว็บไซต์ที่คุณกำลังใช้ เนื่องจากเครื่องมือดึงนี้ทั้งแยกวิเคราะห์ XML ที่วางและดึง sitemap จาก URL ได้ คุณจึงเปลี่ยนจาก sitemap ดิบเป็นรายการ URL ที่ใช้งานได้ในไม่กี่วินาทีโดยไม่ต้องเขียนโค้ดใด ๆ

ทำการดึงเป็นระยะ ไม่ใช่เพียงครั้งเดียว การเปรียบเทียบรายการ URL ของวันนี้กับของเดือนที่แล้วจะเผยให้เห็นหน้าที่เพิ่งเผยแพร่ หน้าที่ถูกลบอย่างเงียบ ๆ และการเปลี่ยนแปลงเชิงโครงสร้างของเว็บไซต์ ซึ่งทั้งหมดเป็นสัญญาณเริ่มต้นที่มีประโยชน์ทั้งต่อสุขภาพ SEO และการกำกับดูแลเนื้อหา

คำถามที่พบบ่อย

ตัวแยก URL ของ sitemap หาลิงก์อย่างไร
มันแยกวิเคราะห์ XML ของ sitemap และดึงทุกที่อยู่ภายในแท็ก <loc> ซึ่งเป็นที่ที่ sitemap แสดง URL ของแต่ละหน้า จากนั้นรายการทั้งหมดจะถูกแสดงพร้อมจำนวนที่พบ
ฉันวาง XML หรือโหลด sitemap จาก URL ได้ไหม
ได้ทั้งสอง คุณวาง XML ดิบโดยตรงเพื่อแยกวิเคราะห์ในเบราว์เซอร์ทันที หรือป้อน URL ของ sitemap แล้วเครื่องมือจะดึงไฟล์ผ่านพร็อกซีก่อนแยก URL
ถ้า XML ของฉันไม่ถูกต้องหรือไม่มี URL จะเป็นอย่างไร
หาก XML แยกวิเคราะห์ไม่ได้ คุณจะได้รับข้อผิดพลาดการแยกวิเคราะห์ และหากไม่มีแท็ก <loc> คุณจะได้รับแจ้งว่าไม่พบ URL ตรวจให้แน่ใจว่าคุณวาง sitemap ที่ถูกต้องซึ่งมีรายการ <loc>
ฉันส่งออก URL ที่แยกออกมาได้ไหม
ได้ หลังการแยก คุณคัดลอกรายการทั้งหมดไปยังคลิปบอร์ดหรือดาวน์โหลดเป็นไฟล์ข้อความธรรมดาเพื่อใช้ในการตรวจสอบ การย้ายเว็บไซต์ หรือเครื่องมือรวบรวมข้อมูลได้
เครื่องมือนี้ฟรีและข้อมูลของฉันเป็นส่วนตัวหรือไม่
ฟรีโดยไม่ต้องลงทะเบียน XML ที่วางไว้ถูกแยกวิเคราะห์ในเครื่องในเบราว์เซอร์ของคุณ มีเพียงตัวเลือก "ดึงและแยก" เท่านั้นที่ติดต่อเซิร์ฟเวอร์เพื่อดาวน์โหลด sitemap จาก URL ที่คุณระบุ

เครื่องมือที่เกี่ยวข้อง

ทำงานต่อด้วยเครื่องมือที่มีประโยชน์เหล่านี้

เครื่องมือสร้าง Meta Tag

เครื่องสร้าง Robots.txt

Open Graph Previewer

เครื่องมือเข้ารหัส/ถอดรหัสเอนทิตี HTML

เครื่องมือดูส่วนหัว HTTP

เครื่องมือตรวจสอบห่วงโซ่การเปลี่ยนเส้นทาง URL