T

Text Machine

강력한 텍스트 도구를 브라우저에서

사이트맵 URL 추출기

추출된 URL

사이트맵 URL 추출기 사용 방법

  1. 1

    사이트맵 제공

    사이트맵의 원시 XML을 XML 입력란에 붙여넣거나, 사이트맵 URL을 입력해 자동으로 가져오세요.

  2. 2

    URL 추출

    붙여넣은 XML에는 'Extract URLs'를, URL에서 사이트맵을 내려받아 파싱하려면 'Fetch and Extract'를 클릭하세요.

  3. 3

    결과 검토

    <loc> 태그 안에서 발견된 모든 링크가 전체 개수와 함께 결과 영역에 나열됩니다.

  4. 4

    복사 또는 다운로드

    'Copy to Clipboard' 또는 'Download as Text File'을 사용해 추출된 URL 목록을 저장하세요.

XML 사이트맵 다루기: 추출과 감사

XML 사이트맵이란

XML 사이트맵은 검색 엔진이 알았으면 하는 URL을 나열하는 구조화된 파일로, urlset 요소로 감싸이고 각 페이지가 하나의 url 항목으로 들어갑니다. 각 항목에서 필수인 자식은 페이지의 절대 URL을 담는 loc 태그뿐이며, lastmod, changefreq, priority 같은 선택 태그는 최신성과 중요도에 대한 힌트를 제공합니다. 검색 엔진은 사이트맵을 발견을 돕는 도구이자 명령이 아닌 제안의 모음으로 취급하므로, URL을 나열한다고 해서 크롤링이나 색인이 강제되지는 않지만 URL을 훨씬 찾기 쉽게 만들어 줍니다.

모든 실제 URL은 loc 태그 안에 있으므로, 모든 loc 태그의 내용을 추출하면 사이트가 검색 엔진에 알리고 있는 페이지의 깔끔하고 완전한 목록을 얻을 수 있습니다. 그 목록은 다양한 SEO 및 이전 작업의 출발점이며, 바로 이 추출기가 만들어 내는 것입니다.

사이트맵 인덱스 파일과 중첩 사이트맵

대형 사이트는 평평한 사이트맵 하나만 쓰는 일이 드뭅니다. 대신 사이트맵 인덱스 파일, 즉 각 항목이 페이지가 아니라 또 다른 사이트맵 파일을 가리키는 sitemapindex 요소를 사용합니다. 전형적인 구성은 게시물, 페이지, 제품, 이미지를 위한 별도 사이트맵을 참조하는 인덱스 하나를 두는 식입니다. 인덱스 파일에서 URL을 추출하면 되돌아오는 loc 태그는 개별 페이지가 아니라 자식 사이트맵의 URL이므로, 실제 페이지 URL에 닿으려면 각 자식 사이트맵에서 차례로 추출해야 할 수 있습니다.

지금 보고 있는 것이 인덱스인지 말단 사이트맵인지 알아보는 것이 절반의 성공입니다. 추출된 URL이 모두 .xml이나 .xml.gz로 끝나면 인덱스를 들고 있는 것이니 한 단계 더 파고들어야 합니다. 일반 HTML 페이지를 가리킨다면 실제 콘텐츠에 도달한 것입니다.

5만 개 URL과 50MB 한계

사이트맵 프로토콜은 단일 사이트맵 파일을 URL 5만 개, 압축 해제 기준 50MB로 제한합니다. 두 한계 중 하나라도 초과하는 사이트는 URL을 여러 사이트맵 파일로 나누고 사이트맵 인덱스로 묶어야 하는데, 이것이 대형 사이트가 애초에 인덱스 파일을 사용하는 주된 이유입니다. 이 한계를 알아 두면 추출한 결과를 점검하는 데 도움이 됩니다. 단일 사이트맵이 5만 개를 훌쩍 넘는 URL을 반환한다면 형식이 잘못된 것이고, 큰 사이트가 작은 사이트맵 하나만 노출한다면 아마 불완전하고 페이지가 빠진 것입니다.

이 상한선은 감사 방식에도 영향을 줍니다. 전체 URL 목록을 뽑았는데 개수가 50,000 같은 딱 떨어지는 숫자에 수상할 만큼 가깝게 떨어진다면, 사이트가 한계에 도달했고 추가 URL이 아직 추출하지 않은 사이트맵에 묶여 있다는 강한 신호입니다.

Gzip으로 압축된 사이트맵

크기 한계를 넘지 않고 대역폭을 아끼기 위해 많은 사이트맵은 .xml.gz 확장자로 gzip 압축되어 제공됩니다. gzip으로 압축된 사이트맵은 그저 압축된 일반 XML 사이트맵일 뿐이며, 검색 엔진은 이를 알아서 압축 해제합니다. 이 도구로 가져올 때는 서버가 다운로드를 처리하지만, .gz 파일을 직접 살펴보면 압축을 풀기 전까지는 읽을 수 있는 XML이 아니라 의미 없는 이진 문자가 보입니다. 내용을 직접 붙여넣을 때는 압축된 원시 바이트가 아니라 압축을 푼 XML을 붙여넣으세요.

압축은 순전히 전송 최적화일 뿐 내부 구조는 전혀 바꾸지 않습니다. 압축을 풀고 나면 gzip 사이트맵도 다른 것과 똑같은 urlset, url, loc 요소를 가지며, 동일한 추출 로직이 적용됩니다.

사이트맵 URL 추출이 그토록 유용한 이유

사이트가 게시하는 모든 URL의 평평한 목록은 실무 SEO 작업의 근간입니다. 사이트 이전 중에는 옛 사이트의 사이트맵을 추출해 완전한 리디렉션 지도를 만들어, 어떤 URL도 404로 남지 않게 합니다. 콘텐츠 감사에서는 이 목록을 크롤러나 스프레드시트에 넣어 페이지별로 상태 코드, 제목, 단어 수를 확인할 수 있습니다. 색인 점검에서는 제출한 URL을 Search Console이 색인되었다고 보고하는 것과 비교할 수 있고, 그 차이가 Google이 무시하고 있는 페이지를 알려 줍니다.

이 목록은 대량 처리 도구의 입력값이기도 합니다. 추출한 URL을 Screaming Frog 같은 크롤러, 링크 검사기, 성능 감사기, 또는 각 URL의 HTTP 헤더를 살피는 스크립트에 흘려보낼 수 있습니다. 무작정 크롤링하는 대신 표준 사이트맵 목록에서 출발하면, 사이트가 노출하려는 바로 그 페이지들을 정확히 감사하게 됩니다.

추출할 때 흔히 빠지는 함정

가장 흔한 놀라움은 인덱스 파일을 추출하고서 사이트에 페이지가 몇 개뿐이라고 생각하는 것입니다. 실제로는 그 몇 안 되는 URL이 각각 수천 페이지를 담은 자식 사이트맵인데도 말입니다. 결론을 내리기 전에 결과가 사이트맵인지 실제 페이지인지 항상 확인하세요. 두 번째 함정은 사이트맵이 빠짐없다고 가정하는 것입니다. 많은 콘텐츠 관리 시스템이 특정 페이지 유형, 페이지로 나뉜 아카이브, 최근 게시된 콘텐츠를 빼고 사이트맵을 생성하므로, 사이트맵은 사이트 URL의 하한일 뿐 완전한 전수 조사가 아닙니다.

그 밖의 함정으로는 실제 변경을 반영하지 못하는 오래된 lastmod 날짜, 더 이상 200을 반환하지 않는 사이트맵 내 URL(정리되지 않은 고립 또는 삭제된 페이지), 그리고 사이트는 https로 옮겼는데 사이트맵은 http URL을 나열하는 프로토콜이나 호스트 불일치가 있습니다. URL을 추출하는 것은 쉬운 부분이고, 가치는 그 목록을 서버가 실제로 제공하는 것과 교차 확인하는 데서 나옵니다.

추출을 SEO 작업 흐름에 끼워 넣기

깔끔하고 반복 가능한 작업 흐름은 이렇습니다. 보통 robots.txt에 링크되어 있거나 관례적인 /sitemap.xml 경로에 있는 사이트맵을 찾고, 실제 페이지에 닿을 때까지 인덱스 파일을 파고들며 URL을 추출하고, 목록을 텍스트 파일로 내보낸 뒤, 사용 중인 감사 또는 이전 도구에 넣는 것입니다. 이 추출기는 붙여넣은 XML을 파싱하는 것과 URL로 사이트맵을 가져오는 것을 모두 할 수 있어, 코드를 한 줄도 작성하지 않고 원시 사이트맵에서 쓸 수 있는 URL 목록까지 몇 초 만에 갈 수 있습니다.

추출은 한 번이 아니라 주기적으로 실행하세요. 오늘의 URL 목록을 지난달 것과 비교하면 새로 게시된 페이지, 조용히 사라진 페이지, 사이트의 구조 변경이 드러나는데, 이 모두는 SEO 건전성과 콘텐츠 거버넌스 양쪽에 유용한 조기 신호입니다.

자주 묻는 질문

사이트맵 URL 추출기는 링크를 어떻게 찾나요?
사이트맵의 XML을 파싱해 <loc> 태그 안의 모든 주소를 가져옵니다. 사이트맵은 바로 그곳에 각 페이지 URL을 나열합니다. 그런 다음 전체 목록이 발견된 개수와 함께 표시됩니다.
XML을 붙여넣거나 URL에서 사이트맵을 불러올 수 있나요?
둘 다 가능합니다. 원시 XML을 직접 붙여넣어 브라우저에서 즉시 파싱하거나, 사이트맵 URL을 입력하면 도구가 프록시를 통해 파일을 가져온 뒤 URL을 추출합니다.
XML이 잘못되었거나 URL이 없으면 어떻게 되나요?
XML을 파싱할 수 없으면 파싱 오류가 표시되고, <loc> 태그가 없으면 URL을 찾지 못했다고 알려 줍니다. <loc> 항목이 포함된 유효한 사이트맵을 붙여넣었는지 확인하세요.
추출된 URL을 내보낼 수 있나요?
네. 추출 후 전체 목록을 클립보드에 복사하거나 일반 텍스트 파일로 다운로드해, 감사, 마이그레이션, 크롤링 도구에 사용할 수 있습니다.
이 도구는 무료이고 데이터가 비공개인가요?
가입 없이 무료입니다. 붙여넣은 XML은 브라우저 안에서 로컬로 파싱되며, 'Fetch and Extract' 옵션만 제공한 URL에서 사이트맵을 내려받기 위해 서버에 접속합니다.

관련 도구

이런 편리한 도구도 함께 사용해 보세요

메타 태그 생성기

Robots.txt 생성기

Open Graph Previewer

HTML 엔티티 인코더/디코더

HTTP 헤더 뷰어

URL 리다이렉트 체인 검사기