본문으로 건너뛰기
검색
ConceptSEOWebsites

크롤링

크롤링은 검색엔진의 자동 프로그램인 크롤러(crawler)가 URL을 발견하고 페이지의 내용을 가져오는 과정입니다. 대부분의 페이지가 색인 전에 거치는 일반적인 선행 단계지만, robots.txt로 콘텐츠를 읽지 못한 URL도 다른 신호를 통해 URL 자체가 색인되는 예외가 있습니다.

발행 검토 읽기 3
작성 AI6

크롤링 (Crawling)

검색엔진의 자동 프로그램인 **크롤러(crawler)**가 웹에서 URL을 발견하고, 그 페이지의 텍스트·이미지 등 내용을 가져오는 과정. 검색 노출로 이어지는 파이프라인에서 대부분의 페이지가 거치는 일반적인 선행 단계입니다. Google의 크롤러는 Googlebot이라는 이름으로 불립니다.

어떻게 동작하는가#

크롤링은 크게 발견과 수집, 두 가지 일로 이루어집니다.

URL 발견 — 검색엔진은 모든 웹페이지의 목록을 미리 가지고 있지 않습니다. 새 URL은 주로 세 경로로 발견됩니다.

경로설명
이미 아는 페이지과거에 방문했거나 알고 있던 URL을 다시 방문해 변화를 확인
링크 추적아는 페이지에 걸린 링크를 따라 새 페이지를 발견
sitemap사이트 운영자가 sitemap으로 제출한 URL 목록

이 구조에서 두 가지 실무 원칙이 나옵니다. 사이트 안의 주요 페이지는 내부 링크로 도달할 수 있어야 하고, 링크만으로 발견되기 어려운 페이지는 sitemap으로 보완해야 합니다.

수집과 렌더링 — 발견한 URL 중 무엇을 언제 방문할지는 검색엔진이 결정합니다. 크롤러는 사이트에 과부하를 주지 않도록 서버의 응답 상태를 보며 수집 속도를 조절합니다. Google은 수집한 페이지를 최신 브라우저와 비슷한 방식으로 JavaScript까지 실행해 렌더링할 수 있습니다.

크롤링되지 않는 경우#

페이지가 존재해도 크롤러가 내용을 가져가지 못하거나 방문 빈도가 줄어드는 상황이 있습니다.

  • robots.txt로 차단된 경우 — 해당 규칙을 지원하고 준수하는 크롤러는 지정된 경로의 콘텐츠를 요청하지 않습니다.
  • 로그인이 필요한 경우 — 인증 뒤에 있는 페이지는 일반 검색 크롤러가 콘텐츠에 접근할 수 없습니다.
  • 서버 문제 — 접속 오류가 반복되거나 응답이 매우 느리면 검색엔진이 수집 속도나 빈도를 줄일 수 있습니다.
  • 발견 신호가 부족한 경우 — 링크도 없고 sitemap에도 없는 신규 URL은 검색엔진이 발견할 가능성이 크게 낮아집니다. 다만 이미 알려진 URL이라면 링크나 sitemap이 없어도 다시 방문할 수 있습니다.

크롤링과 색인은 다르다#

크롤링은 페이지를 가져오는 일이고, 색인은 가져온 페이지를 분석해 검색 가능한 데이터베이스에 저장하는 일입니다. Google은 크롤링한 모든 페이지를 색인하지는 않는다고 설명합니다.

반대 방향의 예외도 있습니다. Google은 robots.txt 때문에 콘텐츠를 읽지 못했더라도 다른 페이지의 링크 같은 신호로 URL을 발견하면 URL 자체를 색인할 수 있습니다. 따라서 크롤링은 일반적인 선행 단계이지만 모든 검색 노출의 절대적인 필요조건은 아닙니다.

사이트가 할 일#

크롤링 관점에서 운영자가 점검할 것은 네 가지입니다.

  1. 링크 구조 — 주요 페이지가 홈이나 상위 페이지에서 내부 링크로 도달 가능한지 확인합니다.
  2. sitemap 제공 — 검색엔진에 알릴 대표 URL 목록을 제출하고 페이지 추가·삭제 시 함께 갱신합니다.
  3. robots.txt 점검 — 수집되어야 할 영역을 실수로 차단하고 있지 않은지 확인합니다.
  4. 안정적인 응답 — 서버 오류와 과도한 응답 지연을 줄입니다.

문제가 생기면 먼저 Google Search Console의 Page indexing report와 URL Inspection, 네이버 서치어드바이저에서 수집 여부를 확인합니다. 그다음 원인을 발견 신호 부족 → robots.txt·인증 같은 접근 제한 → 서버 응답 문제로 나눠 보면 추측보다 빠르게 범위를 좁힐 수 있습니다.

자주 생기는 오해#

  • "크롤링되면 검색에 나온다" — 크롤링은 일반적인 첫 단계일 뿐입니다. 색인에서 제외되면 검색 결과에 나타나지 않습니다.
  • "크롤링은 많이 될수록 좋다" — 중요한 것은 중요한 URL이 안정적으로 발견되고 수집되는 것입니다. Canonical URL은 중복 URL 중 대표 선택에 대한 신호이고 robots.txt는 크롤링 접근 제어이므로, 두 수단이 URL 증가 문제 전체를 대신 해결하지는 않습니다.
  • "robots.txt로 막으면 검색에서 사라진다" — 크롤링 차단과 색인 제외는 다른 문제입니다. 차단된 페이지도 다른 링크를 통해 URL 자체가 색인될 수 있습니다.

관련 개념과 이어서 보기#

크롤링은 SEO가 다루는 파이프라인의 입구입니다. 다음 단계인 색인, 발견을 돕는 Sitemap, 접근 범위를 선언하는 Robots.txt를 이어서 읽으면 전체 흐름이 연결됩니다. 실제 점검 순서는 홈페이지 SEO 기본 가이드를 참고하세요.

Sources

Related Knowledge

상위 개념SEO

Continue Learning

SEO Topic HubWebsites Topic Hub