Robots.txt
robots.txt는 크롤러가 사이트에서 접근할 수 있는 URL 범위를 알리는 텍스트 파일입니다. 크롤링 트래픽을 관리하는 수단이지 웹페이지를 검색 결과에서 제외하거나 비공개로 만드는 보안 수단은 아닙니다.
Robots.txt
자동 클라이언트인 크롤러에게 사이트에서 접근할 수 있는 URL 범위를 알리는
텍스트 파일. 파일명은 robots.txt이고 사이트 호스트의 루트(예:
https://example.com/robots.txt)에 둡니다. 1994년부터 쓰인 Robots
Exclusion Protocol이 2022년 RFC 9309로 표준화되었습니다.
어떻게 동작하는가#
크롤러는 사이트를 크롤링하기 전에 이 파일을
가져와 자신에게 적용되는 규칙을 확인합니다. 규칙은 파일이 놓인 프로토콜·
호스트·포트 조합에만 적용됩니다. https://example.com/robots.txt의 규칙은
https://sub.example.com에 자동으로 적용되지 않습니다.
RFC 9309의 핵심 문법과 검색엔진이 지원하는 추가 레코드는 구분해야 합니다.
| 구분 | 항목 | 역할 |
|---|---|---|
| RFC core group | User-agent | 규칙이 적용될 크롤러를 식별 |
| RFC core rule | Disallow | 접근하지 않도록 요청할 경로 |
| RFC core rule | Allow | 차단 범위 안에서 허용할 더 구체적인 경로 |
| 추가 레코드 | Sitemap | sitemap의 절대 URL을 알림 |
User-agent: *
Disallow: /admin/
Allow: /admin/help/
Sitemap: https://example.com/sitemap.xml
RFC 9309는 Sitemap을 protocol core 밖의 other record 예로 다룹니다.
Google을 비롯한 검색엔진이 이 레코드를 지원하지만, 추가 필드와 세부 지원
범위는 검색엔진별 문서를 함께 확인해야 합니다. 파일은 UTF-8로 인코딩된
일반 텍스트여야 합니다.
무엇에 쓰는가#
Google은 robots.txt의 주된 용도를 크롤러 트래픽 관리로 설명합니다. 실무에서는 사이트 내부 검색 결과, 장바구니, 무한히 조합되는 필터·정렬 URL 같은 영역의 불필요한 수집을 줄이는 데 사용할 수 있습니다. Google에서는 특정 이미지·영상·오디오 파일이 검색 결과에 나타나지 않게 하는 용도로도 사용할 수 있습니다.
페이지 렌더링에 필요한 CSS·JavaScript 리소스를 차단하면 검색엔진이 페이지를 이해하고 분석하는 데 문제가 생길 수 있습니다. 리소스 차단 전에는 해당 파일이 페이지 해석에 필요한지 확인해야 합니다.
무엇을 하지 못하는가#
웹페이지의 색인 제외 수단이 아닙니다. 차단된 페이지도 다른 사이트가 링크하면 Google이 URL 자체를 색인할 수 있습니다. 검색 결과에서 제외하려면 크롤러가 읽을 수 있는 noindex를 사용하고, 비공개 정보라면 인증으로 보호해야 합니다.
접근 권한을 강제하는 보안 장치가 아닙니다. RFC 9309도 robots 규칙은 access authorization이 아니라고 명시합니다. 표준을 준수하는 크롤러는 가져온 규칙을 처리하지만 비준수 봇의 접근까지 기술적으로 차단하지는 못합니다.
자주 생기는 실수#
- 오픈 후 전체 차단 방치 — 개발 단계의
Disallow: /설정을 운영에 남기면 사이트 전체의 수집을 막는 치명적인 설정 오류가 됩니다. 오픈 점검 목록에 robots.txt 확인을 포함하세요. - CSS·JS 차단 — 검색엔진이 페이지를 렌더링하고 이해하는 데 필요한 리소스인지 확인하지 않고 차단하면 분석에 문제가 생길 수 있습니다.
- 다른 호스트에도 적용된다고 착각 — www 유무, 서브도메인, http/https, 포트 조합마다 robots.txt 적용 범위가 다릅니다.
- 차단으로 색인 문제를 해결하려는 시도 — 크롤링 접근 제어와 색인 제외는 서로 다른 작업입니다.
관련 개념과 이어서 보기#
robots.txt는 크롤링 단계의 접근 범위를 알리고, 색인 제어는 noindex가 담당합니다. Sitemap 위치를 알리는 추가 레코드를 둘 수도 있습니다. 사이트 오픈 전 점검 항목으로서의 위치는 홈페이지 SEO 기본 가이드와 홈페이지 SEO 체크리스트에서 확인하세요.
Sources
- Introduction to robots.txt공식 출처Google Search Central · 2026.08.11 확인
- Create and submit a robots.txt file공식 출처Google Search Central · 2026.08.11 확인
- RFC 9309: Robots Exclusion Protocol표준 문서IETF · 2026.08.11 확인
- Block Search indexing with noindex공식 출처Google Search Central · 2026.08.11 확인
Related Knowledge
상위 개념SEO