robots.txt 확인

robots.txt는 도메인 최상단(yoursite.com/robots.txt)에 놓는 일반 텍스트 파일로, 크롤러가 어떤 경로를 가져가도 되는지 알려줍니다. 아래에 도메인을 입력하면 실제로 파일을 가져와 접근 가능한지, 그리고 사이트맵 위치를 크롤러에게 알려주고 있는지까지 확인해 드립니다.

13%가 robots.txt 없음

분석한 웹사이트 959개 기준

공개 데이터베이스의 전체 사이트를 대상으로 집계했습니다.

왜 중요한가

robots.txt가 없는 것보다, 잘못 있는 게 훨씬 위험합니다

파일이 아예 없으면 크롤러는 '전부 허용'으로 간주하고 그냥 지나갑니다. 진짜 사고는 파일이 있는데 엉뚱한 걸 막고 있을 때 납니다. 개발 서버에서 쓰던 `Disallow: /`가 그대로 배포되면 사이트 전체가 색인에서 빠지고, 이건 트래픽이 하루아침에 증발하는 가장 흔한 원인 중 하나입니다. 그래서 '있느냐'보다 '뭐라고 쓰여 있느냐'가 중요합니다.

크롤러가 사이트맵을 찾는 자리입니다

robots.txt의 `Sitemap:` 한 줄은 구글·빙·네이버·얀덱스 등 주요 크롤러가 아무것도 제출하지 않아도 확인하는 유일한 위치입니다. 백링크가 없는 신규 도메인에서는 내부 페이지가 발견되는 사실상 유일한 경로인 경우가 많습니다.

고치는 방법

  1. 1. 반드시 최상단에 둡니다

    `https://yoursite.com/robots.txt` 정확히 그 위치에서 응답해야 합니다. `/public/robots.txt`나 `/assets/robots.txt`는 무시됩니다. 서브도메인은 각각 따로 필요합니다 — `blog.yoursite.com/robots.txt`는 루트 도메인의 파일과 완전히 별개입니다.

  2. 2. 안전한 기본형에서 시작하세요

    대부분의 사이트는 이게 파일 전체입니다. 첫 줄 `User-agent: *`, 둘째 줄 `Allow: /`, 한 줄 띄우고 `Sitemap: https://yoursite.com/sitemap.xml`. `Disallow:`는 정말 가져가면 안 되는 경로에만 추가하세요 — 관리자 페이지, 장바구니·결제 URL, 내부 검색 결과 정도입니다.

  3. 3. 검색결과에서 숨기는 용도로 쓰면 안 됩니다

    Disallow는 *크롤링*을 막을 뿐 *색인*을 막지 않습니다. 외부 링크가 걸린 차단 URL은 설명문 없이 검색결과에 그대로 노출될 수 있습니다. 검색에서 빼고 싶다면 크롤러가 페이지를 가져가도록 허용한 뒤 `<meta name="robots" content="noindex">`를 넣어야 합니다. robots.txt로 막아버리면 그 noindex를 아예 못 읽습니다.

  4. 4. 배포 후 직접 확인하세요

    시크릿 창에서 주소를 열어보세요. 404, 홈으로 리다이렉트, HTML 오류 페이지 — 전부 고장난 겁니다. 그다음 위 검사를 다시 돌려 사이트맵 줄이 잡히는지 확인하면 됩니다.

설명 말고, 그냥 고쳐드릴까요?

시간당 청구나 월 리테이너 없이 고정가로 작업합니다. 착수 전에 금액을 먼저 확정해 드립니다.

고정가 보기 →

자주 묻는 질문

robots.txt는 꼭 있어야 하나요?
아닙니다. 없어도 정상적으로 크롤링됩니다 — 크롤러는 404를 '전부 허용'으로 해석합니다. 가져가지 않았으면 하는 경로가 생겼거나, 사이트맵 위치를 알리고 싶을 때부터 필요해집니다.
서버에 파일이 있는데 왜 404가 뜨나요?
대부분 도메인 최상단에서 서빙되지 않아서입니다. 정적 사이트 프레임워크는 파일을 특정 폴더(`public/`, `static/`, `www/`)에 둬야 `/robots.txt`로 나가고, 일부 호스팅은 그 경로를 가로채기도 합니다. 디스크에 파일이 있다는 것만 믿지 말고 URL을 직접 열어보세요.
robots.txt로 막으면 구글에서 사라지나요?
아닙니다. 가장 흔한 오해입니다. 차단은 크롤링을 막기 때문에 구글이 페이지 내용을 못 읽을 뿐, 다른 페이지가 링크를 걸고 있으면 URL 자체는 검색결과에 남을 수 있습니다. 크롤링은 허용하고 noindex 메타 태그를 쓰는 게 맞습니다.
AI 크롤러도 여기서 막을 수 있나요?
네. GPTBot, ClaudeBot, PerplexityBot, CCBot, Google-Extended 모두 robots.txt의 user-agent 규칙을 따릅니다. 다만 이건 보안 장치가 아니라 정책 표시입니다 — 규칙을 지키기로 한 크롤러만 멈춥니다.

이 검사를 통과하지 못한 실제 사이트

저희 데이터베이스에서 실시간으로 가져옵니다 — 각 사이트의 전체 리포트로 연결됩니다.

전체 디렉터리 둘러보기 →

다른 검사 도구

robots.txt 확인 — 내 사이트 robots.txt 검사기 · E:LAB STUDIO