robots.txt 확인
robots.txt는 도메인 최상단(yoursite.com/robots.txt)에 놓는 일반 텍스트 파일로, 크롤러가 어떤 경로를 가져가도 되는지 알려줍니다. 아래에 도메인을 입력하면 실제로 파일을 가져와 접근 가능한지, 그리고 사이트맵 위치를 크롤러에게 알려주고 있는지까지 확인해 드립니다.
분석한 웹사이트 959개 기준
공개 데이터베이스의 전체 사이트를 대상으로 집계했습니다.
왜 중요한가
robots.txt가 없는 것보다, 잘못 있는 게 훨씬 위험합니다
파일이 아예 없으면 크롤러는 '전부 허용'으로 간주하고 그냥 지나갑니다. 진짜 사고는 파일이 있는데 엉뚱한 걸 막고 있을 때 납니다. 개발 서버에서 쓰던 `Disallow: /`가 그대로 배포되면 사이트 전체가 색인에서 빠지고, 이건 트래픽이 하루아침에 증발하는 가장 흔한 원인 중 하나입니다. 그래서 '있느냐'보다 '뭐라고 쓰여 있느냐'가 중요합니다.
크롤러가 사이트맵을 찾는 자리입니다
robots.txt의 `Sitemap:` 한 줄은 구글·빙·네이버·얀덱스 등 주요 크롤러가 아무것도 제출하지 않아도 확인하는 유일한 위치입니다. 백링크가 없는 신규 도메인에서는 내부 페이지가 발견되는 사실상 유일한 경로인 경우가 많습니다.
고치는 방법
1. 반드시 최상단에 둡니다
`https://yoursite.com/robots.txt` 정확히 그 위치에서 응답해야 합니다. `/public/robots.txt`나 `/assets/robots.txt`는 무시됩니다. 서브도메인은 각각 따로 필요합니다 — `blog.yoursite.com/robots.txt`는 루트 도메인의 파일과 완전히 별개입니다.
2. 안전한 기본형에서 시작하세요
대부분의 사이트는 이게 파일 전체입니다. 첫 줄 `User-agent: *`, 둘째 줄 `Allow: /`, 한 줄 띄우고 `Sitemap: https://yoursite.com/sitemap.xml`. `Disallow:`는 정말 가져가면 안 되는 경로에만 추가하세요 — 관리자 페이지, 장바구니·결제 URL, 내부 검색 결과 정도입니다.
3. 검색결과에서 숨기는 용도로 쓰면 안 됩니다
Disallow는 *크롤링*을 막을 뿐 *색인*을 막지 않습니다. 외부 링크가 걸린 차단 URL은 설명문 없이 검색결과에 그대로 노출될 수 있습니다. 검색에서 빼고 싶다면 크롤러가 페이지를 가져가도록 허용한 뒤 `<meta name="robots" content="noindex">`를 넣어야 합니다. robots.txt로 막아버리면 그 noindex를 아예 못 읽습니다.
4. 배포 후 직접 확인하세요
시크릿 창에서 주소를 열어보세요. 404, 홈으로 리다이렉트, HTML 오류 페이지 — 전부 고장난 겁니다. 그다음 위 검사를 다시 돌려 사이트맵 줄이 잡히는지 확인하면 됩니다.
설명 말고, 그냥 고쳐드릴까요?
시간당 청구나 월 리테이너 없이 고정가로 작업합니다. 착수 전에 금액을 먼저 확정해 드립니다.
고정가 보기 →자주 묻는 질문
- robots.txt는 꼭 있어야 하나요?
- 아닙니다. 없어도 정상적으로 크롤링됩니다 — 크롤러는 404를 '전부 허용'으로 해석합니다. 가져가지 않았으면 하는 경로가 생겼거나, 사이트맵 위치를 알리고 싶을 때부터 필요해집니다.
- 서버에 파일이 있는데 왜 404가 뜨나요?
- 대부분 도메인 최상단에서 서빙되지 않아서입니다. 정적 사이트 프레임워크는 파일을 특정 폴더(`public/`, `static/`, `www/`)에 둬야 `/robots.txt`로 나가고, 일부 호스팅은 그 경로를 가로채기도 합니다. 디스크에 파일이 있다는 것만 믿지 말고 URL을 직접 열어보세요.
- robots.txt로 막으면 구글에서 사라지나요?
- 아닙니다. 가장 흔한 오해입니다. 차단은 크롤링을 막기 때문에 구글이 페이지 내용을 못 읽을 뿐, 다른 페이지가 링크를 걸고 있으면 URL 자체는 검색결과에 남을 수 있습니다. 크롤링은 허용하고 noindex 메타 태그를 쓰는 게 맞습니다.
- AI 크롤러도 여기서 막을 수 있나요?
- 네. GPTBot, ClaudeBot, PerplexityBot, CCBot, Google-Extended 모두 robots.txt의 user-agent 규칙을 따릅니다. 다만 이건 보안 장치가 아니라 정책 표시입니다 — 규칙을 지키기로 한 크롤러만 멈춥니다.
이 검사를 통과하지 못한 실제 사이트
저희 데이터베이스에서 실시간으로 가져옵니다 — 각 사이트의 전체 리포트로 연결됩니다.
- weather.govNational Weather ServiceD 41SEO 37AI 35Schema 0
- eurekalert.orgF 27SEO 11AI 1Schema 0
bell-labs.comNokia Bell Labs | Nokia.comC 68SEO 80AI 45Schema 30- istockphoto.comiStockD 45SEO 40AI 12Schema 0
indiana.eduIndiana University Bloomington | Academics, research, and impactD 54SEO 77AI 45Schema 0- lua.orgThe Programming Language LuaF 33SEO 30AI 23Schema 0
accor.comAccor GroupC 59SEO 72AI 45Schema 0
hetzner.comGünstige Dedicated Server, Cloud & Hosting aus DeutschlandD 50SEO 50AI 45Schema 0