▤ 핵심 요약
- ✓ robots.txt로 특정 크롤러의 접근을 거부하는 의사를 밝힐 수 있습니다.
- ✓ 다만 이는 규칙을 지키는 크롤러에게만 효과가 있는 협약에 가깝습니다.
- ✓ 검색 노출은 유지하면서 학습만 막고 싶다면, 크롤러 이름을 구분해서 설정해야 합니다.
제어할 수 있는 방법
- robots.txt — 크롤러 이름별로 접근을 허용하거나 거부하는 규칙을 적어 둡니다. 각 회사가 공개한 크롤러 이름을 확인해 지정합니다.
- 메타 태그 — 페이지 단위로 색인이나 수집에 대한 지시를 남길 수 있습니다.
- 서버 차단 — 특정 접근을 서버에서 직접 막는 방법도 있지만, 잘못 설정하면 정상적인 검색 노출까지 함께 막힐 수 있습니다.
먼저 정해야 할 것
검색 크롤러와 AI 학습용 크롤러는 이름이 다른 경우가 많습니다. 둘을 구분하지 않고 한꺼번에 막으면 검색 유입까지 사라질 수 있으므로, 무엇을 남기고 무엇을 막을지부터 정해야 합니다.
AI 검색 결과에 내 글이 출처로 인용되는 것은 유입으로 이어질 수 있고, 학습 데이터로 쓰이는 것은 그렇지 않습니다. 이 둘에 대한 판단이 사이트마다 다를 수 있어, 일률적인 정답은 없습니다.
한계
- robots.txt는 강제력이 있는 기술적 차단이 아니라 규칙을 따르겠다는 크롤러에게만 통합니다.
- 이미 수집된 내용을 되돌리는 수단은 아닙니다.
- 크롤러 이름과 정책은 서비스마다 다르고 바뀌기도 하므로, 설정 전에 각 회사의 공식 문서를 확인하세요.