크롤 예산 원리부터 잡아야 서치콘솔 Crawl Stats가 읽힌다

매주 꾸준히 발행하는데 Crawl Stats 수치가 요지부동인 경우가 있습니다. 발행 편수를 늘리면 구글이 더 자주 찾아올 거라 기대하는데, 막상 숫자는 그대로거든요. 구글 공식 문서를 보면 이 전제가 틀릴 수 있어요. 원리를 먼저 잡아야 Crawl Stats 숫자가 비로소 다르게 읽힙니다.
크롤 예산은 두 개의 천장이 있다
구글의 공식 crawl budget 가이드(2026년 7월 기준)는 크롤 예산을 두 가지 요소의 조합으로 정의합니다. 이 두 원리를 먼저 이해하면 Crawl Stats의 어떤 수치가 어느 쪽 문제인지 바로 보입니다.
크롤 용량 한도(Crawl Capacity Limit) — Googlebot이 내 서버에 과부하를 주지 않으면서 처리할 수 있는 물리적 한도입니다. 서버가 빠르고 안정적일수록 높아지고, 응답 시간이 늘거나 5xx 오류가 반복될수록 내려갑니다. Crawl Stats에서 일별 크롤 수가 특정 날 급락했다면 서버 이벤트부터 의심해야 하는 이유가 여기에 있습니다.
크롤 수요(Crawl Demand) — 구글이 이 사이트를 얼마나 자주 다시 확인하고 싶어하는지의 문제입니다. 사이트 규모·업데이트 빈도·페이지 품질·콘텐츠 고유성·URL 재고 규모가 영향을 줍니다. 크롤 수가 정체되어 있다면 용량 한도가 아니라 수요 쪽의 문제일 가능성이 큽니다.
발행 편수는 이 두 요소 중 어느 쪽에도 직접 포함되지 않습니다. 구글 문서가 크롤 예산을 늘리는 방법으로 명시하는 건 서버 자원 추가와 콘텐츠 품질 향상, 두 가지뿐입니다.
발행을 늘리면 오히려 역효과가 나는 경우
발행 편수와 크롤 빈도의 관계는 단순하지 않습니다. 글 수를 빠르게 늘리면서 품질 낮은 페이지나 삭제한 URL, noindex 처리한 페이지가 함께 쌓이면 Googlebot이 그것들을 처리하느라 새 글을 발견하는 속도가 오히려 느려질 수 있습니다.
이게 왜 그런지는 URL 재고(perceived inventory) 원리로 설명됩니다. 구글 문서는 URL 재고를 크롤 수요의 주요 변수로 꼽는데, 실질 정보가 얕은 URL이 많을수록 구글이 사이트 전체의 품질 신호를 낮게 봅니다. 얇은 글이 쌓이면 새 글이 발견되는 속도도 함께 느려진다는 의미입니다.
결국 발행 빈도보다 이 낭비를 먼저 진단하는 게 크롤 효율 개선에 실질적으로 더 빠른 경로인 경우가 많습니다.
Crawl Stats에서 두 천장 중 어느 쪽인지 판별하는 법
서치콘솔의 속성 설정(Settings) > 크롤링 통계(Crawl stats)로 들어가면 Crawl Stats 보고서가 나옵니다. 앞서 정리한 두 원리를 기준으로 보면 수치가 달리 읽힙니다.
일별 크롤 수 추세 — 최근 4주와 그 이전 4주를 비교합니다. 특정 날짜에 급락이 있다면 용량 한도(서버 오류·robots.txt 변경) 쪽을 먼저 봅니다. 발행 편수는 그대로인데 크롤 수가 점진적으로 늘었다면 내부 링크 구조나 사이트맵이 수요를 끌어올리고 있다는 신호입니다.
응답 코드 분포 — 이 수치는 용량 한도에 직접 영향을 주는 낭비 요인을 드러냅니다. 2xx 비율이 압도적으로 높아야 정상이고, 나머지 코드대가 눈에 띄면 구체적 원인으로 들어갑니다.
| 상태코드 | 의미 | 조치 포인트 |
|---|---|---|
| 3xx | 리다이렉트 | 체인이 길어질수록 크롤 비용 상승. 구글 문서에 부정적 영향 명시 |
| 4xx | 404·410 오류 | 4xx 자체는 크롤 예산을 낭비하지 않음(구글 공식). 다만 내부 링크·사이트맵에 죽은 링크가 남으면 불필요한 크롤 요청이 늘 수 있으므로 정리 권장 |
| 5xx | 서버 오류 | 반복 발생 시 크롤 용량 한도 자체가 내려감 — 가장 빠르게 영향 줌 |
'발견됨 - 현재 색인이 생성되지 않음' 교차 확인 — Crawl Stats 화면이 아니라 같은 서치콘솔의 페이지 색인 생성 보고서에서 확인합니다. Googlebot이 URL을 알고 있지만 아직 크롤을 보내지 않은 상태로, 이 숫자가 두 자릿수 이상이라면 크롤 수요가 부족하거나 낭비 URL들이 대역폭을 선점하고 있다는 의미입니다. 발행보다 먼저 볼 게 생긴 겁니다.
noindex와 robots.txt, 원리가 다르면 효과도 다르다
낭비를 줄이는 쪽에서 가장 많이 오해하는 지점이 있습니다. noindex와 robots.txt는 결과가 비슷해 보여도 작동 원리가 반대입니다.
robots.txt로 차단한 URL은 Googlebot이 크롤조차 하지 않습니다. 반면 noindex 태그는 Googlebot이 크롤을 해야만 그 지시를 확인할 수 있습니다. 구글 문서도 이 점을 명시합니다 — noindex는 크롤은 소비하고 색인은 막습니다. 카테고리·태그·페이지네이션 URL을 대량으로 noindex 처리한 블로그라면 응답 코드 분포에서 200 응답은 많은데 색인 수는 훨씬 적은 패턴이 나타날 수 있습니다.
삭제한 글의 4xx URL도 같은 원리로 봐야 합니다. Googlebot은 404 응답을 받으면 재크롤 빈도를 급격히 줄이지만, 내부 링크나 사이트맵에 해당 URL이 남아 있으면 계속 시도될 수 있습니다. 사이트맵과 내부 링크에서도 해당 URL을 제거해야 빠르게 정리됩니다.
크롤 자체를 원하지 않는 URL이라면 noindex보다 robots.txt 차단이 크롤 효율에 낫습니다. 이 원리를 알고 나면 앞으로 새 URL을 어떻게 처리할지 스스로 판단할 수 있습니다.
내 블로그에 크롤 예산이 병목인지 판단하는 기준
블로그 규모가 수백 편 수준이면 크롤 예산이 실질 병목이 되는 경우는 많지 않습니다. 구글 문서 자체도 이 가이드의 주 대상은 수만 URL 이상의 대규모 사이트라고 밝히고 있거든요. 다만 아래 신호 중 하나라도 해당된다면 발행보다 크롤 효율을 먼저 살펴볼 의미가 있습니다.
- 새 글을 발행했는데 서치콘솔 URL 검사에서 "발견됨 - 현재 색인이 생성되지 않음" 상태가 수 주 이상 지속된다
- 일별 크롤 수가 최근 발행 편수보다 적거나 정체돼 있다
- 응답 코드 분포에서 4xx나 3xx가 전체의 10%를 넘는다
이 세 가지에 해당 없다면 현재 크롤 상태는 무난합니다. 그 경우엔 발행 빈도나 크롤 수치보다 개별 글의 품질과 내부 링크 구조에 집중하는 게 검색 노출 향상에 더 직접적으로 작용합니다.
Crawl Stats는 숫자 자체보다 어느 천장이 문제인지를 가리키는 지표입니다. 두 원리를 알고 나면 보고서가 전혀 다른 도구로 보입니다.
참고자료
이 글이 도움이 됐나요?
여러분의 반응이 다음 글의 방향이 돼요


