서치콘솔 URL 검사 상태 메시지 해독과 색인 안 됐을 때 판단 순서

글을 발행하고 나서 서치콘솔 URL 검사 도구를 열면 꼭 이런 상황이 생겨요. "URL이 Google에 등록되어 있음"이 뜨면 잠깐 안도했다가, 그 아래에 "크롤링됨 – 현재 색인이 생성되지 않음" 같은 문구가 붙어 있으면 다시 불안해지는 거요.
이 메시지들, 솔직히 처음엔 뭘 뜻하는지 잘 안 와닿죠. "발견됨"이랑 "크롤링됨"이 뭐가 다른지, 어느 게 더 나쁜 상태인지, 고쳐야 하는 건지 기다려야 하는 건지 — 그 판단 자체가 막히는 거예요.
이 글에서는 URL 검사 도구의 상태 메시지들을 구글 크롤러가 실제로 무슨 일을 한 건지의 관점으로 해독하고, 거기서 어떤 판단으로 이어져야 하는지를 정리해봤어요. 구글 서치콘솔 공식 도움말에 근거한 내용이에요.
상태 메시지를 읽기 전에 알아야 할 것
URL 검사 도구가 보여주는 결과는 두 층으로 나뉘어요. 이걸 먼저 구분해두지 않으면 메시지를 잘못 읽을 수 있어요.
현재 색인 상태는 구글이 이 URL을 마지막으로 크롤링했을 때의 데이터를 기반으로 해요. 오늘 아침에 글을 수정해도 이 화면에 즉시 반영되지 않아요. 구글이 다시 방문하기 전까지는 그 시점의 스냅숏이에요.
라이브 URL 테스트는 지금 이 순간 구글봇이 직접 그 URL에 접근해서 무엇을 가져올 수 있는지를 실시간으로 확인해요. 화면 상단의 버튼을 눌러야 실행돼요.
이 두 결과가 다를 때가 있어요. 현재 색인 상태는 "등록되어 있음"인데 라이브 테스트에서는 접근 오류가 뜨는 경우요. 이때 어느 쪽을 믿어야 할까요. 라이브 테스트 결과예요. 지금 구글봇이 실제로 겪는 환경을 보여주는 거니까요. 현재 색인 상태가 "등록됨"이어도 라이브에서 오류가 난다면, 다음 크롤링 사이클에서 색인이 빠질 수 있어요.
"발견됨"과 "크롤링됨"이 실제로 의미하는 것
두 메시지는 겉으로 비슷해 보이는데, 구글 파이프라인에서 완전히 다른 단계를 가리켜요.
발견됨 – 현재 색인이 생성되지 않음
구글이 이 URL의 존재를 알고 있지만, 아직 방문한 적이 없는 상태예요. 사이트맵이나 다른 페이지의 링크로 주소만 파악한 거예요. "발견됨"이라는 단어 자체가 좌표 확보만 됐다는 뜻이에요 — 내용을 읽은 게 아니에요.
이 상태가 유지되는 이유는 대부분 크롤 예산(crawl budget) 때문이에요. 구글은 각 사이트에 할당하는 크롤링 리소스가 있고, 페이지 수가 많거나 서버 응답이 느리거나 사이트 권위가 낮으면 새 URL이 대기열 뒤로 밀려요. 글 내용의 품질 문제가 아닌 경우가 많아요. 대기 중인 상태라서, 기술적으로 막힌 게 없다면 시간이 지나면 크롤링으로 넘어가요.
크롤링됨 – 현재 색인이 생성되지 않음
구글봇이 이미 방문해서 내용을 읽었어요. 근데 색인에 넣지 않기로 했어요. 이 상태가 더 신경 써야 해요. 구글이 들여다보고 나서 "넣지 않겠다"고 판단한 거니까요.
구글은 그 이유를 공식적으로 명시하지 않아요. 다만 구글 Search Central 문서에 따르면 콘텐츠의 독창성이나 유용성이 기준에 못 미친다고 판단하거나, 같은 사이트 안에서 유사한 페이지가 이미 색인됐을 때 상대적으로 밀리는 경우가 있다고 해요.
핵심 차이는 이렇게 정리돼요. "발견됨"은 문도 안 열어본 것이고, "크롤링됨"은 열어보고 나서 넣지 않기로 한 거예요. 대기의 문제냐, 판단의 문제냐가 달라요.
"크롤링됨"일 때 마지막 방문 날짜가 중요한 이유
같은 "크롤링됨 – 현재 색인이 생성되지 않음" 상태라도 URL 검사 결과의 "마지막 크롤링" 날짜를 보면 판단이 달라져요.
최근 며칠 안에 크롤링됐는데 색인이 없으면, 구글이 방문했지만 아직 색인 처리가 완료되지 않은 전환 구간일 수 있어요. 며칠 더 지켜봐야 해요.
반면 마지막 크롤링이 2~3주 이상 됐는데 색인이 없으면, 구글이 방문했고 색인하지 않기로 결론 낸 상태가 유지되고 있는 거예요. 이 시점에서 색인 요청을 반복해봐야 효과가 없을 가능성이 높아요. 콘텐츠 자체를 먼저 돌아봐야 해요.
기술적으로 막혀 있는 경우들, 용어 해독
기술 설정 때문에 구글이 접근조차 못 하거나 색인을 차단하도록 설정된 경우예요. 이쪽이 원인이면 콘텐츠를 아무리 잘 써도 색인이 될 수 없어요.
Robots.txt로 차단됨
사이트의 robots.txt 파일에 Googlebot 접근을 막는 규칙이 들어있다는 뜻이에요. 이 상태는 사실 색인 문제라기보다 크롤링 차단이에요. 구글이 파일 내용을 읽는 단계까지 아예 못 가니까요. 의도적으로 막은 거라면 그대로 두면 되고, 실수로 막혔다면 robots.txt를 수정해야 해요.
noindex 태그
페이지 HTML에 <meta name="robots" content="noindex"> 태그가 있거나, HTTP 응답 헤더에 noindex 지시어가 있다는 거예요. robots.txt와 다르게, 이건 크롤링은 허용하되 색인만 막는 지시예요. 구글이 페이지에 방문하고 내용을 읽은 뒤에 이 태그를 보면 색인을 하지 않아요. 워드프레스나 일부 CMS에서 임시저장·검색 결과 페이지·특정 카테고리에 자동으로 붙는 경우가 있어요.
적절한 표준 태그가 포함된 대체 페이지
이 페이지가 다른 URL의 중복 버전으로 취급됐다는 거예요. <link rel="canonical" href="..."> 태그가 다른 URL을 가리키고 있어서, 구글이 그쪽을 대표 URL로 선택한 거예요. "표준 태그가 포함된 대체 페이지"라는 문구는 번역이 어색해서 처음엔 뭔 말인지 모르기 쉬운데, 요약하면 "너는 복사본이고 대표는 저기야"라는 뜻이에요. UTM 파라미터가 붙은 URL이 의도치 않게 대표로 취급받는 경우처럼 예상 밖의 상황이 생기기도 해요.
색인이 안 됐을 때 판단 순서
상태 메시지를 읽었으면 이 순서로 확인하면 돼요. 무작정 색인 요청 버튼부터 누르는 건 별로 소용없어요.
robots.txt 차단 여부부터
URL 검사 결과 화면의 "페이지 색인 생성" 섹션을 펼치면 "크롤링 허용 여부" 항목이 나와요. 차단됨이 뜨면 robots.txt가 원인이에요. 이걸 먼저 확인해야 해요. 이 차단이 있는 한 아래 항목을 다 확인해봐야 의미가 없어요.
페이지 가져오기가 성공했는지
구글봇이 요청했을 때 404나 500 같은 오류 코드를 받지 않았는지예요. "가져오기 성공"이나 "마지막 크롤링" 날짜가 표시되면 기술 접근은 된 거예요. 마지막 크롤링 날짜가 비어있으면 아직 크롤링 자체가 안 된 거예요.
noindex가 붙어있는지
"색인 생성 허용 여부" 항목을 확인해요. noindex 태그가 검출됐다고 나오면 이게 원인이에요. CMS에서 자동으로 붙는 경우가 있으니 설정을 꼼꼼히 봐야 해요.
구글이 선택한 대표 URL이 내가 의도한 URL인지
"Google 선택 표준" 항목에서 검사한 URL과 다른 주소가 표시되면, 구글이 이 페이지를 중복으로 판단하고 다른 URL을 대표로 선택한 거예요. canonical 태그가 내 의도와 일치하는지 확인해야 해요.
위가 다 정상인데도 "크롤링됨"이 유지된다면
기술 문제가 없는데 이 상태가 2~3주 이상 이어진다면, 콘텐츠 판단의 문제일 가능성이 높아요. 같은 사이트 안에 비슷한 내용을 다룬 페이지가 여러 개 있진 않은지, 글이 충분히 유용한지를 돌아볼 필요가 있어요. 색인 요청보다 글을 보완하는 게 먼저예요.
상태 메시지를 읽을 줄 알면 요청 타이밍이 달라진다
기술 문제를 수정했다면, 그때 색인 생성 요청을 해요. 구글 서치콘솔 공식 도움말에 따르면 색인 생성 요청은 속도를 보장하지 않아요. 요청 후 처리까지 며칠에서 몇 주가 걸릴 수 있다고 나와요.
"발견됨" 상태가 오래 유지된다면 크롤 예산 문제일 가능성이 높아서, 수동 요청 후 1~2주 지켜보는 게 현실적이에요. "크롤링됨"이 오래 유지된다면 반대로, 요청 전에 콘텐츠를 먼저 보완해야 해요. 구글이 다시 방문해도 같은 판단을 반복할 수 있으니까요.
상태 메시지가 뭘 뜻하는지 정확히 읽어야 다음 행동이 결정돼요. 메시지마다 구글이 어느 단계에서 멈췄는지를 알려주고 있거든요. 그걸 읽지 않고 요청만 반복하면 기다리는 시간만 길어져요.
이 글이 도움이 됐나요?
여러분의 반응이 다음 글의 방향이 돼요


