진단이 아닌 상태부터 시작하세요
페이지 색인 보고서에는 실제 기술 문제와 예상된 제외 상태가 모두 포함됩니다. robots.txt 규칙, noindex 지시문, 인증 요구 사항 또는 응답 오류는 색인을 막을 수 있습니다. 반면 중복 및 canonical 상태는 의도대로 동작하는 것일 수 있고, 발견된 URL은 아직 크롤링되지 않았을 수도 있습니다.
가장 오해를 불러일으키는 상태는 '크롤링됨 - 현재 색인이 생성되지 않음'입니다. 이는 Google이 페이지를 가져왔지만 당시 색인에 추가하지 않았음을 확인합니다. Google은 페이지가 나중에 색인화될 수도 있고 그렇지 않을 수도 있으며 이 상태 때문에 페이지를 다시 제출할 필요가 없다고 명시적으로 말합니다.
정말로 오류인 상태들
이들은 저장을 막은 당신 쪽의 무언가를 가리킵니다. 구글은 각 상태의 출처를, 직접 고칠 수 있으면 웹사이트로, 원인이 저들 쪽이면 구글로 표시합니다. 밑에 깔린 응답을 바로잡는 것이 해결의 전부입니다.
| 상태 | 뜻 | 출처 |
|---|---|---|
| 서버 오류(5xx) | 서버가 500번대 오류를 반환함 | 구글 |
| 리디렉션 오류 | 리디렉션 사슬이 맴돌거나 실패함 | 웹사이트 |
| robots.txt에 의해 차단됨 | robots.txt가 가져오기 허가를 거둠 | 웹사이트 |
| ‘noindex’ 태그에 의해 제외됨 | 페이지가 noindex 지시문을 제공함 | 웹사이트 |
| 소프트 404 | 찾을 수 없다는 안내를 200 코드로 반환함 | 웹사이트 |
| 승인되지 않은 요청으로 차단됨(401) | 페이지가 자격 증명을 요구함 | 웹사이트 |
| 찾을 수 없음(404) | URL이 404를 반환함 | 웹사이트 |
| 액세스 금지로 차단됨(403) | 서버가 403을 반환함 | 웹사이트 |
| 기타 4xx 문제로 차단됨 | 그 밖의 4xx 응답 | 웹사이트 |
이 중 둘은 스스로 자초한 경우가 많아 특히 눈여겨볼 값어치가 있습니다. 소프트 404는 「여기엔 아무것도 없습니다」라는 친절한 페이지를 200 상태로 돌려주고 있다는 뜻입니다. 검색엔진에는 부재가 아니라 성공적으로 가져온 빈약한 페이지로 보이니, 404나 410으로 사실을 말하세요. 그리고 공개하려던 페이지에 401이나 403이 뜬다면 대개 스테이징 규칙이나 방화벽이 운영 환경까지 따라온 것입니다.
오류처럼 보이지만 오류가 아닌 상태들
헛일을 가장 많이 만들어 내는 쪽이 이들입니다. 하나같이 구글이 스스로 내린 결정을 보고하는 것이지, 당신이 집어넣은 결함이 아닙니다. 이들을 쫓는 일은 진짜 문제에 필요한 주의를 갉아먹습니다.
| 상태 | 실제 의미 |
|---|---|
| 적절한 표준 태그가 있는 대체 페이지 | 통합이 의도한 그대로 작동하는 중 |
| 사용자가 선택한 표준 페이지가 없는 중복 페이지 | 표준을 선언하지 않아 구글이 골랐음 |
| 중복, 구글이 사용자와 다른 페이지를 표준으로 선택함 | 선언은 했으나 구글이 동의하지 않음 |
| 리디렉션이 포함된 페이지 | 비표준 URL이 설계대로 리디렉션 중 |
| 검색됨 – 현재 색인이 생성되지 않음 | 알고는 있으나 아직 가져오지 않음 |
| 크롤링됨 – 현재 색인이 생성되지 않음 | 가져와서 평가한 뒤 옆으로 치움 |
두 중복 상태는 갈라 볼 값어치가 있습니다. 「사용자가 선택한 표준 페이지가 없는」은 표준을 한 번도 선언하지 않아 구글이 대신 골랐다는 뜻입니다. 대개 무해하지만, 직접 내릴 수 있던 결정을 넘겨준 셈입니다. 「구글이 사용자와 다른 페이지를 선택함」은 선언했는데 뒤집혔다는 뜻이고, 이는 당신이 지목한 페이지를 검색엔진은 주된 것으로 보지 않는다는 신호입니다.
「크롤링됨 – 색인 생성되지 않음」을 정직하게 읽기
이 상태는 Google이 페이지를 크롤링했지만 당시 페이지의 색인을 생성하지 않았음을 의미합니다. 이는 하나의 보편적인 원인을 식별하지 못하며 실시간 URL 검사 테스트는 인덱싱 성공을 확실하게 예측할 수 없습니다. 보고서에 명시되지 않은 기술적 오류를 만들어내는 것은 가치가 없습니다.
템플릿 기반 사이트에서는 유사·중복 정도, canonical 신호, 내부 링크, 각 페이지가 비슷한 페이지에는 없는 정보를 추가하는지 살펴보는 것이 유용합니다. 이는 진단 항목이지, 이 상태의 모든 URL이 품질 임계값을 통과하지 못했다는 뜻은 아닙니다.
- URL 검사 도구를 열어 페이지가 200을 반환하는지, 자기 참조 표준인지, 본문이 렌더링되는지 확인한다.
- 가장 가까운 형제 페이지 셋과 견줘 본다. 치환된 값을 맞바꿔 동등한 페이지가 나온다면 검색엔진에도 그렇게 보인다.
- 설명적인 앵커 텍스트로 내부에서 링크되는지, 아니면 사이트맵에만 존재하는지 확인한다.
- 이 페이지가 답하는 것 중 어느 형제도 답하지 않는 것이 무엇인지 묻는다. 답이 없다면 그것이 곧 소견이다.
- 그 답이 존재하도록 페이지를 바꾼 다음 색인을 요청한다 — 그 순서로.
「검색됨 – 색인 생성되지 않음」은 다른 신호
이것은 URL은 알려졌지만 아직 가져오지 않았다는 뜻입니다. 작은 사이트라면 대개 잠깐 스쳐 가는 상태입니다. 규모가 크면 이것이야말로 구글이 짚는, 진짜 크롤링 예산 제약의 가장 또렷한 증상입니다. URL은 너무 많고 수요는 적어 대기열이 그들에게 닿지 않는 것입니다.
URL의 큰 몫이 여기 머물러 있다면, 생산적인 일은 페이지를 하나씩 다시 제출하는 것이 아니라 검색엔진에게 살펴 달라고 내미는 저가치 URL의 수를 줄이는 것입니다. 중복을 합치고, 사라진 것에는 제대로 된 404를 돌려주고, 리디렉션 사슬을 짧게 하는 일 말입니다.
증상이 아니라 보고서를 처리하기
보고서는 원인별로 묶여 있어 위에서부터 건수 순으로 처리하고 싶어집니다. 참으세요. 「리디렉션이 포함된 페이지」의 천 건은 대개 잘 굴러가는 리디렉션 설계이고, 「소프트 404」의 마흔 건은 실제 페이지를 건드리는 진짜 결함입니다.
- 먼저 오류 표에 있는 것을 전부 고친다 — 모호하지 않고 기계적이다.
- 정보성 상태는 옆으로 둔다. 다만 건수가 의도와 어긋날 때, 이를테면 설계한 적 없는 표준 통합이 보일 때는 예외다.
- 「크롤링됨 – 색인 생성되지 않음」은 기술 과제가 아니라 편집 과제로 다룬다.
- 재검증은 밑에 깔린 응답이나 내용이 실제로 바뀐 뒤에만 한다.