Chuyển đến nội dung chính
← Tất cả hướng dẫn

Công cụ tìm kiếm hoạt động ra sao

Giữa một trang đã xuất bản và một kết quả tìm kiếm có ba giai đoạn. Phần lớn vấn đề SEO thuộc đúng một giai đoạn, và gọi đúng tên nó giúp bạn khỏi sửa nhầm chỗ.

Bốn giai đoạn, và vì sao phải phân biệt

Công cụ tìm kiếm thực hiện bốn giai đoạn riêng biệt với một trang, và một giai đoạn có thể thành công trong khi giai đoạn tiếp theo thất bại. Khám phá làm cho URL được biết đến. Thu thập dữ liệu lấy trang về. Lập chỉ mục quyết định có lưu trang hay không. Xếp hạng quyết định, với từng truy vấn, có hiển thị trang hay không. Các tính năng AI của Google là một phần của Tìm kiếm và vẫn dựa trên cùng nền tảng về thu thập dữ liệu, lập chỉ mục và điều kiện hiển thị, ngay cả khi việc truy xuất mở rộng sang các tìm kiếm liên quan.

Gần như mọi câu hỏi mở đầu bằng «vì sao trang của tôi không xuất hiện» thực chất là câu hỏi nó dừng ở giai đoạn nào. Câu trả lời thay đổi hoàn toàn việc bạn làm tiếp theo, và các giai đoạn hỏng theo những cách nhìn từ ngoài trông giống hệt nhau: một trang vắng mặt trông y như nhau trong kết quả, dù nó chưa từng được khám phá, bị chặn lúc tải, bị đánh giá không đáng lưu, hay đã lưu rồi mà đơn giản là bị vượt qua.

Giai đoạnĐiều xảy raCách nó hỏng
Khám pháĐịa chỉ được biết tới, qua liên kết hoặc sơ đồ trangKhông gì trỏ tới trang và không sơ đồ nào liệt kê nó
Thu thậpĐịa chỉ được tải và kết xuất như trên trình duyệtrobots.txt từ chối quyền, hoặc máy chủ trả về lỗi
Lập chỉ mụcCông cụ quyết định có lưu trang hay khôngNội dung bị coi là trùng lặp, mỏng, hoặc không đáng lưu
Xếp hạngTrang đã lưu được chấm điểm theo ý định truy vấnTrang đã lưu nhưng tồn tại câu trả lời tốt hơn

Khám phá: một địa chỉ được biết tới ra sao

Google cho biết đại đa số trang mới họ tìm thấy mỗi ngày đến từ liên kết. Trình thu thập đang tải một trang của bạn sẽ rút các địa chỉ trong mã của trang đó rồi xếp vào hàng đợi. Điều này khiến liên kết nội bộ trở thành cơ chế khám phá chính của mọi website, chứ không phải một việc tối ưu thêm vào sau.

Sơ đồ trang là con đường thứ hai. Nó có trọng lượng nhất ở nơi liên kết yếu nhất: website rất lớn, website mới tinh với ít liên kết trỏ về, và website nặng phương tiện không có văn bản neo tự nhiên. Google nói rõ rằng liệt kê một địa chỉ không bảo đảm việc thu thập lẫn lập chỉ mục — đó là gợi ý đưa ra để cân nhắc, không phải hàng đợi sẽ được xử lý.

Hệ quả thực tế là một trang không được gì trỏ tới sẽ dựa vào cơ chế yếu hơn trong hai cơ chế. Một mục trong sơ đồ trang không mang ngữ cảnh: nó nói rằng một địa chỉ tồn tại, nhưng không nói gì về việc trang ấy dùng để làm gì hay liên hệ ra sao với phần còn lại. Một liên kết mang cả hai, qua vị trí đặt và qua văn bản neo.

Thu thập: quyền, năng lực và nhu cầu

Việc thu thập bị giới hạn bởi hai thứ mà Google gọi tên riêng rẽ. Giới hạn năng lực thu thập là số kết nối đồng thời nó mở mà không gây quá tải máy chủ của bạn; nó tự điều chỉnh theo thời gian phản hồi và tỷ lệ lỗi của bạn. Nhu cầu thu thập là mức nó thực sự muốn tải, chi phối bởi quy mô website, tần suất cập nhật và đánh giá của nó về chất lượng.

Chính hướng dẫn của Google nói rằng phần lớn website không cần nghĩ tới điều này. Ngân sách thu thập chỉ thành vấn đề thật ở trên khoảng một triệu trang cập nhật hằng tuần, trên mười nghìn trang thay đổi hằng ngày, hoặc ở bất kỳ website nào có tỷ lệ lớn địa chỉ mắc kẹt ở «Đã phát hiện – hiện chưa lập chỉ mục». Dưới ngưỡng đó, thu thập chậm gần như luôn là triệu chứng của chuyện khác.

Ở nơi nó thực sự áp dụng, các đòn bẩy đều không hào nhoáng: gộp bản trùng, trả về 404 hoặc 410 thật cho những gì đã gỡ vĩnh viễn thay vì soft 404, rút ngắn chuỗi chuyển hướng, cải thiện thời gian phản hồi máy chủ, và hỗ trợ yêu cầu có điều kiện để đáp rẻ cho những trang không đổi. Hãy để ý thứ vắng mặt trong danh sách đó: noindex không phải công cụ ngân sách thu thập, bởi trình thu thập phải tải trang mới đọc được chỉ thị.

Kết xuất: giai đoạn người ta quên

Giữa việc tải và việc lập chỉ mục là kết xuất. Công cụ chạy trang gần như cách một trình duyệt sẽ chạy, rồi lập chỉ mục những gì kết quả kết xuất chứa. Nội dung chỉ hiện ra sau khi JavaScript chạy vì thế vẫn có thể vào chỉ mục — nhưng điều đó phụ thuộc vào việc chạy ấy thành công và vào việc các tài nguyên nó cần có thu thập được hay không.

Đây là chỗ một quy tắc trong robots.txt gây thiệt hại xa nơi nó được viết. Chặn một đường dẫn script hay API khiến trình thu thập không tải được đúng những tệp mà trang dùng để dựng nội dung. HTML tải về ổn thỏa, kết xuất gần như rỗng, và vào chỉ mục gần như rỗng. Không trạng thái nào sẽ nói «bị chặn» — bản thân trang chưa từng bị chặn.

Lập chỉ mục là một phán xét, không phải hàng đợi

Cách đọc sai phổ biến nhất về cả chuỗi này là coi việc lập chỉ mục như xếp hàng: được thu thập, chờ tới lượt, được lập chỉ mục. Không phải vậy. Sau khi kết xuất, công cụ quyết định trang có đáng lưu hay không, và quyết định đó có thể là không.

Đó chính là điều Search Console muốn nói với «Đã thu thập dữ liệu – hiện chưa lập chỉ mục». Không có gì hỏng, không gì chặn, việc tải đã thành công. Trang được đánh giá rồi gạt sang bên. Những trang gần như giống hệt sinh ra từ một mẫu — chỉ khác nhau ở một cái tên hay một con số được thay — là lý do thường gặp, và gửi lại chẳng thay đổi gì, bởi dữ liệu đầu vào của quyết định ấy không đổi.

Xếp hạng và các tính năng AI của Google có chung nền tảng

Với một truy vấn nhất định, Google Tìm kiếm truy xuất và xếp hạng nội dung có liên quan. AI Overviews và AI Mode cũng có thể dùng query fan-out, thực hiện nhiều tìm kiếm liên quan trên các chủ đề phụ và nguồn dữ liệu trước khi tạo câu trả lời kèm liên kết hỗ trợ.

Hậu quả rất đơn giản: khả năng hiển thị trong các tính năng Tìm kiếm AI của Google vẫn phụ thuộc vào khả năng đủ điều kiện của Tìm kiếm thông thường. Google cho biết không có yêu cầu kỹ thuật bổ sung hoặc đánh dấu AI đặc biệt; phải cho phép thu thập thông tin, nội dung quan trọng phải có thể lập chỉ mục và có sẵn ở dạng văn bản, đồng thời các điều khiển xem trước như nosnippet có thể hạn chế những gì xuất hiện trong các tính năng AI.

Thử trên chính website của bạn

Câu hỏi và trả lời

Chặn một trang trong robots.txt có gỡ nó khỏi Google không?

Không. robots.txt chặn việc tải, không chặn việc lập chỉ mục. Một địa chỉ bị chặn nhưng được nơi khác trỏ tới vẫn có thể vào chỉ mục và hiển thị không kèm mô tả, vì trình thu thập chưa bao giờ được phép đọc chỉ thị noindex lẽ ra đã loại nó. Muốn giữ một trang ngoài kết quả, hãy cho phép thu thập rồi trả về noindex, hoặc yêu cầu xác thực.

Việc lập chỉ mục nên mất bao lâu?

Không có khung thời gian bảo đảm. Một trang mới có thể vào chỉ mục trong vài giờ hoặc nằm đó hàng tuần, và Google nói thẳng rằng được thu thập không hứa hẹn được đưa vào. Nếu một trang nằm hàng tuần chưa vào chỉ mục trong khi các trang tương đương cùng website vào rất nhanh, hãy coi đó là phán xét về trang chứ không phải sự chậm trễ.

Tôi có phải lo về ngân sách thu thập không?

Gần như chắc chắn là không. Ngưỡng của Google vào khoảng một triệu trang cập nhật hằng tuần, hoặc mười nghìn trang thay đổi hằng ngày. Dưới mức đó, những trang xuất hiện chậm thường hỏng ở khâu lập chỉ mục chứ không phải đang chờ năng lực thu thập.

Nội dung bằng JavaScript có được lập chỉ mục không?

Có, vì công cụ kết xuất trang trước khi lập chỉ mục. Rủi ro không nằm ở bản thân JavaScript mà ở các phụ thuộc của nó: nếu robots.txt chặn những script hay endpoint mà trang cần, trang sẽ kết xuất rỗng và vào chỉ mục rỗng, mà không trạng thái nào gọi tên nguyên nhân.