HR-Managerin kalkuliert Recruiting-Kosten im Excel-Dashboard

抓取:当谷歌抓取一个网页时意味着什么

如果在搜索控制台或SEO工具中看到“已抓取”这一术语,其含义很简单:谷歌的爬虫访问了该页面并读取了其源代码。如果没有这一步,无论页面内容多么出色,无论在设计和文案上投入了多少心血,任何页面对搜索引擎来说都将处于“隐形”状态。 任何研究技术SEO基础知识的人,几乎都不可避免地会遇到这个术语,在日常使用Google Search Console时也是如此。

网页是如何被爬取的

Googlebot 会沿着链接从一个 URL 跳转到下一个,并在过程中下载每个页面的完整源代码。仅此访问过程就被称为“抓取”,无论后续如何处理收集到的数据。 此外,该爬虫还会记录上次访问该页面的时间,并据此安排下次访问,通常会参考该URL以往的更新频率。

警告:即使网页内容无可挑剔且技术运行正常,但如果 robots.txt 规则设置错误或遗漏了 noindex 标签,也会导致无法被爬虫抓取。

页面被访问的频率取决于所谓的“抓取预算”。定期更新且内部链接丰富的页面会得到优先处理,而被忽视的子页面则较少被抓取,因此其更新内容会延迟显示。 特别是在拥有数千个子页面的大型网站中,该预算在很大程度上决定了哪些区域会被及时访问,而哪些区域仅会被偶尔访问。

  • 机器人会跟随内部和外部链接
  • 源代码已完全加载
  • Robots.txt 可以阻止访问
  • 抓取预算决定了访问频率

被爬取并不等于被收录

“抓取”和“索引”常被混为一谈,但它们是同一过程中两个独立的步骤。 一个网页可能已被访问,但随后并未出现在搜索结果中,原因可能包括内容贫乏、内容重复,或者源代码中存在相互矛盾的指令,这些都会向爬虫发出信号,使其选择忽略该页面。

Search Console会针对每个 URL 分别显示其是否已被抓取但尚未被收录,并且通常还会直接给出原因。定期查看该报告的人,能够比仅通过观察排名更早地发现问题,因为排名下滑通常会有明显的延迟才会显现出来。

  • 爬行总是第一步
  • 索引将在随后进行
  • 内容贫乏会阻碍索引过程
  • 每个URL都显示其自身的状态

About the Author Chefredaktion
Stephan M. Czaja

Unternehmer, Nerd und Coder mit Liebe für Marketing, Ads, Creatives und Kampagnen. Schreibe, seit ich denken kann — über alles, was zählt.