لوگوی درسان وب

خزنده گوگل چیست؟ نحوه کار از خواندن تا ایندکس صفحات

خزنده گوگل یا Googlebot چیست و چگونه صفحات سایت را پیدا می کند؟ در این راهنما با Crawling، Indexing، انواع ربات های گوگل، robots.txt، Sitemap و روش بررسی ورود Googlebot آشنا می شوید.

یونس مرادی یونس مرادی 9 دقیقه مطالعه 286 پسند 2 دیدگاه
خزنده گوگل چیست؟ نحوه کار از خواندن تا ایندکس صفحات

وقتی امروز یک مقاله جدید منتشر می کنید، گوگل همان لحظه از وجود آن خبر ندارد. ابتدا باید URL را کشف کند، سپس Googlebot به آن مراجعه کند و محتوا را دریافت کند، بعد سیستم های گوگل آن را پردازش کنند و در صورت مناسب بودن، امکان ورود صفحه به ایندکس فراهم شود.

این مقاله دقیقا همین سفر را از لحظه انتشار یک صفحه تا زمانی که ممکن است در Google Search ظاهر شود، توضیح می دهد. با خواندن این راهنما یاد می گیرید خزنده گوگل چیست، Googlebot چگونه کار می کند، و چرا گاهی صفحه شما Crawl می شود ولی Index نمی شود.

خزنده یا Crawler چیست؟

در دنیای وب، اصطلاحات Crawler، Bot و Spider تقریبا به یک معنا استفاده می شوند: نرم افزارهای خودکاری که صفحات وب را پیدا و دریافت می کنند.

طبق مستندات رسمی گوگل، کراولر یا خزنده رباتی است که به صورت خودکار وب سایت شما را پیدا خواهد کرد  و در نهایت آن را بررسی می کند. گوگل چندین نوع خزنده یا کراولر دارد .

یک مثال ساده از نحوه حرکت خزنده:

 صفحه A → لینک → صفحه B → لینک → صفحه C 

ربات گوگل وارد صفحه A می شود، لینک صفحه B را پیدا می کند و در ادامه ممکن است صفحه C را نیز کشف کند.

Googlebot چیست؟

گوگل بات خزنده اصلی نتایج جستجو گوگل است. اما نکته مهم این است که ربات گوگل را با کل سیستم گوگل یکی نکنیم.

Googlebot صفحه را Crawl می کند؛ اما Crawl شدن یک صفحه به این معنی نیست که حتما Index شود یا رتبه بگیرد.

گوگل نیز Googlebot را به عنوان خزنده ای معرفی می کند که برای یافتن اطلاعات مورد نیاز Search و محصولات وابسته استفاده می شود. این ربات صفحات وب را کشف می کند، محتوای آن ها را دریافت می کند و سپس سیستم های گوگل درباره نحوه استفاده از آن محتوا تصمیم می گیرند.

گوگل چگونه یک صفحه اینترنتی را پیدا می کند؟

فرآیند پیدا کردن و نمایش یک صفحه در گوگل از چند مرحله تشکیل شده است:

Discovery → Crawling → Processing/Rendering → Indexing → Serving/Ranking

مرحله اول؛ کشف URL

گوگل می تواند صفحه را از طریق موارد زیر پیدا کند:

  • لینک های داخلی
  • لینک سایت های دیگر
  • Sitemap
  • URLهایی که قبلا می شناخته

مرحله دوم؛ Crawling

Googlebot درخواست HTTP برای URL ارسال می کند و اطلاعات صفحه را دریافت می کند.

مرحله سوم؛ پردازش و Rendering

HTML، لینک ها، منابع و در صورت نیاز محتوای تولیدشده توسط JavaScript پردازش می شوند.

مرحله چهارم؛ Indexing

اینجاست که گوگل تصمیم می گیرد محتوا را در سیستم ایندکس خود پردازش و نگهداری کند یا نه.

مرحله پنجم؛ نمایش و رتبه بندی

تنها بعد از آن است که صفحه امکان حضور در نتایج جستجو برای Queryهای مرتبط را پیدا می کند.

تفاوت Crawl، Index و Ranking چیست؟

مرحله معنی
Discovery گوگل URL را پیدا می کند
Crawling Googlebot به URL مراجعه و اطلاعات آن را دریافت می کند
Indexing گوگل صفحه و محتوای آن را پردازش می کند
Ranking سیستم های گوگل مشخص می کنند صفحه برای یک جستجو در چه جایگاهی نمایش داده شود

Crawl شدن ≠ Index شدن ≠ رتبه گرفتن

Googlebot چگونه از صفحه ای به صفحه دیگر می رسد؟

ربات گوگل عمدتاً از طریق لینک ها از صفحه ای به صفحه دیگر می رود. ساختار لینک سازی داخلی نقش کلیدی در کشف صفحات دارد.

مثال:

 صفحه اصلی ↓ دسته بندی سئو ↓ آموزش سئو ↓ خزنده گوگل 

اگر یک صفحه هیچ لینک داخلی نداشته باشد، کشف آن می تواند دشوارتر شود. به این صفحات، صفحات یتیم می گویند.


نقشه سایت چه کمکی به خزنده گوگل می کند؟

نقشه سایت به گوگل در کشف آدرس های جدید از سایت شما کمک می کند، اما پیدا کردن نقشه سایت و بررسی آن توسط خزنده گوگل تضمینی برای ایندکس شدن و به نمایش در آمدن اون صفحه در نتایج جستجو گوگل نیست.

نباید تصور کرد: «اگر صفحات ما در بخش نقشه سایت قرار گرفته گوگل حتما صفحات را ایندکس می کند.» این درست نیست. نقشه سایت یا Sitemap فقط مسیر را نشان می دهد، اما تصمیم نهایی برای ایندکس شدن و به نمایش در آمدن آن صفحه برای مخاطبان با الگوریتم های گوگل است.

robots.txt چیست و چه ارتباطی با ربات گوگل دارد؟

robots.txt فایلی است که به خزنده های موتور جستجو می گوید کدام مسیرها را خزش کند یا کدام صفحات را خزش نکند.

مثال ساده:

 User-agent: Googlebot Disallow: /private/ 

این دستور می گوید ربات گوگل مسیر /private/ را کراول نکند. گوگل می گوید خزنده های عمومی آن در Crawl خودکار قواعد robots.txt را رعایت می کنند.

robots.txt با noindex یکی نیست.

حتی ممکن است URLای که با robots.txt بلاک شده، از طریق لینک های دیگر شناخته شود و URL آن بدون محتوای صفحه در نتایج دیده شود. خود گوگل صراحتا به این نکته اشاره می کند.

گوگل چه خزنده هایی دارد؟

طبق مستندات جدید گوگل، کلاینت های خزنده گوگل اساساً در سه گروه قرار می گیرند:

  • Common Crawlers: خزنده های عمومی مثل Googlebot که برای Search و محصولات مختلف استفاده می شوند.
  • Special-case Crawlers: برای محصولات یا شرایط خاص، مانند برخی crawlerهای تبلیغاتی.
  • User-triggered Fetchers: زمانی که یک کاربر در یک محصول گوگل باعث Fetch شدن یک URL می شود.

معروف ترین خزنده های گوگل:

خزنده کاربرد
Googlebot جستجوی عمومی گوگل
Googlebot-Image تصاویر
Googlebot-Video ویدیو
Googlebot-News Google News
Storebot-Google Google Shopping

گوگل برای این crawlerها User-agentهای جداگانه نیز مستند کرده است.

Googlebot Smartphone و Desktop چه هستند؟

Googlebot می تواند با User-Agent موبایل یا دسکتاپ درخواست ارسال کند. اما آن ها را دو موتور جستجوی مستقل معرفی نکنیم؛ هر دو شکل هایی از Googlebot هستند.

نمونه User Agent:

 Googlebot/2.1 

User-Agent چیست؟

User-Agent بخشی از درخواست HTTP است که مشخص می کند درخواست از طرف چه نرم افزاری ارسال شده است. وقتی Googlebot به سایت شما مراجعه می کند، چیزی شبیه به این همراه درخواست است:

 Googlebot/2.1 

فقط اینکه یک درخواست نام Googlebot داشته باشد ثابت نمی کند واقعا متعلق به گوگل است.

User-Agent قابل جعل است. گوگل برای تایید crawler واقعی توصیه می کند IP و Reverse DNS نیز بررسی شود و برای crawlerهایش IP range رسمی منتشر می کند.

Crawl Budget چیست؟

گوگل منابع نامحدود برای Crawl هر URL در هر لحظه ندارد. به این محدودیت، Crawl Budget می گویند.

برای سایت های خیلی بزرگ مثلا:

  • فروشگاه با ۵۰۰ هزار URL
  • فیلترهای متعدد
  • صفحات پارامتردار
  • URLهای تکراری

موضوع Crawl Budget جدی تر می شود. برای یک سایت ۳۰ صفحه ای لازم نیست صاحب سایت وسواس Crawl Budget داشته باشد.

چه چیزهایی باعث هدر رفت Crawl می شوند؟

  • URLهای فیلتر بی نهایت
  • پارامترهای غیرضروری
  • صفحات Duplicate
  • Redirect chain
  • صفحات 404 زیاد
  • تقویم های بی نهایت
  • Faceted Navigation بد
  • ساختار لینک داخلی ضعیف

سرعت سرور چه تاثیری روی خزنده گوگل دارد؟

گوگل می گوید تلاش می کند تا حد امکان سایت را Crawl کند بدون اینکه سرور را تحت فشار قرار دهد. بنابراین توان پاسخگویی سرور می تواند روی نحوه Crawl شدن سایت اثر بگذارد.

مواردی مثل:

  • TTFB بالا
  • Timeout
  • خطای 5xx
  • محدودیت شدید Firewall
  • Rate Limit نامناسب

می توانند دردسر ایجاد کنند.

آیا Googlebot تصاویر و ویدیوها را هم می بیند؟

بله، گوگل برای Images و Video خزنده های مشخصی دارد:

  • Googlebot-Image
  • Googlebot-Video

حتی می توان قواعد مربوط به آن ها را جداگانه در robots.txt تنظیم کرد.

چگونه بفهمیم Googlebot وارد سایت شده است؟

سه روش اصلی:

  1. Google Search Console: بخش URL Inspection، Page Indexing و Crawl Stats
  2. Server Logs: بررسی درخواست هایی با Googlebot User-Agent
  3. تایید IP/DNS: برای اطمینان از اینکه Googlebot جعلی نیست

چرا گوگل صفحه من را Crawl نمی کند؟

سناریوهای رایج:

  • robots.txt مانع شده
  • لینک داخلی ندارد
  • صفحه تازه ساخته شده
  • Sitemap مشکل دارد
  • URL خطای 404/5xx می دهد
  • Redirect اشتباه است
  • Server کند یا غیرقابل دسترس است
  • ساختار سایت خیلی عمیق است
  • URLهای بسیار زیادی تولید شده اند

چرا صفحه Crawl شده ولی Index نشده است؟

Crawl شدن تضمین Index شدن نیست. دلایل احتمالی:

  • Duplicate content
  • Canonical
  • محتوای کم ارزش
  • Soft 404
  • صفحات بسیار مشابه
  • noindex

در مورد Canonical، گوگل ممکن است چند صفحه مشابه را یک گروه در نظر بگیرد و یک URL را به عنوان نسخه Canonical انتخاب کند؛ نسخه های تکراری نیز معمولا کمتر Crawl می شوند.

هر چند وقت یک بار Googlebot به سایت سر می زند؟

زمان ثابتی وجود ندارد. میزان مراجعه با توجه به سایت، URL، تغییرات، اهمیت و شرایط Crawl متفاوت است.

آیا انتشار روزانه محتوا باعث می شود Googlebot هر روز سایت را Crawl کند؟

پاسخ: الزاما نه.

چگونه سایت را برای Crawl بهتر بهینه کنیم؟

چک لیست اجرایی:

  • ساختار لینک داخلی منطقی
  • Sitemap سالم
  • robots.txt صحیح
  • Canonical صحیح
  • رفع لینک شکسته
  • کاهش URLهای بی ارزش
  • سرور سریع و پایدار
  • استفاده صحیح از Status Code
  • کنترل JavaScript
  • بررسی Search Console
  • بررسی Server Log

جمع بندی

در این مقاله بررسی کردیم که خزنده گوگل چیست، Googlebot چگونه کار می کند و چه مراحلی از کشف URL تا Crawl، Rendering، Indexing و Ranking طی می شود. یاد گرفتیم که Crawl شدن به معنای Index شدن نیست و عوامل متعددی مثل robots.txt، Sitemap، ساختار لینک داخلی، سرعت سرور و Crawl Budget بر نحوه خزیدن گوگل تاثیر می گذارند.

اگر می خواهید سایت شما بهتر Crawl و Index شود، از چک لیست انتهای مقاله استفاده کنید و به طور منظم Search Console و Server Logها را بررسی کنید. به یاد داشته باشید که سئو تکنیکال پایه دیده شدن در گوگل و حتی پاسخ های هوش مصنوعی است.

پرسش‌های پرتکرار

سؤالات متداول این مقاله

آیا Googlebot همان موتور جستجوی گوگل است؟ +
خیر؛ Googlebot یکی از اجزای زیرساخت جمع آوری اطلاعات است.
آیا Crawl شدن یعنی صفحه در گوگل نمایش داده می شود؟ +
خیر.
آیا Sitemap باعث Index شدن صفحه می شود؟ +
تضمین نمی کند.
آیا robots.txt صفحه را از نتایج گوگل حذف می کند؟ +
الزاما خیر.
آیا می توان Googlebot را مسدود کرد؟ +
بله، ولی باید دقیقا بدانید چه پیامدی دارد.
آیا Googlebot واقعی IP مشخص دارد؟ +
گوگل Rangeهای رسمی IP منتشر می کند و روش Reverse DNS برای Verification نیز دارد.
یونس مرادی
نویسنده مقاله

یونس مرادی

متخصص سئو و طراحی سایت

سلام من یونس مرادی بنیانگذار درسان وب در این بخش مقالات تخصصی در حوزه سئو و طراحی سایت را که با دقت فراوان و با استفاده از منابع معتبر جمع آوری شده است را میتوانید مطالعه نمایید. در صورت داشتن هر گونه سوال و نقطه نظر خوشحال میشم زیر پست ها نظرات خودتون برام ارسال کنید.

همه مقالات
گفت‌وگو درباره مقاله

دیدگاه‌ها 2

نظر خود را بنویسید یا به دیدگاه‌های دیگران پاسخ دهید. نوشته‌ها پس از بررسی مدیر منتشر می‌شوند.

ایمیل شما منتشر نمی‌شود. ارسال‌های تکراری، خودکار یا دارای لینک‌های مشکوک فیلتر خواهند شد.

Ym dp

نذاانذانذاذناذناذنانذاذناذنانذ

شیشی

این پاسخ هست به یونس

پیشنهاد مطالعه

مقالات مرتبط

چگونه سایت را سئو کنیم؟ آموزش سئو سایت از صفر تا گرفتن ورودی از گوگل

اگر یک سایت داری و نمی دونی از کجا باید شروع کنی، این راهنما دقیقا برای توئه. از فردا صبح چه کارهایی روی سایتت انجام بدی تا گوگل بهت ورودی بده؟ بسیاری از مقالات سئو با این جمله شروع می شوند: «SEO مخفف Search Engine Opti...

5.0 1 رأی 0 دیدگاه 14 دقیقه مطالعه
نویسنده مقاله یونس مرادی