# Crawl Budget چیست؟ روشهای بهینهسازی بودجه خزش سایت
در این راهنمای هشت پا یاد میگیرید بودجه خزش سایت را با مدیریت URLها، Sitemap، robots.txt، Canonical و عملکرد سرور بهینه کنید.
Crawl Budget یا بودجه خزش یعنی مقدار URLهایی که گوگل میتونه و میخواد از سایتت Crawl کنه. این موضوع برای سایتهای کوچک معمولاً دغدغه اصلی نیست، اما برای سایتهای بزرگ، فروشگاههای اینترنتی، سایتهای محتوایی حجیم، مارکتپلیسها و سایتهایی که URLهای فیلتر، تگ، آرشیو و صفحات تکراری زیاد دارن، میتونه روی کشف و بهروزرسانی صفحات مهم اثر بذاره. هشت پا این راهنما رو برای تیمهای سئو و مدیر سایتهایی نوشته که با مشکلهایی مثل «Discovered – currently not indexed»، ایندکس نشدن صفحات مهم، Crawl زیاد روی URLهای بیارزش یا کندی کشف محتوای جدید روبهرو هستن. خلاصهاش اینه: بهینهسازی Crawl Budget یعنی کاری کنی گوگل زمان و منابع خزش را کمتر روی URLهای بیارزش هدر بده و راحتتر به صفحات مهم، تازه و قابل ایندکس سایت برسه.
Crawl Budget چیست؟
Crawl Budget یعنی مجموعه URLهایی که گوگل هم توان خزش آنها را دارد، هم برای خزششان تقاضا میبیند. این بودجه از دو بخش اصلی ساخته میشود: Crawl Capacity Limit، یعنی گوگل چقدر میتواند بدون فشار به سرور سایتت Crawl کند؛ و Crawl Demand، یعنی گوگل چقدر برای خزش URLهای سایتت انگیزه دارد.
گوگل در راهنمای رسمی Crawl Budget میگه بودجه خزش از ترکیب ظرفیت خزش و تقاضای خزش ساخته میشه، و حتی اگر ظرفیت خزش پر نشده باشد، وقتی تقاضا پایین باشد، Googlebot کمتر سایت را Crawl میکند. همین نکته خیلی مهمه؛ چون Crawl Budget فقط مسئله سرور نیست، مسئله کیفیت، تازگی، محبوبیت و ارزش URLها هم هست. (Google for Developers)
اگر خیلی ساده بگم، بودجه خزش شبیه زمان یک بازرس نیست که بینهایت وقت داشته باشد و بگوید «خب بذار همه URLهای این سایت را یکییکی بخوانم». گوگل باید بین میلیاردها URL در وب تصمیم بگیرد کجا برود، چند بار برگردد و کدام URLها ارزش Crawl دوباره دارند. پس اگر سایتت پر از URLهای تکراری، فیلترهای بیارزش و صفحات کمکیفیت باشد، بخشی از توجه Googlebot را جایی خرج کردهای که خروجی سئویی ندارد.
نکته: Crawl شدن با Index شدن یکی نیست. گوگل ممکنه صفحهای را Crawl کند، اما بعد تصمیم بگیرد آن را وارد Index نکند. این دقیقاً همان جاییه که خیلیها گیج میشن و فکر میکنن «گوگل صفحه را دیده، پس باید رتبه بگیره». نه جانم، دیدن کافی نیست.
آیا همه سایتها باید نگران Crawl Budget باشند؟
نه، همه سایتها لازم نیست درگیر Crawl Budget شوند. اگر سایتت چندصد یا چند هزار URL تمیز دارد و صفحات جدیدت معمولاً سریع Crawl و Index میشوند، احتمالاً مشکل اصلی تو بودجه خزش نیست. اما اگر سایت بزرگ، بسیار پویا یا پر از URLهای تکراری و پارامتردار داری، Crawl Budget باید جدی بررسی شود.
گوگل خودش میگه این راهنما بیشتر برای سایتهای خیلی بزرگ و پرتغییر نوشته شده؛ مثلاً سایتهایی با بیش از ۱ میلیون URL منحصربهفرد که محتوایشان دستکم هفتگی تغییر میکند، یا سایتهای متوسط و بزرگ با بیش از ۱۰ هزار URL که محتوایشان روزانه تغییر زیادی دارد. گوگل تأکید میکند این عددها آستانه قطعی نیستند، فقط برای تشخیص تقریبیاند. (Google for Developers)
پس اینطوری نگاه کن:
|
نوع سایت |
نگرانی درباره Crawl Budget |
برداشت عملی |
|
سایت شرکتی با ۵۰ صفحه |
معمولاً پایین |
بیشتر روی محتوا، لینک داخلی و ایندکسپذیری کار کن |
|
بلاگ با چندصد مقاله |
پایین تا متوسط |
Sitemap، لینک داخلی و کیفیت محتوا مهمترند |
|
فروشگاه با چند ده هزار URL |
متوسط تا بالا |
فیلترها، محصولات ناموجود و پارامترها را کنترل کن |
|
مارکتپلیس یا سایت آگهی |
بالا |
مدیریت URL Inventory حیاتی است |
|
سایت خبری پرتغییر |
بالا |
سرعت Crawl صفحات تازه و ساختار خبر مهم است |
نکته: بعضی سئوکارها روی سایت ۸۰ صفحهای چنان درباره Crawl Budget حرف میزنن انگار دارن دیجیکالا را مدیریت میکنن. اول ببین اصلاً مسئله تو همینه یا نه. شاید مشکل صفحهات اینه که محتوای خوبی نداره، نه اینکه گوگل وقت نکرده Crawlش کنه.
Crawl Budget از چه چیزهایی تشکیل میشود؟

Crawl Budget از دو بخش اصلی ساخته میشه: ظرفیت خزش و تقاضای خزش. ظرفیت خزش بیشتر به سلامت سرور، سرعت پاسخگویی و تحمل سایت مربوطه. تقاضای خزش بیشتر به ارزش، تازگی، محبوبیت و کیفیت URLها مربوط میشه.
Crawl Capacity Limit
Crawl Capacity Limit یعنی گوگل چقدر میتونه سایتت رو Crawl کنه بدون اینکه سرورت اذیت بشه. اگر سرور کند جواب بده، خطای 5xx زیاد داشته باشی یا درخواستها را با 429 محدود کنی، گوگل معمولاً محتاطتر میشه و کمتر Crawl میکند. گوگل هم در مستنداتش میگه اگر پاسخ سایت پایدار باشد و زمان پاسخ بهتر شود، ظرفیت خزش میتونه بالا بره؛ اما اگر Latency زیاد شود، پاسخها کند شوند یا خطاهای 5xx و 429 دیده شود، این ظرفیت پایین میآید. (Google for Developers)
Crawl Demand
Crawl Demand یعنی گوگل چقدر میل دارد URLهای سایتت را Crawl کند. عواملی مثل اندازه سایت، دفعات تغییر محتوا، کیفیت صفحهها، محبوبیت URLها و تازگی محتوا روی این تقاضا اثر دارند. صفحهای که مرتب بهروزرسانی میشه، لینک داخلی خوبی دارد و ارزش محتوایی بالاست، معمولاً تقاضای خزش بیشتری میسازد.
مثال ساده: صفحه اصلی یک سایت خبری احتمالاً خیلی بیشتر از یک مقاله قدیمی بیترافیک Crawl میشه. چرا؟ چون تغییر میکند، مهم است، لینک میگیرد و گوگل انتظار دارد تازهتر بماند. اما یک صفحه تگ بیارزش با ۳ مقاله تکراری؟ گوگل چرا باید مدام وقتش را خرجش کند؟
Crawl Budget چه زمانی روی سئو اثر میگذارد؟
Crawl Budget وقتی روی سئو اثر جدی میگذارد که صفحات مهم سایت دیر Crawl شوند، تغییرات مهم دیر دیده شوند یا Googlebot بخش زیادی از زمانش را روی URLهای بیارزش مصرف کند. این وضعیت بیشتر در سایتهای بزرگ، فروشگاهها، سایتهای خبری، آگهی، املاک، گردشگری و مارکتپلیسها دیده میشه.
چند نشانه عملی:
- صفحات جدید دیر در Search Console دیده میشن.
- URLهای مهم در وضعیت Discovered – currently not indexed میمانند.
- Crawl Stats نشان میدهد Googlebot زیاد روی URLهای فیلتر، پارامتر یا صفحات کمارزش رفته.
- محصولات ناموجود یا صفحات حذفشده هنوز زیاد Crawl میشن.
- صفحات دستهبندی مهم دیر بهروزرسانی میشن.
- سایت خطای 5xx یا کندی سرور در زمان Crawl دارد.
- Sitemap پر از URLهای قدیمی، ریدایرکتشده یا نامعتبره.
- صفحات مهم لینک داخلی ضعیفی دارند و عمیق دفن شدهاند.
نکته: Crawl Budget بهخودیخود فاکتور رتبهبندی نیست. یعنی گوگل نمیگه «بودجه خزش این سایت خوبه، پس رتبهاش را بالا ببرم». اما اگر صفحات مهمت Crawl و Index نشوند یا دیر بهروزرسانی شوند، خب طبیعیه که روی رشد ارگانیکت اثر غیرمستقیم میگذاره.
[LINK: صفحه خدمات تکنیکال سئو و بررسی ایندکس سایت هشت پا]
تفاوت Crawl، Index و Rank چیست؟
دسترسی صحیح رباتها به صفحات تجاری برای سئو و تبلیغات گوگل ادز اهمیت دارد؛ لندینگهای مهم باید URL پایدار، پاسخ سرور سالم و مسیر داخلی مشخص داشته باشند.
Crawl یعنی گوگل صفحه را پیدا و دریافت کند. Index یعنی بعد از بررسی، تصمیم بگیرد صفحه را در فهرست قابل نمایش خودش نگه دارد. Rank یعنی همان صفحه برای یک Query مشخص در نتایج جستجو جایگاه بگیرد.
این سه مرحله را قاطی نکن:
|
مرحله |
معنی ساده |
مثال |
|
Crawl |
گوگل URL را میخواند |
Googlebot وارد صفحه محصول میشود |
|
Index |
گوگل صفحه را قابل ذخیره و نمایش تشخیص میدهد |
محصول وارد نتایج قابل نمایش میشود |
|
Rank |
صفحه برای جستجوی خاص رتبه میگیرد |
محصول برای «خرید کفش پیادهروی» جایگاه میگیرد |
گوگل در مستندات Crawl Budget اشاره میکند هر صفحهای که Crawl میشود الزاماً Index نمیشود؛ بعد از Crawl، صفحه باید ارزیابی و برای ایندکس مناسب تشخیص داده شود. (Google for Developers)
مثلاً اگر صفحهای Crawl شده اما Thin Content دارد، تکراری است، canonical به صفحه دیگری دارد یا ارزش کافی ندارد، ممکنه Index نشود. اینجا مشکل را نباید فقط با «بیشتر Crawl شدن» حل کنی. باید کیفیت و هدف صفحه را درست کنی.
از کجا بفهمیم مشکل Crawl Budget داریم؟
برای تشخیص مشکل Crawl Budget باید Search Console، Crawl Stats، Page Indexing، Sitemap و لاگ سرور را کنار هم ببینی. اگر فقط یک URL ایندکس نشده، سریع نگو مشکل بودجه خزش داریم. باید الگو ببینی، نه مورد پراکنده.
چند مسیر بررسی:
- Page Indexing Report را ببین
وضعیتهایی مثل Discovered – currently not indexed، Crawled – currently not indexed، Soft 404، Duplicate و Alternate page را بررسی کن. - Crawl Stats Report را بررسی کن
ببین Googlebot چند درخواست داشته، چه نوع پاسخهایی گرفته، زمان پاسخ سرور چقدر بوده و کدام فایلها بیشتر Crawl شدهاند. - Sitemap را چک کن
اگر Sitemap پر از URLهای ریدایرکت، 404، noindex یا canonical به URL دیگر باشد، داری سیگنال بد میدی. - URLهای Crawlشده را با URLهای مهم مقایسه کن
اگر Googlebot بیشتر سراغ فیلترها، تگها و پارامترها رفته و صفحات دستهبندی مهم کم Crawl شدن، مشکل جدیه. - لاگ سرور را تحلیل کن
برای سایتهای بزرگ، Log File Analysis خیلی کمک میکنه بفهمی Googlebot واقعاً کجا رفته، نه اینکه فقط حدس بزنی.
گوگل در راهنمای Crawl Stats میگه این گزارش برای سایتهایی با بیش از هزار صفحه کاربرد بیشتری دارد و برای سایتهای کوچکتر معمولاً اطلاعات موردنیاز در همان Index Coverage یا Page Indexing کافی است. (Google Support)
Crawl Stats در Search Console را چطور بخوانیم؟
برای ترکیب دادههای ارگانیک و کمپینها، راهنمای اتصال سرچ کنسول به گوگل ادز میتواند دید کاملتری از Queryها و صفحات مقصد بدهد.
Crawl Stats Report نشان میدهد Googlebot در بازههای زمانی مختلف چقدر سایت را Crawl کرده، چه وضعیتهایی دریافت کرده، سرعت پاسخ چطور بوده و کدام نوع فایلها بیشتر درخواست شدهاند. این گزارش برای تشخیص رفتار خزش خیلی مهمه، مخصوصاً وقتی سایت بزرگ یا پرتغییر داری.
به این بخشها توجه کن:
- Total crawl requests:
تعداد کل درخواستهای Googlebot را نشان میدهد. افزایشش همیشه خوب نیست؛ اگر روی URLهای بیارزش خرج شده باشد، حتی میتواند نشانه مشکل باشد. - Total download size:
حجم دانلود شده توسط Googlebot است. اگر ناگهان بالا برود، باید ببینی منابع سنگین، فایلهای غیرضروری یا مسیرهای بیارزش Crawl نشده باشند. - Average response time:
اگر زمان پاسخ بالا برود، ممکنه ظرفیت خزش پایینتر بیاد. اینجا باید سرور، کش و منابع صفحه بررسی شوند. - By response:
ببین چند درصد پاسخها 200، 301، 404، 5xx یا دیگر وضعیتها هستند. خطاهای سرور برای Crawl Health خطرناکاند. - By file type:
مشخص میکند HTML، CSS، JS، تصویر و فایلهای دیگر چقدر Crawl شدند. اگر منابع ضروری برای Render بلاک باشند، فهم صفحه هم مشکل پیدا میکند. - By Googlebot type:
نشان میدهد Googlebot Smartphone یا Desktop چقدر فعال بوده. برای موبایلفرست بودن وب، این بخش را جدی بگیر.
نمونه فرضی: اگر Crawl requests سایت در یک هفته ۴۰٪ بالا رفته، اما همزمان بخش زیادی از درخواستها روی URLهای فیلتر مثل ?sort=price یا ?color=black بوده، این رشد لزوماً خوب نیست. شاید Googlebot دارد در باتلاق URLهای پارامتردار میچرخه. اینجا باید Faceted Navigation، robots.txt، canonical و لینک داخلی را بررسی کنی.
URL Inventory چیست و چرا در Crawl Budget مهم است؟
URL Inventory یعنی مجموعه URLهایی که گوگل از سایتت میشناسه یا ممکنه بشناسه. هر چقدر این موجودی URL شلوغتر، تکراریتر و بیکیفیتتر باشد، مدیریت Crawl Budget سختتر میشه. در سایتهای بزرگ، مهمترین کار اینه که به گوگل بفهمونی کدام URLها مهماند و کدامها نباید وقت خزش بگیرند.
گوگل در راهنمای رسمی Crawl Budget میگه اگر Googlebot زمان زیادی را صرف URLهایی کند که نباید Crawl شوند، ممکنه نتونه بقیه سایت را خوب کشف کند یا بودجه خزش افزایش پیدا نکند. گوگل حتی مدیریت URL Inventory را یکی از مهمترین جاهایی میداند که صاحبان سایت میتوانند کنترل مثبتی روی بودجه خزش داشته باشند. (Google for Developers)
URLهای دردسرساز معمولاً اینها هستند:
- URLهای پارامتردار مثل فیلتر رنگ، سایز، قیمت و Sort
- صفحات Tag و Archive بیارزش
- صفحات جستجوی داخلی
- صفحات Pagination بیساختار
- محصولات ناموجود با الگوی تکراری
- URLهای ریدایرکتشده در لینک داخلی
- نسخههای http/https یا www/non-www
- صفحات دارای Canonical اشتباه
- صفحات Soft 404
- URLهای تستی یا قدیمی که هنوز لینک داخلی دارند
نکته: Crawl Budget را با زیاد کردن Crawl حل نمیکنی؛ اول باید موجودی URL را تمیز کنی. اگر انبارت پر از چیزهای دورریختنیه، مشکل با آوردن انباردار بیشتر حل نمیشه.
Sitemap چه نقشی در بهینهسازی Crawl Budget دارد؟

Sitemap به گوگل کمک میکند URLهای مهم سایت را بهتر کشف کند، اما فقط وقتی مفید است که تمیز، بهروز و محدود به URLهای قابل ایندکس باشد. Sitemap شلوغ و بیکیفیت میتواند سیگنالهای سایت را خرابتر کند، چون URLهایی را معرفی میکند که نباید اولویت داشته باشند.
یک Sitemap خوب باید این ویژگیها را داشته باشد:
- فقط URLهای 200 و قابل ایندکس داشته باشد.
- URLهای noindex داخلش نباشند.
- URLهای ریدایرکتشده داخلش نباشند.
- URLهایی که canonical به صفحه دیگری دارند، داخلش نیایند.
- صفحات مهم و تازه را پوشش بدهد.
- برای سایتهای بزرگ، بر اساس نوع صفحه تقسیم شود.
- lastmod واقعی و قابل اعتماد داشته باشد، نه اینکه هر روز همه URLها را الکی آپدیت کند.
گوگل در راهنمای Crawl Budget میگه Sitemap را بهروز نگه دارید و اگر سایت محتوای بهروزشونده دارد، از lastmod استفاده کنید. اما حواست باشه lastmod جعلی نزن. اگر همه صفحات را هر روز با تاریخ جدید بفرستی، داری به گوگل میگی «همهچیز مهمه»، و وقتی همهچیز مهم باشه، هیچچیز مهم نیست. (Google for Developers)
[LINK: مقاله آموزش ساخت و بهینهسازی Sitemap برای سایتهای بزرگ]
robots.txt در Crawl Budget چه کاربردی دارد؟
قبل از مسدودکردن مسیرها، ساختار و قواعد یک فایل Robots.txt بهینه را بررسی کنید تا صفحات مهم بهاشتباه از دسترس خزنده خارج نشوند.
robots.txt بهت اجازه میدهد جلوی Crawl شدن بعضی مسیرها را بگیری. برای Crawl Budget، این ابزار وقتی مفیده که بخوای Googlebot وارد مسیرهایی نشه که ارزش سئویی ندارن؛ مثل URLهای فیلتر بیارزش، صفحات Sort، جستجوی داخلی یا مسیرهای تکراری.
اما یک نکته خیلی مهم: robots.txt برای حذف صفحه از Index ساخته نشده. اگر URL قبلاً ایندکس شده باشد و بعد با robots.txt بلاکش کنی، گوگل ممکنه همچنان آن URL را در نتایج نگه دارد، چون اجازه ندارد دوباره صفحه را بخواند و وضعیت جدید را بفهمد.
گوگل در راهنمای Crawl Budget میگه برای URLهایی که نمیخواهید گوگل Crawl کند، robots.txt میتواند مفید باشد؛ اما نباید از noindex برای صرفهجویی در Crawl Budget استفاده کنی، چون گوگل باید صفحه را درخواست کند و بعد با دیدن noindex آن را کنار بگذارد؛ یعنی همچنان Crawl Time مصرف میشود. (Google for Developers)
مثال کاربردی:
- مسیر /search/ برای نتایج جستجوی داخلی معمولاً بهتره بلاک شود.
- مسیرهای ?sort= یا ?view= اگر نسخههای تکراری میسازند، باید کنترل شوند.
- صفحات فیلتر مهم که Search Demand دارند، شاید نباید بلاک شوند؛ باید صفحه اختصاصی، canonical یا ساختار ایندکس درست داشته باشند.
نکته: robots.txt چاقوی تیزه. اگر اشتباه بزنی، ممکنه صفحات مهم را از Crawl خارج کنی. قبل از اعمال، با ابزارهای تست و Search Console چک کن.
Canonical چطور به Crawl Budget کمک میکند؟
برای مشخصکردن نسخه اصلی URLهای مشابه، راهنمای تگ Canonical را بخوانید؛ Canonical نادرست میتواند سیگنال نسخه اصلی را مبهم کند.
Canonical به گوگل کمک میکند بین URLهای مشابه یا تکراری، نسخه ترجیحی را تشخیص دهد. این کار بیشتر برای تجمیع سیگنالها و جلوگیری از ایندکس نسخههای مشابه کاربرد دارد، اما از نظر Crawl Budget هم میتواند کمک کند چون URLهای تکراری را از نظر سیگنالدهی مرتبتر میکند.
ولی Canonical همیشه جلوی Crawl را نمیگیرد. گوگل ممکنه URLهای canonical شده را همچنان Crawl کند تا ببیند سیگنالها و محتوا تغییر نکردهاند. پس اگر هدف اصلیات جلوگیری از خزش مسیرهای کاملاً بیارزش است، فقط canonical کافی نیست.
مثال:
- محصولی که با چند پارامتر رنگ و سایز URLهای نزدیک میسازد، ممکنه نیاز به canonical به نسخه اصلی داشته باشد.
- صفحه فیلتر مهم مثل «کفش پیادهروی مردانه» اگر Search Demand دارد، شاید خودش باید صفحه قابل ایندکس باشد، نه canonical به دسته مادر.
- URLهای Sort مثل ?sort=price_asc معمولاً بهتره به نسخه اصلی canonical شوند یا از مسیر لینکدهی کنترل شوند.
نکته: Canonical برای مدیریت نسخههای مشابه خوبه، اما برای URLهایی که اصلاً نباید Crawl شوند، همیشه کافی نیست. اول نقش URL را مشخص کن، بعد ابزار درست را انتخاب کن.
خطاهای 404، 410 و Soft 404 چه اثری روی Crawl Budget دارند؟
URLهایی که حذف شدهاند اگر درست با 404 یا 410 پاسخ بدهند، معمولاً مشکل بزرگی نیستند. اما Soft 404ها و صفحات حذفشدهای که هنوز با وضعیت 200 باز میشوند، میتونن Crawl Budget را هدر بدهند و کیفیت سایت را پایین نشان دهند.
گوگل در راهنمای Crawl Budget میگه برای صفحات حذفشده دائمی، وضعیت 404 یا 410 سیگنال قویتری است که آن URL دوباره کمتر Crawl شود. همچنین Soft 404ها میتوانند همچنان Crawl شوند و بودجه را هدر بدهند. (Google for Developers)
مثالها:
- محصولی که دیگر هیچوقت برنمیگردد: 404 یا 410 منطقیتره.
- محصولی که موقتاً ناموجوده ولی دوباره برمیگرده: صفحه را نگه دار، اما وضعیت موجودی و پیشنهادهای جایگزین را واضح کن.
- صفحهای که خالی است ولی 200 میدهد: این میتواند Soft 404 شود و دردسر بسازد.
- صفحه دستهبندی بدون محصول: اگر همیشه خالی است، باید تصمیم بگیری حذف، noindex، ادغام یا اصلاح شود.
نکته: از 404 نترس. 404 درست برای URL واقعاً حذفشده فاجعه نیست. فاجعه اینه که ۱۰ هزار صفحه خالی با 200 داشته باشی و فکر کنی چون خطا نیست، پس خوبه.
Redirect Chain چه بلایی سر Crawl Budget میآورد؟
Redirect Chain یعنی یک URL به URL دوم، آن هم به URL سوم و شاید چهارم ریدایرکت شود. این زنجیره هم سرعت را پایین میآورد، هم Crawl را ناکارآمدتر میکند، هم تجربه افراد را بدتر میکند.
گوگل در راهنمای Crawl Budget صریحاً توصیه میکند از Redirect Chainهای طولانی دوری کنید، چون اثر منفی روی خزش دارند. (Google for Developers)
نمونه بد:
/old-page/ → /new-page-1/ → /new-page-2/ → /final-page/
نمونه بهتر:
/old-page/ → /final-page/
در سایتهای قدیمی، این مشکل خیلی رایجه. چند بار مهاجرت URL، تغییر ساختار دستهبندی، تغییر اسلاگ و ریدایرکتهای پشتسرهم باعث میشه Googlebot و آدمها مسیر طولانی طی کنن. اینجا باید ریدایرکتها را Audit کنی و تا حد ممکن به یک مرحله برسونی.
سرعت سایت و سرور چه ربطی به Crawl Budget دارد؟
بهبود عملکرد سرور برای صفحات ورودی کمپین هم حیاتی است؛ اصول مطرحشده در راهنمای لندینگ پیج به حفظ تجربه کاربر بعد از کلیک کمک میکند.
سرعت سایت و سلامت سرور روی Crawl Capacity اثر دارد. اگر سرور سریع و پایدار جواب بدهد، گوگل راحتتر میتواند URLهای بیشتری را Crawl کند. اگر پاسخها کند، ناپایدار یا همراه با خطای 5xx باشند، Googlebot محتاطتر میشود تا به سرورت فشار نیاورد.
چیزهایی که باید بررسی کنی:
- Time to First Byte یا TTFB
- خطاهای 5xx
- خطاهای 429
- کندی در ساعات خاص
- افزایش ناگهانی زمان پاسخ
- منابع JS و CSS سنگین
- کش سمت سرور
- CDN، مخصوصاً برای سایتهای بزرگ و بینالمللی
- وضعیت هاست در زمان Crawl زیاد
گوگل در مستندات Crawl Budget میگه اگر Googlebot بتواند صفحات را سریعتر Load و Render کند، ممکن است بتواند محتوای بیشتری را از سایت بخواند. همینجا میفهمیم سرعت فقط برای UX و Core Web Vitals نیست؛ برای کارایی خزش هم مهمه. (Google for Developers)
نکته: اگر سایتت موقع Crawl سنگین خطای 5xx میدهد، اول سرور و کش را درست کن. با مقاله جدید مشکل حل نمیشود. خانه آتیش گرفته، داری پرده عوض میکنی.
Faceted Navigation و فیلترها را چطور کنترل کنیم؟

Faceted Navigation یعنی ساختار فیلترهایی مثل رنگ، سایز، برند، قیمت، جنس، شهر یا امکانات. این قابلیت برای فروشگاهها و سایتهای آگهی عالیه، اما اگر کنترل نشود، میتواند هزاران یا میلیونها URL تکراری و کمارزش بسازد.
نمونه فرضی: یک فروشگاه کفش این فیلترها را دارد:
- برند: ۲۰ گزینه
- رنگ: ۱۲ گزینه
- سایز: ۱۵ گزینه
- قیمت: ۱۰ بازه
- جنس: ۶ گزینه
اگر ترکیب اینها URL مستقل بسازد و همه قابل Crawl باشند، خیلی سریع با هزاران URL روبهرو میشی که بیشترشان Search Demand مشخص ندارن. گوگل هم ممکنه وقت زیادی را روی ترکیبهایی مثل ?color=blue&size=42&sort=cheap بگذارد، در حالی که صفحه اصلی دستهبندی یا فیلترهای مهمتر باید اولویت داشته باشند.
روش کنترل:
- فیلترهای دارای Search Demand را به صفحه قابل ایندکس تبدیل کن.
- فیلترهای بیارزش را noindex یا canonical کن، بسته به سناریو.
- مسیرهای Sort و View را برای Crawl کنترل کن.
- لینک داخلی را فقط به صفحات فیلتر مهم بده.
- از تولید بینهایت URL ترکیبی جلوگیری کن.
- Sitemap را فقط با URLهای مهم پر کن.
نکته: همه فیلترها بد نیستند. «کفش سفید زنانه» ممکنه صفحه ارزشمند داشته باشد. اما «کفش سفید زنانه سایز ۳۸ مرتبشده بر اساس ارزانترین» احتمالاً صفحهای نیست که بخوای گوگل جدی بگیرد.
محصولات ناموجود و حذفشده را چطور مدیریت کنیم؟
محصولات ناموجود یکی از دردسرهای اصلی Crawl Budget در فروشگاههاست. اگر هزاران محصول ناموجود همچنان با وضعیت 200، لینک داخلی و Sitemap فعال باشند، Googlebot ممکنه وقت زیادی روی صفحاتی بگذارد که فروش نمیسازند.
تصمیم درست به وضعیت محصول بستگی دارد:
|
وضعیت محصول |
تصمیم بهتر |
دلیل |
|
موقتاً ناموجود و دوباره برمیگردد |
نگه داشتن صفحه با پیام موجودی و پیشنهاد جایگزین |
صفحه ارزش و تقاضا دارد |
|
برای همیشه حذف شده و جایگزین دارد |
301 به محصول یا دسته مرتبط |
حفظ مسیر و سیگنال |
|
برای همیشه حذف شده و جایگزین ندارد |
404 یا 410 |
سیگنال حذف دائمی |
|
محصول ناموجود اما ترافیک ارگانیک دارد |
بررسی جداگانه قبل از حذف |
شاید صفحه هنوز ارزش محتوایی یا مقایسهای دارد |
|
دستهبندی خالی |
اصلاح، ادغام یا noindex |
صفحه خالی ارزش خزش ندارد |
نمونه فرضی: اگر فروشگاهی ۵۰ هزار محصول دارد و ۱۸ هزار محصول برای همیشه ناموجود شدهاند، نگه داشتن همه آنها با لینک داخلی و Sitemap فعال میتونه Crawl را شلوغ کند. باید دستهبندی کرد: محصولات پرترافیک با جایگزین ریدایرکت شوند، محصولات بیارزش حذف شوند، و محصولات موقتاً ناموجود با ساختار درست بمانند.
سایت خبری و محتوایی چطور Crawl Budget را بهتر مدیریت کند؟
در سایت خبری یا محتوایی بزرگ، مسئله اصلی معمولاً کشف سریع محتوای تازه و جلوگیری از Crawl بیارزش روی آرشیوهای کمکیفیت، تگهای شلوغ و صفحات تکراریه. اینجا Sitemap خبری، ساختار دستهبندی، لینک داخلی از صفحه اصلی و سرعت سرور خیلی مهم میشن.
کارهای مهم:
- مقالات تازه را سریع از صفحه اصلی یا دسته مرتبط لینک بده.
- Sitemap خبری و Sitemap عادی را تمیز نگه دار.
- تگهای بیارزش و تکراری را کنترل کن.
- آرشیو نویسنده، تاریخ و برچسب را بیدلیل ایندکس نکن.
- صفحات قدیمی مهم را دورهای آپدیت کن.
- مقالات قدیمی بیارزش را ادغام، حذف یا noindex کن.
- از صفحات Pagination بیساختار جلوگیری کن.
- Server Response در زمان انتشار خبرهای زیاد را کنترل کن.
نکته: سایت خبری فقط با انتشار زیاد رشد نمیکند. اگر ساختار آرشیو و لینک داخلی ضعیف باشد، محتوای تازه هم ممکنه آنطور که باید سریع کشف نشود.
سناریوی عملی: وقتی بودجه خزش روی فیلترهای فروشگاه هدر میرفت
اگر ساختار URLهای سایت همزمان روی صفحات ارگانیک و پولی اثر گذاشته، مشاوره گوگل ادز میتواند اولویت اصلاح لندینگها، Queryها و مسیرهای فنی را مشخص کند.
نمونه فرضی: یک فروشگاه اینترنتی ۴۵ هزار URL قابل کشف داشت، اما فقط حدود ۱۲ هزار صفحه واقعاً برای سئو مهم بودند. در Crawl Stats و لاگ سرور مشخص شد Googlebot بخش قابلتوجهی از درخواستها را روی URLهای فیلتر، Sort و صفحات محصول ناموجود مصرف میکرد. مشکل فقط «زیاد بودن URL» نبود؛ مشکل این بود که URLهای بیارزش از طریق لینک داخلی و Sitemap همچنان سیگنال اهمیت میگرفتند.
کارهایی که انجام میدادم:
- Sitemap را پاکسازی میکردم و URLهای noindex، ریدایرکت و ناموجود را حذف میکردم.
- URLهای Sort مثل ?sort=price را از مسیرهای Crawl مهم خارج میکردم.
- فیلترهای دارای Search Demand را به صفحات Landing قابل ایندکس تبدیل میکردم.
- فیلترهای بیارزش را canonical یا robots مدیریت میکردم، بسته به نوع URL.
- محصولات حذفشده را به سه دسته موقت، دائمی با جایگزین و دائمی بدون جایگزین تقسیم میکردم.
- لینک داخلی را از صفحات دستهبندی به محصولات و فیلترهای مهمتر منتقل میکردم.
- بعد از چند هفته، Crawl Stats، Page Indexing و سرعت کشف صفحات جدید را دوباره بررسی میکردم.
نتیجهای که انتظار داریم اینه که سهم Crawl روی صفحات مهم بیشتر شود، خطاهای Soft 404 و Redirect کمتر شوند و صفحات تازه یا دستهبندیهای اصلی سریعتر دیده شوند. عدد دقیق نمیدم، چون بدون لاگ واقعی و داده Search Console عددسازی فقط ظاهر حرفهای دارد و باطنش خالیه.
اعداد خوب، متوسط و ضعیف برای ارزیابی Crawl Budget
برای Crawl Budget عدد جهانی وجود ندارد. سایتها از نظر اندازه، سرور، نوع محتوا، نرخ تغییر و ساختار URL فرق دارند. اما میتونیم با چند معیار اجرایی بفهمیم وضعیت سالمه یا نیاز به بررسی جدی دارد.
|
معیار |
خوب |
متوسط |
ضعیف |
|
URLهای نامعتبر در Sitemap |
تقریباً صفر |
چند مورد محدود |
زیاد و تکرارشونده |
|
پاسخهای 5xx در Crawl Stats |
نزدیک به صفر |
گاهبهگاه |
پرتکرار یا افزایشی |
|
سهم URLهای فیلتر/پارامتر از Crawl |
کنترلشده |
قابل توجه اما قابل توضیح |
زیاد و بیارزش |
|
صفحات مهم در عمق کلیک |
۱ تا ۳ کلیک |
۴ تا ۵ کلیک |
عمیقتر و دفنشده |
|
Discovered – currently not indexed برای صفحات مهم |
کم و گذرا |
متوسط |
زیاد و ماندگار |
|
Redirect Chain |
کم و کوتاه |
چند مسیر نیازمند اصلاح |
زیاد و چندمرحلهای |
|
Soft 404 |
کم |
قابل پیگیری |
زیاد و ساختاری |
نمونه فرضی: اگر سایتت ۸۰ هزار URL قابل کشف دارد، اما Sitemap شامل ۱۵ هزار URL ریدایرکتشده و noindex است، مشکل داری. گوگل از Sitemap انتظار لیست صفحات مهم دارد، نه سطل بازیافت URLهای قدیمی. اینجا قبل از بحثهای پیشرفته، باید همین فایلها را تمیز کنی.
اشتباهات رایج در بهینهسازی Crawl Budget
خیلیها وقتی اسم Crawl Budget میاد، سریع میرن سراغ robots.txt و شروع میکنن به بستن مسیرها. این خطرناکه. بهینهسازی بودجه خزش باید با تحلیل شروع شود، نه با بلاک کردن کور.
اشتباهات مهم:
- نگرانی بیدلیل در سایت کوچک:
اگر سایتت ۱۰۰ صفحه دارد و صفحات مهم Crawl میشن، بودجه خزش مسئله اصلی نیست. شاید محتوا، لینک داخلی یا کیفیت صفحه مشکل دارد. - بلاک کردن صفحات مهم با robots.txt:
گاهی مسیر فیلتر یا دستهای را میبندن که اتفاقاً Search Demand دارد. این کار میتونه فرصت سئو را حذف کند. - استفاده از noindex برای صرفهجویی در Crawl:
گوگل باید صفحه را Crawl کند تا noindex را ببیند. برای URLهایی که اصلاً نباید Crawl شوند، این روش همیشه مناسب نیست. - Sitemap شلوغ و قدیمی:
گذاشتن URLهای 404، noindex، canonical شده یا ریدایرکت داخل Sitemap یعنی سیگنالهای بدیهی را اشتباه میفرستی. - ترس از 404 درست:
حذف URL بیارزش با وضعیت درست، گاهی بهتر از نگه داشتن صفحه خالی با 200 است. - نادیده گرفتن سرعت سرور:
اگر سرور موقع Crawl کند یا ناپایدار است، با تغییر Title و Meta مشکل حل نمیشود. - بیتوجهی به لینک داخلی:
صفحه مهمی که از هیچ جای سایت لینک درست ندارد، نباید انتظار داشته باشد Googlebot هر روز برود پیدایش کند.
نکته: Crawl Budget را با یک پلاگین حل نمیکنی. این موضوع ترکیبی از معماری سایت، سرور، لینک داخلی، URL Inventory و کیفیت محتواست. یعنی باید واقعاً کار کنی؛ میدونم تلخه 🙂
چکلیست بهینهسازی Crawl Budget
قبل از هر تغییر جدی، این چکلیست را برو. اگر سایت بزرگ داری، بهتره این موارد را دورهای بررسی کنی، نه فقط وقتی مشکل ایندکس پیش آمد.
- آیا Sitemap فقط URLهای 200 و قابل ایندکس دارد؟
- آیا URLهای noindex از Sitemap حذف شدهاند؟
- آیا URLهای ریدایرکتشده داخل لینک داخلی باقی ماندهاند؟
- آیا Redirect Chain طولانی داری؟
- آیا صفحات Soft 404 شناسایی شدهاند؟
- آیا محصولات ناموجود دستهبندی شدهاند؟
- آیا فیلترهای بیارزش کنترل شدهاند؟
- آیا فیلترهای مهم صفحه اختصاصی دارند؟
- آیا صفحات جستجوی داخلی Crawl میشوند؟
- آیا تگها و آرشیوهای کمارزش ایندکسپذیرند؟
- آیا خطاهای 5xx در Crawl Stats دیده میشوند؟
- آیا Average Response Time بالا رفته؟
- آیا صفحات مهم در عمق کلیک زیاد دفن شدهاند؟
- آیا لینک داخلی به صفحات مهم کافی است؟
- آیا Discovered – currently not indexed برای صفحات مهم زیاد است؟
- آیا Log File Analysis برای سایتهای بزرگ انجام شده؟
- آیا lastmod در Sitemap واقعی است؟
- آیا URLهای پارامتردار سیاست مشخص دارند؟
- آیا صفحات تکراری canonical درست دارند؟
- آیا بعد از اصلاح، Crawl Stats و Page Indexing پایش میشوند؟
اگر از این چکلیست فقط یک چیز برداری، همین باشه: اول URLهای بیارزش را کم کن، بعد انتظار Crawl بهتر داشته باش. تا وقتی سایتت مسیرهای اضافه زیاد دارد، Googlebot هم بخشی از وقتش را همانجا میگذراند.
آیا افزایش Crawl Budget ممکن است؟
بله، اما نه با دکمه جادویی. گوگل میگه دو مسیر کلی برای افزایش Crawl Budget وجود دارد: منابع سرور را بهتر کنی، مخصوصاً اگر محدودیت از سمت ظرفیت سرور است؛ و کیفیت محتوایی را برای محصول گوگل هدف بهتر کنی، چون برای Google Search عواملی مثل محبوبیت، ارزش کلی برای مخاطب، یکتا بودن محتوا و ظرفیت سرویسدهی در تخصیص منابع خزش نقش دارند. (Google for Developers)
پس بهجای اینکه دنبال «درخواست افزایش Crawl Budget» باشی، این کارها را انجام بده:
- سرور را پایدارتر و سریعتر کن.
- خطاهای 5xx و 429 را کم کن.
- محتوای تکراری و کمارزش را حذف یا ادغام کن.
- لینک داخلی را به صفحات مهمتر متمرکز کن.
- Sitemap را تمیز و بهروز نگه دار.
- URLهای پارامتردار بیارزش را کنترل کن.
- صفحات با ارزش واقعی و تقاضای جستجو بساز.
- صفحات قدیمی مهم را بهروزرسانی کن.
نکته: گوگل وقتی دلیل داشته باشد بیشتر سراغت میاد. دلیلش هم این نیست که تو دوست داری بیشتر Crawl شوی؛ دلیلش اینه که سایتت محتوای ارزشمند، تازه، قابل دسترس و قابل پردازش داشته باشد.
نتیجهگیری
Crawl Budget برای همه سایتها مسئله حیاتی نیست، اما برای سایتهای بزرگ، پرتغییر و دارای URLهای زیاد، میتواند تفاوت مهمی در کشف، Crawl و ایندکس صفحات ارزشمند بسازد. اصل ماجرا این نیست که Googlebot را مجبور کنیم بیشتر بیاید؛ باید کاری کنیم وقتی میآید، وقتش را روی URLهای درست بگذارد. مدیریت URL Inventory، Sitemap تمیز، کنترل فیلترها، حذف Soft 404، کوتاه کردن Redirect Chain، بهبود سرعت سرور و لینک داخلی درست، ستونهای اصلی بهینهسازی بودجه خزش هستند. با بزرگتر شدن سایتها و پیچیدهتر شدن ساختارهای فیلتر و پارامتر، این موضوع از یک بحث فنی فرعی به بخشی از استراتژی جدی سئو تبدیل میشه. اگر حس میکنی صفحات مهم سایتت دیر Crawl یا Index میشن، هشت پا میتونه Crawl Stats، Sitemap، ساختار URL و لاگهای سایتت را بررسی کنه تا مشکل واقعی از حدس جدا شود.
سوالات متداول
آیا Crawl Budget برای سایتهای کوچک مهم است؟
برای بیشتر سایتهای کوچک، Crawl Budget دغدغه اصلی نیست. اگر سایتت چند ده یا چندصد صفحه دارد و صفحات جدید معمولاً سریع Crawl میشوند، بهتره انرژیات را روی کیفیت محتوا، لینک داخلی، Sitemap و رفع خطاهای ایندکس بگذاری. البته این یعنی بیخیال اصول فنی نشو؛ URLهای خراب، noindex اشتباه یا لینک داخلی ضعیف حتی در سایت کوچک هم مشکل میسازد. فقط لازم نیست وارد وسواسهای مخصوص سایتهای میلیونصفحهای بشی.
آیا noindex باعث صرفهجویی در Crawl Budget میشود؟
نه به شکل مستقیم. وقتی صفحه noindex دارد، گوگل باید آن را Crawl کند تا متوجه noindex شود و بعد تصمیم بگیرد آن را از Index کنار بگذارد. برای صفحاتی که اصلاً نمیخواهی گوگل Crawl کند، بسته به شرایط، robots.txt ممکن است گزینه مناسبتری باشد. اما اگر صفحه قبلاً ایندکس شده، بستن آن با robots.txt میتواند باعث شود گوگل نتواند noindex را ببیند؛ پس باید سناریو را دقیق انتخاب کنی.
آیا 404 زیاد Crawl Budget را نابود میکند؟
404 درست برای URLهایی که واقعاً حذف شدهاند، الزاماً فاجعه نیست. مشکل وقتی جدیتر میشود که تعداد زیادی URL حذفشده از لینک داخلی، Sitemap یا مسیرهای مهم همچنان به گوگل معرفی شوند. در این حالت Googlebot بیدلیل سراغ URLهایی میرود که دیگر ارزشی ندارند. برای صفحات حذفشده دائمی، وضعیت درست 404 یا 410 بهتر از صفحه خالی با 200 است.
هر چند وقت یکبار Crawl Stats را بررسی کنیم؟
برای سایتهای کوچک، بررسی ماهانه یا هنگام مشکل ایندکس کافی است. برای سایتهای بزرگ، فروشگاهها، سایتهای خبری و مارکتپلیسها بهتره Crawl Stats دورهای بررسی شود؛ مثلاً هفتگی یا بعد از تغییرات فنی مهم. وقتی مهاجرت URL، تغییر ساختار فیلترها، افزایش محصولات یا افت ایندکس داری، این گزارش باید جدیتر دیده شود. Crawl Stats بهتنهایی تصمیم نمیدهد، اما جهت بررسی را خیلی خوب نشان میدهد.
آیا سرعت سایت روی Crawl Budget اثر دارد؟
بله، مخصوصاً در سایتهای بزرگ. اگر سرور سریع و پایدار جواب بدهد، Googlebot راحتتر میتواند صفحات بیشتری را Crawl کند. اگر زمان پاسخ بالا برود یا خطاهای سرور زیاد شود، گوگل برای جلوگیری از فشار به سایت، Crawl را محتاطتر میکند. سرعت فقط برای تجربه مخاطب نیست؛ برای کارایی خزش هم مهم است، بهخصوص وقتی هزاران یا میلیونها URL داری.



