ملف robots.txt ملف robots.txt

13 طريقة لتطبيق ملف robots.txt بطريقة صحيحة

إعادة التوجيه الذكية لمحركات البحث أصبحت ضرورة لا غنى عنها لأي موقع إلكتروني يسعى للنجاح في عالم تحسين محركات البحث، وملف robots.txt يعتبر البوابة الرئيسية لتحقيق هذا الهدف بطريقة احترافية ومنظمة.

هذا الملف البسيط ظاهريًا يحمل قوة هائلة في التحكم بسلوك محركات البحث مع محتوى موقعك، وفي هذا الدليل الشامل، ستتعلم كل ما تحتاج معرفته عن ملف robots.txt، بدءًا من فهم طبيعته وأهميته، مرورًا بطريقة كتابته وتنسيقه الصحيح، وصولاً إلى أفضل الممارسات لإدارته بفعالية.

كذلك سنغطي كيفية إضافة خريطة الموقع إليه، والأخطاء الشائعة التي يجب تجنبها؛ لضمان استفادة موقعك القصوى من هذه الأداة القوية في رحلته نحو الصدارة في نتائج البحث.

ما هو ملف robots.txt؟

ملف robots.txt هو ملف نصي بسيط، يحتوي على تعليمات وإرشادات تخبر محركات البحث كيفية التعامل مع موقعك الإلكتروني أثناء عملية الزحف والفهرسة.

في الواقع، عندما نتحدث عن تحسين محركات البحث، فإن الملف يعتبر من أهم الأدوات التي تساعدك في توجيه محركات البحث نحو المحتوى المناسب، وهذا الملف يعمل كحارس أمن لموقعك، حيث يحدد للزواحف الآلية ما هي الأجزاء المسموح لها بزيارتها وما هي الأجزاء المحظورة عليها.

منذ عام 2019، شهد عالم الويب تطورات مهمة في معايير ملف robots.txt، حيث اقترحت جوجل تحسينات جديدة على بروتوكول استبعاد الروبوتات، وجعلت أدوات تحليل هذا الملف متاحة للمطورين بشكل مفتوح المصدر.

عملية عمل هذا الملف بسيطة للغاية، محركات البحث تتفقد الملف في موقعك بانتظام للحصول على آخر التعليمات المتعلقة بالزحف، وهذه التعليمات تُسمى بالتوجيهات، وهي التي تحدد سلوك محركات البحث مع محتوى موقعك.

الحساسية العالية لهذا الملف تجعل منه أداة قوية في عالم تحسين محركات البحث، ولكن في نفس الوقت قد يكون خطيرًا إذا لم يتم إعداده بطريقة صحيحة، فخطأ واحد بسيط في الكتابة أو قد يؤدي إلى منع محركات البحث من الوصول إلى موقعك بالكامل.

ما هو ملف robots.txt؟

لماذا يجب أن تهتم بـ robots.txt؟

الاهتمام بملف robots.txt حيث يساعدك في التحكم بطريقة زحف محركات البحث لموقعك، وتوجيه انتباهها نحو المحتوى الأكثر أهمية.

سبب اهتمامك بملف robots.txt هو قدرته على منع محركات البحث من الوصول إلى أجزاء معينة من موقعك، وهذا مفيد عندما تريد حماية محتوى حساس أو منع فهرسة صفحات مكررة قد تضر بترتيب موقعك في نتائج البحث.

عملية إعادة التوجيه الصحيحة لمحركات البحث من خلال الملف تساعد في تحسين كفاءة الزحف، فبدلاً من إضاعة وقت محركات البحث في زحف صفحات غير مهمة، يمكنك توجيهها نحو المحتوى الذي تريد فعلاً أن يظهر في نتائج البحث.

لكن احذر من الإفراط في استخدام هذا الملف، فالكثير من أصحاب المواقع يقعون في فخ حجب محتوى أكثر من اللازم، مما يؤدي إلى قطع الروابط الداخلية وإضعاف بنية الموقع، والحكمة هنا تقتضي استخدام الملف فقط للملفات والصفحات التي لا يجب على محركات البحث رؤيتها إطلاقًا.

المشاكل الشائعة التي يواجهها أصحاب المواقع مع ملف robots.txt تنقسم إلى ثلاث فئات رئيسية:

  1. سوء التعامل مع رموز البدل والأنماط: كثيرًا ما نرى مواقع محجوبة جزئيًا دون قصد من أصحابها بسبب كتابة خاطئة لقواعد الحجب، وأحيانًا تتعارض التوجيهات مع بعضها البعض مما يسبب التباسًا في إعادة التوجيه المطلوبة.
  2. التغييرات المفاجئة غير المقصودة: غالبًا ما يحدث هذا عندما يقوم مطور بتحديث كود الموقع ويغير ملف robots.txt دون إدراك التأثير المحتمل على أداء الموقع في محركات البحث.
  3. إدراج توجيهات خاطئة: بعض المطورين يخلطون بين معايير ملف robots.txt وملفات .htaccess، فيضعون توجيهات لا تعمل في هذا السياق.

لنأخذ مثالاً عمليًا، إذا كنت تدير متجرًا إلكترونيًا ويحتوي على نظام تصفية للمنتجات، فإن هذا النظام قد ينتج صفحات متعددة تحتوي على نفس المحتوى تقريبًا، وهذا النوع من التكرار يربك محركات البحث، ويجعلها تضيع وقتًا ثمينًا في زحف محتوى مكرر.

هنا يأتي دور الملف في إعادة التوجيه الذكية لمحركات البحث بعيدًا عن هذه الصفحات المكررة، صحيح أن هناك طرق أخرى لمعالجة المحتوى المكرر مثل استخدام الرابط الأساسي أو علامة meta robots، لكن هذه الطرق لا تمنع محركات البحث من زحف هذه الصفحات من الأساس.

الفرق هنا أن استخدام الرابط الأساسي أو علامة meta robots يخبر محركات البحث بعدم إظهار هذه الصفحات في نتائج البحث، لكنها لا تزال تزحف إليها وتستهلك من حصتك المخصصة للزحف، بينما ملف robots.txt يمنع الزحف من الأساس، مما يوفر وقت محركات البحث للتركيز على المحتوى الأهم.

كيف يبدو ملف robots.txt؟

ملف robots.txt هو ملف نصي بسيط يحتوي على مجموعة من التوجيهات المكتوبة بطريقة محددة، حيث كل سطر يحتوي على تعليمة واحدة تخبر محركات البحث كيفية التعامل مع أجزاء مختلفة من موقعك.

لنبدأ بمثال بسيط لموقع ووردبريس:

  • User-agent: *
  • Disallow: /wp-admin/

هذا المثال البسيط يوضح البنية الأساسية لملف robots.txt:

  • User-agent: يحدد محرك البحث الذي تتوجه إليه بالتوجيهات.
  • الرمز (*): يعني أن هذه التوجيهات تنطبق على جميع محركات البحث، ويمكنك أيضًا تحديد محركات بحث معينة مثل Googlebot أو BingBot أو غيرها.
  • Disallow: هو التوجيه الذي يمنع الوصول إلى مسار معين، وفي المثال أعلاه، نمنع جميع محركات البحث من دخول مجلد wp-admin الذي يحتوي على لوحة تحكم ووردبريس.
  • المسار /wp-admin/: يحدد المنطقة المحظورة في موقعك، وهذا النوع من إعادة التوجيه مهم؛ لحماية المناطق الإدارية في موقعك.

محركات البحث المختلفة تعرّف نفسها بأسماء مختلفة، فجوجل تستخدم Googlebot، بينما ياهو تستخدم Slurp، وبينغ يستخدم BingBot، وكل مجموعة من التوجيهات تبدأ بتحديد user-agent وتنتهي عندما يبدأ user-agent جديد.

يمكنك أيضًا استخدام توجيه Allow لعكس تأثير توجيه Disallow، هذا مفيد عندما تريد حجب مجلد كامل لكن السماح بالوصول إلى ملف أو مجلد فرعي معين داخله:

  • User-agent: *
  • Allow: /media/terms-and-conditions.pdf
  • Disallow: /media/

هذا المثال يمنع الوصول إلى مجلد media بالكامل، لكنه يسمح بالوصول إلى ملف شروط الخدمة المحدد، وهذا النوع من إعادة التوجيه المحددة يساعد في التحكم الدقيق بما تريد إظهاره أو إخفاؤه.

عند استخدام توجيهات Allow و Disallow معًا، احذر من استخدام رموز البدل؛ لأنها قد تؤدي إلى توجيهات متضاربة، مثلاً:

  • User-agent: *
  • Allow: /directory
  • Disallow: *.html

هذا المثال سيسبب التباسًا لمحركات البحث عند التعامل مع رابط مثل http://www.domain.com/directory.html؛ لأنها لن تعرف هل تطبق قاعدة Allow أم Disallow.

من المهم أن تضع كل توجيه في سطر منفصل، فخطأ شائع هو كتابة عدة توجيهات في نفس السطر، مما يربك محركات البحث، على سبيل المثال:

  • User-agent: * Disallow: /directory-1/ Disallow: /directory-2/

ولكن الطريقة الصحيحة لكتابته:

  • User-agent: *
  • Disallow: /directory-1/
  • Disallow: /directory-2/

يمكنك استخدام رموز البدل للمطابقة المرنة، الرمز (*) يطابق أي تسلسل من الأحرف، بينما الرمز ($) يشير إلى نهاية الرابط:

  • User-agent: *
  • Disallow: *?

هذا المثال يمنع الوصول إلى جميع الروابط التي تحتوي على علامة استفهام، وهو مفيد لمنع فهرسة الروابط التي تحتوي على معاملات ديناميكية، وللإشارة إلى نهاية الرابط، استخدم الرمز ($):

  • User-agent: *
  • Disallow: *.php$

هذا يمنع الوصول إلى جميع الملفات التي تنتهي بـ .php فقط، لكنه لا يمنع الوصول إلى روابط مثل page.php?lang=en لأن الرابط لا ينتهي بـ .php.

قوة قواعد Disallow تتطلب حذرًا شديدًا، فتوجيه بسيط مثل Disallow: /directory لا يحجب فقط المجلد المقصود، بل يحجب أيضًا أي شيء يبدأ بهذا النص، مثل directory-name-1 أو directory.html.

هذا النوع من إعادة التوجيه غير المقصودة يمكن أن يحجب محتوى مهم من موقعك دون أن تدري، لذلك كن محددًا قدر الإمكان في كتابة المسارات، وأخيرًا تذكر أن ملف robots.txt حساس للأحرف الكبيرة والصغيرة، تمامًا مثل روابط الويب، فالمسار /Directory/ يختلف عن /directory/، وهذا قد يسبب مشاكل في إعادة التوجيه إذا لم تنتبه لهذا الفرق.

كيف يبدو ملف robots.txt؟

إضافة خريطة الموقع إلى robots.txt

رغم أن ملف robots.txt صُمم لإخبار محركات البحث بالمناطق المحظورة، ويمكن أيضًا استخدامه لتوجيه محركات البحث إلى خريطة الموقع XML، مما يساعد في تحسين عملية اكتشاف وفهرسة محتوى موقعك.

إضافة خريطة الموقع إلى ملف robots.txt تعتبر من أفضل الممارسات في عالم تحسين محركات البحث، حتى لو كنت قد رفعت خريطة الموقع بالفعل في Google Search Console أو Bing Webmaster Tools.

والسبب أن هناك محركات بحث أخرى قد تستفيد من هذه المعلومة، وطريقة إعادة التوجيه هذه مدعومة من جميع محركات البحث الرئيسية، بما في ذلك جوجل وبينغ وياهو وAsk، والأمر بسيط للغاية، ستحتاج فقط إلى إضافة سطر واحد في نهاية الملف:

  • User-agent: *
  • Disallow: /wp-admin/
  • Sitemap: https://www.example.com/sitemap.xml

من المهم أن تذكر خريطة الموقع كرابط مطلق وليس نسبي، هذا يعني أنه يجب أن يبدأ بـ https:// أو http:// ويحتوي على اسم النطاق كاملاً، وميزة إضافية هنا أن خريطة الموقع لا تحتاج لأن تكون على نفس النطاق الفرعي لملف robots.txt.

إذا كان موقعك يحتوي على عدة خرائط مواقع، يمكنك إضافة جميعها في الملف:

  • User-agent: *
  • Disallow: /wp-admin/
  • Sitemap: https://www.example.com/sitemap1.xml
  • Sitemap: https://www.example.com/sitemap2.xml
  • Sitemap: https://www.example.com/products-sitemap.xml
  • Sitemap: https://www.example.com/blog-sitemap.xml

هذا النوع من إعادة التوجيه المتعددة مفيد للمواقع الكبيرة التي تقسم المحتوى إلى فئات مختلفة، فكل خريطة موقع تركز على نوع معين من المحتوى، مما يساعد محركات البحث في فهم بنية موقعك بشكل أفضل.

يمكنك أيضًا إضافة تعليقات توضيحية؛ لجعل ملف robots.txt أكثر وضوحًا:

  • # إعدادات الزحف الأساسية
  • User-agent: *
  • Disallow: /wp-admin/ # منع الوصول للوحة التحكم
  • Disallow: /private/ # منع الوصول للملفات الخاصة
  • # خرائط المواقع
  • Sitemap: https://www.example.com/sitemap_index.xml
  • Sitemap: https://www.example.com/news-sitemap.xml

التعليقات تبدأ بالرمز (#) ويمكن وضعها في بداية السطر أو بعد التوجيه في نفس السطر، وهذه التعليقات مخصصة للبشر فقط ومحركات البحث تتجاهلها تمامًا.

إذا كان موقعك يستخدم خريطة موقع رئيسية تحتوي على فهرس لخرائط مواقع أخرى، فيمكنك الاكتفاء بذكر الخريطة الرئيسية فقط:

  • User-agent: *
  • Disallow: /wp-admin/
  • Sitemap: https://www.example.com/sitemap_index.xml

هذا النوع من إعادة التوجيه البسيطة يكفي لإخبار محركات البحث عن وجود نظام خرائط مواقع منظم في موقعك، ومن المهم تحديث معلومات خريطة الموقع في ملف robots.txt كلما غيرت موقع أو اسم ملف خريطة الموقع، وهذا جزء مهم من عملية الصيانة المستمرة لموقعك.

أيضًا تأكد من أن خريطة الموقع المذكورة في ملف robots.txt تعمل فعلاً وتحتوي على روابط صحيحة، بالتالي لا فائدة من إعادة التوجيه إلى ملف غير موجود أو تالف، فهذا قد يعطي انطباعًا سلبيًا لمحركات البحث عن مدى احترافية إدارة موقعك.

أفضل ممارسات Robots.txt

اتباع أفضل الممارسات في إعداد وإدارة ملف robots.txt يضمن لك الاستفادة القصوى من هذه الأداة القوية، مع تجنب الأخطاء الشائعة التي قد تضر بأداء موقعك في محركات البحث.

1- الموقع الصحيح واسم الملف

ملف robots.txt يجب أن يكون في الجذر الرئيسي لموقعك دائمًا، أي على https://www.example.com/robots.txt تحديدًا، واسم الملف حساس للأحرف الكبيرة والصغيرة، لذا تأكد من كتابته بحروف صغيرة فقط.

إذا لم تضع الملف في المكان الصحيح، ستفترض محركات البحث عدم وجود توجيهات، وستزحف لموقعك بالكامل دون قيود.

2- فهم أولويات التوجيهات

محركات البحث تتعامل مع ملف robots.txt بطرق مختلفة قليلاً، وبشكل عام التوجيه المطابق الأول له الأولوية، لكن جوجل وبينغ يطبقان قاعدة “الخصوصية أولاً”، مما يعني أن التوجيه الأطول والأكثر تحديدًا له الأولوية:

  • User-agent: *
  • Allow: /about/company/
  • Disallow: /about/

في هذا المثال، محركات البحث ستمتنع عن زحف مجلد /about/ بشكل عام، لكنها ستصل إلى /about/company/ لأن توجيه Allow أكثر تحديدًا، وهذا نوع ذكي من إعادة التوجيه يسمح بالتحكم الدقيق.

3- مجموعة واحدة فقط من التوجيهات لكل محرك بحث

خطأ شائع هو تكرار التوجيهات لنفس محرك البحث في أماكن مختلفة من الملف، وهذا يسبب التباسًا ويجعل محركات البحث تختار فقط المجموعة الأخيرة من التوجيهات، وعلى سبيل المثال:

  • User-agent: *
  • Disallow: /secret/
  • User-agent: googlebot
  • Disallow: /private/
  • User-agent: *
  • Disallow: /admin/

في هذا المثال، جوجل ستطبق فقط التوجيهات الأخيرة لـ User-agent: * وتتجاهل التوجيهات المحددة لـ googlebot.

4- كن محددًا قدر الإمكان

توجيهات Disallow تعمل بنظام المطابقة الجزئية، مما يعني أن Disallow: /directory سيحجب ليس فقط /directory/ بل أيضًا /directory-name أو /directory.html، وهذا قد يؤدي إلى إعادة التوجيه غير المرغوبة لمحركات البحث بعيدًا عن محتوى مهم، لذلك عليك أن تكون محددًا، فبدلاً من:

  • User-agent: *
  • Disallow: /admin

استخدم:

  • User-agent: *
  • Disallow: /admin/

5- التعامل مع التوجيهات المختلطة

عندما تحدد توجيهات لجميع الروبوتات ثم توجيهات خاصة لروبوت معين، فإن الروبوت المحدد سيتبع توجيهاته الخاصة فقط ويتجاهل التوجيهات العامة، على سبيل المثال:

  • User-agent: *
  • Disallow: /secret/
  • Disallow: /test/
  • Disallow: /not-launched-yet/
  • User-agent: googlebot
  • Disallow: /not-launched-yet/

في هذا المثال، جوجل ستصل إلى /secret/ و /test/ لأنها لم تُمنع صراحة في توجيهاتها الخاصة، وإذا كنت تريد منع جوجل من هذه المناطق أيضًا، يجب تكرار هذه التوجيهات في القسم الخاص بها.

6- ملف واحد لكل نطاق فرعي

توجيهات robots.txt تنطبق فقط على النطاق الفرعي الموجود عليه الملف، فملف robots.txt الموجود على http://example.com لا يؤثر على www.example.com أو أي نطاق فرعي آخر، وهذا يتطلب إعادة التوجيه أو النسخ المناسبة للملف حسب بنية موقعك.

7- مراقبة التغييرات

ملف robots.txt من أكثر الملفات التي تتطلب مراقبة مستمرة، فتغيير بسيط أو خطأ في النسخ يمكن أن يؤثر على موقعك بالكامل، خاصًة عند إطلاق مميزات جديدة أو نقل الموقع من بيئة التطوير إلى الإنتاج.

8- تجنب التوجيهات غير المدعومة

لا تستخدم توجيه noindex في ملف robots.txt، فهذا التوجيه غير الرسمي لم يعد مدعومًا من جوجل منذ سبتمبر 2019، ولم يكن مدعومًا من بينغ، واستخدم بدلاً من ذلك علامة meta robots أو X-Robots-Tag لمنع فهرسة الصفحات.

9- أمثلة عملية مفيدة

إليك بعض الأمثلة العملية الشائعة:

للسماح لجميع محركات البحث بالوصول إلى كل شيء:

  • User-agent: *
  • Disallow:

أو يمكنك ترك ملف robots.txt فارغًا أو عدم إنشائه من الأساس، لمنع جميع محركات البحث من الوصول إلى الموقع بالكامل:

  • User-agent: *
  • Disallow: /

لمنع جوجل فقط من الوصول:

  • User-agent: googlebot
  • Disallow: /

لمنع محركات بحث متعددة من مجلدات محددة:

  • User-agent: googlebot
  • User-agent: bingbot
  • Disallow: /admin/
  • Disallow: /private/

للسماح بوصول محدود لمحرك بحث الأخبار:

  • User-agent: googlebot
  • Disallow: /
  • User-agent: googlebot-news
  • Disallow:

هذا النوع من إعادة التوجيه التفصيلية يعطيك تحكمًا كاملاً في كيفية تفاعل محركات البحث المختلفة مع محتوى موقعك.

أفضل ممارسات Robots.txt

10- التعامل مع Crawl-delay

توجيه Crawl-delay يستخدم لإبطاء زحف محركات البحث، لكن طريقة التعامل معه تختلف بين محركات البحث، فجوجل لا تدعم هذا التوجيه، بينما بينغ وياهو ويانديكس تدعمه:

  • User-agent: bingbot
  • Disallow: /private/
  • Crawl-delay: 10

هذا المثال يطلب من بينغ انتظار 10 ثوانٍ بين كل طلب زحف، لكن تذكر أن هذا حل مؤقت فقط إذا كان خادمك يعاني من الضغط، والحل الأمثل هو تحسين أداء الخادم أو الموقع نفسه.

11- تجنب الأخطاء الشائعة

تأكد من عدم وجود أخطاء إملائية أو نحوية في أسماء التوجيهات، مثلاً كتابة “Dissallow” بدلاً من “Disallow” سيجعل التوجيه غير مفهوم لمحركات البحث، وتأكد أيضًا من أن كل مسار يبدأ بالرمز (/). المسار “admin” مختلف عن “/admin/” وقد يؤدي إلى إعادة التوجيه غير المرغوبة.

12- إدارة الموقع العلني للملف

تذكر أن ملف robots.txt متاح للعامة ويمكن لأي شخص قراءته، ومنع أقسام معينة من موقعك قد يلفت انتباه أشخاص بنوايا سيئة إلى هذه المناطق، وهذا نوع من إعادة التوجيه السلبية التي قد تعرض موقعك للخطر.

13- التحديث والصيانة المستمرة

جعل مراقبة ملف robots.txt جزءًا من روتين الصيانة الدورية لموقعك أمر بالغ الأهمية، فأي تغيير في بنية الموقع أو إضافة أقسام جديدة يجب أن يصاحبه مراجعة الملف؛ للتأكد من أن إعادة التوجيه لا تزال مناسبة.

اتباع هذه الممارسات المثلى سيضمن لك الاستفادة القصوى من ملف robots.txt مع تجنب المشاكل الشائعة التي قد تضر بأداء موقعك في محركات البحث، وتذكر أن هذا الملف الصغير له تأثير كبير على كيفية رؤية العالم لموقعك الإلكتروني.

الخلاصة

ملف robots.txt هو أداة قوية ومهمة في عالم تحسين محركات البحث، لكنه يتطلب فهمًا عميقًا واستخدامًا حذرًا، ومن خلال إتقان طريقة كتابته وإدارته بشكل صحيح، يمكنك التحكم الكامل في كيفية تفاعل محركات البحث مع موقعك.

فسواء كنت تريد منع الوصول إلى مناطق حساسة، أو توجيه محركات البحث إلى المحتوى الأهم، أو حتى إعادة التوجيه الذكية لتحسين كفاءة الزحف، ملف robots.txt يوفر لك الأدوات اللازمة لتحقيق هذه الأهداف.

لكن تذكر دائمًا أن القوة تأتي مع المسؤولية، وخطأ واحد في هذا الملف قد يؤثر على موقعك بالكامل، لذا خذ وقتك في التخطيط والاختبار والمراقبة المستمرة؛ لضمان عمل كل شيء كما هو مطلوب.

اترك تعليقاً

لن يتم نشر عنوان بريدك الإلكتروني. الحقول الإلزامية مشار إليها بـ *