robots.txt: الدليل الكامل
يخبر robots.txt برامج الزحف أين يجوز لها التنقل. سطر خاطئ واحد قد يُخرج موقعك بالكامل من نتائج البحث.
وظيفة robots.txt
robots.txt ملف نصي في جذر نطاقك يخبر برامج الزحف بالأجزاء المسموح زحفها. إنه طلب لا حماية: البرامج المهذّبة تحترمه وغيرها تتجاهله.
ليس لإخفاء الصفحات: استخدم noindex لذلك.
التوجيهات الأساسية
| التوجيه | المعنى |
|---|---|
User-agent |
البرنامج المعني (* = الجميع) |
Allow |
مسارات مسموح زحفها |
Disallow |
مسارات ممنوعة |
Sitemap |
رابط خريطة الموقع |
Crawl-delay |
تأخير بين الطلبات (غالبًا يُتجاهل) |
ملف بداية آمن
User-agent: *
Allow: /
Disallow: /api/
Disallow: /search
Disallow: /*?s=
Sitemap: https://example.com/sitemap.xml
أنشئ ملفًا صحيحًا مع مولّد robots.txt.
Allow وDisallow: الترتيب
الأطول مطابقةً يفوز، لذا التحديد مهم. Allow: /blog قد ينشئ استثناءً تحت Disallow: /. اختبر القواعد الغامضة قبل النشر.
ستة أخطاء تضرّ
Disallow: /في الإنتاج — يُخرج الموقع كله.- حجب CSS وJS — يحتاجهما Google للعرض.
- الاعتماد على robots.txt للخصوصية — استخدم المصادقة.
- حجب الـ sitemap أو صفحات تريد فهرستها.
- أخطاء صياغة —
Disallow /بدون نقطتين يُتجاهل. - غياب إشارة الـ sitemap.
robots.txt وnoindex معًا
فخ كلاسيكي: إذا كانت الصفحة محظورة في robots.txt فلن يرى الزاحف وسم noindex — وقد تُفهرس. لإزالتها، اسمح بالزحف وأضف noindex.
اختبر قبل النشر
انشر على بيئة تجريبية، افتح /robots.txt، وتأكد من سماح URL المتوقعة. راقب التغطية في Search Console بعد النشر.
ابنِ ملفك
استخدم مولّد robots.txt مجانًا، ثم اقرنه بـ خريطة موقع XML.