เครื่องมือตรวจสอบไฟล์ robots.txt

วางกฎ robots.txt ของคุณและเส้นทาง URL ที่ต้องการทดสอบ แล้วเครื่องมือจะอ่านบรรทัด Allow และ Disallow เพื่อบอกว่าเส้นทางนั้นจะถูกบล็อกหรือถูกอนุญาต มีประโยชน์เมื่อหน้าเว็บหายไปจาก Google อย่างกะทันหัน และคุณต้องการยืนยันว่ากฎ Disallow ที่เข้มงวดเกินไปเป็นสาเหตุหรือไม่ หรือเมื่อคุณกำลังร่างกฎใหม่และต้องการตรวจสอบเส้นทางก่อนนำไฟล์ไปใช้งาน

วิธีการทำงานของเครื่องมือ

  1. 1

    วางกฎของคุณ

    คัดลอกบรรทัด Allow และ Disallow จาก robots.txt ของคุณลงในช่อง หรือร่างกฎใหม่เพื่อทดลอง

  2. 2

    ป้อนเส้นทางเพื่อทดสอบ

    พิมพ์เส้นทาง URL ที่ต้องการตรวจสอบ เช่น /private/page ใช้เฉพาะเส้นทางเท่านั้น ไม่ใช่โดเมนแบบเต็ม

  3. 3

    ตรวจสอบกฎ

    เครื่องมือจะสแกนบรรทัด Allow และ Disallow แล้วค้นหากฎที่ตรงกับเส้นทางที่คุณป้อน

  4. 4

    อ่านผลลัพธ์

    คุณจะได้จำนวนกฎที่พบ เส้นทางที่ทดสอบ และคำตัดสิน: อนุญาตโดยค่าเริ่มต้น ถูกบล็อกโดย Disallow หรือถูกอนุญาตโดย Allow

robots.txt ที่ถูกต้องแบบขั้นต่ำ

User-agent: *
Allow: /
Disallow: /admin/
Disallow: /draft/
Sitemap: https://example.com/sitemap.xml
  • User-agent: *. ใช้กับครอว์เลอร์ทุกตัวที่ไม่ได้ระบุชื่อไว้อย่างชัดเจนในบล็อกอื่น
  • Allow: /. อนุญาตทุกอย่างโดยค่าเริ่มต้น
  • Disallow: /admin/. ไดเรกทอรีผู้ดูแลระบบเข้าถึงไม่ได้
  • Sitemap:. บอกเครื่องมือค้นหาว่าจะหาแผนผังเว็บไซต์ XML ได้ที่ใด

กฎที่ Googlebot ปฏิบัติตามจริง

ตัววิเคราะห์ของ Google เป็นมาตรฐานโดยพฤตินัยสำหรับการตีความกฎที่คลุมเครือ:

  • เส้นทางแยกแยะตัวพิมพ์ใหญ่-เล็ก /Admin/ และ /admin/ ต่างกัน
  • การจับคู่ที่ยาวที่สุดชนะ Allow: /admin/public/ เหนือกว่า Disallow: /admin/ สำหรับ URL ที่ขึ้นต้นด้วย /admin/public/
  • ไวลด์การ์ด * จับคู่กับลำดับอักขระใดก็ได้ ส่วน $ ยึดกับส่วนท้ายของ URL
  • ความคิดเห็น ขึ้นต้นด้วย #
  • ไม่ขึ้นกับลำดับ กฎถูกประเมินตามความเฉพาะเจาะจง (ความยาวเส้นทาง) ไม่ใช่ตามลำดับที่เขียน

ข้อผิดพลาดที่พบบ่อย

ข้อผิดพลาด ผลลัพธ์
Disallow: / อยู่ด้านบน ไม่มี Allow ทั้งเว็บไซต์ถูกบล็อก
Disallow: *.pdf พาร์เซอร์หลายตัวไม่สนใจ, ใช้ Disallow: /*.pdf$
URL แบบสัมพัทธ์กับโปรโตคอลหรือแบบสัมบูรณ์ใน Disallow ถูกเพิกเฉย, เส้นทางต้องเป็นแบบสัมพัทธ์
หลายบรรทัด User-agent ก่อนกฎ ถูกรวมเข้าด้วยกัน กฎใช้กับ UA ทั้งหมดที่ระบุ
ช่องว่างท้ายเส้นทาง ถูกถือเป็นเส้นทางอื่นอย่างเงียบ ๆ
วางไฟล์ robots.txt ในไดเรกทอรีย่อย ดึงเฉพาะไฟล์ที่โดเมนรากเท่านั้น

robots.txt เทียบกับ noindex

robots.txt บอกครอว์เลอร์ให้ไม่ดึง URL หน้าเว็บที่ถูกจัดทำดัชนีไปแล้วและถูกบล็อกใน robots.txt ในภายหลัง อาจยังคงอยู่ในดัชนีได้นานหลายเดือน เพราะครอว์เลอร์ไม่สามารถดึงหน้านั้นเพื่อยืนยันการนำออกได้ หากต้องการนำออกจากดัชนี ให้ใช้เมตาแท็ก noindex หรือส่วนหัว HTTP บนหน้าเว็บโดยตรง และปล่อยให้ครอว์เลอร์เห็นมัน

Crawl-delay

Crawl-delay: 10 ขอเวลา 10 วินาทีระหว่างการร้องขอ Google เพิกเฉยต่อคำสั่งนี้ (ตั้งอัตราการรวบรวมข้อมูลได้ใน Search Console) ส่วน Bing, Yandex และครอว์เลอร์เฉพาะทางบางตัวปฏิบัติตาม ใช้กับเว็บไซต์ขนาดเล็กที่ถูกกดดันจากบอทเฉพาะทาง

สิ่งที่ Disallow ไม่ได้ทำ

  • ป้องกันการถูกลิงก์ถึง เว็บไซต์อื่นยังลิงก์ไปยัง URL ที่ถูกห้ามได้ และ URL นั้นจะปรากฏในผลการค้นหาเป็นเพียง URL (ไม่มีชื่อเรื่องหรือคำอธิบาย)
  • ป้องกันไม่ให้หน้าเว็บแสดงผล ผู้ใช้ยังเข้าชม URL ที่ถูก Disallow ได้
  • ซ่อน URL จากคนทั้งโลก robots.txt เป็นสาธารณะ การระบุเส้นทางลับไว้ในนั้นเท่ากับเป็นการโฆษณามัน

คำถามที่พบบ่อย

เพราะ Disallow บล็อกการรวบรวมข้อมูล ไม่ใช่การจัดทำดัชนี หาก Google รู้จัก URL อยู่แล้ว (จากลิงก์หรือแผนผังเว็บไซต์) ก็อาจคง URL นั้นไว้ในผลการค้นหาได้ ให้ใส่แท็ก noindex บนหน้าเว็บ แล้วปล่อยให้ Google ดึงหน้านั้นเพื่อยืนยันการนำออก

ได้ ให้ใช้บล็อก User-agent: BadBot ที่มีกฎเฉพาะของตัวเอง โปรดทราบว่าบอทที่ประพฤติไม่ดีจะเพิกเฉยต่อ robots.txt อย่างสิ้นเชิง มีเพียงบอทที่ปฏิบัติตามกฎเท่านั้นที่เคารพไฟล์นี้

ไม่ควร robots.txt เป็นสาธารณะ การระบุไว้เท่ากับเป็นการเปิดเผยตำแหน่ง ให้ใช้การยืนยันตัวตนและการควบคุมการเข้าถึงระดับเซิร์ฟเวอร์แทน

ใช่ สำหรับเส้นทาง Disallow: /Admin/ จะไม่บล็อก /admin/ โปรดให้ตรงกับตัวพิมพ์ใหญ่-เล็กจริงของ URL ของคุณ

ได้ ให้ระบุบรรทัด Sitemap: หลายบรรทัดเพื่อชี้ไปยังแผนผังเว็บไซต์ XML แยกกัน หรือชี้ไปยังดัชนีแผนผังเว็บไซต์

เครื่องมือที่เกี่ยวข้อง

เครื่องดึงลิงก์ภายนอก

วางโค้ด HTML ดิบ และระบุ URL ฐานได้ตามต้องการ จากนั้นรับรายการลิงก์ภายนอก http/https ทั้งหมดในโค้ดแบบไม่มีรายการซ้ำ เพื่อใช้ตรวจสอบลิงก์และประเมินผล SEO

เครื่องมือสร้างสเกมาสำหรับคำถามบ่อย (FAQ Schema Generator)

สร้างมาร์กอัป JSON-LD แบบ FAQPage จากคู่คำถามและคำตอบ เพื่อให้หน้าเว็บของคุณเข้าเกณฑ์ผลการค้นหาแบบสมบูรณ์ (rich results) และกล่องคำตอบของ Google

เครื่องมือตรวจสอบความยาวของคำอธิบายเมตา

วัดคำอธิบายเมตาเป็นจำนวนอักขระและพิกเซลโดยประมาณ เปรียบเทียบแนวทางการเรียบเรียง และดูตัวอย่างการจัดวางบนเดสก์ท็อปกับมือถือ

ตัวตรวจสอบ Hreflang

ตรวจ hreflang ใน HTML ที่วางภายในเบราว์เซอร์ ทั้งโค้ด URL แบบเต็ม รายการซ้ำ ตำแหน่ง และการอ้างอิงตัวเองแบบไม่บังคับ

เครื่องมือดึงลิงก์ภายใน

ดึงลิงก์ภายในทั้งหมดจาก URL หรือ HTML ที่วาง พร้อมข้อความลิงก์ แอตทริบิวต์ rel และสถานะ nofollow เพื่อใช้ตรวจสอบ SEO

เครื่องมือตรวจสอบเฮดเดอร์ความปลอดภัย HTTP

วาง HTTP response headers แล้วตรวจ HSTS, CSP, clickjacking, MIME, referrer และนโยบาย cross-origin ภายในเบราว์เซอร์

เครื่องมือนี้มีให้บริการในภาษาอื่น