เครื่องมือสร้างไฟล์ robots.txt

กำหนดครอว์เลอร์ที่คุณต้องการเจาะจง ระบุเส้นทางที่ต้องการบล็อกและเส้นทางที่ต้องการอนุญาต เพิ่ม crawl-delay หากต้องการ และชี้ไปยังแผนผังเว็บไซต์ของคุณ แล้วเครื่องมือจะประกอบไฟล์ robots.txt ที่จัดรูปแบบถูกต้องซึ่งคุณคัดลอกและนำไปใช้ได้ มันจัดการรูปแบบบรรทัดและเครื่องหมายวรรคตอนให้ครบถ้วน คุณจึงไม่ต้องจำไวยากรณ์หรือการสะกดชื่อ user-agent

วิธีสร้างไฟล์

  1. 1

    กำหนด user-agent

    ป้อนครอว์เลอร์ที่กฎจะมีผล หรือปล่อย * ไว้เพื่อเจาะจงบอททุกตัว

  2. 2

    ระบุเส้นทางที่จะบล็อก

    เพิ่มไดเรกทอรีหรือเส้นทางที่จะบล็อก บรรทัดละหนึ่งรายการ เช่น /admin/ หรือ /checkout/

  3. 3

    ระบุเส้นทางที่จะอนุญาต

    เพิ่มเส้นทางที่ควรยังถูกรวบรวมข้อมูลได้ บรรทัดละหนึ่งรายการ เพื่อสร้างข้อยกเว้นภายใน Disallow ที่กว้างกว่า

  4. 4

    เพิ่มแผนผังเว็บไซต์และ crawl-delay

    ประกาศ URL แผนผังเว็บไซต์ของคุณ และหากจำเป็น ระบุ crawl-delay เป็นวินาที

  5. 5

    คัดลอกและนำไปใช้

    คัดลอกไฟล์ที่สร้างขึ้นและวางไว้ที่ https://yourdomain.com/robots.txt ที่รากเท่านั้น ไม่ใช่ไดเรกทอรีย่อย

เทมเพลตเริ่มต้นที่พบบ่อย

อนุญาตทุกอย่าง (เว็บไซต์ส่วนใหญ่):

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

บล็อก staging / ผู้ดูแลระบบ:

User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml

บล็อกครอว์เลอร์ฝึก AI และอนุญาตเครื่องมือค้นหา:

User-agent: GPTBot
Disallow: /

User-agent: CCBot
Disallow: /

User-agent: Google-Extended
Disallow: /

User-agent: ClaudeBot
Disallow: /

User-agent: anthropic-ai
Disallow: /

User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml

user-agent ที่ควรรู้จัก

User-agent เจ้าของ วัตถุประสงค์
Googlebot Google Search การจัดทำดัชนีเว็บ
Googlebot-Image Google ค้นหารูปภาพ
Google-Extended Google การฝึก Bard/Gemini (เลือกไม่เข้าร่วมได้)
Bingbot Microsoft ค้นหา Bing
DuckDuckBot DuckDuckGo ค้นหา DDG
GPTBot OpenAI ChatGPT / การฝึก (เลือกไม่เข้าร่วมได้)
ClaudeBot Anthropic การฝึก Claude (เลือกไม่เข้าร่วมได้)
CCBot Common Crawl ชุดข้อมูลที่ LLM หลายตัวใช้
AhrefsBot Ahrefs ดัชนีลิงก์ย้อนกลับสำหรับ SEO
SemrushBot Semrush การวิจัย SEO
MJ12bot Majestic การวิจัย SEO

บอทฝึก AI ใช้แนวทางเลือกไม่เข้าร่วมตามธรรมเนียม ไม่ใช่ข้อกำหนดทางกฎหมาย ผู้ให้บริการที่มีเจตนาดีจะปฏิบัติตามคำสั่งเหล่านี้ ส่วนผู้ที่ขาดความเคร่งครัดจะไม่ทำตาม

กฎการจับคู่เส้นทาง

  • เส้นทางเป็นแบบสัมพัทธ์กับรากของโดเมนและเริ่มด้วย /
  • * จับคู่กับอักขระใดก็ได้ Disallow: /*.pdf$ บล็อกไฟล์ PDF ทั้งหมด
  • $ ยึดกับส่วนท้ายของ URL Disallow: /*/trash$ บล็อก /foo/trash แต่ไม่บล็อก /foo/trashes/...
  • การจับคู่ที่ยาวที่สุดชนะ Allow: /admin/public/ แทนที่ Disallow: /admin/ สำหรับเส้นทางย่อยนั้น
  • เส้นทางแยกแยะตัวพิมพ์ใหญ่-เล็ก

สิ่งที่ robots.txt ทำไม่ได้

  • ลบหน้าออกจาก Google ใช้เมตาแท็ก noindex บนหน้านั้นเอง
  • ปกป้อง URL จากมนุษย์ robots.txt เป็นสาธารณะ และเป็นเพียงคำแนะนำสำหรับบอทที่ปฏิบัติตาม
  • จำกัดอัตราการเข้าถึงของ Googlebot Google เพิกเฉยต่อ Crawl-delay ให้ใช้ Search Console
  • บล็อกบอทที่เพิกเฉยต่อ robots.txt เครื่องมือดึงข้อมูลสแปมไม่อ่านไฟล์นี้

รายการตรวจสอบการนำไปใช้

  1. วางที่ https://yourdomain.com/robots.txt ที่รากเท่านั้น
  2. เสิร์ฟด้วย Content-Type: text/plain (เซิร์ฟเวอร์ส่วนใหญ่ทำให้อัตโนมัติ)
  3. ขนาด: น้อยกว่า 500 KB Google จะตัดไฟล์ที่ใหญ่กว่านี้
  4. หลังการนำไปใช้ ให้ตรวจสอบไฟล์ที่ดึงมาในเครื่องมือ robots.txt Tester ของ Google Search Console
  5. เมื่อลบ Disallow โปรดทราบว่าการยกเลิกการจัดทำดัชนีอาจใช้เวลาหลายสัปดาห์

คำถามที่พบบ่อย

ไม่จำเป็นเสมอไป หากไม่มี ครอว์เลอร์จะถือว่า “อนุญาตทุกอย่าง” หากคุณมีสิ่งที่ต้องบล็อก เช่น staging, ผู้ดูแลระบบ, การชำระเงิน, การค้นหาภายใน ก็จำเป็นต้องมี

คุณสามารถขอให้พวกมันหยุดผ่านบล็อก user-agent เช่น GPTBot, ClaudeBot, CCBot และ Google-Extended ผู้ให้บริการรายใหญ่ปฏิบัติตาม ส่วนเครื่องมือดึงข้อมูลที่ขาดความรับผิดชอบจะเพิกเฉยโดยสิ้นเชิง

ครอว์เลอร์มีความยืดหยุ่น คำสั่งที่ไม่รู้จักจะถูกเพิกเฉย ข้อผิดพลาดร้ายแรง (HTTP 404 หรือ 500) จะถูกถือว่า “อนุญาตทุกอย่าง” ตรวจสอบไฟล์ก่อนนำไปใช้

ที่รากของแต่ละโฮสต์ที่คุณต้องการครอบคลุม, https://www.example.com/robots.txt และ https://example.com/robots.txt เป็นไฟล์แยกกันสำหรับโฮสต์แยกกัน

ไม่ เส้นทางที่คุณป้อนใช้เพื่อประกอบไฟล์เท่านั้น ไม่มีการบันทึกหรือเก็บล็อก

เครื่องมือที่เกี่ยวข้อง

ตารางอ้างอิง ASCII

ตาราง ASCII ครบตั้งแต่ 0 ถึง 127 พร้อมค่าเลขฐานสิบ ฐานสิบหก ฐานแปด ฐานสอง และรูปแบบการอ้างอิงอักขระแบบตัวเลขของ HTML รวม NUL, LF และ DEL

อ้างอิงตัวอักษร HTML

รายการที่สามารถค้นหาได้ขององค์ประกอบ HTML พร้อมรหัสชื่อและรหัสตัวเลข รวมถึงฟังก์ชันสำเนาด้วยคลิกเดียวสำหรับตัวอักษรพิเศษและสัญลักษณ์ต่างๆ

ตารางอ้างอิงแป้นพิมพ์ลัด

ค้นหาแป้นพิมพ์ลัดเริ่มต้นตามเอกสารของ VS Code, Chrome และ Bash ที่ใช้ GNU Readline บน macOS, Windows และ Linux

ตัวตรวจสอบอีเมล

ตรวจสอบที่อยู่อีเมล: ตรวจไวยากรณ์ RFC 5322 ค้นหา MX เรกคอร์ดแบบเรียลไทม์ พร้อมรายละเอียดส่วนท้องถิ่น โดเมน และความยาว ไม่มีการส่งอีเมลใด ๆ

เครื่องมือสร้าง EditorConfig

สร้างไฟล์ .editorconfig จากกฎการเยื้อง การจบบรรทัด และชุดอักขระของคุณ แล้วเพิ่มเซกชันที่ถูกต้องให้ทุกภาษาในรีโพซิทอรี ทั้ง Python, Go, YAML, Makefile และอื่น ๆ

ตัวลดรูปพีชคณิตบูลีน

ประเมินนิพจน์บูลีนสำหรับทุกชุดอินพุตและดูตารางค่าความจริงที่สมบูรณ์ รองรับตัวแปรสูงสุดห้าตัวและตัวดำเนินการ &, |, !, ^

เครื่องมือนี้มีให้บริการในภาษาอื่น