เครื่องมือสร้างไฟล์ robots.txt
กำหนดครอว์เลอร์ที่คุณต้องการเจาะจง ระบุเส้นทางที่ต้องการบล็อกและเส้นทางที่ต้องการอนุญาต เพิ่ม crawl-delay หากต้องการ และชี้ไปยังแผนผังเว็บไซต์ของคุณ แล้วเครื่องมือจะประกอบไฟล์ robots.txt ที่จัดรูปแบบถูกต้องซึ่งคุณคัดลอกและนำไปใช้ได้ มันจัดการรูปแบบบรรทัดและเครื่องหมายวรรคตอนให้ครบถ้วน คุณจึงไม่ต้องจำไวยากรณ์หรือการสะกดชื่อ user-agent
วิธีสร้างไฟล์
-
1
กำหนด user-agent
ป้อนครอว์เลอร์ที่กฎจะมีผล หรือปล่อย * ไว้เพื่อเจาะจงบอททุกตัว
-
2
ระบุเส้นทางที่จะบล็อก
เพิ่มไดเรกทอรีหรือเส้นทางที่จะบล็อก บรรทัดละหนึ่งรายการ เช่น /admin/ หรือ /checkout/
-
3
ระบุเส้นทางที่จะอนุญาต
เพิ่มเส้นทางที่ควรยังถูกรวบรวมข้อมูลได้ บรรทัดละหนึ่งรายการ เพื่อสร้างข้อยกเว้นภายใน Disallow ที่กว้างกว่า
-
4
เพิ่มแผนผังเว็บไซต์และ crawl-delay
ประกาศ URL แผนผังเว็บไซต์ของคุณ และหากจำเป็น ระบุ crawl-delay เป็นวินาที
-
5
คัดลอกและนำไปใช้
คัดลอกไฟล์ที่สร้างขึ้นและวางไว้ที่ https://yourdomain.com/robots.txt ที่รากเท่านั้น ไม่ใช่ไดเรกทอรีย่อย
เทมเพลตเริ่มต้นที่พบบ่อย
อนุญาตทุกอย่าง (เว็บไซต์ส่วนใหญ่):
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
บล็อก staging / ผู้ดูแลระบบ:
User-agent: *
Disallow: /admin/
Disallow: /staging/
Disallow: /cart/
Disallow: /checkout/
Disallow: /*?session=
Sitemap: https://example.com/sitemap.xml
บล็อกครอว์เลอร์ฝึก AI และอนุญาตเครื่องมือค้นหา:
User-agent: GPTBot
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: *
Allow: /
Sitemap: https://example.com/sitemap.xml
user-agent ที่ควรรู้จัก
| User-agent | เจ้าของ | วัตถุประสงค์ |
|---|---|---|
| Googlebot | Google Search | การจัดทำดัชนีเว็บ |
| Googlebot-Image | ค้นหารูปภาพ | |
| Google-Extended | การฝึก Bard/Gemini (เลือกไม่เข้าร่วมได้) | |
| Bingbot | Microsoft | ค้นหา Bing |
| DuckDuckBot | DuckDuckGo | ค้นหา DDG |
| GPTBot | OpenAI | ChatGPT / การฝึก (เลือกไม่เข้าร่วมได้) |
| ClaudeBot | Anthropic | การฝึก Claude (เลือกไม่เข้าร่วมได้) |
| CCBot | Common Crawl | ชุดข้อมูลที่ LLM หลายตัวใช้ |
| AhrefsBot | Ahrefs | ดัชนีลิงก์ย้อนกลับสำหรับ SEO |
| SemrushBot | Semrush | การวิจัย SEO |
| MJ12bot | Majestic | การวิจัย SEO |
บอทฝึก AI ใช้แนวทางเลือกไม่เข้าร่วมตามธรรมเนียม ไม่ใช่ข้อกำหนดทางกฎหมาย ผู้ให้บริการที่มีเจตนาดีจะปฏิบัติตามคำสั่งเหล่านี้ ส่วนผู้ที่ขาดความเคร่งครัดจะไม่ทำตาม
กฎการจับคู่เส้นทาง
- เส้นทางเป็นแบบสัมพัทธ์กับรากของโดเมนและเริ่มด้วย
/ *จับคู่กับอักขระใดก็ได้Disallow: /*.pdf$บล็อกไฟล์ PDF ทั้งหมด$ยึดกับส่วนท้ายของ URLDisallow: /*/trash$บล็อก/foo/trashแต่ไม่บล็อก/foo/trashes/...- การจับคู่ที่ยาวที่สุดชนะ
Allow: /admin/public/แทนที่Disallow: /admin/สำหรับเส้นทางย่อยนั้น - เส้นทางแยกแยะตัวพิมพ์ใหญ่-เล็ก
สิ่งที่ robots.txt ทำไม่ได้
- ลบหน้าออกจาก Google ใช้เมตาแท็ก
noindexบนหน้านั้นเอง - ปกป้อง URL จากมนุษย์ robots.txt เป็นสาธารณะ และเป็นเพียงคำแนะนำสำหรับบอทที่ปฏิบัติตาม
- จำกัดอัตราการเข้าถึงของ Googlebot Google เพิกเฉยต่อ
Crawl-delayให้ใช้ Search Console - บล็อกบอทที่เพิกเฉยต่อ robots.txt เครื่องมือดึงข้อมูลสแปมไม่อ่านไฟล์นี้
รายการตรวจสอบการนำไปใช้
- วางที่
https://yourdomain.com/robots.txtที่รากเท่านั้น - เสิร์ฟด้วย
Content-Type: text/plain(เซิร์ฟเวอร์ส่วนใหญ่ทำให้อัตโนมัติ) - ขนาด: น้อยกว่า 500 KB Google จะตัดไฟล์ที่ใหญ่กว่านี้
- หลังการนำไปใช้ ให้ตรวจสอบไฟล์ที่ดึงมาในเครื่องมือ robots.txt Tester ของ Google Search Console
- เมื่อลบ Disallow โปรดทราบว่าการยกเลิกการจัดทำดัชนีอาจใช้เวลาหลายสัปดาห์
คำถามที่พบบ่อย
ไม่จำเป็นเสมอไป หากไม่มี ครอว์เลอร์จะถือว่า “อนุญาตทุกอย่าง” หากคุณมีสิ่งที่ต้องบล็อก เช่น staging, ผู้ดูแลระบบ, การชำระเงิน, การค้นหาภายใน ก็จำเป็นต้องมี
คุณสามารถขอให้พวกมันหยุดผ่านบล็อก user-agent เช่น GPTBot, ClaudeBot, CCBot และ Google-Extended ผู้ให้บริการรายใหญ่ปฏิบัติตาม ส่วนเครื่องมือดึงข้อมูลที่ขาดความรับผิดชอบจะเพิกเฉยโดยสิ้นเชิง
ครอว์เลอร์มีความยืดหยุ่น คำสั่งที่ไม่รู้จักจะถูกเพิกเฉย ข้อผิดพลาดร้ายแรง (HTTP 404 หรือ 500) จะถูกถือว่า “อนุญาตทุกอย่าง” ตรวจสอบไฟล์ก่อนนำไปใช้
ที่รากของแต่ละโฮสต์ที่คุณต้องการครอบคลุม, https://www.example.com/robots.txt และ https://example.com/robots.txt เป็นไฟล์แยกกันสำหรับโฮสต์แยกกัน
ไม่ เส้นทางที่คุณป้อนใช้เพื่อประกอบไฟล์เท่านั้น ไม่มีการบันทึกหรือเก็บล็อก
เครื่องมือที่เกี่ยวข้อง
ตารางอ้างอิง ASCII
ตาราง ASCII ครบตั้งแต่ 0 ถึง 127 พร้อมค่าเลขฐานสิบ ฐานสิบหก ฐานแปด ฐานสอง และรูปแบบการอ้างอิงอักขระแบบตัวเลขของ HTML รวม NUL, LF และ DEL
อ้างอิงตัวอักษร HTML
รายการที่สามารถค้นหาได้ขององค์ประกอบ HTML พร้อมรหัสชื่อและรหัสตัวเลข รวมถึงฟังก์ชันสำเนาด้วยคลิกเดียวสำหรับตัวอักษรพิเศษและสัญลักษณ์ต่างๆ
ตารางอ้างอิงแป้นพิมพ์ลัด
ค้นหาแป้นพิมพ์ลัดเริ่มต้นตามเอกสารของ VS Code, Chrome และ Bash ที่ใช้ GNU Readline บน macOS, Windows และ Linux
ตัวตรวจสอบอีเมล
ตรวจสอบที่อยู่อีเมล: ตรวจไวยากรณ์ RFC 5322 ค้นหา MX เรกคอร์ดแบบเรียลไทม์ พร้อมรายละเอียดส่วนท้องถิ่น โดเมน และความยาว ไม่มีการส่งอีเมลใด ๆ
เครื่องมือสร้าง EditorConfig
สร้างไฟล์ .editorconfig จากกฎการเยื้อง การจบบรรทัด และชุดอักขระของคุณ แล้วเพิ่มเซกชันที่ถูกต้องให้ทุกภาษาในรีโพซิทอรี ทั้ง Python, Go, YAML, Makefile และอื่น ๆ
ตัวลดรูปพีชคณิตบูลีน
ประเมินนิพจน์บูลีนสำหรับทุกชุดอินพุตและดูตารางค่าความจริงที่สมบูรณ์ รองรับตัวแปรสูงสุดห้าตัวและตัวดำเนินการ &, |, !, ^
เครื่องมือนี้มีให้บริการในภาษาอื่น
- Robots.txt-generator [NL]
- Générateur de Robots.txt [FR]
- مولد ملفات robots.txt [AR]
- Generator robots.txt [PL]
- Generator Robots.txt [ID]
- Robots.txt-Generator [DE]
- Generador de Robots.txt [ES]
- Robots.txtジェネレーター [JA]
- Robots.txt-generator [SV]
- Bộ tạo file robots.txt [VI]
- Robots.txt 생성기 [KO]
- Gerador de Robots.txt [PT]
- Robots.txt Generator [EN]
- Generatore di Robots.txt [IT]
- Генератор robots.txt [RU]
- Robots.txt Oluşturucu [TR]
- Robots.txt 生成器 [ZH]