ไฟล์ robots.txt เป็นไฟล์ข้อความธรรมดาที่อยู่บนเซิร์ฟเวอร์ของเว็บไซต์ของคุณ ซึ่งใช้เป็นแนวทางสำหรับเว็บครอว์เลอร์หรือบอทในการนำทางและรวบรวมข้อมูลหน้าเว็บต่างๆ ของเว็บไซต์ของคุณ
ในฐานะส่วนหนึ่งของ Robots Exclusion Protocol (REP) ฟังก์ชันนี้มีหน้าที่หลักในการจัดการปริมาณการเข้าชมจากโปรแกรมรวบรวมข้อมูล และป้องกันไม่ให้หน้าเว็บหรือส่วนใดส่วนหนึ่งของเว็บไซต์ของคุณถูกจัดทำดัชนีโดยเครื่องมือค้นหา
ในบทความนี้:
ความสำคัญของ robots.txt
- การควบคุมเว็บครอว์เลอร์: ฟังก์ชันนี้จะบอกโปรแกรมรวบรวมข้อมูลเว็บว่าหน้าเว็บใดที่พวกมันสามารถเข้าชมได้และหน้าเว็บใดที่พวกมันไม่สามารถเข้าชมได้ ซึ่งจะช่วยให้คุณจัดการได้ว่าเครื่องมือค้นหาเห็นเว็บไซต์ของคุณอย่างไร
- ปกป้องข้อมูลที่ละเอียดอ่อน: สามารถบล็อกโปรแกรมรวบรวมข้อมูลไม่ให้เข้าถึงหน้าเว็บที่มีข้อมูลส่วนตัวหรือข้อมูลที่ละเอียดอ่อนได้
- เพิ่มประสิทธิภาพงบประมาณการรวบรวมข้อมูลการบล็อกหน้าเว็บที่ไม่จำเป็นจะช่วยให้เครื่องมือค้นหาให้ความสำคัญกับส่วนที่สำคัญที่สุดของเว็บไซต์ของคุณ
- ปรับปรุงประสิทธิภาพของไซต์การลดจำนวนหน้าเว็บที่เว็บไซต์ทำการรวบรวมข้อมูลจะช่วยลดภาระของเซิร์ฟเวอร์และปรับปรุงประสิทธิภาพโดยรวมของเว็บไซต์ได้
- ป้องกันการสร้างเนื้อหาซ้ำ: ช่วยป้องกันไม่ให้เครื่องมือค้นหาจัดทำดัชนีเนื้อหาที่ซ้ำกัน ซึ่งจะช่วยปรับปรุงอันดับการค้นหาของเว็บไซต์ของคุณได้
- รักษาความปลอดภัยของสถานที่: สามารถใช้เพื่อบล็อกการเข้าถึงพื้นที่ผู้ดูแลระบบและพื้นที่ปลอดภัยของเว็บไซต์ของคุณได้
- ยกระดับประสบการณ์ผู้ใช้การจัดการการเข้าถึงของโปรแกรมรวบรวมข้อมูล (crawler) ช่วยให้มั่นใจได้ว่าผู้ใช้จะพบเนื้อหาที่เกี่ยวข้องและสำคัญที่สุดเมื่อค้นหาเว็บไซต์ของคุณ
ตรวจสอบไฟล์ robots.txt ของเว็บไซต์ของคุณ
ในการเปิดไฟล์ robots.txt ของเว็บไซต์ของคุณ ให้ทำตามขั้นตอนด้านล่างนี้:
- เปิดเว็บเบราว์เซอร์ของคุณ (เช่น Chrome, Firefox หรือ Safari)
- ในแถบที่อยู่ ให้พิมพ์ URL ของเว็บไซต์ของคุณตามด้วยเครื่องหมาย '/robots.txt' (โดยไม่ต้องใส่เครื่องหมายคำพูด)
- ตัวอย่างเช่น หาก URL ของเว็บไซต์ของคุณคือ www.example.com คุณจะต้องพิมพ์ www.example.com/robots.txt เพื่อเปิดไฟล์.

คำสั่งต่างๆ ภายในไฟล์ robots.txt
- ตัวแทนผู้ใช้: ระบุเว็บครอว์เลอร์ที่จะใช้กฎเหล่านี้ เครื่องหมายดอกจัน (
*หมายความว่ากฎเหล่านี้ใช้กับโปรแกรมรวบรวมข้อมูลทุกตัว - ไม่อนุญาต: สั่งให้โปรแกรมรวบรวมข้อมูลไม่เข้าถึงเส้นทาง URL ที่ระบุ
- อนุญาต: แทนที่ค่า a
Disallowคำสั่งเพื่ออนุญาตการเข้าถึงเส้นทาง URL ที่ระบุ - แผนผังเว็บไซต์: ระบุตำแหน่งของไฟล์แผนผังเว็บไซต์ (sitemap) ซึ่งช่วยให้เครื่องมือค้นหาเข้าใจโครงสร้างของเว็บไซต์ของคุณ