10 คำสั่งใน robots.txt ที่มือใหม่ SEO ต้องรู้ก่อนเริ่มทำเว็บ
อธิบาย 10 คำสั่งหลักในไฟล์ robots.txt ที่มือใหม่หัดทำ SEO ต้องเข้าใจ เพื่อให้ควบคุมการเข้าดูของ Search Engine และป้องกันปัญหาทางเทคนิคที่พบบ่อย
การตั้งค่าไฟล์ robots.txt ถือเป็นขั้นตอนพื้นฐานที่สำคัญมากสำหรับมือใหม่ที่เริ่มเรียน SEO เพราะไฟล์นี้ทำหน้าที่กำหนดว่าเครื่องมือค้นหา (Search Engine Bots) สามารถเข้าถึงหน้าเว็บหรือส่วนใดของเว็บไซต์ได้บ้าง หากตั้งค่าผิดอาจส่งผลให้เว็บไซต์ไม่ถูกนำเข้าสู่ระบบดัชนี (Indexing) หรือสูญเสียอันดับการค้นหาโดยไม่รู้ตัว บทความนี้จึงสรุป 10 คำสั่งสำคัญใน robots.txt ที่มือใหม่ต้องทำความเข้าใจอย่างถูกต้องก่อนจะเริ่มปรับแต่งเว็บไซต์
ความแตกต่างระหว่าง robots.txt และ meta robots

ก่อนจะลงมือเขียนคำสั่ง สิ่งแรกที่ต้องแยกให้ออกคือ robots.txt กับ meta robots tag ต่างกันอย่างไร robots.txt เป็นไฟล์ที่วางไว้ที่รากของเว็บไซต์ (root directory) และใช้ควบคุมไม่ให้ Search Engine Bot เข้ามาดาวน์โหลดหรือดูหน้าเว็บนั้นๆ เลย ในขณะที่ meta robots tag อยู่ภายในโค้ด HTML ของแต่ละหน้า และใช้สั่งว่า “ห้าม index” หรือ “ห้าม follow” ลิงก์ในหน้านั้นๆ แม้ Bot จะเข้ามาดูได้ก็ตาม การสับสนสองตัวนี้คือสาเหตุหลักที่ทำให้มือใหม่มักตั้งค่าผิดและกระทบกับอันดับ SEO โดยไม่ตั้งใจ
คำสั่งพื้นฐาน 3 ข้อที่ต้องเข้าใจก่อน
User-agent: การระบุเป้าหมายของคำสั่ง
คำสั่งแรกคือ User-agent ซึ่งใช้ระบุกลุ่มของ Bot ที่เราจะส่งคำสั่งไปหา เช่น User-agent: * หมายความว่าคำสั่งถัดไปจะใช้กับทุก Bot หรือ User-agent: GPTBot ก็หมายความว่าคำสั่งนั้นใช้เฉพาะกับ Bot ของ ChatGPT เท่านั้น หากไม่ระบุ User-agent ก่อนแล้วเขียน Disallow ต่อทันที คำสั่งนั้นจะไม่ถูกต้องตามมาตรฐานและอาจถูกมองข้ามโดย Search Engine
Disallow: การห้ามเข้าพื้นที่เฉพาะ
คำสั่ง Disallow ใช้ระบุ path หรือ directory ที่ห้าม Bot เข้าไป เช่น Disallow: /admin/ จะป้องกันไม่ให้ Bot เข้าไปดูหน้าหลังบ้าน หรือ Disallow: /search?q= เพื่อไม่ให้ Bot เข้าไปเก็บหน้าผลการค้นหาภายในเว็บ ซึ่งมักมีเนื้อหาซ้ำกันและไม่มีคุณค่าในการค้นหา
Allow: การอนุญาตแม้จะอยู่ในพื้นที่ที่ห้าม
คำสั่ง Allow ใช้ข้อยกเว้น คือแม้ path บางส่วนจะถูก Disallow ไว้ แต่เราต้องการให้ Bot เข้ามาใน sub-path เฉพาะก็ได้ ตัวอย่างเช่น Disallow: /products/ ต่อด้วย Allow: /products/category1/ จะทำให้ Bot เข้าไปดูเฉพาะหมวดหมู่ที่ 1 ได้เท่านั้น ซึ่งคำสั่งนี้ช่วยให้เราควบคุมระดับความละเอียดของการเข้าถึงได้ดียิ่งขึ้น
คำสั่งขั้นสูงที่มือใหม่ควรรู้
Sitemap: การชี้เส้นทางไฟล์ XML Sitemap
คำสั่ง Sitemap: https://example.com/sitemap.xml เป็นคำสั่งที่ควรใส่ไว้เสมอ เพราะเป็นการบอก Search Engine ว่าไฟล์ XML Sitemap ของเว็บเราอยู่ที่ไหน แม้ Search Engine จะสามารถค้นพบเองได้ในบางกรณี แต่การระบุชัดเจนจะช่วยให้การ Crawl มีประสิทธิภาพมากขึ้น โดยเฉพาะเว็บที่มีหน้าจำนวนมาก
Crawl-delay: การควบคุมความเร็วในการ Crawl
คำสั่ง Crawl-delay ใช้ระบุจำนวนวินาทีที่ Bot ต้องรอระหว่างเข้าดูแต่ละหน้า เช่น Crawl-delay: 10 หมายความว่า Bot ต้องรอ 10 วินาทีก่อนจะโหลดหน้าถัดไป คำสั่งนี้เหมาะสำหรับเว็บที่มีทรัพยากรจำกัดหรือใช้ shared hosting เพื่อป้องกันไม่ให้ Bot เข้ามาพร้อมกันจำนวนมากจนเว็บช้าหรือล่ม อย่างไรก็ตาม Google ไม่สนับสนุนคำสั่งนี้อย่างเป็นทางการ ดังนั้นจึงควรใช้เฉพาะกับ Bot อื่นๆ ที่รองรับคำสั่งนี้เท่านั้น
Wildcards: การใช้สัญลักษณ์ * ใน Disallow
สัญลักษณ์ * ใช้แทนตัวอักษรหลายตัว เช่น Disallow: /page?id=* จะห้าม Bot เข้าไปทุก URL ที่มี query string เริ่มต้นด้วย id= ซึ่งช่วยลดปริมาณ URL ซ้ำๆ ที่ Bot ต้อง Crawl โดยไม่จำเป็น
คำสั่งที่ควรหลีกเลี่ยงหรือใช้ด้วยความระมัดระวัง
Disallow /: การบล็อกทั้งเว็บไซต์
คำสั่ง Disallow: / หมายความว่าห้าม Bot เข้ามาที่เว็บทั้งหมด ซึ่งมือใหม่มักใช้โดยไม่ได้คิดให้รอบคอบ คำสั่งนี้เหมาะใช้เฉพาะช่วงที่เว็บไซต์ยังอยู่ในขั้นตอนการพัฒนาและยังไม่พร้อมให้ Search Engine เข้ามาเท่านั้น หากใช้งานบนเว็บที่พร้อมแล้ว จะทำให้เว็บไม่ถูกนำเข้าสู่ระบบดัชนีเลย และสูญเสียโอกาสในการค้นหาทั้งหมด
การใช้ Disallow กับไฟล์ CSS และ JavaScript
การ Disallow ไฟล์ CSS และ JavaScript อาจดูเหมือนช่วยประหยัด bandwidth แต่ในทางกลับกันจะขัดขวางการทำงานของ Search Engine เพราะ Bot ต้องการไฟล์เหล่านี้ในการเรนเดอร์หน้าเว็บเพื่อเข้าใจเนื้อหาและโครงสร้าง หากบล็อกไว้ Google อาจไม่สามารถอ่านหรือตีความเนื้อหาได้ถูกต้อง ซึ่งส่งผลต่ออันดับ SEO โดยตรง
Disallow กับ URL ที่ต้องการให้ถูก Index
ความผิดพลาดที่พบบ่อยคือมือใหม่มัก Disallow URL ที่ต้องการให้ติดอันดับ เช่น หน้าสินค้าหรือหน้าบทความ เพราะคิดว่า URL นั้นซ้ำกันหรือมี query string แต่ในความเป็นจริงหากหน้าเหล่านั้นมีเนื้อหาที่มีคุณค่าและต้องการให้ผู้ใช้ค้นหาพบ การ Disallow จะทำให้ Bot ไม่สามารถเข้าถึงได้เลยและ URL นั้นจะหายไปจากระบบดัชนีโดยสมบูรณ์
ข้อผิดพลาดที่มือใหม่มักทำ
การสะกดชื่อไฟล์ผิด
ชื่อไฟล์ต้องเป็น robots.txt ตัวเล็กทั้งหมด หากพิมพ์เป็น robots.txt หรือ ROBOTS.TXT Search Engine อาจไม่พบไฟล์นี้และคำสั่งทั้งหมดจะไม่มีผลใดๆ เลย ควรตรวจสอบชื่อไฟล์ให้ถูกต้องทุกตัวอักษรก่อนอัปโหลด
การลืมอัปเดตไฟล์หลังปรับโครงสร้างเว็บ
เมื่อมีการเปลี่ยน URL, เพิ่ม directory ใหม่ หรือลบหน้าเว็บออกไป ควรอัปเดตไฟล์ robots.txt ตามไปด้วย หากคำสั่งเดิมยังคงชี้ไปที่ path ที่ไม่มีอยู่แล้ว แม้จะไม่ส่งผลเสียโดยตรง แต่อาจทำให้การ Crawl มีประสิทธิภาพลดลงและสิ้นเปลืองทรัพยากรโดยไม่จำเป็น
การรวมคำสั่งกับ meta robots โดยไม่แยก
มือใหม่มักคิดว่า Disallow ใน robots.txt เท่ากับ noindex แต่ไม่ใช่ หากต้องการไม่ให้หน้าถูก index ควรใช้ meta robots tag ใน HTML แทน เพราะแม้ Bot จะถูกห้ามเข้ามาใน robots.txt แต่หน้าเว็บนั้นอาจถูก Crawl จากลิงก์ภายนอกและถูก index ได้หากไม่มี meta robots tag รองรับ
คำถามที่พบบ่อย
robots.txt กับ meta robots tag ต่างกันอย่างไร
robots.txt เป็นไฟล์ที่ควบคุมไม่ให้ Bot เข้ามาดาวน์โหลดหน้าเว็บเลย ในขณะที่ meta robots tag อยู่ใน HTML ของแต่ละหน้าและใช้สั่งว่าห้าม index หรือห้าม follow ลิงก์ แม้ Bot จะเข้ามาดูได้ก็ตาม ทั้งสองตัวทำงานคนละระดับและควรใช้ร่วมกันอย่างเหมาะสม
การ Disallow ทั้งเว็บไซต์มีผลเสียอย่างไร
การ Disallow ทั้งเว็บไซต์ด้วยคำสั่ง Disallow: / จะทำให้ Search Engine ไม่สามารถเข้าถึงหน้าใดในเว็บได้เลย ส่งผลให้เว็บไม่ถูกนำเข้าสู่ระบบดัชนีและไม่สามารถติดอันดับในการค้นหาได้ คำสั่งนี้ควรใช้เฉพาะช่วงที่เว็บยังอยู่ในขั้นตอนการพัฒนาเท่านั้น
มือใหม่ควรเริ่มตั้งค่า robots.txt อย่างไร
มือใหม่ควรเริ่มจากค่าพื้นฐานเท่านั้น คือระบุ User-agent: * ต่อด้วย Disallow เฉพาะพื้นที่หลังบ้านเช่น /admin/ และ /wp-admin/ จากนั้นเพิ่ม Sitemap ชี้ไปยังไฟล์ XML Sitemap ของเว็บ และหลีกเลี่ยงการ Disallow ไฟล์ CSS, JavaScript หรือ URL ที่ต้องการให้ติดอันดับ
สรุป
การตั้งค่าไฟล์ robots.txt เป็นขั้นตอนพื้นฐานที่สำคัญมากสำหรับมือใหม่ที่เริ่มเรียน SEO เพราะไฟล์นี้ควบคุมการเข้าถึงของ Search Engine Bots โดยตรง คำสั่ง 10 ข้อที่กล่าวมาครอบคลุมทั้งคำสั่งพื้นฐานอย่าง User-agent, Disallow, Allow, Sitemap ไปจนถึงคำสั่งขั้นสูงอย่าง Crawl-delay และ Wildcards รวมถึงข้อผิดพลาดที่มือใหม่มักทำ เช่น การบล็อกทั้งเว็บไซต์โดยไม่ตั้งใจหรือการ Disallow ไฟล์ CSS และ JavaScript ที่จำเป็น การทำความเข้าใจแต่ละคำสั่งอย่างถูกต้องก่อนลงมือปรับแต่งจะช่วยให้เว็บไซต์มีโครงสร้างทางเทคนิคที่แข็งแกร่งและพร้อมสำหรับการทำ SEO ขั้นต่อไป หากต้องการเรียนรู้เพิ่มเติมเกี่ยวกับขั้นตอนถัดไปในการปรับแต่งเว็บไซต์ สามารถศึกษาเพิ่มเติมเกี่ยวกับ On-Page SEO และ Technical SEO ได้ในบทความถัดไป