บอท AI มีสามแบบ และควรคิดแยกกัน
- บอทฝึกโมเดล (เช่น GPTBot, ClaudeBot, CCBot) เก็บเนื้อหาไปสร้างชุดข้อมูล บล็อกแล้วไม่กระทบว่าจะมีคนเจอเว็บคุณหรือไม่
- บอทค้นหาของ AI (เช่น OAI-SearchBot, Claude-SearchBot, PerplexityBot) ทำให้เว็บคุณไปโผล่เป็นแหล่งอ้างอิงในคำตอบ บล็อกแล้วเสียโอกาสได้ผู้เข้าชมจาก AI
- บอทที่ดึงตามคำสั่งผู้ใช้ (เช่น ChatGPT-User, Claude-User) มาเฉพาะเมื่อมีคนขอให้ AI อ่านลิงก์ของคุณ OpenAI, Perplexity และ Meta ระบุว่าบอทแบบนี้อาจไม่ทำตาม robots.txt
- หลายเว็บต้องการ “ไม่ให้ฝึก แต่ให้ค้นเจอ” ซึ่งทำได้ เพราะแต่ละเจ้าแยกชื่อบอทตามจุดประสงค์แล้ว
ข้อควรรู้
- Google-Extended ไม่ได้เป็นบอทที่เข้าเว็บ มันเป็นชื่อที่ใช้บอก Google ว่าข้อมูลที่ Googlebot เก็บไปจะใช้ฝึกและอ้างอิงใน Gemini ได้หรือไม่ Google ระบุว่าไม่มีผลกับการติดอันดับใน Google Search
- Applebot-Extended ก็เช่นกัน ไม่ได้เข้าเว็บเอง แค่คุมว่าข้อมูลที่ Applebot เก็บจะใช้ฝึกโมเดลของ Apple ได้หรือไม่
- ชื่อบอทต้องตรงทั้งคำ กลุ่ม “Applebot” ไม่ครอบคลุม “Applebot-Extended” ถ้าไม่มีกลุ่มของชื่อนั้น บอทจะใช้กลุ่ม * แทน (RFC 9309)
- Bytespider ของ ByteDance ไม่มีเอกสารทางการที่เข้าถึงได้ และมีรายงานหลายแห่งว่าไม่ทำตาม robots.txt เราจึงไม่ใส่ไว้ในตาราง
- robots.txt เป็นคำขอ ไม่ใช่การบังคับ ถ้าต้องการกันจริงต้องบล็อกที่เซิร์ฟเวอร์หรือ CDN
- ถ้าเซิร์ฟเวอร์ตอบ robots.txt เป็น error 5xx บอทต้องถือว่าห้ามทั้งเว็บ ถ้าเป็น 4xx (เช่น 404) บอทถือว่าเข้าได้ทั้งหมด
ตรวจอย่างไร
- การตัดสินใช้ไลบรารี robots-parser ซึ่งทำตาม RFC 9309: เลือกกลุ่มจากชื่อบอทแบบไม่สนตัวพิมพ์เล็กใหญ่, กฎที่ยาวที่สุดชนะ, ถ้ายาวเท่ากัน Allow ชนะ, รองรับ * และ $
- เราเทียบผลของเครื่องมือนี้กับไลบรารี Protego บน robots.txt จริงของ 31 เว็บไทยและต่างประเทศ รวม 64,768 การตัดสิน ต่างกัน 98 ครั้ง: 74 ครั้งเป็นกรณี Applebot-Extended ที่ Protego จับชื่อแบบคำย่อยซึ่งผิด RFC และ 24 ครั้งเป็น path ที่ลงท้ายด้วย “?” เปล่า ซึ่งเครื่องมือนี้ตัด “?” ทิ้ง
- และเทียบบนไฟล์สุ่ม 4,000 ไฟล์ที่เน้นโครงสร้างแปลก ๆ อีก 96,000 การตัดสิน ต่างกัน 338 ครั้ง ทุกครั้งมาจากบรรทัด Crawl-delay ที่แทรกระหว่าง User-agent ซึ่งเครื่องมือนี้ข้ามไปแบบเดียวกับตัวอ่านอ้างอิงของ Google
- ไลบรารี robots-parser เดิมมีจุดที่ไม่ตรง RFC สามจุด เราแก้ไว้ในตัวครอบแล้ว: ไฟล์ /robots.txt ต้องอ่านได้เสมอ, กลุ่มของบอทที่ไม่มีกฎเลยต้องถือว่าเข้าได้, และบรรทัด Sitemap หรือ Crawl-delay ต้องไม่ตัดกลุ่ม
- รายชื่อบอท จุดประสงค์ และการทำตาม robots.txt มาจากเอกสารของแต่ละบริษัท ตรวจล่าสุด 2026-09-23
คำถามที่พบบ่อย
บล็อก GPTBot แล้วจะหายจาก ChatGPT ไหม
ไม่หายจากการค้นหา GPTBot ใช้เก็บข้อมูลไปฝึกโมเดลเท่านั้น การแสดงเว็บในผลค้นหาของ ChatGPT ใช้ OAI-SearchBot ซึ่งแยกกัน
บล็อก Google-Extended แล้วอันดับ Google ตกไหม
Google ระบุว่าไม่มีผลกับการติดอันดับใน Google Search และไม่ได้ใช้เป็นสัญญาณจัดอันดับ
robots.txt ของฉันถูกส่งไปไหนไหม
ไม่ การตรวจเกิดในเบราว์เซอร์ของคุณทั้งหมด หน้านี้ไม่ได้ดึง robots.txt จากเว็บคุณเอง คุณต้องคัดลอกมาวาง
ทำไมไม่มีบอท AI ตัวอื่น
ตารางนี้ใส่เฉพาะบอทที่มีเอกสารทางการระบุชื่อและจุดประสงค์ชัดเจน ตอนนี้มี 23 ตัว บอทฝึกโมเดล 8 ตัว
แหล่งอ้างอิง
- OpenAI https://developers.openai.com/api/docs/bots
- Anthropic https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
- Google https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
- Apple https://support.apple.com/en-us/119829
- Perplexity https://docs.perplexity.ai/guides/bots
- Meta https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/
- Common Crawl https://commoncrawl.org/ccbot
- Amazon https://developer.amazon.com/amazonbot
- Mistral https://docs.mistral.ai/robots
- RFC 9309 — Robots Exclusion Protocol