ข้ามไปยังเนื้อหา
KoishiAI
EN

เช็กว่าบอท AI เข้าเว็บคุณได้ไหม

วาง robots.txt ของเว็บคุณ แล้วดูว่าบอทของ ChatGPT, Claude, Gemini, Perplexity และอื่น ๆ ถูกอนุญาตหรือถูกบล็อก ทั้งบอทที่เก็บข้อมูลไปฝึกโมเดล และบอทที่ทำให้เว็บคุณไปโผล่ในคำตอบของ AI

robots.txt ไม่ถูกส่งออกไปไหน — ตรวจในเบราว์เซอร์ทั้งหมด รายชื่อบอทตรวจกับเอกสารทางการ ณ 2026-09-23

เปิด https://เว็บของคุณ/robots.txt แล้วคัดลอกทั้งหมดมาวางที่นี่

ลองกับ:

สรุป

บอทฝึกโมเดลที่ถูกบล็อก
บอทค้นหาของ AI ที่เข้าได้
บอทดึงตามคำสั่งผู้ใช้ที่เข้าได้

    เก็บข้อมูลไปฝึกโมเดล

    บล็อกแล้วเนื้อหาใหม่ของคุณจะไม่ถูกนำไปฝึก AI รุ่นถัดไป

    บอท ผล ตัดสินโดย ทำตาม robots.txt
    GPTBot OpenAI ทำตาม
    ClaudeBot Anthropic ทำตาม
    Google-Extended Google · ไม่ใช่บอทแยก: คุมว่าข้อมูลที่ Googlebot เก็บไปจะใช้ฝึกและอ้างอิงใน Gemini ได้ไหม ไม่มีผลกับ Google Search ทำตาม
    Applebot-Extended Apple · ไม่ได้เข้าเว็บเอง: คุมว่าข้อมูลที่ Applebot เก็บไปจะใช้ฝึกโมเดลของ Apple ได้ไหม ทำตาม
    Meta-ExternalAgent Meta ทำตาม
    CCBot Common Crawl · ชุดข้อมูลเปิดที่บริษัท AI จำนวนมากนำไปฝึกโมเดล ทำตาม
    Amazonbot Amazon · Amazon ระบุว่าอาจใช้ฝึกโมเดล AI ทำตาม
    MistralAI-Training Mistral ทำตาม

    ค้นหาและอ้างอิงในคำตอบ AI

    บล็อกแล้วเว็บคุณจะไม่ถูกอ้างอิงใน ChatGPT search, Claude, Perplexity ฯลฯ

    บอท ผล ตัดสินโดย ทำตาม robots.txt
    OAI-SearchBot OpenAI ทำตาม
    Claude-SearchBot Anthropic ทำตาม
    PerplexityBot Perplexity ทำตาม
    Meta-WebIndexer Meta ทำตาม
    Amzn-SearchBot Amazon ทำตาม
    MistralAI-Index Mistral ทำตาม

    ดึงหน้าเมื่อผู้ใช้สั่ง

    เข้ามาเฉพาะเมื่อมีคนขอให้ AI อ่านหน้านั้น บางเจ้าระบุว่าไม่ทำตาม robots.txt

    บอท ผล ตัดสินโดย ทำตาม robots.txt
    ChatGPT-User OpenAI · OpenAI ระบุว่ากฎ robots.txt อาจไม่มีผล เพราะผู้ใช้เป็นคนสั่ง อาจไม่ทำตาม
    Claude-User Anthropic ทำตาม
    Perplexity-User Perplexity · Perplexity ระบุว่าโดยทั่วไปไม่สนกฎ robots.txt อาจไม่ทำตาม
    Meta-ExternalFetcher Meta · Meta ระบุว่าอาจข้ามกฎ robots.txt เพราะผู้ใช้เป็นคนสั่ง อาจไม่ทำตาม
    Amzn-User Amazon · Amazon ระบุว่าอาจไม่ทำตามทุกคำสั่งใน robots.txt บางส่วน
    MistralAI-User Mistral ทำตาม

    เครื่องมือค้นหาทั่วไป

    บล็อกแล้วหายจากผลค้นหาของเจ้านั้นทั้งหมด

    บอท ผล ตัดสินโดย ทำตาม robots.txt
    Googlebot Google · บล็อกตัวนี้ = หายจาก Google Search รวมถึง AI Overviews ทำตาม
    Applebot Apple · ใช้กับ Siri, Spotlight และ Safari ทำตาม

    อื่น ๆ

    บอท ผล ตัดสินโดย ทำตาม robots.txt
    OAI-AdsBot OpenAI · ตรวจความปลอดภัยของหน้าที่ลงโฆษณาใน ChatGPT ทำตาม

    สร้าง robots.txt สำหรับบอท AI

    เลือกว่าอนุญาตอะไรบ้าง แล้วคัดลอกไปต่อท้าย robots.txt เดิมของคุณ

      

    ตัวสร้างนี้ไม่บล็อก Googlebot และ Applebot เพราะจะทำให้หายจากผลค้นหาทั้งหมด

    บอท AI มีสามแบบ และควรคิดแยกกัน

    • บอทฝึกโมเดล (เช่น GPTBot, ClaudeBot, CCBot) เก็บเนื้อหาไปสร้างชุดข้อมูล บล็อกแล้วไม่กระทบว่าจะมีคนเจอเว็บคุณหรือไม่
    • บอทค้นหาของ AI (เช่น OAI-SearchBot, Claude-SearchBot, PerplexityBot) ทำให้เว็บคุณไปโผล่เป็นแหล่งอ้างอิงในคำตอบ บล็อกแล้วเสียโอกาสได้ผู้เข้าชมจาก AI
    • บอทที่ดึงตามคำสั่งผู้ใช้ (เช่น ChatGPT-User, Claude-User) มาเฉพาะเมื่อมีคนขอให้ AI อ่านลิงก์ของคุณ OpenAI, Perplexity และ Meta ระบุว่าบอทแบบนี้อาจไม่ทำตาม robots.txt
    • หลายเว็บต้องการ “ไม่ให้ฝึก แต่ให้ค้นเจอ” ซึ่งทำได้ เพราะแต่ละเจ้าแยกชื่อบอทตามจุดประสงค์แล้ว

    ข้อควรรู้

    • Google-Extended ไม่ได้เป็นบอทที่เข้าเว็บ มันเป็นชื่อที่ใช้บอก Google ว่าข้อมูลที่ Googlebot เก็บไปจะใช้ฝึกและอ้างอิงใน Gemini ได้หรือไม่ Google ระบุว่าไม่มีผลกับการติดอันดับใน Google Search
    • Applebot-Extended ก็เช่นกัน ไม่ได้เข้าเว็บเอง แค่คุมว่าข้อมูลที่ Applebot เก็บจะใช้ฝึกโมเดลของ Apple ได้หรือไม่
    • ชื่อบอทต้องตรงทั้งคำ กลุ่ม “Applebot” ไม่ครอบคลุม “Applebot-Extended” ถ้าไม่มีกลุ่มของชื่อนั้น บอทจะใช้กลุ่ม * แทน (RFC 9309)
    • Bytespider ของ ByteDance ไม่มีเอกสารทางการที่เข้าถึงได้ และมีรายงานหลายแห่งว่าไม่ทำตาม robots.txt เราจึงไม่ใส่ไว้ในตาราง
    • robots.txt เป็นคำขอ ไม่ใช่การบังคับ ถ้าต้องการกันจริงต้องบล็อกที่เซิร์ฟเวอร์หรือ CDN
    • ถ้าเซิร์ฟเวอร์ตอบ robots.txt เป็น error 5xx บอทต้องถือว่าห้ามทั้งเว็บ ถ้าเป็น 4xx (เช่น 404) บอทถือว่าเข้าได้ทั้งหมด

    ตรวจอย่างไร

    • การตัดสินใช้ไลบรารี robots-parser ซึ่งทำตาม RFC 9309: เลือกกลุ่มจากชื่อบอทแบบไม่สนตัวพิมพ์เล็กใหญ่, กฎที่ยาวที่สุดชนะ, ถ้ายาวเท่ากัน Allow ชนะ, รองรับ * และ $
    • เราเทียบผลของเครื่องมือนี้กับไลบรารี Protego บน robots.txt จริงของ 31 เว็บไทยและต่างประเทศ รวม 64,768 การตัดสิน ต่างกัน 98 ครั้ง: 74 ครั้งเป็นกรณี Applebot-Extended ที่ Protego จับชื่อแบบคำย่อยซึ่งผิด RFC และ 24 ครั้งเป็น path ที่ลงท้ายด้วย “?” เปล่า ซึ่งเครื่องมือนี้ตัด “?” ทิ้ง
    • และเทียบบนไฟล์สุ่ม 4,000 ไฟล์ที่เน้นโครงสร้างแปลก ๆ อีก 96,000 การตัดสิน ต่างกัน 338 ครั้ง ทุกครั้งมาจากบรรทัด Crawl-delay ที่แทรกระหว่าง User-agent ซึ่งเครื่องมือนี้ข้ามไปแบบเดียวกับตัวอ่านอ้างอิงของ Google
    • ไลบรารี robots-parser เดิมมีจุดที่ไม่ตรง RFC สามจุด เราแก้ไว้ในตัวครอบแล้ว: ไฟล์ /robots.txt ต้องอ่านได้เสมอ, กลุ่มของบอทที่ไม่มีกฎเลยต้องถือว่าเข้าได้, และบรรทัด Sitemap หรือ Crawl-delay ต้องไม่ตัดกลุ่ม
    • รายชื่อบอท จุดประสงค์ และการทำตาม robots.txt มาจากเอกสารของแต่ละบริษัท ตรวจล่าสุด 2026-09-23

    คำถามที่พบบ่อย

    บล็อก GPTBot แล้วจะหายจาก ChatGPT ไหม

    ไม่หายจากการค้นหา GPTBot ใช้เก็บข้อมูลไปฝึกโมเดลเท่านั้น การแสดงเว็บในผลค้นหาของ ChatGPT ใช้ OAI-SearchBot ซึ่งแยกกัน

    บล็อก Google-Extended แล้วอันดับ Google ตกไหม

    Google ระบุว่าไม่มีผลกับการติดอันดับใน Google Search และไม่ได้ใช้เป็นสัญญาณจัดอันดับ

    robots.txt ของฉันถูกส่งไปไหนไหม

    ไม่ การตรวจเกิดในเบราว์เซอร์ของคุณทั้งหมด หน้านี้ไม่ได้ดึง robots.txt จากเว็บคุณเอง คุณต้องคัดลอกมาวาง

    ทำไมไม่มีบอท AI ตัวอื่น

    ตารางนี้ใส่เฉพาะบอทที่มีเอกสารทางการระบุชื่อและจุดประสงค์ชัดเจน ตอนนี้มี 23 ตัว บอทฝึกโมเดล 8 ตัว

    แหล่งอ้างอิง

    • OpenAI https://developers.openai.com/api/docs/bots
    • Anthropic https://support.claude.com/en/articles/8896518-does-anthropic-crawl-data-from-the-web-and-how-can-site-owners-block-the-crawler
    • Google https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
    • Apple https://support.apple.com/en-us/119829
    • Perplexity https://docs.perplexity.ai/guides/bots
    • Meta https://developers.facebook.com/docs/sharing/webmasters/web-crawlers/
    • Common Crawl https://commoncrawl.org/ccbot
    • Amazon https://developer.amazon.com/amazonbot
    • Mistral https://docs.mistral.ai/robots
    • RFC 9309 — Robots Exclusion Protocol