ข้ามไปยังเนื้อหา
KoishiAI
EN
← สารบัญ

บทที่ 9 จาก 9 · AI 101 — คู่มือเริ่มต้นสำหรับคนที่จะเอา AI ไปใช้งานจริง

ภาคผนวก — คำศัพท์ คำสั่ง และเส้นทางเรียนรู้

คำศัพท์ที่เจอบ่อยพร้อมความหมายสั้น ๆ คำสั่งตรวจสภาพเครื่องและจัดการโมเดลที่ใช้ประจำ เส้นทางเรียนรู้แบบสัปดาห์ต่อสัปดาห์ และสรุปทั้งเล่มในแปดบรรทัด

9.1 คำศัพท์ที่เจอบ่อย

คำความหมายอย่างสั้น
Parameter (พารามิเตอร์)ตัวเลขที่โมเดลเรียนรู้ไว้ วัดเป็น B (พันล้าน) เป็นตัวบอกขนาดคร่าว ๆ
Tokenหน่วยย่อยของข้อความที่โมเดลมองเห็น ภาษาไทยกิน token มากกว่าอังกฤษ
Temperatureความสุ่มของคำตอบ 0 คือคงที่ที่สุด เหมาะกับงานที่ต้องแม่น สูงขึ้นคือหลากหลายขึ้น
Top-p / Top-kวิธีจำกัดตัวเลือกคำถัดไป ใช้คู่กับ temperature เพื่อคุมความสร้างสรรค์
System promptคำสั่งที่ตั้งบทบาทและกติกาให้โมเดล ก่อนที่ผู้ใช้จะพิมพ์อะไร
KV cacheหน่วยความจำที่เก็บผลคำนวณของ token ก่อนหน้า เพื่อไม่ต้องคำนวณซ้ำ เป็นตัวกิน VRAM หลักตอน context ยาว
Prefill / Decodeสองช่วงของการตอบ คืออ่าน prompt ซึ่งใช้กำลังคำนวณ กับพิมพ์คำตอบทีละ token ซึ่งใช้ bandwidth
TTFTเวลาถึง token แรก ตัวเลขที่ผู้ใช้รู้สึกมากที่สุด
Batchingรวมคำขอหลายรายการให้การ์ดทำพร้อมกัน เพิ่ม throughput รวมได้มาก
Prefix cachingใช้ผลคำนวณซ้ำเมื่อ prompt หลายรายการมีส่วนต้นเหมือนกัน ช่วยมากในงาน agent
Speculative decodingให้โมเดลเล็กเดาล่วงหน้าแล้วโมเดลใหญ่ตรวจ ทำให้เร็วขึ้นโดยคำตอบเหมือนเดิม
GQAเทคนิคที่ลดจำนวน KV heads ทำให้ KV cache เล็กลงมาก เป็นเหตุผลที่โมเดลใหม่รับ context ยาวได้
Hallucinationโมเดลแต่งข้อมูลที่ไม่มีอยู่จริงด้วยน้ำเสียงมั่นใจ
Guardrailชั้นตรวจสอบอินพุตและเอาต์พุตก่อนถึงผู้ใช้จริง

9.2 คำสั่งที่ใช้ประจำ

ตรวจสภาพเครื่อง

# ไดรเวอร์และการ์ด
nvidia-smi
nvidia-smi -q -d MEMORY,POWER,TEMPERATURE

# CUDA ที่ PyTorch เห็น
python -c "import torch; print(
  torch.__version__,
  torch.version.cuda,
  torch.cuda.is_available(),
  torch.cuda.get_device_name(0),
  torch.cuda.get_device_properties(0).total_memory/1024**3)"

# เฝ้าดูแบบต่อเนื่อง
watch -n 1 nvidia-smi
nvtop

จัดการโมเดล

# ดูขนาดที่โหลดมาแล้ว
du -sh ~/.cache/huggingface/hub/* | sort -h
du -sh ~/.ollama/models

# ล้างของที่ไม่ใช้
huggingface-cli delete-cache
ollama rm ชื่อโมเดล

# ดูโครงสร้างโมเดลก่อนโหลดจริง
python -c "
from transformers import AutoConfig
c = AutoConfig.from_pretrained('Qwen/Qwen3-8B')
print(c.num_hidden_layers,
      c.num_key_value_heads,
      c.hidden_size,
      c.max_position_embeddings)"

9.3 เส้นทางเรียนรู้ที่แนะนำ

ช่วงเวลาทำอะไร
สัปดาห์ที่ 1ติดตั้ง Ollama รันโมเดล 8B ให้ได้ ลองเปลี่ยน temperature และ system prompt ดู nvidia-smi ระหว่างรัน เพื่อเห็นว่า VRAM ขยับอย่างไร
สัปดาห์ที่ 2เรียกผ่าน API ด้วยโค้ด เขียนสคริปต์ที่ทำงานจริงหนึ่งอย่าง ลองเปลี่ยนขนาดโมเดล 4B / 8B / 14B แล้วเทียบคุณภาพกับความเร็ว
สัปดาห์ที่ 3สร้างชุด eval ของตัวเอง 30 เคส วัดจริงว่าโมเดลไหนพอ คำนวณ VRAM ล่วงหน้าแล้วเทียบกับที่วัดได้จริง
สัปดาห์ที่ 4ต่อ RAG กับเอกสารของตัวเอง โดยใช้ embedding + reranker + LLM แล้วเรียนรู้ว่าคุณภาพขึ้นกับการค้นมากกว่าขนาดโมเดล
เดือนที่ 2ถ้าต้องรับผู้ใช้หลายคน ย้ายจาก Ollama ไป vLLM แล้ว benchmark ใหม่ ถ้าต้องการความเฉพาะทาง ลอง LoRA fine-tune บนงานแคบ ๆ หนึ่งงาน
ตลอดเวลาทุกครั้งที่เจอปัญหาที่แก้ยาก ให้จดไว้ว่าอาการอะไร สาเหตุอะไร แก้อย่างไร บันทึกแบบนี้มีค่ากับตัวคุณในอีกหกเดือนมากกว่าบทความใด ๆ ที่อ่าน

สรุปทั้งเล่มในแปดบรรทัด

  1. ไม่ใช่ทุกปัญหาต้องใช้ LLM งานข้อมูลตาราง ML แบบเดิมมักดีกว่า
  2. อ่านชื่อโมเดลให้ออก จะประหยัดเวลาและพื้นที่ได้มาก
  3. VRAM กำหนดว่ารันได้ไหม bandwidth กำหนดว่าเร็วแค่ไหน
  4. เลือกตัวรันตามลักษณะงาน ไม่ใช่ตามความนิยม และพูดกับ API มาตรฐานเสมอ
  5. คำนวณ VRAM ที่จำนวนผู้ใช้สูงสุด ไม่ใช่ที่หนึ่งคน — KV cache คือตัวที่คนลืม
  6. เลือกโมเดลที่เล็กที่สุดที่ผ่านชุดทดสอบของคุณเอง ไม่ใช่ตัวที่คะแนนสูงสุด
  7. ไฟล์โมเดลรันโค้ดได้ ใช้ safetensors และปิด trust_remote_code เป็นค่าตั้งต้น
  8. สิ่งที่โมเดลอ่านคือข้อมูล ไม่ใช่คำสั่ง และคนต้องเป็นคนตัดสินใจเรื่องสำคัญเสมอ

ระบบนิเวศนี้เปลี่ยนเร็วมาก ตัวเลขและชื่อรุ่นในชุดคู่มือนี้เป็นตัวอย่างเพื่อให้เห็นวิธีคิด ไม่ใช่รายการที่ต้องยึดตาม สิ่งที่เปลี่ยนช้าคือหลักการทั้งแปดข้อข้างบน ให้ยึดหลักการ แล้วตรวจตัวเลขจากแหล่งทางการทุกครั้งก่อนตัดสินใจ