บทที่ 9 จาก 9 · AI 101 — คู่มือเริ่มต้นสำหรับคนที่จะเอา AI ไปใช้งานจริง
ภาคผนวก — คำศัพท์ คำสั่ง และเส้นทางเรียนรู้
คำศัพท์ที่เจอบ่อยพร้อมความหมายสั้น ๆ คำสั่งตรวจสภาพเครื่องและจัดการโมเดลที่ใช้ประจำ เส้นทางเรียนรู้แบบสัปดาห์ต่อสัปดาห์ และสรุปทั้งเล่มในแปดบรรทัด
9.1 คำศัพท์ที่เจอบ่อย
| คำ | ความหมายอย่างสั้น |
|---|---|
| Parameter (พารามิเตอร์) | ตัวเลขที่โมเดลเรียนรู้ไว้ วัดเป็น B (พันล้าน) เป็นตัวบอกขนาดคร่าว ๆ |
| Token | หน่วยย่อยของข้อความที่โมเดลมองเห็น ภาษาไทยกิน token มากกว่าอังกฤษ |
| Temperature | ความสุ่มของคำตอบ 0 คือคงที่ที่สุด เหมาะกับงานที่ต้องแม่น สูงขึ้นคือหลากหลายขึ้น |
| Top-p / Top-k | วิธีจำกัดตัวเลือกคำถัดไป ใช้คู่กับ temperature เพื่อคุมความสร้างสรรค์ |
| System prompt | คำสั่งที่ตั้งบทบาทและกติกาให้โมเดล ก่อนที่ผู้ใช้จะพิมพ์อะไร |
| KV cache | หน่วยความจำที่เก็บผลคำนวณของ token ก่อนหน้า เพื่อไม่ต้องคำนวณซ้ำ เป็นตัวกิน VRAM หลักตอน context ยาว |
| Prefill / Decode | สองช่วงของการตอบ คืออ่าน prompt ซึ่งใช้กำลังคำนวณ กับพิมพ์คำตอบทีละ token ซึ่งใช้ bandwidth |
| TTFT | เวลาถึง token แรก ตัวเลขที่ผู้ใช้รู้สึกมากที่สุด |
| Batching | รวมคำขอหลายรายการให้การ์ดทำพร้อมกัน เพิ่ม throughput รวมได้มาก |
| Prefix caching | ใช้ผลคำนวณซ้ำเมื่อ prompt หลายรายการมีส่วนต้นเหมือนกัน ช่วยมากในงาน agent |
| Speculative decoding | ให้โมเดลเล็กเดาล่วงหน้าแล้วโมเดลใหญ่ตรวจ ทำให้เร็วขึ้นโดยคำตอบเหมือนเดิม |
| GQA | เทคนิคที่ลดจำนวน KV heads ทำให้ KV cache เล็กลงมาก เป็นเหตุผลที่โมเดลใหม่รับ context ยาวได้ |
| Hallucination | โมเดลแต่งข้อมูลที่ไม่มีอยู่จริงด้วยน้ำเสียงมั่นใจ |
| Guardrail | ชั้นตรวจสอบอินพุตและเอาต์พุตก่อนถึงผู้ใช้จริง |
9.2 คำสั่งที่ใช้ประจำ
ตรวจสภาพเครื่อง
# ไดรเวอร์และการ์ด
nvidia-smi
nvidia-smi -q -d MEMORY,POWER,TEMPERATURE
# CUDA ที่ PyTorch เห็น
python -c "import torch; print(
torch.__version__,
torch.version.cuda,
torch.cuda.is_available(),
torch.cuda.get_device_name(0),
torch.cuda.get_device_properties(0).total_memory/1024**3)"
# เฝ้าดูแบบต่อเนื่อง
watch -n 1 nvidia-smi
nvtop
จัดการโมเดล
# ดูขนาดที่โหลดมาแล้ว
du -sh ~/.cache/huggingface/hub/* | sort -h
du -sh ~/.ollama/models
# ล้างของที่ไม่ใช้
huggingface-cli delete-cache
ollama rm ชื่อโมเดล
# ดูโครงสร้างโมเดลก่อนโหลดจริง
python -c "
from transformers import AutoConfig
c = AutoConfig.from_pretrained('Qwen/Qwen3-8B')
print(c.num_hidden_layers,
c.num_key_value_heads,
c.hidden_size,
c.max_position_embeddings)"
9.3 เส้นทางเรียนรู้ที่แนะนำ
| ช่วงเวลา | ทำอะไร |
|---|---|
| สัปดาห์ที่ 1 | ติดตั้ง Ollama รันโมเดล 8B ให้ได้ ลองเปลี่ยน temperature และ system prompt ดู nvidia-smi ระหว่างรัน เพื่อเห็นว่า VRAM ขยับอย่างไร |
| สัปดาห์ที่ 2 | เรียกผ่าน API ด้วยโค้ด เขียนสคริปต์ที่ทำงานจริงหนึ่งอย่าง ลองเปลี่ยนขนาดโมเดล 4B / 8B / 14B แล้วเทียบคุณภาพกับความเร็ว |
| สัปดาห์ที่ 3 | สร้างชุด eval ของตัวเอง 30 เคส วัดจริงว่าโมเดลไหนพอ คำนวณ VRAM ล่วงหน้าแล้วเทียบกับที่วัดได้จริง |
| สัปดาห์ที่ 4 | ต่อ RAG กับเอกสารของตัวเอง โดยใช้ embedding + reranker + LLM แล้วเรียนรู้ว่าคุณภาพขึ้นกับการค้นมากกว่าขนาดโมเดล |
| เดือนที่ 2 | ถ้าต้องรับผู้ใช้หลายคน ย้ายจาก Ollama ไป vLLM แล้ว benchmark ใหม่ ถ้าต้องการความเฉพาะทาง ลอง LoRA fine-tune บนงานแคบ ๆ หนึ่งงาน |
| ตลอดเวลา | ทุกครั้งที่เจอปัญหาที่แก้ยาก ให้จดไว้ว่าอาการอะไร สาเหตุอะไร แก้อย่างไร บันทึกแบบนี้มีค่ากับตัวคุณในอีกหกเดือนมากกว่าบทความใด ๆ ที่อ่าน |
สรุปทั้งเล่มในแปดบรรทัด
- ไม่ใช่ทุกปัญหาต้องใช้ LLM งานข้อมูลตาราง ML แบบเดิมมักดีกว่า
- อ่านชื่อโมเดลให้ออก จะประหยัดเวลาและพื้นที่ได้มาก
- VRAM กำหนดว่ารันได้ไหม bandwidth กำหนดว่าเร็วแค่ไหน
- เลือกตัวรันตามลักษณะงาน ไม่ใช่ตามความนิยม และพูดกับ API มาตรฐานเสมอ
- คำนวณ VRAM ที่จำนวนผู้ใช้สูงสุด ไม่ใช่ที่หนึ่งคน — KV cache คือตัวที่คนลืม
- เลือกโมเดลที่เล็กที่สุดที่ผ่านชุดทดสอบของคุณเอง ไม่ใช่ตัวที่คะแนนสูงสุด
- ไฟล์โมเดลรันโค้ดได้ ใช้ safetensors และปิด
trust_remote_codeเป็นค่าตั้งต้น - สิ่งที่โมเดลอ่านคือข้อมูล ไม่ใช่คำสั่ง และคนต้องเป็นคนตัดสินใจเรื่องสำคัญเสมอ
ระบบนิเวศนี้เปลี่ยนเร็วมาก ตัวเลขและชื่อรุ่นในชุดคู่มือนี้เป็นตัวอย่างเพื่อให้เห็นวิธีคิด ไม่ใช่รายการที่ต้องยึดตาม สิ่งที่เปลี่ยนช้าคือหลักการทั้งแปดข้อข้างบน ให้ยึดหลักการ แล้วตรวจตัวเลขจากแหล่งทางการทุกครั้งก่อนตัดสินใจ