การวัดผลสายสร้างข้อความ (BLEU & ROUGE)
เมื่อคำตอบไม่มีผิดถูก 100% เราจะวัดการแปลภาษาและการสรุปความได้อย่างไร
พื้นฐานที่ควรรู้: เมื่อ AI ต้องเขียนเรียงความ หรือแปลภาษา มันสามารถเขียนได้ 100 รูปแบบโดยที่ความหมายยังถูกเหมือนเดิม การจะให้คอมพิวเตอร์ตรวจเทียบตัวอักษรแบบเป๊ะๆ จึงทำไม่ได้
เหมือนอาจารย์ตรวจข้อสอบอัตนัย โดยการกวาดสายตาหา "คีย์เวิร์ด" ว่านักเรียนเขียนคำสำคัญที่ตรงกับธงคำตอบมาครบไหม ยิ่งมีคำตรงกันเยอะ ยิ่งได้คะแนนดี
Metrics ยอดนิยม
- BLEU: ดูว่าคำที่ AI ผลิตออกมา ตรงกับเฉลยเยอะแค่ไหน (Precision) เหมาะที่สุดสำหรับวัดคุณภาพงานแปลภาษา (Translation quality)
- ROUGE: ดูว่าคำจากเฉลย โผล่ในคำตอบของ AI ครบไหม (Recall) เหมาะที่สุดสำหรับวัดงานสรุปข้อความ (Summarization recall)
- BERTScore: เป็นตัวชี้วัดยุคใหม่ที่ใช้ AI มาช่วยดู "ความคล้ายคลึงทางความหมาย" (Semantic similarity) เหมาะมากสำหรับตรวจงานสรุปที่ใช้คำพ้องความหมาย
สรุป Key Takeaways
- BLEU เหมาะกับงานแปลภาษา (Translation quality)
- ROUGE เหมาะกับงานสรุปใจความ (Summarization recall)
- BERTScore เหมาะกับตรวจดูความหมายที่คล้ายคลึงกันของข้อความสรุป (Semantic similarity for summaries)
คำถามที่พบบ่อย
ROUGE, BLEU ใช้วัดอะไร ต่างกันยังไง
ทั้งคู่เทียบข้อความที่โมเดลสร้างกับข้อความอ้างอิง — ROUGE เน้นงาน "สรุป" (วัดว่าเก็บใจความจากต้นฉบับครบไหม เน้น recall) ส่วน BLEU เน้นงาน "แปลภาษา" (วัดความแม่นของ n-gram เน้น precision) จำคู่ ROUGE-สรุป BLEU-แปล พอสำหรับข้อสอบ
BERTScore ต่างจาก ROUGE/BLEU ตรงไหน
ROUGE/BLEU นับคำซ้ำตรงตัว — ประโยคความหมายเดียวกันแต่ใช้คนละคำจะได้คะแนนต่ำ ส่วน BERTScore เทียบด้วย embedding จึงจับ "ความหมายคล้าย" ได้แม้ใช้คำต่างกัน เหมาะกับงาน generative ที่มีคำตอบถูกหลายแบบ
Perplexity คืออะไร
ตัววัดว่าโมเดล "งง" กับข้อความแค่ไหน — ค่าต่ำแปลว่าโมเดลทำนายลำดับคำได้มั่นใจ ใช้เทียบคุณภาพ language model กันเอง แต่ไม่ได้บอกว่าคำตอบมีประโยชน์ต่องานจริงไหม จึงใช้ร่วมกับ metric เฉพาะงานเสมอ
ลองทำ Quiz ท้ายบท
คำถามแนวข้อสอบของโมดูลนี้ 2 ข้อ · เฉลยทันที

