ข้ามไปเนื้อหาหลัก
AWS AI Practitioner· ~6 นาที· อัปเดตล่าสุด

การ Deploy และฮาร์ดแวร์สำหรับ AI

รูปแบบของ Inference และ AWS Trainium

รูปแบบการทำ Inference (การใช้งานจริง)

เมื่อ Train โมเดลเสร็จ การนำไปเปิดให้ใช้งาน (Endpoint) มี 4 รูปแบบที่มักออกสอบ:

  • Real-time Inference: ใช้สำหรับงานที่ต้องตอบสนองทันที (Low Latency) เช่น ระบบแนะนำสินค้าตอนลูกค้ากดดูเว็บ
  • Asynchronous Inference: ใช้กับคำขอที่มีขนาดใหญ่มาก (Payload ใหญ่ได้ถึง 1GB) และประมวลผลนาน (สูงสุด 1 ชั่วโมง) เช่น วิเคราะห์วิดีโอ
  • Serverless Inference: เหมาะกับงานที่คนเรียกใช้ไม่สม่ำเสมอ (Intermittent traffic) มาๆ หายๆ ระบบจะปรับขยายอัตโนมัติ จ่ายเงินตามจริง
  • Batch Transform: รันผลทีละเยอะๆ แบบ Offline เช่น ประมวลผลข้อมูลลูกค้าหลาย Gigabytes ทุกคืนวันเสาร์

ฮาร์ดแวร์รักษ์โลก

สรุป Key Takeaways

  • Real-time Inference: ต้องการผลลัพธ์ทันที (Low latency)
  • Asynchronous Inference: ข้อมูลขนาดใหญ่ (Payload สูงสุด 1GB) รอนานได้สูงสุด 1 ชั่วโมง
  • Serverless Inference: ทราฟฟิกมาเป็นช่วงๆ (Intermittent traffic)
  • Batch Transform: ประมวลผลข้อมูลก้อนใหญ่ตอนออฟไลน์ (เช่น รันวันหยุด)
  • AWS Trainium: ชิปสำหรับเทรน LLMs ที่ใช้พลังงานคุ้มค่าที่สุด (Lowest environmental impact)

คำถามที่พบบ่อย

Real-time, Batch, Serverless inference เลือกยังไง

Real-time endpoint = ต้องตอบทันทีตลอดเวลา (แชทบอท ตรวจ fraud ตอนรูดบัตร) · Batch transform = ประมวลผลข้อมูลกองใหญ่เป็นรอบ ไม่รีบ (สกอร์ลูกค้าทุกคืน) · Serverless = traffic นานๆ มาที ไม่อยากจ่ายค่าเครื่องว่าง · Async = งานชิ้นใหญ่ประมวลผลนาน — จับคีย์เวิร์ดความถี่และความรีบในโจทย์

GPU จำเป็นเสมอไหมสำหรับงาน ML

ไม่ — GPU จำเป็นกับการเทรน deep learning และ inference โมเดลใหญ่ แต่โมเดลเล็ก/อัลกอริทึมดั้งเดิมรันบน CPU ถูกกว่า AWS ยังมีชิปเฉพาะทาง: Trainium สำหรับเทรน, Inferentia สำหรับ inference ที่คุ้มต้นทุนกว่า GPU ทั่วไป — คีย์เวิร์ด cost-effective training/inference ในข้อสอบชี้ไปทางนี้

ลองทำ Quiz ท้ายบท

คำถามแนวข้อสอบของโมดูลนี้ 2 ข้อ · เฉลยทันที

อ่านจบแล้วอย่าลืมทำเครื่องหมาย