Amazon Redshift
โกดังสำหรับข้อมูลยักษ์ (Data Warehouse)
RDS เหมือนแคชเชียร์บันทึกธุรกรรมหน้าร้าน (OLTP) ทำงานจุกจิกเร็วๆ ที่ละรายการ ส่วน Redshift เหมือนหอสมุดขนาดยักษ์ ที่เอาไว้โกยข้อมูลของร้านค้าทั้งปี โยนมารวมกัน แล้วให้ผู้จัดการเอาไปวิ่งทำ Report วิเคราะห์หารูปแบบ (OLAP) ยอดขายทั้งแสนสาขาข้ามปี (ซึ่งถ้าไปรันคำสั่งแบบนี้ใส่ RDS แคชเชียร์จะค้างพังกระจายทันที)
Amazon Redshift (ระบบโกดังข้อมูล) คือบริการสำหรับสร้าง Data Warehouse ขนาดเพตาไบต์ (Petabyte) ออกแบบมาให้เก่งกาจด้านงานวิเคราะห์ข้อมูลขนาดมหึมา การออกรายงานสำหรับฝ่ายวิเคราะห์ข้อมูลและ BI (Business Intelligence)
- โครงสร้างการเก็บข้อมูลจะเป็นแบบคอลัมน์ (Columnar storage) ทำให้มันวิ่งกวาดค้นหาผลลัพธ์คำสั่งรวม/ค่าเฉลี่ยข้ามล้านแถวได้อย่างรวดเร็ว
- Redshift Spectrum เป็นฟีเจอร์เด็ดที่ทำให้คุณสามารถรันคำสั่ง SQL ทะลุลงไปกวาดค้นหาไฟล์ที่กองทิ้งไว้ใน S3 (Data Lake) ได้เลยโดยไม่ต้องโหลดข้อมูลนั้นเข้ามาอยู่ในตัว Redshift!
สรุป Key Takeaways
- Redshift = Data Warehouse สายวิเคราะห์ข้อมูลระดับ petabyte
- โครงสร้างแบบ Columnar เหมาะสำหรับออกรายงาน / BI / งาน OLAP
- Redshift Spectrum ไว้ยิงคิวรีข้อมูลที่อยู่ใน S3 ได้ตรงๆ
คำถามที่พบบ่อย
Redshift ต่างจาก RDS ยังไง ในเมื่อเป็น SQL เหมือนกัน
ต่างที่ลักษณะงาน — RDS เป็น OLTP: รับ transaction เล็กๆ จำนวนมากแบบเรียลไทม์ (สั่งซื้อ, โอนเงิน) ส่วน Redshift เป็น OLAP: วิเคราะห์ข้อมูลมหาศาลย้อนหลัง (สรุปยอดขายรายปีจากข้อมูลพันล้านแถว) เก็บข้อมูลแบบ columnar ทำให้ query วิเคราะห์เร็วกว่ามาก — เจอคำว่า data warehouse / BI / analytics ให้นึกถึง Redshift
Redshift Spectrum คืออะไร
ฟีเจอร์ที่ให้ query ข้อมูลที่นอนอยู่ใน S3 ได้ตรงๆ โดยไม่ต้องโหลดเข้า Redshift ก่อน — เหมาะกับ data lake ที่ข้อมูลส่วนใหญ่แช่ใน S3 แล้วอยากวิเคราะห์ร่วมกับข้อมูลใน warehouse
แล้ว Athena กับ Redshift เลือกอะไร
Athena = serverless query ไฟล์ใน S3 จ่ายต่อ query ไม่ต้องมี cluster — เหมาะกับ query เป็นครั้งคราว (ad-hoc) ส่วน Redshift เหมาะกับ warehouse ที่ทีม BI query หนักต่อเนื่องทุกวันและต้องการประสิทธิภาพคงที่ — โจทย์ serverless + ad-hoc + S3 ตอบ Athena
ลองทำ Quiz ท้ายบท
คำถามแนวข้อสอบของโมดูลนี้ 5 ข้อ · เฉลยทันที

