AI อ่านรูปได้ — ส่งรูปให้วิเคราะห์
ใช้งาน Multimodal ส่งภาพให้ AI อธิบาย หรือดึงข้อมูล
ดวงตาของ AI (Vision Capabilities)
ความสามารถที่เรียกว่า Multimodal (มัลติโมดัล: การประมวลผลข้อมูลหลายรูปแบบ ทั้งข้อความ ภาพ เสียง) ทำให้เราส่งรูปให้ AI วิเคราะห์ได้
เหมือนคุณตาบอดแล้วมีเพื่อนตาดีคอยอธิบายสิ่งที่อยู่ตรงหน้าให้ฟัง แต่เพื่อนคนนี้มีความจำระดับสารานุกรมโลก ทำให้บอกได้เลยว่าต้นไม้ในรูปคือพันธุ์อะไร หรือโค้ดในรูปผิดตรงไหน
[แนบรูปภาพใบเสร็จ / บิลค่าน้ำไฟ / สลิปโอนเงิน]
ช่วยดึงข้อมูลทั้งหมดออกมาเป็น JSON Format (ฟอร์แมตข้อมูลคอมพิวเตอร์)
ต้องมี Keys ดังนี้: store_name, date, total_amount, vat_amount, items (เป็น Array ของรายการสินค้า)สรุป Key Takeaways
- AI สามารถอ่านข้อความ (OCR) ในรูปภาพได้
- สามารถส่ง Diagram ให้ AI อธิบายระบบ
- เหมาะสำหรับงานดึงข้อมูลจากใบเสร็จ หรือแปลงภาพวาดบนกระดานเป็นตาราง
คำถามที่พบบ่อย
ส่งรูปให้ AI ดู มันเห็นอะไรได้บ้าง
โมเดล multimodal อ่านได้ทั้งวัตถุ ข้อความในภาพ (ป้าย เอกสาร ลายมือที่ชัด) แผนภูมิ และความสัมพันธ์ในภาพ เช่น อธิบายว่ากราฟบอกเทรนด์อะไร ใช้งานจริงที่ฮิตคือถ่ายรูปเอกสาร/ใบเสร็จให้ดึงข้อมูล และส่งภาพ error บนจอให้ช่วย debug
รูปแบบไหนที่ AI มักอ่านพลาด
ลายมือหวัดๆ ตารางซับซ้อนที่เส้นชิดกัน ตัวเลขในภาพความละเอียดต่ำ และการนับจำนวนวัตถุเยอะๆ — งานที่ตัวเลขต้องเป๊ะ (เช่น ยอดเงินในใบเสร็จ) ควรมีขั้นตรวจซ้ำเสมอ
รูปที่ส่งไปจะถูกเอาไปเทรนโมเดลไหม
ขึ้นกับผู้ให้บริการและแผนที่ใช้ — บัญชีองค์กร/API ส่วนใหญ่ไม่เอาข้อมูลไปเทรน แต่แผนฟรีบางเจ้าอาจใช้ปรับปรุงบริการ ก่อนส่งภาพที่มีข้อมูลส่วนตัวหรือความลับบริษัท ให้อ่านนโยบายข้อมูลของแผนที่คุณใช้ก่อน

