ระบบสกัดข้อมูลเอกสารด้วย AI OCR
ระบบสาธิตที่อ่านเอกสารสแกนภาษาไทย-อังกฤษ สกัดข้อมูลเป็นฟิลด์ที่มีโครงสร้าง และส่งรายการที่ไม่มั่นใจให้มนุษย์ตรวจทาน
เป็นระบบสาธิตที่จัดทำขึ้นเพื่อแสดงขีดความสามารถ ไม่ใช่ระบบที่ติดตั้งใช้งานจริงของลูกค้า
- ประเภทองค์กร
- องค์กรที่ประมวลผลเอกสารปริมาณมาก
- อุตสาหกรรม
- บริการทางการเงินและภาครัฐ
01 / CHALLENGE
โจทย์และความท้าทาย
เอกสารสแกนอย่างแบบฟอร์มคำขอ หนังสือราชการ และเอกสารประกอบ เข้ามาที่องค์กรจำนวนมากทุกวัน แต่ข้อมูลในเอกสารเหล่านั้นยังต้องอาศัยเจ้าหน้าที่อ่านและคีย์เข้าระบบทีละรายการ
เอกสารภาษาไทยมีความท้าทายเฉพาะสำหรับ OCR ทั้งการไม่มีช่องว่างระหว่างคำ สระที่อยู่เหนือและใต้บรรทัด รวมถึงเอกสารที่ปนภาษาไทยกับอังกฤษและตารางซับซ้อน เครื่องมือสำเร็จรูปทั่วไปจึงให้ผลไม่คงที่พอสำหรับงานจริง
02 / APPROACH
แนวทางที่เราพัฒนา
เราพัฒนาไปป์ไลน์หลายขั้น: วิเคราะห์โครงสร้างหน้าเอกสารก่อนเพื่อแยกหัวข้อ ตาราง และย่อหน้า จากนั้น OCR อ่านข้อความ และใช้โมเดลภาษาช่วยสกัดข้อมูลเป็นฟิลด์ตามแบบเอกสารแต่ละประเภท ทุกค่ามีระดับความมั่นใจกำกับ
รายการที่ความมั่นใจต่ำกว่าเกณฑ์ถูกส่งเข้าหน้าจอตรวจทานที่แสดงภาพเอกสารคู่กับค่าที่สกัดได้ ให้เจ้าหน้าที่แก้ไขได้เร็ว ผลการแก้ไขถูกเก็บไว้ใช้ปรับปรุงระบบ ระบบสาธิตนี้ทดสอบกับชุดเอกสารตัวอย่างที่จัดทำขึ้นเอง
03 / FEATURE_SET
ฟีเจอร์สำคัญ
OCR ไทย-อังกฤษ
ไปป์ไลน์ที่ออกแบบสำหรับเอกสารไทยโดยเฉพาะ รวมถึงเอกสารปนสองภาษา
สกัดเป็นฟิลด์พร้อมความมั่นใจ
แปลงเอกสารเป็นข้อมูลมีโครงสร้างตามแบบเอกสารแต่ละประเภท พร้อมค่าความมั่นใจรายฟิลด์
หน้าจอตรวจทานคู่เอกสาร
เทียบภาพเอกสารกับค่าที่สกัดได้ในหน้าจอเดียว แก้ไขได้รวดเร็ว
ส่งต่อผ่าน API
ข้อมูลที่ยืนยันแล้วพร้อมส่งเข้าระบบปลายทางขององค์กรโดยอัตโนมัติ
04 / PREVIEW
ตัวอย่างระบบ
