ข้ามไปยังเนื้อหา
45intIntelligence Delivered
ผลงาน
ระบบสาธิตแนะนำ

ระบบสกัดข้อมูลเอกสารด้วย AI OCR

ระบบสาธิตที่อ่านเอกสารสแกนภาษาไทย-อังกฤษ สกัดข้อมูลเป็นฟิลด์ที่มีโครงสร้าง และส่งรายการที่ไม่มั่นใจให้มนุษย์ตรวจทาน

เป็นระบบสาธิตที่จัดทำขึ้นเพื่อแสดงขีดความสามารถ ไม่ใช่ระบบที่ติดตั้งใช้งานจริงของลูกค้า

ประเภทองค์กร
องค์กรที่ประมวลผลเอกสารปริมาณมาก
อุตสาหกรรม
บริการทางการเงินและภาครัฐ

01 / CHALLENGE

โจทย์และความท้าทาย

เอกสารสแกนอย่างแบบฟอร์มคำขอ หนังสือราชการ และเอกสารประกอบ เข้ามาที่องค์กรจำนวนมากทุกวัน แต่ข้อมูลในเอกสารเหล่านั้นยังต้องอาศัยเจ้าหน้าที่อ่านและคีย์เข้าระบบทีละรายการ

เอกสารภาษาไทยมีความท้าทายเฉพาะสำหรับ OCR ทั้งการไม่มีช่องว่างระหว่างคำ สระที่อยู่เหนือและใต้บรรทัด รวมถึงเอกสารที่ปนภาษาไทยกับอังกฤษและตารางซับซ้อน เครื่องมือสำเร็จรูปทั่วไปจึงให้ผลไม่คงที่พอสำหรับงานจริง

02 / APPROACH

แนวทางที่เราพัฒนา

เราพัฒนาไปป์ไลน์หลายขั้น: วิเคราะห์โครงสร้างหน้าเอกสารก่อนเพื่อแยกหัวข้อ ตาราง และย่อหน้า จากนั้น OCR อ่านข้อความ และใช้โมเดลภาษาช่วยสกัดข้อมูลเป็นฟิลด์ตามแบบเอกสารแต่ละประเภท ทุกค่ามีระดับความมั่นใจกำกับ

รายการที่ความมั่นใจต่ำกว่าเกณฑ์ถูกส่งเข้าหน้าจอตรวจทานที่แสดงภาพเอกสารคู่กับค่าที่สกัดได้ ให้เจ้าหน้าที่แก้ไขได้เร็ว ผลการแก้ไขถูกเก็บไว้ใช้ปรับปรุงระบบ ระบบสาธิตนี้ทดสอบกับชุดเอกสารตัวอย่างที่จัดทำขึ้นเอง

03 / FEATURE_SET

ฟีเจอร์สำคัญ

  • OCR ไทย-อังกฤษ

    ไปป์ไลน์ที่ออกแบบสำหรับเอกสารไทยโดยเฉพาะ รวมถึงเอกสารปนสองภาษา

  • สกัดเป็นฟิลด์พร้อมความมั่นใจ

    แปลงเอกสารเป็นข้อมูลมีโครงสร้างตามแบบเอกสารแต่ละประเภท พร้อมค่าความมั่นใจรายฟิลด์

  • หน้าจอตรวจทานคู่เอกสาร

    เทียบภาพเอกสารกับค่าที่สกัดได้ในหน้าจอเดียว แก้ไขได้รวดเร็ว

  • ส่งต่อผ่าน API

    ข้อมูลที่ยืนยันแล้วพร้อมส่งเข้าระบบปลายทางขององค์กรโดยอัตโนมัติ

04 / PREVIEW

ตัวอย่างระบบ

ภาพประกอบเชิงนามธรรมของการสกัดข้อมูลเอกสาร: กองเอกสารป้อนข้อมูลเข้าสู่แกนประมวลผลที่ปล่อยชิปฟิลด์ข้อมูลออกมา