เครื่องจับคู่รายการแบบฟัซซี่ (Fuzzy List Matcher)
การเปรียบเทียบข้อมูลที่ส่งออกจากระบบ CRM กับตารางรายการลูกค้าที่มีใบแจ้งหนี้ หรือการจับคู่ชื่อผู้ขายจากระบบ ERP สองระบบที่แตกต่างกัน มักจะเกิดปัญหาเมื่อมีความแตกต่างเล็กน้อย เช่น “Acme Corp.” เทียบกับ “ACME Corporation” หรือ “acme corp.” หากนำรายชื่อทั้งสองมาวางซ้อนกันและตั้งเกณฑ์ความคล้ายคลึงกัน เครื่องมือจะแนะนำรายการที่เหมาะสมที่สุดในรายชื่อ B สำหรับแต่ละรายการในรายชื่อ A และจะระบุรายการที่มีค่าต่ำกว่าเกณฑ์ไว้เพื่อให้ตรวจสอบด้วยตนเอง
วิธีจับคู่รายการสองรายการที่ยุ่งเหยิงกัน
-
1
วางรายการ A
แต่ละบรรทัดแสดงข้อมูลหนึ่งรายการ ได้แก่ ชื่อลูกค้า รหัสผลิตภัณฑ์ และที่อยู่ถนน
-
2
วางรายการ B
กลุ่มรายการตัวเลือก ความแตกต่างของตัวพิมพ์ใหญ่-เล็ก ช่องว่าง และการพิมพ์ผิดถือว่าไม่เป็นปัญหา
-
3
ตั้งเกณฑ์
เปอร์เซ็นต์ความคล้ายคลึงที่ใช้ในการพิจารณาว่ามีการตรงกันหรือไม่ (ค่าเริ่มต้นที่เหมาะสมคือ 70%)
-
4
อ่านรายงาน
รายการแต่ละรายการจะถูกจับคู่กับผู้สมัครประเภท B ที่เหมาะสมที่สุดพร้อมคะแนนความเชื่อมั่น ส่วนรายการที่มีคะแนนต่ำกว่าเกณฑ์จะถูกระบุเพื่อให้ตรวจสอบเพิ่มเติม
วิธีการวัดความคล้ายคลึงกัน
เครื่องมือนี้ใช้ค่า similar_text ของ PHP (ซึ่งเป็นคะแนนสำหรับลำดับย่อยที่เหมือนกันยาวที่สุด) และแสดงผลลัพธ์ในรูปแบบเปอร์เซ็นต์ โดยยิ่งค่าสูงเท่าไรก็ยิ่งดีขึ้น ส่วนการตรงกันอย่างสมบูรณ์จะเท่ากับ 100%
| ขีดจำกัด | พฤติกรรม |
|---|---|
| ≥ 95% | เกือบเหมือนกันทุกประการ, ต่างกันเพียงตัวพิมพ์ใหญ่-เล็กหรือช่องว่างเท่านั้น |
| 80–94% | พิมพ์ผิด เครื่องหมายวรรคตอนหาย หรือส่วนท้ายคำถูกตัดทอน |
| 60–79% | ลำดับคำเปลี่ยน คำย่อเทียบกับรูปเต็ม |
| < 60% | มีแนวโน้มว่าจะไม่ตรงกันจริง, ให้ตรวจสอบด้วยตนเอง |
คำแนะนำ
- ปรับข้อมูลให้เป็นมาตรฐานก่อน หากคุณทราบสัญญาณรบกวนที่พบบ่อย เช่น แปลงเป็นตัวพิมพ์เล็ก ลบเครื่องหมายวรรคตอน และยุบช่องว่าง จะได้คะแนนที่แม่นยำขึ้น
- ตัดคำต่อท้ายชื่อบริษัทออก (“Inc”, “Ltd”, “GmbH”) หากปรากฏอย่างไม่สม่ำเสมอในรายการหนึ่งแต่ไม่ปรากฏในอีกรายการหนึ่ง
- แยกที่อยู่ที่ยาว, การจับคู่ “ถนน + เมือง” แยกกัน ได้ผลดีกว่าการจับคู่ทั้งบรรทัดที่รวมเป็นข้อความเดียว
- ระวังการจับคู่แบบหนึ่งต่อหลาย เครื่องมือนี้จะเลือกค่า B ที่เหมาะสมที่สุดสำหรับแต่ละรายการ A แต่ไม่ได้ป้องกันไม่ให้ค่า B เดียวกันจับคู่กับหลายแถวของ A
เมื่อใดควรใช้อัลกอริทึมที่เข้มงวดกว่า
สำหรับงานการกำจัดข้อมูลซ้ำในปริมาณมาก ระยะทางเลเวนชไตน์ (Levenshtein distance) หรือวิธีการของยาโร–วิงคล์เลอร์ (Jaro–Winkler) มีประสิทธิภาพสูงกว่า similar_text โดยเฉพาะในกรณีของชื่อที่ตำแหน่งของตัวอักษรมีความสำคัญ หากการจับคู่แบบคลุมเครือถูกนำมาใช้ในการคำนวณค่าใช้จ่ายหรือการรวมข้อมูล ควรตรวจสอบคู่ข้อมูลสุ่ม 20 คู่ก่อนจะใช้ผลลัพธ์ในระดับใหญ่
คำถามที่พบบ่อย
ค่า 70% จะสามารถตรวจจับการจับคู่ที่ถูกต้องส่วนใหญ่ได้ ในขณะเดียวกันก็จะระบุกรณีที่ไม่ตรงตามเกณฑ์อย่างชัดเจน หากรายการ B สะอาดและคุณไม่สามารถยอมรับผลบวกเทียมได้ ให้เพิ่มเกณฑ์ขึ้นเป็น 85% แต่หากทั้งสองรายการมีข้อมูลที่ไม่แม่นยำ และคุณวางแผนจะตรวจสอบทุกกรณีด้วยตนเอง ก็สามารถลดเกณฑ์ลงเหลือ 55% ได้
ได้ แต่ควรปรับข้อมูลให้เป็นมาตรฐานก่อน โดยลบช่องว่าง ขีดกลาง และรหัสประเทศนำหน้า และแปลงอีเมลเป็นตัวพิมพ์เล็ก หากใช้การจับคู่แบบคลุมเครือกับค่าดิบ ผลลัพธ์จะให้คะแนนต่ำสำหรับรายการที่มีโครงสร้างเหมือนกัน
ภายในระบบ เครื่องมือจะแปลงทั้งสองฝั่งเป็นตัวพิมพ์เล็กก่อนเปรียบเทียบ ดังนั้นคำว่า “Apple” และ “apple” จึงได้คะแนน 100%
ใช่, การจับคู่ทำงานที่ฝั่งเซิร์ฟเวอร์ ดังนั้นรายการทั้งสองของคุณจะถูกส่งไปยังเครื่องมือเพื่อเปรียบเทียบ ข้อมูลจะถูกประมวลผลในหน่วยความจำเฉพาะคำขอครั้งนั้นเท่านั้น และจะไม่ถูกจัดเก็บหรือบันทึกไว้ในภายหลัง
เครื่องมือที่เกี่ยวข้อง
ตารางอ้างอิง ASCII
ตาราง ASCII ครบตั้งแต่ 0 ถึง 127 พร้อมค่าเลขฐานสิบ ฐานสิบหก ฐานแปด ฐานสอง และรูปแบบการอ้างอิงอักขระแบบตัวเลขของ HTML รวม NUL, LF และ DEL
อ้างอิงตัวอักษร HTML
รายการที่สามารถค้นหาได้ขององค์ประกอบ HTML พร้อมรหัสชื่อและรหัสตัวเลข รวมถึงฟังก์ชันสำเนาด้วยคลิกเดียวสำหรับตัวอักษรพิเศษและสัญลักษณ์ต่างๆ
ตารางอ้างอิงแป้นพิมพ์ลัด
ค้นหาแป้นพิมพ์ลัดเริ่มต้นตามเอกสารของ VS Code, Chrome และ Bash ที่ใช้ GNU Readline บน macOS, Windows และ Linux
ตัวลดรูปพีชคณิตบูลีน
ประเมินนิพจน์บูลีนสำหรับทุกชุดอินพุตและดูตารางค่าความจริงที่สมบูรณ์ รองรับตัวแปรสูงสุดห้าตัวและตัวดำเนินการ &, |, !, ^
เครื่องสร้างตัวอักษรสุ่ม
สร้างตัวอักษร A-Z แบบสุ่ม เลือกจำนวน ตัวพิมพ์ใหญ่ ตัวพิมพ์เล็ก หรือแบบผสม แล้วใช้กับเกม โจทย์ หรือกิจกรรมในห้องเรียน
เครื่องมือสร้าง EditorConfig
สร้างไฟล์ .editorconfig ด้วยกฎสไตล์และขนาดการเยื้อง การจบบรรทัด ชุดอักขระ และช่องว่างของคุณ เพื่อให้การจัดรูปแบบสอดคล้องกันในทุก IDE และโปรแกรมแก้ไข
เครื่องมือนี้มีให้บริการในภาษาอื่น
- Correspondance de listes floues [FR]
- 퍼지 목록 매처 [KO]
- مطابق القوائم الضبابية [AR]
- Luddig listmatchare [SV]
- Fuzzy-Listenabgleich [DE]
- Comparador de Listas Difusas [ES]
- Pembanding Daftar Fuzzy [ID]
- ファジーリストマッチャー [JA]
- Bộ so khớp danh sách mờ [VI]
- Fuzzy lijstmatcher [NL]
- Rozmyte dopasowywanie list [PL]
- Correspondência de Lista Difusa [PT]
- Fuzzy List Matcher [EN]
- Corrispondente di Liste Fuzzy [IT]
- Метод сопоставления нечётких списков [RU]
- Bulanık Liste Eşleştirici [TR]
- 模糊列表匹配器 [ZH]