ค้นหา Unicode
ใส่อักขระปริศนา, ช่องว่างแปลก ๆ ที่ผู้ใช้ของคุณวาง glyph จากตัวอย่างฟอนต์ emoji ที่ทำให้ regex ของคุณพัง, แล้วการค้นหาคืน code point ของ Unicode (U+XXXX) และไบต์ UTF-8 ดิบในรูปเลขฐานสิบหก หนึ่งบรรทัดต่อหนึ่งอักขระ
วิธีระบุอักขระ Unicode
-
1
วางอักขระ
คุณวาง glyph เดียวหรือทั้งสตริงได้: อักขระแต่ละตัวถูกวิเคราะห์ตามลำดับ
-
2
อ่าน code point
ได้สัญกรณ์ U+ มาตรฐาน ตัวพิมพ์ใหญ่ เติมศูนย์ให้อย่างน้อยสี่หลักเลขฐานสิบหก
-
3
ตรวจไบต์ UTF-8
ดูลำดับ 1–4 ไบต์ที่อักขระใช้บนดิสก์หรือบนสาย
-
4
คัดลอกผลลัพธ์
ผลลัพธ์เป็นตารางรูปแบบ CSV (อักขระ, code point, ไบต์ UTF-8) ที่คุณเลือกและวางลงในสเปรดชีตหรือรายงานบั๊กได้
งานสืบสวนทั่วไปที่คุณทำได้ด้วยการค้นหา
บั๊ก Unicode ส่วนใหญ่ดูเหมือนกันบนหน้าจอ วิธีเดียวที่จะบอกช่องว่างปกติจาก no-break space หรือ apostrophe โค้งจาก prime คือการตรวจ code point
กับดักทั่วไปที่การค้นหาแก้ได้
| ดูเหมือน | จริง ๆ คือ | Code point |
|---|---|---|
| ช่องว่าง | No-break space | U+00A0 |
| ช่องว่าง | Narrow no-break space | U+202F |
| (ไม่มีอะไร) | Zero-width space | U+200B |
| (ไม่มีอะไร) | Zero-width joiner | U+200D |
| Apostrophe | Right single quotation mark | U+2019 |
| Apostrophe | Prime (ฟุต/นาที) | U+2032 |
| Hyphen | En dash | U+2013 |
| Hyphen | Non-breaking hyphen | U+2011 |
โครงสร้างไบต์ UTF-8 ในพริบตา
- 1 ไบต์, ASCII, U+0000 ถึง U+007F (
0xxxxxxx) - 2 ไบต์, Latin supplement, อาหรับ, ฮีบรู (
110xxxxx 10xxxxxx) - 3 ไบต์, CJK, สัญลักษณ์ส่วนใหญ่ (
1110xxxx 10xxxxxx 10xxxxxx) - 4 ไบต์, Emoji, ระบบเขียนหายาก (
11110xxx 10xxxxxx 10xxxxxx 10xxxxxx)
หากคอลัมน์ฐานข้อมูลของคุณมีความยาวไบต์คงที่ emoji 4 ไบต์จะกินสี่ช่องแม้จะเรนเดอร์เป็น glyph เดียว, แหล่งบั๊กการตัดข้อความที่พบบ่อย
คำถามที่พบบ่อย
มักเป็น BOM marker (U+FEFF) ที่ต้นไฟล์ หรือ zero-width joiner หลงเหลือจากโปรแกรมประมวลผลคำ วางหนึ่งตัวลงในการค้นหา แล้วมันจะบอกคุณทันที จากนั้นคุณลบมันด้วย find-and-replace ง่าย ๆ
ได้ การค้นหาวนทีละอักขระ ดังนั้นทั้งคำผลิตหนึ่งแถวต่ออักขระพร้อม code point และไบต์ UTF-8
code point คืออัตลักษณ์เชิงนามธรรมของอักขระ, U+00E9 เป็น “é” เสมอไม่ว่าคุณเก็บไว้ที่ไหน UTF-8 เป็นหนึ่งในหลายการเข้ารหัสที่เปลี่ยน code point เป็นไบต์ “é” ตัวเดียวกันคือสองไบต์ C3 A9 ใน UTF-8 แต่เป็นไบต์เดียว E9 ใน Latin-1
ใช่ การค้นหาคำนวณบนเซิร์ฟเวอร์ของเรา: อักขระที่คุณวางจะถูกส่งไป วิเคราะห์ แล้วส่ง code point และไบต์ UTF-8 กลับมาทันที เราไม่เก็บข้อความที่คุณส่ง
เครื่องมือที่เกี่ยวข้อง
เครื่องแปลงตัวเลขเป็นคำไทย
เขียนจำนวนไม่เกิน 18 หลักเป็นคำไทย หรือเขียนจำนวนบาทและสตางค์ตามค่าที่กรอกในเบราว์เซอร์ รองรับเลขอารบิกกับเลขไทยและไม่ปัดค่า
เครื่องมือสร้างตัวอักษรวงกลม
แปลงข้อความธรรมดาให้เป็นตัวอักษรวงกลม (Ⓐ Ⓑ Ⓒ) ที่คัดลอกแล้ววางลงในไบโอ Instagram, TikTok และ Discord ได้ มีทั้งตัวพิมพ์ใหญ่และตัวพิมพ์เล็กในวงกลม พร้อมตัวเลขในวงกลม โดยไม่ต้องใช้แอป
สัญลักษณ์ลูกศรสำหรับคัดลอก
คัดลอกลูกศร Unicode ที่ใช้บ่อยได้ในคลิกเดียว ทั้งแบบตรง สองเส้น ทแยง มีขอ วงกลม และสามเหลี่ยม สำหรับเอกสาร แชต และงานออกแบบ
เครื่องสุ่มนามสกุลญี่ปุ่น
เลือกนามสกุลญี่ปุ่นแบบโรมาจิ 1–60 รายการโดยไม่ซ้ำในชุดเดียว จากรายการคงที่ 60 รายการ
สัญลักษณ์น้อยกว่าหรือเท่ากับ
คัดลอกสัญลักษณ์ ≤ และสัญลักษณ์เปรียบเทียบทางคณิตศาสตร์ที่เกี่ยวข้อง รวมถึง Unicode เอนทิตี HTML และการเขียน LaTeX สำหรับสเปรดชีต งานวิจัย และหน้าเว็บ
เครื่องกำเนิดข้อความแบบวงกลม
แปลงข้อความธรรมดาเป็นอักขระ Unicode แบบวงกลม รูปแบบโครงร่าง เติม และวงกลมตัวเลขสำหรับประวัติโซเชียล แชท และเอกสาร
เครื่องมือนี้มีให้บริการในภาษาอื่น
- بحث يونيكود [AR]
- Unicode opzoeken [NL]
- Unicode-uppslagning [SV]
- Recherche Unicode [FR]
- Wyszukiwarka Unicode [PL]
- Unicode検索 [JA]
- Pencarian Unicode [ID]
- Pesquisa de Unicode [PT]
- Unicode-Suche [DE]
- Búsqueda de Unicode [ES]
- 유니코드 조회 [KO]
- Tra cứu Unicode [VI]
- Unicode Lookup [EN]
- Ricerca Unicode [IT]
- Поиск символов Unicode [RU]
- Unicode Arama [TR]
- Unicode 字符查找 [ZH]