Penyesuai Teks Unicode
Bandingkan teks yang disisipkan di semua empat bentuk normalisasi Unicode (NFC, NFD, NFKC, NFKD) — lihat poin kode dan panjang byte UTF-8 untuk setiap bentuk, dan bentuk mana yang sudah cocok dengan input Anda. Menangkap bug yang disebabkan oleh perbedaan bentuk tersusun-vs-terurai yang merusak perbandingan string/kunci database.
Input
Output
Bentuk normalisasi mana (jika ada) yang sudah cocok dengan input Anda, sebelum konversi apa pun.
| Bentuk | Teks Ternormalisasi | Poin Kode | Byte UTF-8 | Sama dengan Input? |
|---|---|---|---|---|
| No data yet | ||||
Panduan
Apa yang dilakukan alat ini?
Alat ini mengambil teks apa pun dan menunjukkan kepada Anda dengan tepat bagaimana tampilannya di bawah setiap dari empat bentuk normalisasi Unicode — NFC, NFD, NFKC, dan NFKD — berdampingan: teks yang dinormalisasi, poin kodenya dalam notasi U+XXXX, panjang byte UTF-8, dan apakah bentuk itu cocok dengan input asli Anda byte demi byte. Alat ini juga memberi tahu Anda bentuk mana (jika ada) teks tempel Anda sudah ada di dalamnya.
Mengapa bentuk normalisasi penting
Beberapa karakter dapat direpresentasikan dengan dua cara berbeda dalam Unicode. Huruf beraksén seperti é dapat menjadi satu titik kode yang telah dikomposisi sebelumnya (U+00E9), atau e biasa (U+0065) diikuti oleh tanda akut gabungan (U+0301). Keduanya ditampilkan secara identik di layar, tetapi keduanya adalah urutan byte yang berbeda — jadi "café" === "café" dapat secara diam-diam mengembalikan false jika satu string berasal dari bentuk yang menggabungkan aksen dan yang lain berasal dari bentuk (seperti nama file HFS+ macOS, atau beberapa pipa IME/OCR) yang menguraikannya. Hal yang sama berlaku untuk karakter kompatibilitas: ligatur seperti fi (U+FB01) adalah satu titik kode yang terlihat seperti f + i, tetapi hanya bentuk K (NFKC/NFKD) yang memperlakukannya sebagai setara dengan urutan dua huruf.
- NFC (Canonical Composition) — menggabungkan karakter menjadi bentuk komposisi sebelumnya di mana pun memungkinkan. Bentuk paling umum di web dan di sebagian besar database.
- NFD (Canonical Decomposition) — membagi karakter yang telah dikomposisi menjadi karakter dasar ditambah tanda penggabung.
- NFKC / NFKD — komposisi/dekomposisi yang sama, tetapi juga meliputi kesetaraan "kompatibilitas" (ligatur, bentuk lebar penuh, superskrip) yang NFC/NFD tinggalkan. Kehilangan informasi untuk pemformatan, tetapi berguna untuk pencarian/pencocokan.
Cara menggunakannya
Tempel atau ketik teks apa pun. Alat ini segera menunjukkan bentuk normalisasi mana yang sudah cocok dengan input Anda, kemudian tabel dengan semua empat bentuk — teks yang dinormalisasi, poin kode, dan panjang byte UTF-8 — sehingga Anda dapat melihat dengan tepat karakter mana yang berubah (dan berapa banyak byte) di bawah setiap transformasi.
Penggunaan umum
- Debugging bug perbandingan string atau pencarian yang disebabkan oleh bentuk tersusun/terurai yang tidak cocok (titik rasa sakit klasik saat membandingkan nama file atau input pengguna terhadap database)
- Menentukan bentuk normalisasi mana yang akan diterapkan sebelum menyimpan, melakukan hash, atau mengindeks teks yang dikirimkan pengguna
- Memahami mengapa pencarian tidak cocok dengan teks yang terlihat identik di layar
- Memeriksa apakah string yang berat dalam aksén atau ligatur akan mengubah ukuran saat dinormalisasi (mempengaruhi bidang panjang tetap, hash, atau pemeriksaan panjang byte)
Alat terkait
- Unicode Character Info — cari properti Unicode lengkap (blok, kategori, kelas bidi) dari karakter apa pun
- Unicode to HTML Entities — konversi karakter Unicode ke entitas HTML
&#...; - Text to Unicode Converter — konversi teks ke notasi titik kode mentah
U+XXXX
Privasi
Alat ini berjalan sepenuhnya di browser Anda menggunakan API String.prototype.normalize() bawaan. Teks Anda tidak pernah diunggah ke server.
Cara lain menggunakan alat ini
REST API
curl -X POST https://api.iotools.cloud/v1/tool/unicode-text-normalizer \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"inputText": "Café"
}'Ganti dengan kunci Anda sendiri dari akun Anda. Bidang alat menjadi isi permintaan — tanpa pembungkus.
Tanyakan ke agen AI
Use the IOTools `unicode-text-normalizer` tool (Unicode Text Normalizer) on this input:
YOUR_INPUT_HERETempelkan ini ke agen mana pun yang terhubung ke server MCP IOTools, lalu tambahkan input Anda.
Widget sematan
<iframe
src="https://iotools.cloud/embed/unicode-text-normalizer/"
width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
title="Penyesuai Teks Unicode — iotools.cloud"
sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
allow="clipboard-write"
style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>Tempelkan ini di halaman Anda sendiri — gratis, tanpa kunci, cukup tautan balik.
| Biaya per panggilan | Mulai dari 5 kredit |
|---|