Detektor Enkoding Karakter
Deteksi enkoding karakter dari teks yang ditempel atau file yang diunggah — pendeteksian BOM (UTF-8/UTF-16/UTF-32), validator byte lanjutan UTF-8 yang sebenarnya, deteksi ASCII, dan heuristik frekuensi byte untuk charset warisan single-byte seperti Windows-1252 dan ISO-8859-1 (Latin-1) saat tidak ada BOM dan byte tidak valid UTF-8.
Input
Jenis file apa pun. Dibaca secara lokal di browser Anda. Digunakan hanya saat kotak teks kosong.
Output
| Property | Value |
|---|---|
| No data yet | |
Semua kandidat yang dipertimbangkan
| Encoding | Confidence | Signals |
|---|---|---|
| No data yet | ||
Cara lain menggunakan alat ini
REST API
curl -X POST https://api.iotools.cloud/v1/tool/character-encoding-detector \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"inputText": "Hello, World!",
"file": ""
}'Ganti dengan kunci Anda sendiri dari akun Anda. Bidang alat menjadi isi permintaan — tanpa pembungkus.
Tanyakan ke agen AI
Use the IOTools `character-encoding-detector` tool (Character Encoding Detector) on this input:
YOUR_INPUT_HERETempelkan ini ke agen mana pun yang terhubung ke server MCP IOTools, lalu tambahkan input Anda.
Widget sematan
<iframe
src="https://iotools.cloud/embed/character-encoding-detector/"
width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
title="Detektor Enkoding Karakter — iotools.cloud"
sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
allow="clipboard-write"
style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>Tempelkan ini di halaman Anda sendiri — gratis, tanpa kunci, cukup tautan balik.
| Biaya per panggilan API/MCP | Mulai dari 5 kredit |
|---|
Juga tersedia melalui
Panduan
Teks yang berantakan — tanda tanya di tempat huruf yang diaksenkan seharusnya berada, atau string seperti é menggantikan é — hampir selalu berarti file ditulis dalam satu enkoding karakter dan dibaca kembali dalam enkoding lain. Detektor Enkoding Karakter memeriksa byte mentah dari teks yang ditempel atau file yang diunggah dan melaporkan enkoding yang paling mungkin, beserta bukti tingkat byte di balik tebakan itu.
Cara menggunakannya
Tempel teks ke Input Text, atau lepaskan file ke uploader untuk memeriksa byte aslinya. Hasilnya diperbarui secara otomatis dan menampilkan Detected Encoding, persentase Confidence, BOM apa pun yang ditemukan, jumlah byte, dan baris Reasoning dalam bahasa Inggris. Tabel All candidates considered di bawahnya mencantumkan setiap enkoding yang ditimbang detektor, masing-masing dengan tingkat kepercayaan dan alasannya sendiri, sehingga Anda dapat melihat tebakan runner-up dan mengapa mereka mendapat skor lebih rendah.
Cara kerja deteksi
Deteksi berjalan melalui urutan pemeriksaan yang tetap, dari paling hingga paling tidak pasti:
- Byte order mark (BOM). Beberapa enkoding menambahkan urutan byte tetap ke file —
EF BB BFuntuk UTF-8,FF FE/FE FFuntuk UTF-16, dan varian 4-byte untuk UTF-32. Menemukan satu hampir pasti: 99% kepercayaan. - ASCII murni. Jika setiap byte berada dalam rentang
0x00–0x7F, itu adalah ASCII valid — dan, karena ASCII adalah subset ketat dari UTF-8, secara bersamaan valid UTF-8. Dilaporkan dengan 100% kepercayaan. - UTF-8 valid. Tanpa BOM, validator UTF-8 nyata berjalan melalui aliran byte: memeriksa bahwa byte lanjutan memiliki bit tinggi yang benar, menolak enkoding "panjang berlebih" (lebih banyak byte daripada yang diperlukan codepoint), dan menolak out-of-range codepoint atau byte pengganti UTF-16 yang terisolasi. Itu adalah pemeriksaan tata bahasa yang sebenarnya, bukan hanya "apakah dekoding melempar" — jadi menangkap urutan yang salah bentuk bahwa decoder yang longgar akan diam-diam terima. Teks yang lulus dengan bersih dilaporkan sebagai UTF-8 dengan 97% kepercayaan.
- Tebakan charset warisan single-byte. Jika byte gagal validasi UTF-8, detektor kembali ke heuristik frekuensi byte antara Windows-1252 dan ISO-8859-1 (Latin-1), dua enkoding Barat single-byte paling umum. Byte dalam rentang
0x80–0x9Fadalah kode kontrol yang tidak terdefinisi dalam Latin-1 tetapi tanda baca yang dapat dicetak (tanda kutip keriting, garis putus-putus) dalam Windows-1252, jadi kehadiran mereka menunjuk ke Windows-1252. Cabang ini dibatasi jauh di bawah 70% kepercayaan, karena itu adalah tebakan statistik, bukan kepastian — byte yang sama sering valid dalam lebih dari satu charset.
Apakah data saya diunggah ke mana pun?
Tidak. Deteksi berjalan sepenuhnya di browser Anda (atau, melalui API, di handler permintaan) — tidak ada yang dikirim ke layanan pihak ketiga.
Mengapa file saya tidak terdeteksi sebagai Shift_JIS, Big5, atau enkoding CJK lainnya?
Enkoding multi-byte Asia warisan itu tidak tercakup — menebak mereka dari rentang byte saja menghasilkan banyak false positive, tidak seperti pemeriksaan BOM atau pemeriksaan tata bahasa UTF-8. Jika Anda tahu file adalah Shift_JIS atau GBK, dekode langsung dengan label itu daripada mengandalkan deteksi.