Детектор кодировки символов
Определите кодировку символов вставленного текста или загруженного файла — обнаружение BOM (UTF-8/UTF-16/UTF-32), настоящий валидатор байтов продолжения UTF-8, обнаружение ASCII и эвристика частоты байтов для однобайтовых устаревших кодировок, таких как Windows-1252 и ISO-8859-1 (Latin-1), когда нет BOM и байты не являются валидными UTF-8.
Ввод
Любой тип файла. Читается локально в вашем браузере. Используется только при пустом текстовом поле.
Вывод
| Property | Value |
|---|---|
| No data yet | |
Все рассмотренные кандидаты
| Encoding | Confidence | Signals |
|---|---|---|
| No data yet | ||
Другие способы использовать этот инструмент
REST API
curl -X POST https://api.iotools.cloud/v1/tool/character-encoding-detector \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"inputText": "Hello, World!",
"file": ""
}'Подставьте свой собственный ключ из аккаунта. Поля инструмента — это тело запроса, без обёртки.
Спросите у ИИ-агента
Use the IOTools `character-encoding-detector` tool (Character Encoding Detector) on this input:
YOUR_INPUT_HEREВставьте это любому агенту, подключённому к MCP-серверу IOTools, и добавьте свой ввод.
Виджет для встраивания
<iframe
src="https://iotools.cloud/embed/character-encoding-detector/"
width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
title="Детектор кодировки символов — iotools.cloud"
sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
allow="clipboard-write"
style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>Вставьте это на свою страницу — бесплатно, без ключа, нужна лишь обратная ссылка.
| Стоимость вызова API/MCP | От 5 кредитов |
|---|
Также доступно через
Руководства
Искаженный текст — вопросительные знаки вместо букв с ударениями или строки вроде é вместо é — почти всегда означает, что файл был записан в одной кодировке символов и прочитан в другой. Детектор кодировки символов проверяет сырые байты вставленного текста или загруженного файла и сообщает его наиболее вероятную кодировку с байтовым уровнем доказательств позади этого предположения.
Как использовать
Вставьте текст в Входной текст или перетащите файл в загрузчик, чтобы проверить его исходные байты. Результат обновляется автоматически и показывает Обнаруженную кодировку, процент Уверенности, любой найденный BOM, количество байтов и строку Причины на понятном языке. Таблица Все рассмотренные кандидаты ниже показывает каждую кодировку, которую взвесил детектор, каждую со своей уверенностью и причиной, чтобы вы могли увидеть второстепенные варианты и причины, по которым они набрали меньше баллов.
Как работает обнаружение
Обнаружение проходит через фиксированную последовательность проверок — от наиболее к наименее определенной:
- Маркер порядка байтов (BOM). Некоторые кодировки добавляют в файл фиксированную последовательность байтов —
EF BB BFдля UTF-8,FF FE/FE FFдля UTF-16 и 4-байтовые варианты для UTF-32. Его обнаружение почти определенно: 99% уверенности. - Чистый ASCII. Если каждый байт находится в диапазоне
0x00–0x7F, это корректный ASCII — и, поскольку ASCII является строгим подмножеством UTF-8, одновременно корректный UTF-8. Сообщается со 100% уверенности. - Корректный UTF-8. Без BOM, реальный валидатор UTF-8 проходит через поток байтов: проверяет, что байты продолжения имеют правильные высокие биты, отклоняет "переполненные" кодировки (больше байтов, чем нужно кодовой точке), и отклоняет кодовые точки вне диапазона или одиночные половины суррогата UTF-16. Это подлинная проверка грамматики, а не просто "выбросила ли декодирование исключение" — поэтому она ловит неправильно сформированные последовательности, которые снисходительный декодер молча бы принял. Текст, прошедший чистку, сообщается как UTF-8 с 97% уверенности.
- Предположение об однобайтовой устаревшей кодировке. Если байты не прошли проверку UTF-8, детектор переходит к эвристике частоты байтов между Windows-1252 и ISO-8859-1 (Latin-1), двумя наиболее распространенными однобайтовыми западными кодировками. Байты в диапазоне
0x80–0x9F— это неопределенные коды управления в Latin-1, но печатаемая пунктуация (фигурные кавычки, тире) в Windows-1252, поэтому их наличие указывает на Windows-1252. Эта ветвь ограничена значительно ниже 70% уверенности, потому что это статистическое предположение, а не определенность — одни и те же байты часто действительны в более чем одной кодировке.
Загружаются ли мои данные где-нибудь?
Нет. Обнаружение работает полностью в вашем браузере (или, через API, в обработчике запроса) — ничто не отправляется сторонним сервисам.
Почему мой файл не определяется как Shift_JIS, Big5 или другая кодировка CJK?
Эти устаревшие многобайтовые азиатские кодировки не охватываются — их угадывание только по диапазонам байтов производит много ложных срабатываний, в отличие от проверки BOM или проверки грамматики UTF-8. Если вы знаете, что файл это Shift_JIS или GBK, декодируйте его напрямую с этой меткой, вместо того чтобы полагаться на обнаружение.