Перейти к основному содержанию

Детектор кодировки символов

Определите кодировку символов вставленного текста или загруженного файла — обнаружение BOM (UTF-8/UTF-16/UTF-32), настоящий валидатор байтов продолжения UTF-8, обнаружение ASCII и эвристика частоты байтов для однобайтовых устаревших кодировок, таких как Windows-1252 и ISO-8859-1 (Latin-1), когда нет BOM и байты не являются валидными UTF-8.

Ввод

Или загрузите файл
Drop a file or browse
One file · any type

Любой тип файла. Читается локально в вашем браузере. Используется только при пустом текстовом поле.

Вывод

Результат
PropertyValue
No data yet

Все рассмотренные кандидаты

Результат
EncodingConfidenceSignals
No data yet
Это было полезно?

Другие способы использовать этот инструмент

REST API

curl -X POST https://api.iotools.cloud/v1/tool/character-encoding-detector \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "inputText": "Hello, World!",
    "file": ""
  }'

Подставьте свой собственный ключ из аккаунта. Поля инструмента — это тело запроса, без обёртки.

Спросите у ИИ-агента

Use the IOTools `character-encoding-detector` tool (Character Encoding Detector) on this input:

YOUR_INPUT_HERE

Вставьте это любому агенту, подключённому к MCP-серверу IOTools, и добавьте свой ввод.

Виджет для встраивания

<iframe
  src="https://iotools.cloud/embed/character-encoding-detector/"
  width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
  title="Детектор кодировки символов — iotools.cloud"
  sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
  allow="clipboard-write"
  style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>

Вставьте это на свою страницу — бесплатно, без ключа, нужна лишь обратная ссылка.

Стоимость вызова API/MCPОт 5 кредитов

Также доступно через

Руководства

Искаженный текст — вопросительные знаки вместо букв с ударениями или строки вроде é вместо é — почти всегда означает, что файл был записан в одной кодировке символов и прочитан в другой. Детектор кодировки символов проверяет сырые байты вставленного текста или загруженного файла и сообщает его наиболее вероятную кодировку с байтовым уровнем доказательств позади этого предположения.

Как использовать

Вставьте текст в Входной текст или перетащите файл в загрузчик, чтобы проверить его исходные байты. Результат обновляется автоматически и показывает Обнаруженную кодировку, процент Уверенности, любой найденный BOM, количество байтов и строку Причины на понятном языке. Таблица Все рассмотренные кандидаты ниже показывает каждую кодировку, которую взвесил детектор, каждую со своей уверенностью и причиной, чтобы вы могли увидеть второстепенные варианты и причины, по которым они набрали меньше баллов.

Как работает обнаружение

Обнаружение проходит через фиксированную последовательность проверок — от наиболее к наименее определенной:

  1. Маркер порядка байтов (BOM). Некоторые кодировки добавляют в файл фиксированную последовательность байтов — EF BB BF для UTF-8, FF FE/FE FF для UTF-16 и 4-байтовые варианты для UTF-32. Его обнаружение почти определенно: 99% уверенности.
  2. Чистый ASCII. Если каждый байт находится в диапазоне 0x000x7F, это корректный ASCII — и, поскольку ASCII является строгим подмножеством UTF-8, одновременно корректный UTF-8. Сообщается со 100% уверенности.
  3. Корректный UTF-8. Без BOM, реальный валидатор UTF-8 проходит через поток байтов: проверяет, что байты продолжения имеют правильные высокие биты, отклоняет "переполненные" кодировки (больше байтов, чем нужно кодовой точке), и отклоняет кодовые точки вне диапазона или одиночные половины суррогата UTF-16. Это подлинная проверка грамматики, а не просто "выбросила ли декодирование исключение" — поэтому она ловит неправильно сформированные последовательности, которые снисходительный декодер молча бы принял. Текст, прошедший чистку, сообщается как UTF-8 с 97% уверенности.
  4. Предположение об однобайтовой устаревшей кодировке. Если байты не прошли проверку UTF-8, детектор переходит к эвристике частоты байтов между Windows-1252 и ISO-8859-1 (Latin-1), двумя наиболее распространенными однобайтовыми западными кодировками. Байты в диапазоне 0x800x9F — это неопределенные коды управления в Latin-1, но печатаемая пунктуация (фигурные кавычки, тире) в Windows-1252, поэтому их наличие указывает на Windows-1252. Эта ветвь ограничена значительно ниже 70% уверенности, потому что это статистическое предположение, а не определенность — одни и те же байты часто действительны в более чем одной кодировке.

Загружаются ли мои данные где-нибудь?

Нет. Обнаружение работает полностью в вашем браузере (или, через API, в обработчике запроса) — ничто не отправляется сторонним сервисам.

Почему мой файл не определяется как Shift_JIS, Big5 или другая кодировка CJK?

Эти устаревшие многобайтовые азиатские кодировки не охватываются — их угадывание только по диапазонам байтов производит много ложных срабатываний, в отличие от проверки BOM или проверки грамматики UTF-8. Если вы знаете, что файл это Shift_JIS или GBK, декодируйте его напрямую с этой меткой, вместо того чтобы полагаться на обнаружение.

encodingcharacter-encodingutf-8bomcharsetlatin-1windows-1252detector

Часть рабочего процесса

Все подборки

Нравятся инструменты? Уберите рекламу.

Один платёж навсегда убирает всю рекламу с вашего аккаунта. Без подписки, без слежки.