Нормализатор текста Unicode
Сравните вставленный текст со всеми четырьмя формами нормализации Unicode (NFC, NFD, NFKC, NFKD) — посмотрите кодовые точки и длину байтов UTF-8 для каждой и какую форму уже соответствует ваш ввод. Обнаруживает ошибки, вызванные разницей между составными и разложенными формами, которые нарушают сравнение строк/ключей базы данных.
Ввод
Вывод
Какой(-ые) форме(-ам) нормализации уже соответствует ваш ввод до любого преобразования.
| Форма | Нормализованный текст | Кодовые точки | Байты UTF-8 | То же, что ввод? |
|---|---|---|---|---|
| No data yet | ||||
Руководства
Что делает этот инструмент?
Он берет любой текст и показывает вам, как он выглядит под каждой из четырех форм нормализации Unicode — NFC, NFD, NFKC и NFKD — рядом: нормализованный текст, его кодовые точки в нотации U+XXXX, его длину в байтах UTF-8 и соответствует ли эта форма вашему исходному вводу байт за байтом. Он также сообщает вам, какая форма (если таковая имеется) вашего вставленного текста уже находится.
Почему формы нормализации важны
Некоторые символы можно представить двумя разными способами в Unicode. Буква с диакритическим знаком, такая как é, может быть одной предкомпилированной кодовой точкой (U+00E9), или обычной e (U+0065), за которой следует комбинирующий острый акцент (U+0301). Оба отображаются одинаково на экране, но это разные последовательности байтов — поэтому "café" === "café" может молча вернуть false, если одна строка поступила из формы, которая компилирует акценты, а другая из формы (например, имена файлов HFS+ macOS или некоторые конвейеры IME/OCR), которая их разложит. То же самое относится к символам совместимости: лигатура, такая как fi (U+FB01), это одна кодовая точка, которая выглядит как f + i, но только формы K (NFKC/NFKD) рассматривают ее как эквивалент двухбуквенной последовательности.
- NFC (Каноническая композиция) — комбинирует символы в их предкомпилированную форму, где это возможно. Наиболее распространенная форма в Интернете и в большинстве баз данных.
- NFD (Каноническое разложение) — разбивает предкомпилированные символы на базовый символ плюс комбинирующие знаки.
- NFKC / NFKD — это же композиция/разложение, но также включают эквивалентности "совместимости" (лигатуры, полноширинные формы, надстрочные) которые NFC/NFD оставляют в стороне. Потеря информации для форматирования, но полезно для поиска/сопоставления.
Как это использовать
Вставьте или введите любой текст. Инструмент сразу показывает, какую(-ые) форму(-ы) нормализации ваш ввод уже имеет, затем таблицу со всеми четырьмя формами — их нормализованный текст, кодовые точки и длину в байтах UTF-8 — чтобы вы могли точно увидеть, какие символы изменяются (и на сколько байтов) под каждым преобразованием.
Распространенное использование
- Отладка ошибок сравнения строк или поиска, вызванных несовпадающими составными/разложенными формами (классическая проблема при сравнении имен файлов или пользовательского ввода с базой данных)
- Решение о том, какую форму нормализации применить перед сохранением, хешированием или индексированием пользовательского текста
- Понимание того, почему поиск не соответствует тексту, который выглядит идентично на экране
- Проверка, изменится ли размер текста с большим количеством диакритических знаков или лигатур при нормализации (влияет на поля с фиксированной длиной, хеши или проверки длины байтов)
Связанные инструменты
- Unicode Character Info — посмотрите полные свойства Unicode (блок, категория, класс двунаправленности) любого символа
- Unicode to HTML Entities — преобразуйте символы Unicode в HTML-сущности
&#...; - Text to Unicode Converter — преобразуйте текст в сырую нотацию кодовой точки
U+XXXX
Конфиденциальность
Этот инструмент работает полностью в вашем браузере, используя встроенный API String.prototype.normalize(). Ваш текст никогда не загружается на сервер.
Другие способы использовать этот инструмент
REST API
curl -X POST https://api.iotools.cloud/v1/tool/unicode-text-normalizer \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"inputText": "Café"
}'Подставьте свой собственный ключ из аккаунта. Поля инструмента — это тело запроса, без обёртки.
Спросите у ИИ-агента
Use the IOTools `unicode-text-normalizer` tool (Unicode Text Normalizer) on this input:
YOUR_INPUT_HEREВставьте это любому агенту, подключённому к MCP-серверу IOTools, и добавьте свой ввод.
Виджет для встраивания
<iframe
src="https://iotools.cloud/embed/unicode-text-normalizer/"
width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
title="Нормализатор текста Unicode — iotools.cloud"
sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
allow="clipboard-write"
style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>Вставьте это на свою страницу — бесплатно, без ключа, нужна лишь обратная ссылка.
| Стоимость вызова | От 5 кредитов |
|---|