Normalizador de Texto Unicode
Compare texto colado em todos os quatro formulários de normalização Unicode (NFC, NFD, NFKC, NFKD) — veja os pontos de código e o comprimento de byte UTF-8 de cada, e qual forma sua entrada já corresponde. Captura os bugs de composição-vs-decomposição que quebram comparações de string/chave de banco de dados.
Entrada
Saída
Qual(is) formulário(s) de normalização sua entrada já corresponde, antes de qualquer conversão.
| Formulário | Texto Normalizado | Pontos de Código | Bytes UTF-8 | Mesmo que a Entrada? |
|---|---|---|---|---|
| No data yet | ||||
Guias
O que esta ferramenta faz?
Ela pega qualquer texto e mostra exatamente como fica sob cada um dos quatro formulários de normalização Unicode — NFC, NFD, NFKC e NFKD — lado a lado: o texto normalizado, seus pontos de código em notação U+XXXX, seu comprimento em bytes UTF-8 e se esse formulário corresponde à sua entrada original byte por byte. Também informa qual formulário (se houver) seu texto colado já está.
Por que os formulários de normalização importam
Alguns caracteres podem ser representados de duas maneiras diferentes em Unicode. Uma letra acentuada como é pode ser um único ponto de código pré-composto (U+00E9), ou um e simples (U+0065) seguido por um acento agudo combinado (U+0301). Ambos são renderizados de forma idêntica na tela, mas são sequências de bytes diferentes — então "café" === "café" pode silenciosamente retornar false se uma string veio de um formulário que compõe acentos e a outra veio de um formulário (como nomes de arquivo HFS+ do macOS, ou alguns pipelines de IME/OCR) que os decompõe. O mesmo se aplica a caracteres de compatibilidade: um ligadura como fi (U+FB01) é um único ponto de código que parece f + i, mas apenas os formulários K (NFKC/NFKD) o tratam como equivalente à sequência de duas letras.
- NFC (Composição Canônica) — combina caracteres em sua forma pré-composta onde possível. O formulário mais comum na web e na maioria dos bancos de dados.
- NFD (Decomposição Canônica) — divide caracteres pré-compostos em um caractere base mais marcas combinadas.
- NFKC / NFKD — a mesma composição/decomposição, mas também incluem equivalências de "compatibilidade" (ligaduras, formas de largura completa, sobrescritos) que NFC/NFD deixam de lado. Lossy para formatação, mas útil para busca/correspondência.
Como usá-la
Cole ou digite qualquer texto. A ferramenta mostra imediatamente qual(is) formulário(s) de normalização sua entrada já corresponde, depois uma tabela com todos os quatro formulários — seu texto normalizado, pontos de código e comprimento em bytes UTF-8 — para que você possa ver precisamente quais caracteres mudam (e quantos bytes) sob cada transformação.
Usos comuns
- Depuração de bugs de comparação de string ou busca causados por formulários compostos/decompostos incompatíveis (um ponto de dor clássico ao comparar nomes de arquivo ou entrada do usuário com um banco de dados)
- Decidindo qual formulário de normalização aplicar antes de armazenar, fazer hash ou indexar texto enviado pelo usuário
- Compreender por que uma busca não corresponde ao texto que parece idêntico na tela
- Verificar se uma string pesada em acentos ou ligaduras mudará de tamanho quando normalizada (afeta campos de comprimento fixo, hashes ou verificações de comprimento de byte)
Ferramentas relacionadas
- Unicode Character Info — procure as propriedades completas de Unicode (bloco, categoria, classe bidi) de qualquer caractere
- Unicode to HTML Entities — converta caracteres Unicode em entidades HTML
&#...; - Text to Unicode Converter — converta texto para notação de ponto de código bruto
U+XXXX
Privacidade
Esta ferramenta é executada inteiramente no seu navegador usando a API String.prototype.normalize() integrada. Seu texto nunca é enviado para um servidor.
Mais formas de usar esta ferramenta
API REST
curl -X POST https://api.iotools.cloud/v1/tool/unicode-text-normalizer \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"inputText": "Café"
}'Troque pela sua própria chave, da sua conta. Os campos da ferramenta viram o corpo da requisição — sem envelope.
Peça a um agente de IA
Use the IOTools `unicode-text-normalizer` tool (Unicode Text Normalizer) on this input:
YOUR_INPUT_HERECole isto em qualquer agente conectado ao servidor MCP do IOTools e depois adicione sua entrada.
Widget para incorporar
<iframe
src="https://iotools.cloud/embed/unicode-text-normalizer/"
width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
title="Normalizador de Texto Unicode — iotools.cloud"
sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
allow="clipboard-write"
style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>Coloque isso na sua própria página — grátis, sem chave, só um link de volta.
| Custo por chamada | A partir de 5 créditos |
|---|