Detector de Codificação de Caracteres
Detecte a codificação de caracteres do texto colado ou arquivo enviado — detecção de BOM (UTF-8/UTF-16/UTF-32), validador de byte de continuação UTF-8 real, detecção ASCII e heurística de frequência de byte para conjuntos de caracteres herdados de um byte único como Windows-1252 e ISO-8859-1 (Latin-1) quando não há BOM e os bytes não são UTF-8 válido.
Entrada
Qualquer tipo de arquivo. Lido localmente no seu navegador. Usado apenas quando a caixa de texto está vazia.
Saída
| Property | Value |
|---|---|
| No data yet | |
Todos os candidatos considerados
| Encoding | Confidence | Signals |
|---|---|---|
| No data yet | ||
Mais formas de usar esta ferramenta
API REST
curl -X POST https://api.iotools.cloud/v1/tool/character-encoding-detector \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"inputText": "Hello, World!",
"file": ""
}'Troque pela sua própria chave, da sua conta. Os campos da ferramenta viram o corpo da requisição — sem envelope.
Peça a um agente de IA
Use the IOTools `character-encoding-detector` tool (Character Encoding Detector) on this input:
YOUR_INPUT_HERECole isto em qualquer agente conectado ao servidor MCP do IOTools e depois adicione sua entrada.
Widget para incorporar
<iframe
src="https://iotools.cloud/embed/character-encoding-detector/"
width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
title="Detector de Codificação de Caracteres — iotools.cloud"
sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
allow="clipboard-write"
style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>Coloque isso na sua própria página — grátis, sem chave, só um link de volta.
| Custo por chamada de API/MCP | A partir de 5 créditos |
|---|
Também disponível via
Guias
Texto distorcido — pontos de interrogação onde deveriam estar letras acentuadas, ou strings como é no lugar de é — quase sempre significa que um arquivo foi gravado em uma codificação de caracteres e relido em outra. O Detector de Codificação de Caracteres inspeciona os bytes brutos do texto colado ou arquivo enviado e relata sua codificação mais provável, com a evidência em nível de byte por trás dessa suposição.
Como usar
Cole o texto em Texto de Entrada, ou solte um arquivo no uploader para inspecionar seus bytes originais. O resultado é atualizado automaticamente e mostra a Codificação Detectada, uma porcentagem de Confiança, qualquer BOM encontrado, a contagem de bytes e uma linha de Raciocínio em linguagem comum. Uma tabela Todos os candidatos considerados abaixo lista todas as codificações que o detector considerou, cada uma com sua própria confiança e raciocínio, para que você possa ver as suposições do segundo lugar e por que pontuaram mais baixo.
Como funciona a detecção
A detecção passa por uma sequência fixa de verificações, da mais para a menos certa:
- Marca de ordem de byte (BOM). Algumas codificações adicionam uma sequência de byte fixa a um arquivo —
EF BB BFpara UTF-8,FF FE/FE FFpara UTF-16, e variantes de 4 bytes para UTF-32. Encontrar uma é quase definitivo: 99% de confiança. - ASCII puro. Se cada byte está no intervalo
0x00–0x7F, é ASCII válido — e, como ASCII é um subconjunto rigoroso de UTF-8, é simultaneamente UTF-8 válido. Relatado com 100% de confiança. - UTF-8 válido. Sem um BOM, um validador UTF-8 real percorre o fluxo de byte: verifica se os bytes de continuação têm os bits altos corretos, rejeita codificações "alongadas demais" (mais bytes do que o codepoint precisa), e rejeita codepoints fora do intervalo ou meios de substituto UTF-16 solitários. Esta é uma verificação de gramática genuína, não apenas "a decodificação gerou erro" — então captura sequências malformadas que um decodificador lenient silenciosamente aceitaria. O texto que passa limpo é relatado como UTF-8 com 97% de confiança.
- Suposição de conjunto de caracteres herdado de um byte único. Se os bytes falharem na validação UTF-8, o detector volta para uma heurística de frequência de byte entre Windows-1252 e ISO-8859-1 (Latin-1), as duas codificações de um byte mais comuns do Ocidente. Os bytes no intervalo
0x80–0x9Fsão códigos de controle indefinidos em Latin-1, mas pontuação imprimível (aspas onduladas, travessões) em Windows-1252, então sua presença aponta para Windows-1252. Este ramo é mantido bem abaixo de 70% de confiança, porque é uma suposição estatística, não uma certeza — os mesmos bytes são frequentemente válidos em mais de um conjunto de caracteres.
Meus dados são enviados para algum lugar?
Não. A detecção é executada inteiramente no seu navegador (ou, pela API, no manipulador de solicitações) — nada é enviado para um serviço de terceiros.
Por que meu arquivo não é detectado como Shift_JIS, Big5 ou outra codificação CJK?
Essas codificações asiáticas multi-byte herdadas não são cobertas — adivinhar delas apenas a partir de intervalos de byte produz muitos falsos positivos, diferentemente da verificação de BOM ou verificação de gramática UTF-8. Se você sabe que um arquivo é Shift_JIS ou GBK, decodifique-o diretamente com esse rótulo em vez de contar com detecção.