Pular para o conteúdo principal

Detector de Codificação de Caracteres

Detecte a codificação de caracteres do texto colado ou arquivo enviado — detecção de BOM (UTF-8/UTF-16/UTF-32), validador de byte de continuação UTF-8 real, detecção ASCII e heurística de frequência de byte para conjuntos de caracteres herdados de um byte único como Windows-1252 e ISO-8859-1 (Latin-1) quando não há BOM e os bytes não são UTF-8 válido.

Entrada

Ou envie um arquivo
Drop a file or browse
One file · any type

Qualquer tipo de arquivo. Lido localmente no seu navegador. Usado apenas quando a caixa de texto está vazia.

Saída

Resultado
PropertyValue
No data yet

Todos os candidatos considerados

Resultado
EncodingConfidenceSignals
No data yet
Isso foi útil?

Mais formas de usar esta ferramenta

API REST

curl -X POST https://api.iotools.cloud/v1/tool/character-encoding-detector \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "inputText": "Hello, World!",
    "file": ""
  }'

Troque pela sua própria chave, da sua conta. Os campos da ferramenta viram o corpo da requisição — sem envelope.

Peça a um agente de IA

Use the IOTools `character-encoding-detector` tool (Character Encoding Detector) on this input:

YOUR_INPUT_HERE

Cole isto em qualquer agente conectado ao servidor MCP do IOTools e depois adicione sua entrada.

Widget para incorporar

<iframe
  src="https://iotools.cloud/embed/character-encoding-detector/"
  width="100%" height="520" frameborder="0" scrolling="no" loading="lazy"
  title="Detector de Codificação de Caracteres — iotools.cloud"
  sandbox="allow-scripts allow-forms allow-same-origin allow-downloads allow-popups allow-popups-to-escape-sandbox"
  allow="clipboard-write"
  style="width:100%;border:1px solid #e5e7eb;border-radius:12px;overflow:hidden"></iframe>
<script src="https://iotools.cloud/embed.js" async></script>

Coloque isso na sua própria página — grátis, sem chave, só um link de volta.

Custo por chamada de API/MCPA partir de 5 créditos

Também disponível via

Guias

Texto distorcido — pontos de interrogação onde deveriam estar letras acentuadas, ou strings como é no lugar de é — quase sempre significa que um arquivo foi gravado em uma codificação de caracteres e relido em outra. O Detector de Codificação de Caracteres inspeciona os bytes brutos do texto colado ou arquivo enviado e relata sua codificação mais provável, com a evidência em nível de byte por trás dessa suposição.

Como usar

Cole o texto em Texto de Entrada, ou solte um arquivo no uploader para inspecionar seus bytes originais. O resultado é atualizado automaticamente e mostra a Codificação Detectada, uma porcentagem de Confiança, qualquer BOM encontrado, a contagem de bytes e uma linha de Raciocínio em linguagem comum. Uma tabela Todos os candidatos considerados abaixo lista todas as codificações que o detector considerou, cada uma com sua própria confiança e raciocínio, para que você possa ver as suposições do segundo lugar e por que pontuaram mais baixo.

Como funciona a detecção

A detecção passa por uma sequência fixa de verificações, da mais para a menos certa:

  1. Marca de ordem de byte (BOM). Algumas codificações adicionam uma sequência de byte fixa a um arquivo — EF BB BF para UTF-8, FF FE/FE FF para UTF-16, e variantes de 4 bytes para UTF-32. Encontrar uma é quase definitivo: 99% de confiança.
  2. ASCII puro. Se cada byte está no intervalo 0x000x7F, é ASCII válido — e, como ASCII é um subconjunto rigoroso de UTF-8, é simultaneamente UTF-8 válido. Relatado com 100% de confiança.
  3. UTF-8 válido. Sem um BOM, um validador UTF-8 real percorre o fluxo de byte: verifica se os bytes de continuação têm os bits altos corretos, rejeita codificações "alongadas demais" (mais bytes do que o codepoint precisa), e rejeita codepoints fora do intervalo ou meios de substituto UTF-16 solitários. Esta é uma verificação de gramática genuína, não apenas "a decodificação gerou erro" — então captura sequências malformadas que um decodificador lenient silenciosamente aceitaria. O texto que passa limpo é relatado como UTF-8 com 97% de confiança.
  4. Suposição de conjunto de caracteres herdado de um byte único. Se os bytes falharem na validação UTF-8, o detector volta para uma heurística de frequência de byte entre Windows-1252 e ISO-8859-1 (Latin-1), as duas codificações de um byte mais comuns do Ocidente. Os bytes no intervalo 0x800x9F são códigos de controle indefinidos em Latin-1, mas pontuação imprimível (aspas onduladas, travessões) em Windows-1252, então sua presença aponta para Windows-1252. Este ramo é mantido bem abaixo de 70% de confiança, porque é uma suposição estatística, não uma certeza — os mesmos bytes são frequentemente válidos em mais de um conjunto de caracteres.

Meus dados são enviados para algum lugar?

Não. A detecção é executada inteiramente no seu navegador (ou, pela API, no manipulador de solicitações) — nada é enviado para um serviço de terceiros.

Por que meu arquivo não é detectado como Shift_JIS, Big5 ou outra codificação CJK?

Essas codificações asiáticas multi-byte herdadas não são cobertas — adivinhar delas apenas a partir de intervalos de byte produz muitos falsos positivos, diferentemente da verificação de BOM ou verificação de gramática UTF-8. Se você sabe que um arquivo é Shift_JIS ou GBK, decodifique-o diretamente com esse rótulo em vez de contar com detecção.

encodingcharacter-encodingutf-8bomcharsetlatin-1windows-1252detector

Parte de um fluxo de trabalho

Todas as coleções

Ama as ferramentas? Livre-se dos anúncios.

Um único pagamento remove todos os anúncios da sua conta, para sempre. Sem assinatura, sem rastreamento.