Entender as estatísticas de texto e a contagem de caracteres
O que este contador mede
O Text Counter divide um texto em todas as métricas que importam para o comprimento. Enquanto você digita ou cola, ele soma os caracteres com e sem espaços e, em seguida, as palavras, as frases, os parágrafos e as linhas. Ao lado dessas contagens habituais, estima o tempo de leitura e de fala e mostra os detalhes de baixo nível que a maioria das ferramentas ignora: clusters de grafemas Unicode, pontos de código e unidades de código, além do tamanho em bytes do texto em UTF-8, UTF-16 e várias codificações antigas.
Um painel de composição separado distribui os caracteres por tipo — coreano, emoji, ASCII e outro Unicode — para você ver num relance do que o texto é realmente feito.
Quando esses números importam
Os limites de caracteres moldam boa parte do que escrevemos. Um tweet para em 280 caracteres, uma meta descrição é cortada nos resultados de busca depois de cerca de 160, e um SMS se divide em segmentos ao passar de 160. Campos de redação ou de inscrição costumam impor um teto rígido de palavras ou de caracteres. Acompanhar a contagem subir enquanto você edita é bem mais prático do que colar o texto num formulário e vê-lo recusado.
As estimativas de tempo de leitura e de fala ajudam no outro lado do problema: prever quanto tempo um artigo ou roteiro exigirá do público, em vez de quanto espaço ele ocupa.
Um exemplo concreto
Pegue a cadeia 'Hello, world!'. São 13 caracteres com espaços e 12 sem, duas palavras, uma frase e uma linha. Agora cole um emoji como 👨👩👧: na tela ele parece um único caractere e conta como um cluster de grafemas, mas é formado por vários pontos de código unidos, e por isso seus totais de pontos de código e de bytes ficam maiores. Ver os dois números explica por que um emoji de 'um caractere' pode consumir boa parte de um limite rígido de bytes.
Observações e casos-limite
A diferença entre caracteres com e sem espaços aumenta em textos muito formatados, então verifique qual contagem cada plataforma realmente aplica: a maioria das redes sociais inclui os espaços, enquanto alguns sistemas antigos não. A contagem de palavras depende dos separadores, de modo que a escrita CJK (chinês, japonês, coreano) sem espaços é tratada por regras que reconhecem o sistema de escrita, e não por uma simples divisão por espaços. As frases são contadas pela pontuação final, então abreviações ou reticências podem alterar o total. O tamanho em bytes, por fim, depende inteiramente da codificação: um caractere acentuado ou CJK ocupa uma unidade de código, mas vários bytes em UTF-8 — exatamente o que o painel de codificação torna visível.