Entender las estadísticas de texto y el recuento de caracteres
Qué mide este contador
Text Counter desglosa un texto en todas las métricas que importan para la longitud. A medida que escribes o pegas, cuenta los caracteres con espacios y sin ellos, y luego las palabras, las oraciones, los párrafos y las líneas. Junto a esos recuentos habituales estima el tiempo de lectura y de habla, y muestra los detalles de bajo nivel que la mayoría de las herramientas omite: clústeres de grafemas Unicode, puntos de código y unidades de código, además del tamaño en bytes de tu texto en UTF-8, UTF-16 y varias codificaciones heredadas.
Un panel de composición aparte reparte los caracteres por tipo —coreano, emoji, ASCII y otro Unicode— para que veas de un vistazo de qué está hecho realmente tu texto.
Cuándo importan estos números
Los límites de caracteres condicionan buena parte de lo que escribimos. Un tuit se detiene en 280 caracteres, una meta descripción se recorta en los resultados de búsqueda pasados los 160 aproximadamente, y un SMS se divide en segmentos al superar los 160. Los formularios de ensayos o de solicitud suelen imponer un tope estricto de palabras o de caracteres. Ver cómo sube la cuenta mientras editas resulta mucho más cómodo que pegar el texto en un formulario y que lo rechace.
Las estimaciones de tiempo de lectura y de habla ayudan con la otra cara del problema: planificar cuánto tardará el público en leer un artículo o escuchar un guion, en lugar de cuánto espacio ocupa.
Un ejemplo concreto
Toma la cadena 'Hello, world!'. Son 13 caracteres con espacios y 12 sin ellos, dos palabras, una oración y una línea. Ahora pega un emoji como 👨👩👧: en pantalla parece un único carácter y cuenta como un clúster de grafemas, pero está formado por varios puntos de código unidos, y por eso sus totales de puntos de código y de bytes son mayores. Ver ambas cifras explica por qué un emoji de 'un carácter' puede consumir buena parte de un límite estricto de bytes.
Notas y casos límite
La diferencia entre caracteres con y sin espacios crece en textos muy formateados, así que conviene saber qué recuento aplica realmente cada plataforma: la mayoría de las redes sociales incluye los espacios, mientras que algunos sistemas antiguos no. El recuento de palabras se apoya en los separadores, de modo que la escritura CJK (chino, japonés, coreano) sin espacios se trata con reglas que reconocen el sistema de escritura y no con una simple división por espacios. Las oraciones se cuentan por la puntuación final, así que las abreviaturas o los puntos suspensivos pueden alterar el total. El tamaño en bytes, por último, depende por completo de la codificación: un carácter acentuado o CJK ocupa una unidad de código pero varios bytes en UTF-8, y eso es justo lo que revela el panel de codificación.