了解文字統計與字元數
這個計數器測量什麼
Text Counter 會把一段文字拆解成所有和長度有關的指標。你一邊輸入或貼上,它就一邊計算含空格與不含空格的字元數,接著統計單字、句子、段落與行數。除了這些常見數字,它還會估算閱讀時間與朗讀時間,並顯示多數工具略過的底層細節:Unicode 字素叢集、碼位、編碼單元,以及文字在 UTF-8、UTF-16 和數種舊有編碼下的位元組大小。
另一個組成面板會依類型分類字元——韓文、表情符號、ASCII 以及其他 Unicode——讓你一眼看出文字實際由什麼構成。
這些數字何時重要
字元上限左右了我們書寫的許多內容。一則推文停在 280 個字元,meta description 在搜尋結果中超過約 160 個字元就會被截斷,簡訊一旦超過 160 個字元便會拆成多段。作文欄位或申請表單也常設下嚴格的字數或字元上限。編輯時看著計數往上跑,遠比貼進表單後才被退回來得省事。
閱讀時間與朗讀時間的估算則處理問題的另一面:預估一篇文章或講稿會佔用聽眾多少時間,而不是它佔了多少空間。
具體範例
以字串 'Hello, world!' 為例,含空格是 13 個字元、不含空格是 12 個,2 個單字、1 個句子、1 行。接著貼上像 👨👩👧 這樣的表情符號:畫面上看起來是單一字元,以字素叢集計算也只算 1 個,但它內部其實由多個碼位結合而成,因此碼位數與位元組總量都比較高。同時看這兩個數字,就能明白為何一個『一個字元』的表情符號會吃掉嚴格位元組限制的一大部分。
注意事項與邊界情況
含空格與不含空格的字元數差距,在排版繁複的文字中會拉得更開,所以要確認各平台實際採用哪一種算法:多數社群網站會把空格算進去,部分老舊系統則不會。單字數仰賴分隔字元,因此沒有空格的 CJK(中文、日文、韓文)文句,是以能辨識書寫系統的規則來處理,而非單純以空格切分。句子數以句末標點為依據,所以縮寫或刪節號可能會讓總數浮動。最後,位元組大小完全取決於編碼:帶重音的字元或 CJK 字元只算一個編碼單元,在 UTF-8 中卻佔用多個位元組,而編碼面板正好把這一點呈現出來。