Grapheme clusters count editing units, not bytes or scalar values
A user-perceived character may contain multiple code points: an accent sequence, flag pair, emoji modifier, or ZWJ composition. UTF-16 length is a different measurement again.
The segmenter applies Unicode grapheme break properties, Hangul rules, regional-indicator pairing, emoji ZWJ handling, and Indic conjunct handling from versioned data.