Как считается

  • Сначала удаляется выбранный класс символов или фрагментов, затем применяется отдельное правило пробелов.
  • Обработка выполняется локально над Unicode-строкой; исходный текст не изменяется.
  • Режим HTML удаляет фрагменты, похожие на теги, но не разбирает документ как браузер.

Границы расчёта

Регулярные правила для тегов и скобок не понимают вложенную или повреждённую разметку. Для очистки недоверенного HTML перед публикацией используйте специализированный санитайзер.

Источники и методика

  1. Стандарт Unicode Unicode Consortium · проверено 15 июля 2026 г.
  2. Unicode Text Segmentation Unicode Consortium · проверено 15 июля 2026 г.