Как определить кодировку текста
Определение кодировки текста
Инструмент читает байты текста или файла и подбирает наиболее вероятную кодировку: сначала проверяет BOM-метку и признаки UTF-16, затем оценивает, похож ли поток на корректный UTF-8, и только потом разбирает однобайтовые кириллические варианты.
Так можно понять, в какой кодировке сохранен документ, еще до того как открыть его в редакторе и получить нечитаемый текст.
Когда определение особенно полезно
- перед импортом CSV или дампа базы, когда источник неизвестен
- при разборе старых файлов без пометки о кодировке
- когда один и тот же текст в разных программах выглядит по-разному
Про точность
Windows-1251 и KOI8-R устроены похоже, поэтому на коротком фрагменте детектор дает предположение, а не гарантию. Чем больше текста, тем увереннее результат, а для файлов надежнее загружать их целиком.
Как определить кодировку текста
-
Вставьте текст или загрузите файл
Впишите фрагмент в поле или нажмите "Загрузить файл" - анализ запускается сразу.
-
Посмотрите определенную кодировку
В карточках появятся название кодировки, уровень уверенности и размер в байтах.
-
Сверьтесь с HEX-превью
Панель байтов помогает вручную отличить UTF-8 от однобайтовой Windows-1251 или KOI8-R.
-
Решите, что делать дальше
С известной кодировкой откройте подходящий конвертер, например приведение к UTF-8.
Вопросы и ответы
Не всегда: похожие однобайтовые кодировки различить трудно. Детектор показывает предполагаемую кодировку и уровень уверенности, и на длинном тексте ошибается реже
UTF-8 и UTF-8 с BOM, признаки UTF-16, ASCII, а из однобайтовых - Windows-1251 и KOI8-R
И так, и так. Строку вставляют в поле, файл загружают целиком - по файлу точнее, потому что анализируются реальные байты, а не уже раскодированный браузером текст
Оно показывает, как символы хранятся в байтах: видно BOM-метку и диапазоны, по которым UTF-8 отличается от Windows-1251 и KOI8-R