Перейти к содержимому
myconvert.ru

Перекодировать текст из windows-1251 в UTF-8

Файлы не покидают устройство

Принимаем TXT, CSV — до 50 файлов за раз.

Файлы не загружаются на сервер

Windows-1251 в UTF-8 онлайн — исправить кракозябры

Кракозябры вместо русского текста — классическая проблема выгрузок из старых учётных систем, экспортов из 1С и файлов, пришедших от партнёров. Причина в том, что формат .txt и .csv не хранит информацию о кодировке: программа читает байты и угадывает, как их толковать.

Перекодирование исправляет это раз и навсегда: файл переписывается в UTF-8, который понимают все современные программы.

Как это работает

Инструмент проверяет, корректен ли файл как UTF-8, и если нет — перебирает однобайтовые кириллические кодировки, оценивая каждый вариант статистически. Правильное прочтение даёт много кириллицы, естественное соотношение гласных и отсутствие странных символов; неправильное — набор диакритики и псевдографики.

Определённая кодировка указывается в карточке файла, так что результат всегда можно проверить. Обработка идёт в браузере: выгрузки с данными не передаются на сервер.

Как пользоваться

  1. 1Добавьте файлы TXT или CSV с нечитаемым текстом.
  2. 2Оставьте автоопределение кодировки или выберите её вручную, если знаете точно.
  3. 3Нажмите «Перекодировать».
  4. 4Скачайте результат — в карточке файла будет указано, какая кодировка была определена.
Четыре шага работы с TXT: добавить файлы, проверить настройки, запустить обработку, скачать результат

Частые вопросы

Почему вообще появляются кракозябры?
Потому что в текстовом файле не записано, в какой кодировке он сохранён. Программа вынуждена угадывать, и если файл сделан в windows-1251, а редактор по умолчанию ждёт UTF-8, каждый русский символ превращается в пару непонятных знаков. Сам файл при этом не испорчен — неверно только его прочтение.
Как работает автоопределение?
Сначала проверяется, является ли файл корректным UTF-8: случайно совпасть с этой кодировкой почти невозможно. Если нет, текст расшифровывается в windows-1251, CP866, KOI8-R и ISO-8859-5, и каждый вариант оценивается по доле кириллицы, соотношению гласных и количеству символов, которых в осмысленном тексте не бывает. Побеждает вариант с лучшей оценкой.
Определение ошиблось. Что делать?
Выберите кодировку вручную в настройках. Обычно ошибки случаются на очень коротких файлах или на текстах, где кириллицы почти нет, — там статистике просто не на чем работать.
Какие кодировки поддерживаются?
Windows-1251 (она же ANSI — самая частая в русских документах), CP866 (кодировка DOS, встречается в выгрузках из старых учётных систем), KOI8-R (наследие UNIX) и ISO-8859-5. Результат всегда записывается в UTF-8.
Файл уже в UTF-8 — зачем его обрабатывать?
Иногда затем, чтобы добавить метку BOM: без неё Excel открывает CSV в системной кодировке и снова показывает кракозябры. Инструмент распознает такой случай и напишет, что исходник уже был в UTF-8.

Статьи по теме