WikiSort.ru - Не сортированное

ПОИСК ПО САЙТУ | о проекте

UTF-8 (от англ. Unicode Transformation Format, 8-bit — «формат преобразования Юникода, 8-бит») — распространённый стандарт кодирования текста, позволяющий более компактно хранить и передавать символы Юникода, используя переменное количество байт (от 1 до 4), и обеспечивающий полную обратную совместимость с 7-битной кодировкой ASCII. Стандарт UTF-8 официально закреплён в документах RFC 3629 и ISO/IEC 10646 Annex D. Кодировка UTF-8 сейчас является доминирующей в веб-пространстве. Она также нашла широкое применение в UNIX-подобных операционных системах^[1]. Формат UTF-8 был разработан 2 сентября 1992 года Кеном Томпсоном и Робом Пайком, и реализован в Plan 9^[2]. Идентификатор кодировки в Windows – 65001^[3].

Сравнивая UTF-8 и UTF-16, можно отметить, что наибольший выигрыш в компактности UTF-8 даёт для текстов на латинице, поскольку латинские буквы без диакритических знаков, цифры и наиболее распространённые знаки препинания кодируются в UTF-8 лишь одним байтом, и коды этих символов соответствуют их кодам в ASCII.^[4]^[5]

Алгоритм кодирования

Алгоритм кодирования в UTF-8 стандартизирован в RFC 3629 и состоит из 3 этапов:

1. Определить количество октетов (байтов), требуемых для кодирования символа. Номер символа берётся из стандарта Юникод.

Диапазон номеров символов	Требуемое количество октетов
`00000000-0000007F`	1
`00000080-000007FF`	2
`00000800-0000FFFF`	3
`00010000-0010FFFF`	4

Для символов Юникода с номерами от U+0000 до U+007F (занимающими один байт c нулём в старшем бите) кодировка UTF-8 полностью соответствует 7-битной кодировке US-ASCII.

2. Установить старшие биты первого октета в соответствии с необходимым количеством октетов, определённом на первом этапе:

0xxxxxxx — если для кодирования потребуется один октет;
110xxxxx — если для кодирования потребуется два октета;
1110xxxx — если для кодирования потребуется три октета;
11110xxx — если для кодирования потребуется четыре октета.

Если для кодирования требуется больше одного октета, то в октетах 2-4 два старших бита всегда устанавливаются равными 10₂ (10xxxxxx). Это позволяет легко отличать первый октет в потоке, потому что его старшие биты никогда не равны 10₂.

Количество октетов	Значащих бит	Шаблон
1	7	`0xxxxxxx`
2	11	`110xxxxx 10xxxxxx`
3	16	`1110xxxx 10xxxxxx 10xxxxxx`
4	21	`11110xxx 10xxxxxx 10xxxxxx 10xxxxxx`

3. Установить значащие биты октетов в соответствии с номером символа Юникода, выраженном в двоичном виде. Начать заполнение с младших битов номера символа, поставив их в младшие биты последнего октета, продолжить справа налево до первого октета. Свободные биты первого октета, оставшиеся незадействованными, заполнить нулями.

Примеры кодирования

Символ		Двоичный код символа	UTF-8 в двоичном виде	UTF-8 в шестнадцатеричном виде
$	`U+0024`	`100100`	`00100100`	`24`
¢	`U+00A2`	`10100010`	`11000010 10100010`	`C2 A2`
€	`U+20AC`	`100000 10101100`	`11100010 10000010 10101100`	`E2 82 AC`
𐍈	`U+10348`	`1 00000011 01001000`	`11110000 10010000 10001101 10001000`	`F0 90 8D 88`

Маркер UTF-8

Для указания, что файл или поток содержит символы Юникода, в начале файла или потока может быть вставлен маркер последовательности байтов (англ. Byte order mark, BOM), который в случае кодирования в UTF-8 принимает форму трёх байтов: EF BB BF₁₆.

	1-й байт	2-й байт	3-й байт
Двоичный код	`1110 1111`	`1011 1011`	`1011 1111`
Шестнадцатеричный код	`EF`	`BB`	`BF`

Пятый и шестой байты

Изначально кодировка UTF-8 допускала использование до шести байтов для кодирования одного символа, однако в ноябре 2003 года стандарт RFC 3629 запретил использование пятого и шестого байтов, а диапазон кодируемых символов был ограничен символом U+10FFFF. Это было сделано для обеспечения совместимости с UTF-16.

Примечания

↑ Usage Statistics of Character Encodings for Websites, June 2011 (англ.)
↑ http://www.cl.cam.ac.uk/~mgk25/ucs/utf-8-history.txt (англ.)
↑ Code Page Identifiers - Windows applications | Microsoft Docs
↑ Well, I'm Back. String Theory (англ.). Robert O'Callahan (1 March 2008). Проверено 1 марта 2008. Архивировано 23 августа 2011 года.
↑ Ростислав Чебыкин. Всем кодировкам кодировка. UTF‑8: современно, грамотно, удобно. (неопр.). HTML и CSS. Проверено 22 марта 2009. Архивировано 23 августа 2011 года.

Ссылки

Кодировки символов
Основы		алфавит • текст (файл • данные) • набор символов • конверсия
Исторические кодировки	Докомп.:	семафорная (Макарова) • Морзе • Бодо • МТК-2
Исторические кодировки	Комп.:	6-битная • УПП • RADIX-50 • EBCDIC (ДКОИ-8) • КОИ-7 • ISO 646
современное 8-битное представление	символы	ASCII (управляющие • печатные) • не-ASCII (псевдографика)
	8-битные код.стр.	Кириллица: КОИ-8 • Основная кодировка • MacCyrillic
	ISO 8859	1 (лат.) • 2 • 3 • 4 • 5 (кир.) • 6 • 7 • 8 • 9 • 10 • 11 • 12 • 13 • 14 • 15 (€) • 16
	Windows	1250 • 1251 (кир.) • 1252 • 1253 • 1254 • 1255 • 1256 • 1257 • 1258 • WGL4
	IBM & DOS	437 • 850 • 852 • 855 • 866 «альт.» • МИК
Многобайтные	Традиционные	DBCS (GB2312) • HTML
Многобайтные	Unicode	UTF-32 • UTF-16 • UTF-8 • список символов (кириллица)
Связанные темы		интерфейс пользователя • раскладка клавиатуры • локаль • перевод строки • шрифт • транслит • нестандартные шрифты
Утилиты		iconv • recode

Данная страница на сайте WikiSort.ru содержит текст со страницы сайта "Википедия".

Если Вы хотите её отредактировать, то можете сделать это на странице редактирования в Википедии.

Если сделанные Вами правки не будут кем-нибудь удалены, то через несколько дней они появятся на сайте WikiSort.ru .

Текст в блоке "Читать" взят с сайта "Википедия" и доступен по лицензии Creative Commons Attribution-ShareAlike; в отдельных случаях могут действовать дополнительные условия.

Другой контент может иметь иную лицензию. Перед использованием материалов сайта WikiSort.ru внимательно изучите правила лицензирования конкретных элементов наполнения сайта.

2019-2026
WikiSort.ru - проект по пересортировке и дополнению контента Википедии

[1] Usage Statistics of Character Encodings for Websites, June 2011 (англ.)

[2] ttp://www.cl.cam.ac.uk/~mgk25/ucs/utf-8-history.txt (англ.)

[3] Code Page Identifiers - Windows applications | Microsoft Docs

[stringtheory-4] Well, I'm Back. String Theory (англ.). Robert O'Callahan (1 March 2008). Проверено 1 марта 2008. Архивировано 23 августа 2011 года.

[vsem-5] Ростислав Чебыкин. Всем кодировкам кодировка. UTF‑8: современно, грамотно, удобно. (неопр.). HTML и CSS. Проверено 22 марта 2009. Архивировано 23 августа 2011 года.

Форматы cериализационных цифровых данных
Текстовые	ASCII85 Base58 Base64 UTF-8 UTF-16 UTF-32 UUE yEnc
Интернет и телекоммуникации	MIME S/MIME multipart/form-data RSS GeoRSS Tag-length-value
Медиа	CD Video Flash Video MusicDNA Video CD Super Video CD
Другие	CBEFF RINEX QTI