Unicode-символы: коды, HTML-сущности и байты UTF-8
Знак рубля ₽ — это U+20BD, ₽ и 3 байта E2 82 BD в UTF-8. Вставьте текст — получите таблицу кодов каждого символа, или введите код и получите сам символ.
Инструмент
Как узнать код символа Unicode и его HTML-сущность
Код символа — это его порядковый номер в таблице Unicode, записанный в шестнадцатеричной системе после «U+»: длинное тире — U+2014, знак рубля — U+20BD, буква «Ж» — U+0416. Инструмент показывает для каждого символа текста шестнадцатеричный и десятичный номер, HTML-сущность, байты UTF-8 и описание. В режиме «Код → символ» работает обратный перевод: подойдёт любая запись — U+2014, 0x2014, \u2014, —, —, — или просто 8212.
U+20BD → десятичный номер: 2·16³ + 0·16² + 11·16 + 13 = 8381
→ HTML: ₽ (десятичная), ₽ (шестнадцатеричная)
→ JavaScript / JSON: \u20BD, CSS: \20BD
→ UTF-8 (3 байта, диапазон U+0800–U+FFFF): 1110xxxx 10xxxxxx 10xxxxxx
Пример расчёта вручную для ₽. Код 20BD в двоичном виде — 0010 0000 1011 1101. Для трёхбайтовой записи UTF-8 биты раскладываются по шаблону: первые четыре (0010) идут в байт 1110 0010 = E2, следующие шесть (000010) — в 10 000010 = 82, последние шесть (111101) — в 10 111101 = BD. Получаем E2 82 BD — ровно то, что покажет таблица.
Справочник частых символов: тире, кавычки, валюты, стрелки
| Символ | Код | HTML | Как набрать в Windows |
|---|---|---|---|
| — длинное тире | U+2014 | — — | Alt+0151 |
| – короткое тире | U+2013 | – – | Alt+0150 |
| − минус | U+2212 | − − | 2212 Alt+X в Word |
| « » кавычки-ёлочки | U+00AB U+00BB | « » | Alt+0171, Alt+0187 |
| „ “ кавычки-лапки | U+201E U+201C | „ “ | Alt+0132, Alt+0147 |
| ₽ рубль | U+20BD | ₽ | правый Alt+8 (Windows 10+) |
| ₸ тенге | U+20B8 | ₸ | 20B8 Alt+X в Word |
| ₴ гривна | U+20B4 | ₴ | 20B4 Alt+X в Word |
| Br белорусский рубль | U+0042 U+0072 | Br | две латинские буквы |
| € евро | U+20AC | € € | Alt+0136 (русская Windows) |
| № номер | U+2116 | № № | клавиша в русской раскладке |
| неразрывный пробел | U+00A0 |   | Alt+0160 |
| ° градус | U+00B0 | ° ° | Alt+0176 |
| ≈ ≠ ≤ ≥ | U+2248 U+2260 U+2264 U+2265 | ≈ ≠ ≤ ≥ | код Alt+X |
| → ← ↑ ↓ | U+2192 U+2190 U+2191 U+2193 | → ← ↑ ↓ | код Alt+X |
| ударение (а́) | U+0301 | ́ | 0301 Alt+X после гласной |
| … многоточие | U+2026 | … … | Alt+0133 |
Alt-коды зависят от кодовой страницы Windows: в русской (CP1251) евро — Alt+0136, в западноевропейской (CP1252) — Alt+0128; комбинация «код + Alt+X» работает одинаково везде.
Что такое Unicode, UTF-8 и кодовая точка
Unicode — единая таблица, в которой у каждого знака любой письменности есть свой номер; в версии 17.0 (сентябрь 2025 года) их 159 801. Номер называют кодовой точкой, а способ записать её байтами — кодировкой. UTF-8 — переменной длины: от 1 байта для ASCII до 4 для эмодзи, поэтому русский текст в UTF-8 вдвое тяжелее английского той же длины. UTF-16 хранит символы по 2 байта, а всё, что выше U+FFFF, — парами (суррогатными парами), отсюда length равный 2 у одного эмодзи в JavaScript.
HTML-сущность — запись символа именем или номером между «&» и «;». Числовые сущности работают для любого кода, именованные — только для тех, что есть в спецификации: HTML 4 знал 252 имени, HTML5 — 2 231, включая № и ✓. Для валют СНГ имён нет: ₽ добавили в Unicode 7.0 (2014 год) после утверждения знака Банком России, ₸ — в версии 5.2 (2009), ₴ — в 4.1 (2005).
Где пригодится: типографика, разработка, документы
Редактору таблица помогает отличить дефис «-» от короткого тире «–» и длинного «—», а кавычки-«ёлочки» от программистских “лапок”: по правилам русской типографики в тексте ставят «ёлочки», а внутри них — „лапки“. Разработчику она показывает, откуда в строке взялся «невидимый» пробел нулевой ширины (U+200B) или BOM (U+FEFF), ломающие сравнение строк и JSON.
Ещё один случай — омоглифы: латинская «c» (U+0063) и кириллическая «с» (U+0441) выглядят одинаково, но поиск их не находит, а пароль с подменённой буквой не принимается. Колонка «Описание» показывает письменность каждой буквы, и подмена находится сразу.
Пример расчёта
- Исходные данные: Режим — Текст → коды символов; Текст — Цена — 1 500 ₽ (≈ 8 000 ₸).
- Результат: Кодовых точек в тексте — 26 символов (Байт в UTF-8 — 38; Единиц UTF-16 (length в JavaScript) — 26; Уникальных символов — 15; Символов вне ASCII — 8).
Вопросы и ответы
Как узнать код символа Unicode?
Вставьте символ или слово в поле «Текст»: в таблице появится код вида U+2014, десятичный номер 8212, сущность — и байты UTF-8. Код — это номер символа в таблице Unicode, записанный в шестнадцатеричной системе после «U+».
Чем отличаются ₽, ₽ и —?
Это три способа записать символ в HTML. ₽ — десятичный номер, ₽ — тот же номер в шестнадцатеричной записи, — — именованная сущность. Имена есть не у всех символов: у тире и евро — есть, у рубля и тенге — нет, для них подходит только числовая запись.
Почему «😀».length в JavaScript равен 2?
Строки JavaScript хранятся в UTF-16, а эмодзи U+1F600 лежит вне базовой плоскости и занимает две 16-битные единицы: D83D и DE00 (суррогатная пара). Инструмент показывает и число кодовых точек, и число единиц UTF-16 — именно его вернёт length.
Как ввести символ по коду с клавиатуры?
В Word, Outlook и WordPad наберите шестнадцатеричный код и нажмите Alt+X: 20BD Alt+X даст ₽. В русской Windows работают Alt-коды на цифровой клавиатуре: Alt+0151 — длинное тире, Alt+0171 и Alt+0187 — «ёлочки». В macOS — раскладка Unicode Hex Input и код с зажатой Option, в Linux — Ctrl+Shift+U.
Как поставить знак рубля ₽ и знак тенге ₸?
₽ (U+20BD) в Windows 10 и 11 набирается правым Alt+8 в русской раскладке, в Word — 20BD Alt+X. ₸ (U+20B8) и ₴ (U+20B4) отдельной клавиши в обычных раскладках не имеют: скопируйте символ из таблицы ниже или введите код в режиме «Код → символ». У белорусского рубля знака нет — пишут Br.
Сколько байт занимает символ в UTF-8?
От 1 до 4. Латиница, цифры и знаки ASCII — 1 байт, кириллица и большинство европейских букв — 2 байта, ₽, ₸, ₴, тире и стрелки — 3 байта, эмодзи — 4. Слово «Привет» в UTF-8 весит 12 байт, а СМС в кодировке UCS-2 вмещает 70 кириллических символов вместо 160 латинских.
Источники и методика
Обновлено: