Следите за новинками
в нашем Telegram канале. Жми, чтобы подписаться:)
⊗rsPmStUt 112 of 373 menu
◀ ▶

Кодировка текста в Rust

Текст в памяти хранят как последовательность байт. В Rust для литералов в двойных кавычках используют кодировку UTF-8: обычная латинская буква часто занимает один байт, а буква вне латиницы может занять два или больше, хотя на экране это один символ.

Из этого следует различие для длины. Число байт в записи и число символов на экране не всегда совпадают. Отдельные команды считают байты и символы по разным правилам, это разберем в уроках про длину.

Пока достаточно помнить: литерал в кавычках хранит текст как байты UTF-8, а на экране мы видим символы, которые из этих байт собирает программа при выводе.

Скажите своими словами, почему одна буква может занимать больше одного байта.

Дана строка:

let word = "go";

Скажите, сколько байт занимает word в UTF-8.

Сравните: что считает команда длины в байтах и что считает перебор символов текста.

← →
↑
Мы используем cookie для работы сайта, аналитики и персонализации. Обработка данных происходит согласно Политике конфиденциальности.
принять все настроить отклонить