Функция strings.unicode_split
Функция strings.unicode_split разбивает
строковый тензор на отдельные Unicode символы.
Первым параметром функция принимает входной
тензор со строками. Вторым параметром передается
имя входного тензора. Третьим параметром можно
передать тип данных для результирующих элементов.
Синтаксис
tf.strings.unicode_split(input, input_encoding, [errors], [replacement_char], [name])
Пример
Давайте разобьем строку 'abcde' на отдельные символы:
import tensorflow as tf
t = tf.constant(['abcde'])
res = tf.strings.unicode_split(t, 'UTF-8')
print(res)
Результат выполнения кода:
tf.Tensor([['a' 'b' 'c' 'd' 'e']], shape=(1, 5), dtype=string)
Пример
Давайте разобьем строку 'model.keras' на отдельные символы:
import tensorflow as tf
t = tf.constant(['model.keras'])
res = tf.strings.unicode_split(t, 'UTF-8')
print(res)
Результат выполнения кода:
tf.Tensor([['m' 'o' 'd' 'e' 'l' '.' 'k' 'e' 'r' 'a' 's']], shape=(1, 11), dtype=string)
Пример
Давайте разобьем несколько строк на отдельные символы:
import tensorflow as tf
t = tf.constant(['abcde', 'model.keras'])
res = tf.strings.unicode_split(t, 'UTF-8')
print(res)
Результат выполнения кода:
tf.Tensor(
[['a' 'b' 'c' 'd' 'e']
['m' 'o' 'd' 'e' 'l' '.' 'k' 'e' 'r' 'a' 's']], shape=(2, 11), dtype=string)
Пример
Давайте разобьем строку с использованием кодировки 'UTF-16-BE':
import tensorflow as tf
t = tf.constant(['abcde'])
res = tf.strings.unicode_split(t, 'UTF-16-BE')
print(res)
Результат выполнения кода:
tf.Tensor([['a' 'b' 'c' 'd' 'e']], shape=(1, 5), dtype=string)
Смотрите также
-
функцию
split,
которая разбивает строки по разделителю -
функцию
unicode_decode,
которая декодирует строки в Unicode символы -
функцию
unicode_encode,
которая кодирует Unicode символы в строки -
функцию
bytes_split,
которая разбивает строки на байты