Разработчики: | |
Дата последнего релиза: | декабрь 2017 г |
Отрасли: | Интернет-сервисы |
Технологии: | Речевые технологии |
2017: Разработка алгоритма Tacotron 2
В конце декабря 2017 года компания Google анонсировала систему синтеза речи, которая способна преобразовывать текст в речь, максимально приближенную к человеческой. Алгоритм получил название Tacotron 2.
Система способна читать любые предложения, игнорировать грамматические ошибки и менять тональность речи. Алгоритм говорит пока только на английском
Отмечается, что Tacotron 2 использует контекст, чтобы произносить абсолютно одинаковые слова. Он также реагирует на пунктуационные правила в тексте, а также может подчеркивать конкретные слова. Технология способна различить разные формы глагола или определить, выполняет ли слово роль глагола или существительного.
Google давно занимается технологиями синтеза речи при помощи искусственного интеллекта. В 2016 году компания представила синтезатор, звучащий близко к человеческой речи. Он использует ИИ-систему WaveNet, которая обучается соответствию текста определенным формам колебаний волны и затем на основании этой базы знаний формирует из текстовых отрывков отдельные звуковые волны.
Tacotron 2 подключили к нейросети WaveNet, которая создает необходимые звуки на основе данных из другой системы глубинного обучения, которая преобразовывает текст в спектрограмму (изображает аудиочастоты в зависимости от времени).
В Google отмечают, что в целом Tacotron 2 работает отлично, но все-таки испытывает сложности с произношением некоторых сложных слов, а также иногда случайным образом выдает странные шумы. Кроме того, система не способна работать в реальном времени, и авторам пока не удается взять движок под контроль, то есть задать ему нужную интонацию, например, счастливый или грустный голос.
Как полагают разработчики Tacotron 2, алгоритм может быть использован для улучшения работы голосовых помощников, которые получают все более широкое распространение.[1]
Примечания
Подрядчики-лидеры по количеству проектов
Группа компаний ЦРТ (Центр речевых технологий) (44)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (29)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (27)
SteadyControl (18)
Naumen (Наумен консалтинг) (15)
Другие (191)
Группа компаний ЦРТ (Центр речевых технологий) (5)
SteadyControl (4)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (4)
Naumen (Наумен консалтинг) (2)
Neuro.net (Нейро) (2)
Другие (17)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (12)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (7)
Voice Systems Robotics (VSR, VS Robotics) (3)
Naumen (Наумен консалтинг) (3)
SteadyControl (2)
Другие (14)
Распределение вендоров по количеству проектов внедрений (систем, проектов) с учётом партнёров
Группа компаний ЦРТ (Центр речевых технологий) (17, 46)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (3, 30)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (12, 29)
SteadyControl (1, 23)
SteadyControl HoReCa (1, 23)
Другие (353, 210)
Группа компаний ЦРТ (Центр речевых технологий) (2, 5)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (1, 5)
SteadyControl (1, 4)
SteadyControl HoReCa (1, 4)
SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
Другие (9, 13)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (2, 12)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
SteadyControl HoReCa (1, 3)
Voice Systems Robotics (VSR, VS Robotics) (1, 3)
Naumen (Наумен консалтинг) (1, 3)
Другие (12, 16)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (1, 9)
Группа компаний ЦРТ (Центр речевых технологий) (4, 7)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
SteadyControl (1, 7)
SteadyControl HoReCa (1, 7)
Другие (17, 29)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
SteadyControl (1, 5)
SteadyControl HoReCa (1, 5)
Ростелеком (2, 4)
СалютДевайсы (ранее SberDevices) (2, 4)
Другие (20, 33)
Распределение базовых систем по количеству проектов, включая партнерские решения (проекты, партнерские проекты)
МТС Exolve Голосовой робот - 29 (5, 24)
SteadyControl Система контроля и управления персоналом - 23 (23, 0)
BSS Digital2Speech - 21 (21, 0)
Voice2Med Система распознавания речи в медицине - 14 (14, 0)
Naumen Erudite - 13 (13, 0)
Другие 146
BSS Digital2Speech - 5 (5, 0)
SteadyControl Система контроля и управления персоналом - 4 (4, 0)
Voice2Med Система распознавания речи в медицине - 4 (4, 0)
МТС Exolve Голосовой робот - 2 (0, 2)
3i TouchPoint Analytics - 2 (2, 0)
Другие 8
МТС Exolve Голосовой робот - 12 (1, 11)
BSS Digital2Speech - 6 (6, 0)
Naumen Erudite - 3 (3, 0)
VS Robotics: VS Робот-оператор - 3 (3, 0)
SteadyControl Система контроля и управления персоналом - 3 (3, 0)
Другие -1
МТС Exolve Голосовой робот - 9 (0, 9)
SteadyControl Система контроля и управления персоналом - 7 (7, 0)
BSS Digital2Speech - 6 (6, 0)
EXpress Защищенный корпоративный мессенджер - 6 (6, 0)
SmartLogger II - 4 (4, 0)
Другие 13
SteadyControl Система контроля и управления персоналом - 5 (5, 0)
BSS Digital2Speech - 4 (4, 0)
YandexGPT (YaLM 2.0) - 3 (3, 0)
EXpress Защищенный корпоративный мессенджер - 3 (3, 0)
BSS: Виртуальный голосовой ассистент - 3 (3, 0)
Другие 23