Разработчики: | ВКонтакте |
Дата премьеры системы: | 2022/09/22 |
Технологии: | Речевые технологии |
Основные статьи:
2022: Анонс технологии распознавания речи
Теперь разработчики смогут бесплатно использовать в своих инди-проектах технологию ВКонтакте, которая считывает голос и переводит его в текст. Об этом 22 сентября 2022 года рассказал технический директор ВКонтакте Александр Тоболь. Технология распознавания речи, или ASR, Automatic Speech Recognition, внедряется в несколько кликов. Нейросети хорошо справляются с аудио с посторонними шумами, большим количеством сленга и сокращений.
По информации компании, для распознавания можно выбрать одну из двух моделей. Нейтральная подойдёт для разборчивой речи, как в телешоу или интервью, а спонтанная поможет, когда нужно обработать более обыденную речь со сленгом и ненормативной лексикой. Нейросети ВКонтакте обрабатывают файлы за несколько секунд, умеют удалять из расшифровки шумы и паузы, понимают неразборчивую речь и даже отдельный звук «ъ».
Технологию можно попробовать через веб-интерфейс на специальной странице или интегрировать через публичный API ВКонтакте. На портале доступен широкий набор методов, с помощью которых можно создавать мини-приложения ВКонтакте или использовать в сторонних проектах. Решение подойдёт для стартапов, инди-проектов, личных pet-проектов для обучения и саморазвития. Версию с обработкой аудио до 100 минут в сутки можно применять для любых целей. А для безлимитного использования технологии можно отправить заявку на электронную почту.
Каждый месяц пользователи ВКонтакте отправляют более 2 млрд голосовых — это миллионы часов аудио, которые обрабатывают наши нейросети. Применение технологии ограничено только фантазией: можно сделать игру с голосовым управлением или с помощью чат-бота наконец добавить распознавание голосовых в какой-нибудь сторонний мессенджер. поведал Александр Тоболь, СТО ВКонтакте |
ASR используется ВКонтакте для расшифровки голосовых сообщений, генерации субтитров в видео, персональных рекомендаций и многого другого. Под капотом у решения сразу три нейросети: одна отвечает за распознавание речи, вторая находит подходящие слова, а третья расставляет знаки препинания. Технология построена таким образом, чтобы справляться с ежедневной обработкой сотен миллионов сообщений разной длительности, качества и наполнения. Каждое сообщение расшифровывается очень быстро — примерно за 1,5 секунды после отправки.
Подрядчики-лидеры по количеству проектов
Группа компаний ЦРТ (Центр речевых технологий) (45)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (29)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (27)
SteadyControl (18)
Naumen (Наумен консалтинг) (15)
Другие (196)
Группа компаний ЦРТ (Центр речевых технологий) (5)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (4)
SteadyControl (4)
Naumen (Наумен консалтинг) (2)
Neuro.net (Нейро) (2)
Другие (17)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (12)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (7)
Naumen (Наумен консалтинг) (3)
Voice Systems Robotics (VSR, VS Robotics) (3)
SteadyControl (2)
Другие (14)
Распределение вендоров по количеству проектов внедрений (систем, проектов) с учётом партнёров
Группа компаний ЦРТ (Центр речевых технологий) (18, 47)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (4, 30)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (12, 29)
SteadyControl (1, 23)
SteadyControl HoReCa (1, 23)
Другие (381, 217)
Группа компаний ЦРТ (Центр речевых технологий) (2, 5)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (1, 5)
SteadyControl (1, 4)
SteadyControl HoReCa (1, 4)
SberDevices (СалютДевайсы, ранее СберДевайсы) (2, 2)
Другие (9, 13)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (2, 12)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
Naumen (Наумен консалтинг) (1, 3)
SteadyControl (1, 3)
SteadyControl HoReCa (1, 3)
Другие (12, 16)
МТС Exolve (Межрегиональный ТранзитТелеком, МТТ) (1, 9)
Группа компаний ЦРТ (Центр речевых технологий) (4, 7)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
SteadyControl (1, 7)
SteadyControl HoReCa (1, 7)
Другие (18, 30)
Banks Soft Systems, BSS (Бэнкс Софт Системс, БСС) (2, 7)
Сбербанк (3, 5)
SteadyControl HoReCa (1, 5)
SteadyControl (1, 5)
СалютДевайсы (ранее SberDevices) (2, 4)
Другие (25, 39)
Распределение базовых систем по количеству проектов, включая партнерские решения (проекты, партнерские проекты)
МТС Exolve Голосовой робот - 29 (5, 24)
SteadyControl Система контроля и управления персоналом - 23 (23, 0)
BSS Digital2Speech - 21 (21, 0)
Voice2Med Система распознавания речи в медицине - 14 (14, 0)
Naumen Erudite - 13 (13, 0)
Другие 152
BSS Digital2Speech - 5 (5, 0)
SteadyControl Система контроля и управления персоналом - 4 (4, 0)
Voice2Med Система распознавания речи в медицине - 4 (4, 0)
МТС Exolve Голосовой робот - 2 (0, 2)
Neuro.net Голосовой робот - 2 (2, 0)
Другие 8
МТС Exolve Голосовой робот - 12 (1, 11)
BSS Digital2Speech - 6 (6, 0)
Naumen Erudite - 3 (3, 0)
VS Robotics: VS Робот-оператор - 3 (3, 0)
SteadyControl Система контроля и управления персоналом - 3 (3, 0)
Другие 0
МТС Exolve Голосовой робот - 9 (0, 9)
SteadyControl Система контроля и управления персоналом - 7 (7, 0)
EXpress Защищенный корпоративный мессенджер - 6 (6, 0)
BSS Digital2Speech - 6 (6, 0)
SmartLogger II - 4 (4, 0)
Другие 12
SteadyControl Система контроля и управления персоналом - 5 (5, 0)
BSS Digital2Speech - 4 (4, 0)
EXpress Защищенный корпоративный мессенджер - 4 (4, 0)
Сбер: GigaChat - 3 (3, 0)
Robovoice Пользовательская no-code платформа для разработки ИИ-ботов - 3 (3, 0)
Другие 28