Российские ИИ-модели в два раза точнее OpenAI и Nvidia в русскоязычных задачах

Отечественные системы распознавания речи продемонстрировали вдвое меньше ошибок при выполнении русскоязычных задач по сравнению с зарубежными аналогами от OpenAI и Nvidia. Об этом сообщили в MWS AI, входящей в МТС Web Services, перед форумом «Цифровые решения». Тестирование проводилось на более чем двенадцати тысячах размеченных аудиозаписей общей длительностью около тридцати восьми часов. Выборка включала записи как с четкой речью, так и с акустическим шумом и фоновой речью. В результате испытаний российские модели показали достаточную точность для использования в ключевых бизнес-сценариях в основных отраслях экономики. Сравнение проводилось по показателю WER, который отражает количество ошибок при распознавании слов относительно эталонной расшифровки. Средний WER у GigaAM от «Сбера» составил 7,4%, что более чем в два раза лучше, чем у Nvidia Parakeet (15,8%) и более чем в три раза лучше, чем у Nvidia Nemotron (25,5%). На записях с шумом разрыв оказался еще более заметным: у GigaAM WER достиг 18%, у Nvidia Parakeet — 33%, а у Whisper от OpenAI — 62%. Второе место по точности заняла другая российская разработка — Vosk от Alpha Cephei. Форум «Цифровые решения» проходит в Национальном центре «Россия» с 6 по 10 октября. Данную информацию сообщает портал Наша Газета Крым.