Главная / Технологии

Меньше шума, больше смысла: опыт SESAME для Speech Enhancement

Технологии02.09.2026· 1 мин чтения
Меньше шума, больше смысла: опыт SESAME для Speech Enhancement
Реклама

Привет, Хабр! Мы — Александр Забурдаев, Ксения Золина, Даниил Марценюк, Илья Трофименко, Илья Кулешов — студенты мастерской по сервисам и платформам ИИ в Инженерно-математической школе НИУ ВШЭ и VK. Хотим поделиться опытом, который мы накопили, пытаясь перестать кормить весь речевой сигнал одной и той же нейросети целиком, и дать разным экспертам разбираться с разными типами шума. 

Речь пойдёт о задаче улучшения качества речи (Speech Enhancement, SE) и о том, как получилось интегрировать в неё разреженную смесь экспертов (sparse Mixture of Experts, MoE). Это архитектура, которая в языковых моделях уже стала стандартом, а в обработке аудио до сих пор не прижилась.

Реклама

Модель мы назвали SESAME — Speech Enhancement with Sparse Adaptive Mixture of Experts. Она построена на базе MP-SENet. В ней стандартные полносвязные блоки внутри трансформера заменены на разреженный MoE-модуль. Код проекта доступен на GitHub.

Зачем вообще понадобилась очередная модель шумоподавления, когда их и так десятки — расскажем ниже. А заодно разберём, какие трюки из мира LLM в аудио работают, а какие нет (например, Expert Choice) — и почему.

Читать далее
Реклама
Реклама
Похожие материалы
Как создавался агрегатор ИБ-новостей: склейка сюжетов, семь признаков важности и порог по данным
Технологии
Как создавался агрегатор ИБ-новостей: склейка сюжетов, семь признаков важности и порог по данным

Идея агрегатора новостей по кибербезопасности зародилась еще давно. Хотелось получать самое важное и без инфошума. LLM тогда ещё не были повседневным инструментом, и первую версию реализовал на модели суммаризации rut5_base_sum_gazeta, а важность считал textrank. Работало так себе. Потом появились сервисы, которые сами подбирают новости под настроенную ленту. Но оптимального решения так и не увидел – это либо про всё сразу, либо что-то про одну узкую тему. Задача изначально выглядела простой. Моделей полно, готовых наработок должно было быть много. Но на практике уже первые недели ушли на тюнинг, и лучше при этом не становилось: поднял порог – канал молчит сутки, опустил – в ленту попали вебинары, квадранты и пресс-релизы продуктов. Из этого опыта родилось гибридное решение. Важность теперь считает формула из семи признаков, все логируется, а модель пишет тексты и отсекает нерелевантное.

02.09.2026 · 1 мин
Локальный путь в image_input съел четыре слота подряд
Технологии
Локальный путь в image_input съел четыре слота подряд

31 августа в 14:32 по Москве у нас вышла последняя штатная публикация. Дальше cron честно стартовал по расписанию, генератор успевал выбрать тему и написать текст, но в ленте ничего не появлялось. Так повторилось четыре раза: три запуска 1 сентября и утренний запуск 2 сентября.

02.09.2026 · 1 мин
Кооперативный хоррор Reanimal от создателей Little Nightmares удостоился престижной награды от принца Швеции
Технологии
Кооперативный хоррор Reanimal от создателей Little Nightmares удостоился престижной награды от принца Швеции

Пока игровой мир следил за выставкой Gamescom 2026 и расширенным показом GTA VI, разработчики кооперативного хоррор-приключения Reanimal были заняты получением престижной награды от принца Швеции. Источник изображения: THQ Nordic

02.09.2026 · 1 мин
Смартфоны получат аналог Nvidia DLSS: её принесёт следующий флагманский чип Qualcomm Snapdragon
Технологии
Смартфоны получат аналог Nvidia DLSS: её принесёт следующий флагманский чип Qualcomm Snapdragon

Qualcomm продолжает делиться деталями о будущем флагманском процессоре Snapdragon. Ранее компания сообщила, что новые ядра Oryon в составе чипа смогут работать на частоте до 5 ГГц и получат новую архитектуру кеша FlexCache. Сейчас компания рассказала о некоторых особенностях нового встроенного GPU Adreno в составе будущего чипа. Источник изображений: Qualcomm

02.09.2026 · 1 мин

Комментарии

Войдите, чтобы оставить комментарий.

Пока нет комментариев — станьте первым.

Реклама
Меньше шума, больше смысла: опыт SESAME для Speech Enhancement | ARCHIVE0 WIKI