Недавно были опубликованы результаты отбора статей на одну из ведущих международных конференций в области искусственного интеллекта и машинного обучения — Конференцию по системам обработки нейронной информации (Conference on Neural Information Processing Systems, NeurIPS). Исследовательская группа под руководством преподавателя Университета МГУ-ППИ в Шэньчжэне и Совместного центра прикладной математики МГУ, ППИ и Университета МГУ-ППИ в Шэньчжэне Ли Чунь добилась значимых успехов: две научные статьи были приняты к публикации.
По данным оргкомитета, в этом году конференция получила 21 575 заявок, из которых было принято к публикации 5 290 статей (24,52%). Как конференция категории А по классификации Китайской ассоциации информатики и вычислительной техники (CCF), NeurIPS входит в тройку крупнейших мировых конференций в области искусственного интеллекта и машинного обучения (NeurIPS, ICML, ICLR) и обладает исключительным международным авторитетом. NeurIPS традиционно характеризуется строгими критериями отбора и высоким требованием к научной новизне как в теоретической, так и в прикладной областях. Принятие двух статей одновременно свидетельствует о высоком научном потенциале Университета МГУ-ППИ в Шэньчжэне и его передовых позициях в междисциплинарных исследованиях по искусственному интеллекту.
Статьи выполнены под научным руководством преподавателя Университета МГУ-ППИ в Шэньчжэне Ли Чунь, который выступает в качестве автора-корреспондента. Первые авторы работ — студенты Цю Сихан и Чжан Ваньпэн (в рамках выпускной квалификационной работы). Исследования посвящены современным направлениям, таким как распознавание эмоций в условиях неполных модальностей и высокоразмерные генеративные модели. Тематика охватывает ряд актуальных областей, включая федеративное обучение и AIGC-генерацию изображений.
Статья “Federated Dialogue-Semantic Diffusion for Emotion Recognition under Incomplete Modalities” (Распознавание эмоций при отсутствии части модальностей: федеративная диалогово-семантическая диффузионная модель) подготовлена авторами Цю Сиханом, Чэн Цзяжуном, Фан Юйхао, Чжан Ваньпэном, Лу Яо, Чжан Е и Ли Чунь.
В мультимодальном распознавании эмоций в диалогах (MERC) эмоциональное понимание усиливается за счет объединения сигналов различных модальностей. Однако в реальных условиях непредсказуемые пропуски модальностей существенно снижают эффективность существующих методов. Традиционные подходы к восстановлению модальностей зависят от полного набора мультимодальных данных и при экстремальных распределениях (например, при постоянном отсутствии определенной модальности) часто приводят к семантическим искажениям. Чтобы преодолеть эти ограничения, был предложен федеративный диалогово-ориентированный и семантически согласованный диффузионный фреймворк FedDISC, впервые интегрирующий федеративное обучение в задачу восстановления модальностей. FedDISC агрегирует модально-специфические диффузионные модели, обученные на разных клиентах, и распределяет их клиентам, у которых соответствующая модальность отсутствует, тем самым устраняя зависимость каждого клиента от полноты собственных данных. Кроме того, модуль DISC-диффузии использует диалоговый граф для моделирования зависимостей внутри диалога и применяет семантическую условную сеть для усиления семантического выравнивания, обеспечивая согласованность восстановленной модальности с имеющимися данными на уровне контекста, идентичности говорящего и смысла. Исследовательская группа университета также предложила стратегию чередующегося замораживания и агрегирования, при которой модули восстановления и классификации поочередно фиксируются, что способствует их совместной оптимизации. Масштабные эксперименты на датасетах IEMOCAP, CMU-MOSI и CMU-MOSEI демонстрируют, что FedDISC обеспечивает превосходную точность классификации эмоций при различных схемах отсутствующих модальностей и значительно превосходит существующие методы.


Рис. 1. Схема архитектуры DGN и SCN
DGN с помощью графовой сети моделирует контекстные и говорящие зависимости, тогда как SCN с помощью механизма внимания извлекает межмодальную семантическую информацию.

Рис. 2. Визуализация t-SNE демонстрирует сравнение эффективности восстановления модальностей различными методами при доступности только одной модальности
По сравнению с другими методами, признаки, генерируемые FedDISC, обладают большей распределительной схожестью с исходными модальными признаками, что подтверждает эффективность предлагаемого подхода.

Табл. 1. Результаты сравнения на наборах данных CMU-MOSI и CMU-MOSEI при различных уровнях пропусков модальностей
Статья “Proper Hölder-Kullback Dirichlet Diffusion: A Framework for High Dimensional Generative Modeling” («Proper Hölder–Kullback Dirichlet-диффузия: фреймворк для высокоразмерного генеративного моделирования») подготовлена авторами: Чжан Ваньпэном, Фан Юхао, Цю Сиханом, Чэн Цзяжуном, Хун Цзялуном, Чжай Бином, Чжоу Цином, Лу Яо, Чжан Е и Ли Чунь.
Основанные на диффузии генеративные модели традиционно опираются на гауссовские априорные распределения, и лишь ограниченное число исследований рассматривает альтернативные варианты. В данной работе предлагается фреймворк Proper Hölder–Kullback Dirichlet, в котором прямой и обратный диффузионные процессы формулируются посредством времязависимого мультипликативного преобразования. В отличие от классических методов, основанных на перерассчитанных нижних оценках правдоподобия (reweighted ELBO) или верхних границах дивергенции Кульбака–Лейблера (KLUB), авторы вводят два новых показателя расходимости: Proper Hölder Divergence (PHD) и Proper Hölder–Kullback (PHK) Divergence, причем последний направлен на восстановление недостающей симметрии в существующих формулировках. При оптимизации диффузионной модели с использованием PHK авторам удалось достичь значения Fréchet Inception Distance (FID) = 2.78 на безусловном наборе данных CIFAR-10. Комплексные эксперименты на ряде наборов изображений подтверждают преимущества предлагаемого генеративного подхода и демонстрируют эффективность PHK в процессе обучения. Эта работа расширяет семейство диффузионных моделей за счет применения негауссовских процессов и эффективных оптимизационных инструментов, открывая новые возможности для создания разнообразных и высококачественных генеративных моделей.


Рис. 3. Сравнение образцов, сгенерированных бета-диффузионной моделью и моделью Dirichlet-диффузии, обученными на безусловном наборе изображений CIFAR-10
Ссылки на статьи:
https://neurips.cc/virtual/2025/poster/116219
https://neurips.cc/virtual/2025/poster/118993