Portrait of Dr Minghui Dong

董明会 博士

深圳河套学院 国家海外高层次人才引进计划领军人才
研究方向:多模态语言大模型、社会世界模型

个人简介

董明会博士是国家海外高层次人才引进计划领军人才,现任深圳河套学院 语言模型与人机交互中心(LIMA) 副教授,于 2026 年 6 月加入该中心。他在语音与语言处理、多模态智能以及交互式人工智能系统领域拥有二十余年的研究与系统研发经验,工作横跨高校、国家级科研机构与产业界。

董明会博士本科毕业于中国科学技术大学,硕士毕业于北京大学,博士毕业于新加坡国立大学。2004 至 2024 年,他在新加坡科技研究局(A*STAR)资讯通信研究院(I²R)担任首席科学家兼语音生成与理解实验室主任,主持了语音合成、语音转换、多语言语音技术、多模态情感计算、对话系统以及医疗语音人工智能等多个研究项目。2024 至 2026 年,他在浙江理工大学龙港研究院担任首席科学家兼教授,致力于人工智能技术在制造业中的应用。

他的研究成果包括 120 余篇论文和多项国际专利,相关技术已应用于教育、医疗、国防、公共服务和智能制造等领域。他主持或联合主持了 20 多项政府与产业资助的科研项目,并推动语音与语言技术在亚洲多地落地为实际系统。

董明会博士在国际学术界发挥着重要的引领作用。他现任 COLIPS 副主席、ISCA SIG-CSLP 主席,以及《亚洲语言处理国际期刊》(IJALP)主编,并曾任 PREMIA 主席与 IAPR 理事。他曾担任 30 多个大型国际会议的主席或组织者,包括 ICASSP、SLT、IJCNLP-AACL、Interspeech、ISCSLP、IALP、CLSW 和 APSIPA 等。

他目前的研究兴趣集中于语音生成、语音理解、多模态交互、大模型与智能体、社会智能等方向,并延伸至 AI + 医疗、交通、金融、舆情、社会治理等跨学科领域,致力于打通基础研究与大规模落地之间的通路。他持续工作在人工智能理论、系统工程与产业转型的交叉点上,兼顾学术进步与现实影响。

工作经历

副教授 · 2026 年 6 月至今
深圳河套学院 语言模型与人机交互中心(LIMA)
首席科学家 兼 教授 · 2024 – 2026
浙江理工大学龙港研究院
首席科学家 兼 实验室主任 · 2004 – 2024
新加坡科技研究局(A*STAR)资讯通信研究院(I²R)
研究员 · 2001 – 2004
新加坡言丰科技公司(Infotalk Technology)
研究工程师 · 1995 – 1998
北京大学

学术任职

副主席 · 2013 至今
中文及东方语言信息处理学会(COLIPS)
主席 · 2022 – 2026
国际语音通信协会(ISCA)汉语口语处理组(SIG-CSLP)
理事 · 2016 至今
亚洲自然语言处理联盟(AFNLP)
理事 · 2018 – 2022
国际模式识别协会(IAPR)
主席 · 2018 – 2022
模式识别与机器智能学会(PREMIA)
指导委员会委员 · 2020 至今
汉语词汇语义学国际研讨会(CLSW)
主编 · 2011 至今
《亚洲语言处理国际期刊》(IJALP)

教育背景

计算机科学 博士
新加坡国立大学
1998 – 2001
计算机科学 硕士
北京大学
1992 – 1995
计算机科学 学士
中国科学技术大学
1987 – 1992

研究方向

语音生成 语音理解 多模态交互 大模型与智能体 社会智能

跨学科方向:AI + 医疗、交通、金融、舆情、社会治理等

科研项目

专利成果

两个前沿方向

让AI听懂人类,也理解社会。面向下一代人工智能,本方向的研究涵盖从语音感知、语言推理到智能体交互与社会涌现的完整链条——从理解个体的语音与语言,到理解大量个体相互作用所形成的社会,旨在使人工智能能够更自然地与人交流,并更可靠地参与真实世界的运行。

语音、图像、文本和环境声音汇入神经模型并生成实时语音的多模态语音大模型示意图
01 · VOICE × MULTIMODALITY

多模态语音大模型

使人工智能真正具备听、说、理解与推理的能力。

研究能够直接处理语音,并与文本、图像、视频及环境声音协同工作的基础模型,使系统不仅能够识别语音内容,还能理解说话者的情绪、意图、个性与健康状态,并结合交流场景以自然语音实时应答。

原生端到端语音模型全模态模型全双工交互语音推理情感与健康计算端侧智能

关键研究问题

  • 如何统一语音理解、语言推理与可控语音生成?
  • 如何实现边听、边想、边说,并支持打断与长期记忆?
  • 如何在端侧实现低延迟、隐私友好的持续交互?

前沿趋势

从级联系统走向原生端到端,从轮流问答走向全双工交互,从文字推理走向声音与全模态推理,从云端助手走向个性化、长期运行的端侧语音智能体。

应用价值

面向智能终端、车载系统、机器人、教育、医疗健康与普惠服务等场景,使自然语音成为连接人与智能系统的核心入口。

重大意义

推动人工智能从以文本处理为核心的工具,发展为能够感知人、理解人并与人持续协作的交互伙伴。

大量数字个体通过关系网络形成群体行为与城市社会演化的社会世界模型示意图
02 · AGENTS × SOCIETY

社会世界模型

让AI从理解个体走向理解社会。

在数字信息世界模型和物理世界模型之后,进一步建模个体、机构、关系、规则、事件与社会环境,构建具有属性、偏好、状态和长期记忆的数字个体,模拟其持续互动及由此产生的群体行为和社会演化。

大模型智能体多智能体系统智能体记忆与进化群体智能社会模拟持续校准

关键研究问题

  • 如何构建可信、可持续演化的大规模数字个体?
  • 微观互动如何形成传播、协作、竞争与群体涌现?
  • 如何用现实观测持续校准模拟并验证预测结果?

核心能力

连接个体行为与宏观现象,在可控制、可重复、可比较的数字社会中推演政策影响,发现长期、极端和群体性风险。

应用价值

服务交通、舆情、金融与政务等领域,构建面向政策评估与人工智能能力测评的仿真环境,支持决策比较、风险预警与动态评测。

重大意义

将部分高成本、长周期且难以回退的现实试错转化为数字推演,使人工智能理解社会规律、具备社会常识,并更安全可靠地参与社会发展。

河套学院的科研条件

深圳河套学院面向世界科技前沿和国家重大需求,汇聚人工智能领域的高水平师资、科研平台与合作网络,为多模态语音大模型和社会世界模型提供从基础研究到系统验证的完整条件。

PLATFORM

高水平科研平台

依托语言模型与人机交互等科研平台,开展大模型、智能体与人机交互的交叉研究。

COMPUTING

算力与工程条件

支持多模态模型训练、端侧智能实验和大规模多智能体模拟,贯通算法、系统与验证。

PROJECTS

重大项目与真实场景

面向医疗、交通、舆情、金融和政务等问题,在真实需求中研究有挑战、有价值的课题。

COLLABORATION

开放的合作机会

连接计算机、语言、医疗和社会科学,并与高校、科研机构及产业团队开展合作交流。

该平台既支持提出新的模型与算法,也支持将研究成果转化为大规模系统与实际应用。

会议组织

在 30 余个国际会议担任重要角色,部分如下:

旗舰级会议:APSIPA 2025 特别专题主席、SLT 2024 程序委员会主席、IJCNLP-AACL 2023 出版主席、ICASSP 2022 运营主席、INTERSPEECH 2014 TTS 领域主席、COLING 2010 宣传主席、ACL-IJCNLP 2009 组织主席

语音与语言处理核心会议:NCMMSC 2026 程序主席、ISCSLP 大会主席(2022)/程序主席(2014)、TAI 2023 会议主席、Oriental-COCOSDA 2021 组织主席、IWSDS 2021 组织主席、Blizzard Challenge 2014 本地组织主席

亚洲语言处理系列会议:IALP(2008—2026 多届主席/程序主席)、CLSW(2008、2009、2016、2023 四届主席/程序主席)、PACLIC 程序主席(2006、2011)、ICCPOL 2006 组织主席

跨学科会议:ICSR 2024 工业主席、CIS-RAM 2024 工业主席、ICAICTA 2024 组织主席、ICOT 2017 程序主席

按年份完整列表

担任以下学术会议的主席或组织者:

审稿工作

担任以下期刊与会议的审稿人或程序委员会委员:

论文著作

期刊与编著

会议论文