深圳大学附属华南医院神经外科杜世伟、陶蔚团队联合香港中文大学(深圳)数据科学学院李海州团队,在国际权威期刊Nature旗下《Scientific Data》(JCR Q1区)发表题为“VocalMind: A Stereotactic EEG Dataset for Vocalized, Mimed, and Imagined Speech in Tonal Language”的研究成果。该研究首次建立了面向声调语言(普通话)的立体定向脑电图(sEEG)多模态语音数据集,涵盖发声语音(Vocalized)、默读语音(Mimed)和想象语音(Imagined)三种模式,包含单词和句子两个层级,总时长67.85分钟的高精度神经信号记录。研究团队创新性地提出融合CNN与RNN的基线解码模型,成功实现从sEEG信号到语音波形的端到端重建,为声调语言脑机接口(BCI)的临床转化提供了重要基础资源。魏明怡(深圳大学附属华南医院)、何天与(香港中文大学[深圳])为共同第一作者。
原文链接:https://pubmed.ncbi.nlm.nih.gov/40253415/
研究背景与科学问题
全球约60%-70%人口使用声调语言(如汉语、泰语),但现有语音BCI研究集中于非声调语言(如英语),缺乏针对声调变化语义功能的解码方案。癫痫患者术中植入sEEG电极的独特优势:无需开颅,可同步获取语言相关脑区(如Broca区、颞叶)的高时空分辨率信号。现有公开sEEG语音数据集时长不足(5-10分钟/受试者),且仅关注孤立单词,缺乏句子级语义信息。默读/想象语音的神经机制不明确,亟需多模态数据支持跨任务迁移学习。
研究方法与技术创新
研究受试者植入9根电极(140触点),覆盖额叶、颞叶及顶叶语言网络,采用以下三种任务:
发声语音:“请清晰朗读屏幕文字”(音频同步录制)。
默读语音:“无声模仿发音,保持口型但不出声”。
想象语音:“在脑海中默念文字,不移动嘴唇”。
任务设计包含:
20个单词:覆盖普通话四声及不同发音部位,如“牛奶níu nǎi”、“青菜 qīng cài”。
100个句子:选自WenetSpeech语料库,长度5-8字,如“我现在过去了”。
数据处理
sEEG信号:剔除30个异常电极后,提取高频伽马(70-150 Hz)和低频信号,降采样至200 Hz。创新性采用动态时间规整(DTW)对齐默读/想象语音与发声语音的神经响应。
音频信号:通过LibROSA生成80维梅尔频谱图(窗口64ms,步长20ms)。
解码模型:1D-CNN(64通道)→Dropout(0.7)→双向GRU(3层,256单元)→线性层(输出80维梅尔频谱)。六折交叉验证,以发声语音为监督信号迁移至默读或想象语音解码。
核心成果与临床价值
数据集特性:
多模态:包含原始/预处理sEEG、音频及梅尔频谱,文件命名规范(“Vocalized_DaNao_1.csv”)。
高精度标注:电极坐标公开(GitHub),支持跨研究数据整合。
解码性能:
发声语音:频谱相关性(PCC=0.82±0.03)、基频误差(RMSE=12.1Hz),显著优于默读(PCC=0.71±0.05)和想象语音(PCC=0.68±0.06)。
声调保留:解码的普通话四声轮廓与原始语音高度一致(Pitch Correlation >0.75)。
可懂度验证:通过HiFi-GAN合成的例句(如“我们又见面了”)获临床医生认可。
应用场景:
为失语患者提供脑机接口语音输出方案。同时揭示了声调语言在默读/想象时的神经编码差异。