注意切换时大脑同时编码两路语音流
核心发现
人在多说话者场景中切换注意力时,大脑皮层并非「先断开旧目标、再连接新目标」,而是存在一个短暂的 同时对两路语音流进行神经编码 的窗口期。
具体机制:对新目标流的 neural engagement(神经追踪增强)先于 对旧目标流的 disengagement(神经追踪减弱),形成非对称的 engage-before-disengage 模式。
实验设计
- EEG 记录,正常听力成人
- 两个竞争性 TED talk 语音流(前方左右扬声器,60° 分离)
- 16 人背景 babble 噪声(后方扬声器)
- 屏幕箭头提示每 15–30 秒切换注意力
- 用 Temporal Response Function (TRF) 量化神经追踪
三个层次的发现
- 低层声学编码 (speech envelope 包络追踪):切换后立即出现双路同时编码,新流先 engage,旧流后 disengage
- alpha 功率 :切换后 EEG alpha 功率显著下降,反映认知努力的瞬态增加;恢复时间约 4 秒,与双路编码窗口吻合
- 词汇预测层 (lexical prediction,用 LLM 建模):切换后词汇上下文经历一次「reset」——大脑不延续旧说话者的语义上下文到新说话者上,而是重新开始积累
词汇上下文的四种假说
用 Mistral 7B LLM 构建四种 context-accumulation 策略,比较哪个最匹配 EEG 数据:
| 假说 | 描述 |
|---|---|
| —— | —— |
| Continuous | 不区分说话者,一路积累上下文 |
| Selective | 只积累被注视流的上下文 |
| Reset | 每次切换清零重新开始 |
| Memory | 保持两条独立的上下文链 |
结果:Reset 假说与神经数据最一致——切换后大脑对新流从零开始建立词汇预测,不继承旧流的语境。
意义
- 解释了鸡尾酒会场景中注意力如何灵活重定向
- 「先连接后断开」的策略可能支持在保持当前关注的同时探索其他听觉流
- 将 LLM 作为认知模型工具来测试词汇预测假说,方法新颖