近年来,大模型在文本转语音系统中被用于注入情感与说话人特征。大家觉得实现自然情感表达主要依赖哪些技术模块?比如情感标签标注、声码器设计或多语言训练策略。哪些因素最关键,如何在自然度和可控性之间取得平衡?