声场生成方法、装置、设备及介质制造方法及图纸

技术编号：43636222 阅读：17 留言：0更新日期：2024-12-13 12:36

本发明专利技术提供一种声场生成方法、装置、设备及介质，其中方法包括：将场景描述信息输入至大型语言模型中，得到所述大型语言模型输出的所述场景描述信息所对应场景的声音内容信息和声音位置信息；基于所述声音内容信息和所述声音位置信息，生成所述场景描述信息所对应的场景声场。本发明专利技术提供的方法、装置、设备和介质，通过大型语言模型解析输入的场景描述信息，生成与之对应的声音内容信息和位置信息，确保声音与场景的高度匹配。结合声音内容信息和声音位置信息进行声场生成，精确再现声音在空间中的传播特性。本发明专利技术能够减少对复杂硬件的依赖，适用于各种复杂的应用场景。同时，本发明专利技术能够实时响应场景变化，提供更加逼真和动态的声音环境。

全部详细技术资料下载

【技术实现步骤摘要】

本专利技术涉及人工智能，尤其涉及一种声场生成方法、装置、设备及介质。

技术介绍

1、声场还原技术通过模拟声音在空间中的传播特性，实现声音的空间定位、方向感和环境反射效果，使用户能够感受到逼真的三维音效。这种技术广泛应用于虚拟现实、增强现实、沉浸式音频系统等领域，为用户提供沉浸式的听觉体验。

2、然而，现有的声场还原技术主要依赖于多通道音频系统和物理声学模型，通常需要大量的硬件设备和复杂的计算资源。此外，这些技术在实际应用中难以处理动态场景的变化，无法灵活应对多样化的声场需求，限制了其在复杂环境中的应用。

技术实现思路

1、本专利技术提供一种声场生成方法、装置、设备及介质，用以解决相关技术中声场还原硬件成本高、适用范围有限的缺陷。

2、本专利技术提供一种声场生成方法，包括如下步骤：

3、将场景描述信息输入至大型语言模型中，得到所述大型语言模型输出的所述场景描述信息所对应场景的声音内容信息和声音位置信息；

4、基于所述声音内容信息和所述声音位置信息，生成所述场景描述信息所对应的场景声场。

5、根据本专利技术提供的声场生成方法，所述场景描述信息包括场景环境描述信息，所述场景环境描述信息用于描述场景所在的环境。

6、根据本专利技术提供的声场生成方法，所述场景描述信息还包括场景参考声音信息，所述场景参考声音信息用于描述场景中候选的声音的内容和/或位置。

7、根据本专利技术提供的声场生成方法，所述基于所述声音内

8、获取与所述声音内容信息对应的音频；

9、基于所述音频和所述声音位置信息，生成所述场景描述信息所对应的场景声场。

10、根据本专利技术提供的声场生成方法，所述获取与所述声音内容信息对应的音频，包括：

11、在所述声音内容信息中包括人声内容的情况下，基于语音合成模型生成所述人声内容对应的音频；

12、以及，在所述声音内容信息中包括非人声内容的情况下，基于声音效果生成模型生成所述非人声内容对应的音频。

13、根据本专利技术提供的声场生成方法，所述基于所述音频和所述声音位置信息，生成所述场景描述信息所对应的场景声场，包括：

14、基于所述声音位置信息，对所述音频进行空间声音还原，得到所述场景描述信息所对应的场景声场。

15、本专利技术还提供一种声场生成装置，包括如下模块：

16、场景解析单元，用于将场景描述信息输入至大型语言模型中，得到所述大型语言模型输出的所述场景描述信息所对应场景的声音内容信息和声音位置信息；

17、声场生成单元，用于基于所述声音内容信息和所述声音位置信息，生成所述场景描述信息所对应的场景声场。

18、本专利技术还提供一种电子设备，包括存储器、处理器及存储在存储器上并可在处理器上运行的计算机程序，所述处理器执行所述程序时实现如上述任一种所述声场生成方法。

19、本专利技术还提供一种非暂态计算机可读存储介质，其上存储有计算机程序，该计算机程序被处理器执行时实现如上述任一种所述声场生成方法。

20、本专利技术还提供一种计算机程序产品，包括计算机程序，所述计算机程序被处理器执行时实现如上述任一种所述声场生成方法。

21、本专利技术提供的声场生成方法、装置、设备及介质，通过大型语言模型解析用户输入的场景描述信息，生成与之对应的声音内容信息和声音位置信息，确保声音与场景的高度匹配。结合声音内容信息和声音位置信息进行声场生成，精确再现声音在空间中的传播特性。本专利技术能够减少对复杂硬件的依赖，适用于各种复杂的应用场景。同时，本专利技术能够实时响应场景变化，提供更加逼真和动态的声音环境。

本文档来自技高网...

【技术保护点】

1.一种声场生成方法，其特征在于，包括：

2.根据权利要求1所述的声场生成方法，其特征在于，所述场景描述信息包括场景环境描述信息，所述场景环境描述信息用于描述场景所在的环境。

3.根据权利要求2所述的声场生成方法，其特征在于，所述场景描述信息还包括场景参考声音信息，所述场景参考声音信息用于描述场景中候选的声音的内容和/或位置。

4.根据权利要求1至3中任一项所述的声场生成方法，其特征在于，所述基于所述声音内容信息和所述声音位置信息，生成所述场景描述信息所对应的场景声场，包括：

5.根据权利要求4所述的声场生成方法，其特征在于，所述获取与所述声音内容信息对应的音频，包括：

6.根据权利要求4所述的声场生成方法，其特征在于，所述基于所述音频和所述声音位置信息，生成所述场景描述信息所对应的场景声场，包括：

7.一种声场生成装置，其特征在于，包括：

8.一种电子设备，包括存储器、处理器及存储在所述存储器上并可在所述处理器上运行的计算机程序，其特征在于，所述处理器执行所述程序时实现如权利要求1至6任一项所述声场生成方法。

9.一种非暂态计算机可读存储介质，其上存储有计算机程序，其特征在于，所述计算机程序被处理器执行时实现如权利要求1至6任一项所述声场生成方法。

10.一种计算机程序产品，包括计算机程序，其特征在于，所述计算机程序被处理器执行时实现如权利要求1至6任一项所述声场生成方法。

...

【技术特征摘要】

1.一种声场生成方法，其特征在于，包括：

2.根据权利要求1所述的声场生成方法，其特征在于，所述场景描述信息包括场景环境描述信息，所述场景环境描述信息用于描述场景所在的环境。

5.根据权利要求4所述的声场生成方法，其特征在于，所述获取与所述声音内容信息对应的音频，包括：

6.根据权利要...

【专利技术属性】
技术研发人员：俞立夫，宋若淼，凌然，张龙，马耀中，李孟辉，吴江照，
申请(专利权)人：合肥智能语音创新发展有限公司，
类型：发明
国别省市：

全部详细技术资料下载我是这个专利的主人