# 文本到音频
文本到音频
Tangoflux
TangoFlux是一个高效的文本到音频(TTA)生成模型,拥有515M参数,能够在单个A40 GPU上仅用3.7秒生成长达30秒的44.1kHz音频。
文本转声音#音频生成开源
672
Sketch2sound
Sketch2Sound是一个生成音频的模型,能够从一组可解释的时间变化控制信号(响度、亮度、音高)以及文本提示中创建高质量的声音。
音频生成#声音模仿
1,176
Ezaudio
EzAudio是一个先进的文本到音频(T2A)生成模型,它能够从文本提示中创建高质量的音频。
AI文本转语音#声音生成开源
696
Bark
优质新品
Bark是由Suno开发的基于Transformer的文本到音频模型,能够生成逼真的多语言语音以及其他类型的音频,如音乐、背景噪声和简单音效。
AI语音合成#多语言开源
696
Stable Audio Open Demo
Stable Audio Open 是一个能够从文本提示生成长达47秒的立体声音频的技术。
AI音乐生成#文本到音频开源
1,680
Audiolcm
AudioLCM是一个基于PyTorch实现的文本到音频生成模型,它通过潜在一致性模型来生成高质量且高效的音频。
AI文本转语音#语音合成开源
2,028
Stable Audio Open 1.0
优质新品
Stable Audio Open 1.0是一个利用自编码器、基于T5的文本嵌入和基于变压器的扩散模型来生成长达47秒的立体声音频的AI模型。
AI音乐生成#音频处理开源
1,836
Make An Audio 2
Make-An-Audio 2是一种基于扩散模型的文本到音频生成技术,由浙江大学、字节跳动和香港中文大学的研究人员共同开发。
AI音乐生成#扩散模型开源
708
Musiclm
MusicLM是一个模型,可以根据文本描述生成高保真音乐。
AI音乐生成#文本到音频开源
1,356