简介
AudioSep是一种基于自然语言查询的开放领域音频源分离模型。它由文本编码器和分离模型两个关键组件组成。我们在大规模多模态数据集上训练AudioSep,并在许多任务上广泛评估其能力,包括音频事件分离、乐器分离和语音增强。AudioSep表现出强大的分离性能和令人印象深刻的零样本泛化能力,使用音频标题或文本标签作为查询,大大优于以前的音频查询和语言查询声音分离模型。为了保证本工作的可重复性,我们将发布源代码、评估基准和预训练模型。
截图

产品特色
基于自然语言查询的音频源分离
支持开放领域音频概念分离
支持音频事件分离、乐器分离和语音增强
具有强大的分离性能和零样本泛化能力
流量来源
直接访问 | 35.41% | 外链引荐 | 48.58% | 邮件 | 0.07% |
自然搜索 | 14.44% | 社交媒体 | 1.48% | 展示广告 | 0.02% |
最新流量情况
月访问量
21214.13k
平均访问时长
255.38
每次访问页数
3.22
跳出率
43.63%
总流量趋势图
地理流量分布情况
美国
29.22%
中国
17.09%
印度
4.83%
韩国
4.75%
英国
4.42%
地理流量分布全球图
同类开源产品

Podlm Public
podlm-public是一个利用AI技术将URL内容转换成播客并推送到小宇宙平台的项目。
AI音频编辑#自动化转换

Podcastfy
优质新品
Podcastfy是一个开源的Python包,它使用生成式人工智能技术,将网页内容、PDF文件和文本转化为引人入胜的多语言音频对话。
AI音频编辑#huggingface-spaces

Safeear
SafeEar是一个创新的音频深度检测框架,它能够在不依赖于语音内容的情况下检测深度音频。
AI音频增强器#深度

Multispecies Whale Detection
multispecies-whale-detection 是谷歌开发的一个开源项目,旨在通过神经网络检测和分类不同物种和地理区域的鲸鱼声音。
AI音频编辑#神经网络

Pdf To Podcast
pdf-to-podcast是一个基于人工智能技术的生产力工具,能够将PDF文档转换成播客节目。
AI音频编辑#文本到语音

Draw An Audio
Draw an Audio是一个创新的视频到音频合成技术,它通过多指令控制,能够根据视频内容生成高质量的同步音频。
AI音频编辑#视频处理

Easy Voice Toolkit
Easy Voice Toolkit是一个基于开源语音项目的AI语音工具箱,提供包括语音模型训练在内的多种自动化音频工具。
AI音频编辑#语音转录

Elevenlabs Audio Isolation API
Audio Isolation 是 ElevenLabs 提供的一项在线音频处理服务,专注于从音频中分离出人声或背景音乐。
AI音频编辑#人声隔离

Bleep That Sht
bleep_that_sht 是一个使用 Python 编写的应用程序,它利用 Whisper 转录模型来转录音频,然后根据用户选择的关键词,使用相应的时间戳来替换为哔声。
AI音频编辑#AI
替代品

Podlm Public
podlm-public是一个利用AI技术将URL内容转换成播客并推送到小宇宙平台的项目。
AI音频编辑#自动化转换

Podcastfy
优质新品
Podcastfy是一个开源的Python包,它使用生成式人工智能技术,将网页内容、PDF文件和文本转化为引人入胜的多语言音频对话。
AI音频编辑#huggingface-spaces

Safeear
SafeEar是一个创新的音频深度检测框架,它能够在不依赖于语音内容的情况下检测深度音频。
AI音频增强器#深度

Multispecies Whale Detection
multispecies-whale-detection 是谷歌开发的一个开源项目,旨在通过神经网络检测和分类不同物种和地理区域的鲸鱼声音。
AI音频编辑#神经网络

Pdf To Podcast
pdf-to-podcast是一个基于人工智能技术的生产力工具,能够将PDF文档转换成播客节目。
AI音频编辑#文本到语音

Draw An Audio
Draw an Audio是一个创新的视频到音频合成技术,它通过多指令控制,能够根据视频内容生成高质量的同步音频。
AI音频编辑#视频处理

Easy Voice Toolkit
Easy Voice Toolkit是一个基于开源语音项目的AI语音工具箱,提供包括语音模型训练在内的多种自动化音频工具。
AI音频编辑#语音转录

Bleep That Sht
bleep_that_sht 是一个使用 Python 编写的应用程序,它利用 Whisper 转录模型来转录音频,然后根据用户选择的关键词,使用相应的时间戳来替换为哔声。
AI音频编辑#AI

Genau
GenAU是一个由Snap Research开发的音频生成模型,它通过AutoCap自动字幕生成模型和GenAu音频生成架构,显著提升了音频生成的质量。
AI音频增强器#自动字幕
精选AI产品推荐

Nocode
中文精选
NoCode 是一款无需编程经验的平台,允许用户通过自然语言描述创意并快速生成应用,旨在降低开发门槛,让更多人能实现他们的创意。
开发平台#应用开发
912

Listenhub
优质新品
ListenHub 是一款轻量级的 AI 播客生成工具,支持中文和英语,基于前沿 AI 技术,能够快速生成用户感兴趣的播客内容。
音频生成#AI
348

Lovart
国外精选
Lovart 是一款革命性的 AI 设计代理,能够将创意提示转化为艺术作品,支持从故事板到品牌视觉的多种设计需求。
AI设计工具#创意工具
1,128

Fastvlm
FastVLM 是一种高效的视觉编码模型,专为视觉语言模型设计。
AI模型#图像处理开源
564

Smart PDFs
国外精选
Smart PDFs 是一个在线工具,利用 AI 技术快速分析 PDF 文档,并生成简明扼要的总结。
文章摘要#AI
984

Keysync
KeySync 是一个针对高分辨率视频的无泄漏唇同步框架。
视频编辑#视频处理开源
480

Anyvoice
AnyVoice是一款领先的AI声音生成器,采用先进的深度学习模型,将文本转换为与人类无法区分的自然语音。
音频生成#文本转语音
26.38k

Liblibai
中文精选
LiblibAI是一个中国领先的AI创作平台,提供强大的AI创作能力,帮助创作者实现创意。
AI模型#图像生成
344.42k