Llama Omni
Llama Omni
LLaMA-Omni模型适合语音识别、语音合成和自然语言处理领域的研究人员和开发者。它可以帮助他们构建低延迟、高质量的语音交互系统,推动智能语音助手和相关应用的发展。
总访问量: 474,564,576
占比最多地区: US(19.34%)
1,104
简介
LLaMA-Omni是一个基于Llama-3.1-8B-Instruct构建的低延迟、高质量的端到端语音交互模型,旨在实现GPT-4o级别的语音能力。该模型支持低延迟的语音交互,能够同时生成文本和语音响应。它在不到3天的时间内使用仅4个GPU完成训练,展示了其高效的训练能力。
截图
产品特色
基于Llama-3.1-8B-Instruct构建,确保高质量响应。
低延迟语音交互,延迟低至226毫秒。
同时生成文本和语音响应。
在不到3天的时间内使用4个GPU完成训练。
支持Gradio演示,方便用户交互体验。
提供本地推理脚本,方便用户进行本地测试。
使用教程
克隆LLaMA-Omni仓库到本地。
进入LLaMA-Omni目录并安装所需的包。
安装fairseq和flash-attention。
下载Llama-3.1-8B-Omni模型和Whisper-large-v3模型。
下载基于单元的HiFi-GAN声码器。
启动Gradio演示,访问本地服务器进行交互。
对于本地推理,按照omni_speech/infer/examples目录中的格式组织语音指令文件,然后参考提供的脚本进行操作。
流量来源
直接访问51.61%外链引荐33.46%邮件0.04%
自然搜索12.58%社交媒体2.19%展示广告0.11%
最新流量情况
月访问量
4.92m
平均访问时长
393.01
每次访问页数
6.11
跳出率
36.20%
总流量趋势图
地理流量分布情况
美国
19.34%
中国
13.25%
印度
9.32%
俄罗斯
4.28%
德国
3.63%
地理流量分布全球图