Hibiki
Hibiki 适合需要实时语音翻译的场景,如国际会议、多语言直播、在线教育等,尤其适合开发者和研究人员,可用于开发相关应用或进行学术研究。
总访问量: 474,564,576
占比最多地区: US(19.34%)
960
简介
Hibiki 是一款专注于流式语音翻译的先进模型。它通过实时积累足够的上下文信息来逐块生成正确的翻译,支持语音和文本翻译,并可进行声音转换。该模型基于多流架构,能够同时处理源语音和目标语音,生成连续的音频流和时间戳文本翻译。其主要优点包括高保真语音转换、低延迟实时翻译以及对复杂推理策略的兼容性。Hibiki 目前支持法语到英语的翻译,适合需要高效实时翻译的场景,如国际会议、多语言直播等。模型开源免费,适合开发者和研究人员使用。
截图
产品特色
支持流式语音翻译,实时逐块生成翻译结果
可同时生成目标语音和文本翻译,满足多种使用需求
采用多流架构,联合建模源语音和目标语音
支持语音转换功能,可保留原说话人的语音特征
提供多种后端实现(如 PyTorch、Rust、MLX 等),适配不同硬件平台
使用教程
1. 安装所需的后端库(如 PyTorch 或 Rust)。
2. 下载 Hibiki 模型文件,选择适合的版本(如 PyTorch 或 MLX)。
3. 准备待翻译的音频文件。
4. 使用命令行工具运行翻译脚本,指定音频文件和输出路径。
5. 根据需要调整参数(如分类器自由引导系数)以优化翻译效果。
6. 查看生成的翻译音频文件和文本翻译结果。
流量来源
直接访问51.61%外链引荐33.46%邮件0.04%
自然搜索12.58%社交媒体2.19%展示广告0.11%
最新流量情况
月访问量
4.92m
平均访问时长
393.01
每次访问页数
6.11
跳出率
36.20%
总流量趋势图
地理流量分布情况
美国
19.34%
中国
13.25%
印度
9.32%
俄罗斯
4.28%
德国
3.63%
地理流量分布全球图