Omnivoice
首页
音色库
创建数字人
声音克隆
开发者
我的
Omnivoice
首页
音色库
创建数字人
声音克隆
更多
小米 k2-fsa 开源 OmniVoice 0.8B · 云端在线版

OmniVoice在线版:最快中文AI配音

基于小米 k2-fsa 开源 OmniVoice 0.8B 扩散语言模型(646 语种训练),在英伟达高速 GPU 云基座加持下,无需下载整合包、不配本地环境,即可调用 SOTA 级 AI 配音能力。支持 600+ 语言零样本合成、20 秒极速克隆、RTF 低至 0.1,高并发下探 0.025,最高 40 倍实时生成。OmniVoice在线版还一站式集成 Indextts1、 Indextts2、CosyVoice3.5、Qwen3-TTS等全部最热中文语音合成模型,一个账号=全部中文热门语音合成模型。

模型底座:小米 OmniVoice 0.8B(Qwen3-0.6B Init) · Apache-2.0 开源 · 646 语种 / 58.1 万小时训练 · RTF 0.025 基线

模型介绍

OmniVoice在线版
是什么?

OmniVoice在线版是小米 AI 实验室新一代 Kaldi 团队(k2-fsa)开源的 OmniVoice 零样本 TTS 大模型的云端封装版本。OmniVoice 于 2026 年 4 月随论文 arXiv:2604.00688 正式发布,是目前开源社区中覆盖语种最广、中文理解最强的零样本语音合成底座之一。

核心技术架构

采用单阶段离散非自回归(NAR)扩散语言模型架构,双向 Transformer 主干直接将文本映射至多码本声学 Token,彻底砍掉传统“文本→语义→声学”的两级级联,推理并行度大幅提升。训练阶段引入全码本随机掩码(Full-Codebook Random Masking),加速收敛并提升生成稳定性。

输入文本 / 音素单阶段 NAR 扩散双向 Transformer多码本声学 Token输出24kHz 音频

在线版核心价值

无需下载任何声音克隆软件,浏览器打开 omnivoiceai.net,上传 20 秒短音频即可创建专属语音模型;也可通过文字描述直接“捏”出全新音色(Voice Design)。短视频旁白、粤语短剧、方言内容、课程音频均可批量生成,全流程在在线环境中完成。

0.8B
参数量

主干采用 Qwen3-0.6B 预训练权重初始化,首次在 NAR-TTS 中释放大语言模型的语义理解红利

58.1万小时
训练语料 · 646 种语言与方言

源自 50 个开源数据集清洗降噪,低资源语种动态上采样

0.025 RTF
推理速度 · 40 倍实时

24kHz 高保真输出,OmniVoice在线版常态 RTF≈0.1

0.84%
中文 WER(英文 1.30%)

多音字、专名、拼音纠音原生支持

Apache-2.0
开源协议

代码 GitHub(k2-fsa/OmniVoice)、权重 HuggingFace 全量开放

数据经过 OmniVoice 模型处理后转换为语音波形的技术示意图
核心功能

一个平台,装下整套 AI 配音工作流

从零样本克隆到音色设计,从语气微调到高保真输出,全部在浏览器里完成。

多语言与方言零样本克隆

600+ 语种零样本合成,646 语种训练全覆盖;跨语言保音色,中文声线读日文、克隆声说泰语质感不塌。OmniVoice 原生支持 3–10 秒克隆,在线版推荐 20 秒以对抗环境噪声。

Voice Design 音色设计

无需上传音频,文字描述「30 岁男声 / 低音 / 川渝口音 / 松弛」即可生成全新声线,适配游戏 NPC、广播剧角色、品牌旁白。

可控克隆与语气微调

8 维情绪滑块(开心 / 悲伤 / 厌恶 / 惊讶 / 愤怒 / 恐惧 / 忧郁 / 平静)精细调控语气浓度;支持参考原音频或上传参考音频锁定音色基底;

极速模型构建

上传样本后云端 30 秒内完成音高、音色、语速、口音分析,建好即用,不走训练队列。

浏览器即开即用

Windows / macOS / Linux / iPad / 手机浏览器全兼容,无显卡要求,账号登录即用。

24kHz 高保真细节保留

OmniVoice 原生输出 24kHz;在线版通过后端声码器增强,保留呼吸声、唇齿音、自然停顿与情绪起伏,听感接近真人录音。

声音克隆

两步完成声音克隆

从上传样本到开口朗读,最快 1 分钟内完成。

01第一步

上传或录制语音样本

支持 MP3 / WAV / M4A,推荐 5–60 秒(建议 20 秒),单文件 ≤ 50MB。

  • 安静环境正常语速,混合陈述 / 疑问 / 感叹句
  • 避开背景音乐与噪底
  • 必要时点击「AI 降噪」预处理样本
02第二步

输入文本,用你的声音朗读

选择克隆声音 → 粘贴文案(支持中文/拼音/英文音素纠错)→ 选择目标语言(可直选粤语、日文、泰语等)→ 点击「转换」,即刻生成。

手机录制语音并传输到电脑生成克隆声音的流程示意图

旁注:OmniVoice 原生 3–10 秒即可克隆,在线版取 20 秒是为带噪样本预留容错空间。

应用场景

一套声模,覆盖全场景配音需求

从个人创作到企业出海,声音资产一次构建、多端复用。

有声书与播客制作

批量产出章节音频,保留稳定声线与自然节奏,大幅降低录制成本。

短视频与自媒体配音

抖音 / B 站 / YouTube 旁白、口播、解说道具,一套声模多平台复用,日更无忧。

在线教育与知识付费

用你自己的声音规模化讲课,减少重复录音,保护嗓子,课程量产效率倍增。

企业品牌与商业应用

建立跨语种统一品牌声线,出海短剧、电商带货、客服播报一键多语言输出。

方言与无障碍内容

粤语、川话、陕话等方言朗读;为视障用户保存亲人声线,制作个性化有声陪伴内容。

耳机麦克风、手机、电脑和多语言沟通构成的 OmniVoice 应用场景图
为什么选择我们

为什么选择 OmniVoice在线版

模型代差 + 语种覆盖 + 中文理解 + 云原生体验,四重优势一次给齐。

01

模型代差

小米 k2-fsa OmniVoice 单阶段 NAR 扩散架构,比传统两段级联 TTS 快一个量级,RTF 0.025 基线。

02

语种最广

646 语种训练,低资源语种 CER<5%,是当前开源零样本 TTS 覆盖面最宽的底座。

03

中文最懂

Qwen3 初始化,多音字上下文自判,“银行/行走”“重量/重复”不再翻车。

04

云原生零门槛

不配环境、不占显存,手机浏览器也能跑批量任务。

05

生态成熟

模型权重 Apache-2.0 免费商用,OmniVoice在线版 API 已被 300+ 平台接入。

常见问题

常见问题 FAQ

关于语言支持、声音克隆、多音字、文件保存与 API 接入的高频问题。

覆盖中英日韩等主流语种,同时搭载 100+ 语种(如泰语、俄语、越南语等)原生配音能力,依托音色跨语言迁移技术,复刻声线切换任意语种仍保留原有音色质感,轻松适配跨境短剧、海外短视频多语言内容生产。

用户评价

创作者们的真实反馈

来自 UP 主、出海运营、有声书制作人与职教讲师的使用体验。

OmniVoice在线版每周帮我省下 10 小时录音时间,粉丝完全分不清 AI 和原声,漫剧批量台词一键搞定。

U
科技区 UP 主B 站

646 语种一个声模打通 5 国配音,品牌声线高度统一,原来外包一周的工作量现在半天就跑完。

出海短剧运营跨境电商

20 秒克隆加上语气标签,整本书的角色对话我一个人就能包办,录制流程相当于重做了一遍。

有声书制作人内容工作室

克隆自己的授课原声生成课程音频,语气节奏几乎一模一样,嗓子终于能歇一歇了。

职教讲师在线教育
首页
声音数字人
声音克隆
配音神器