🎙️ 零样本声音克隆20 秒样本
20 秒样本
克隆你的专属声音
上传一段短音频,云端 30 秒完成音高、音色、语速、口音分析,建好即用,不走训练队列。
样本采样中… 00:20
音高 · 音色 · 语速 · 口音分析中 68%
基于小米 k2-fsa 开源 OmniVoice 0.8B 扩散语言模型(646 语种训练),在英伟达高速 GPU 云基座加持下,无需下载整合包、不配本地环境,即可调用 SOTA 级 AI 配音能力。支持 600+ 语言零样本合成、20 秒极速克隆、RTF 低至 0.1,高并发下探 0.025,最高 40 倍实时生成。OmniVoice在线版还一站式集成 Indextts1、 Indextts2、CosyVoice3.5、Qwen3-TTS等全部最热中文语音合成模型,一个账号=全部中文热门语音合成模型。
模型底座:小米 OmniVoice 0.8B(Qwen3-0.6B Init) · Apache-2.0 开源 · 646 语种 / 58.1 万小时训练 · RTF 0.025 基线
OmniVoice在线版是小米 AI 实验室新一代 Kaldi 团队(k2-fsa)开源的 OmniVoice 零样本 TTS 大模型的云端封装版本。OmniVoice 于 2026 年 4 月随论文 arXiv:2604.00688 正式发布,是目前开源社区中覆盖语种最广、中文理解最强的零样本语音合成底座之一。
采用单阶段离散非自回归(NAR)扩散语言模型架构,双向 Transformer 主干直接将文本映射至多码本声学 Token,彻底砍掉传统“文本→语义→声学”的两级级联,推理并行度大幅提升。训练阶段引入全码本随机掩码(Full-Codebook Random Masking),加速收敛并提升生成稳定性。
无需下载任何声音克隆软件,浏览器打开 omnivoiceai.net,上传 20 秒短音频即可创建专属语音模型;也可通过文字描述直接“捏”出全新音色(Voice Design)。短视频旁白、粤语短剧、方言内容、课程音频均可批量生成,全流程在在线环境中完成。
主干采用 Qwen3-0.6B 预训练权重初始化,首次在 NAR-TTS 中释放大语言模型的语义理解红利
源自 50 个开源数据集清洗降噪,低资源语种动态上采样
24kHz 高保真输出,OmniVoice在线版常态 RTF≈0.1
多音字、专名、拼音纠音原生支持
代码 GitHub(k2-fsa/OmniVoice)、权重 HuggingFace 全量开放

从零样本克隆到音色设计,从语气微调到高保真输出,全部在浏览器里完成。
600+ 语种零样本合成,646 语种训练全覆盖;跨语言保音色,中文声线读日文、克隆声说泰语质感不塌。OmniVoice 原生支持 3–10 秒克隆,在线版推荐 20 秒以对抗环境噪声。
无需上传音频,文字描述「30 岁男声 / 低音 / 川渝口音 / 松弛」即可生成全新声线,适配游戏 NPC、广播剧角色、品牌旁白。
8 维情绪滑块(开心 / 悲伤 / 厌恶 / 惊讶 / 愤怒 / 恐惧 / 忧郁 / 平静)精细调控语气浓度;支持参考原音频或上传参考音频锁定音色基底;
上传样本后云端 30 秒内完成音高、音色、语速、口音分析,建好即用,不走训练队列。
Windows / macOS / Linux / iPad / 手机浏览器全兼容,无显卡要求,账号登录即用。
OmniVoice 原生输出 24kHz;在线版通过后端声码器增强,保留呼吸声、唇齿音、自然停顿与情绪起伏,听感接近真人录音。
从上传样本到开口朗读,最快 1 分钟内完成。
支持 MP3 / WAV / M4A,推荐 5–60 秒(建议 20 秒),单文件 ≤ 50MB。
选择克隆声音 → 粘贴文案(支持中文/拼音/英文音素纠错)→ 选择目标语言(可直选粤语、日文、泰语等)→ 点击「转换」,即刻生成。

旁注:OmniVoice 原生 3–10 秒即可克隆,在线版取 20 秒是为带噪样本预留容错空间。
从个人创作到企业出海,声音资产一次构建、多端复用。
批量产出章节音频,保留稳定声线与自然节奏,大幅降低录制成本。
抖音 / B 站 / YouTube 旁白、口播、解说道具,一套声模多平台复用,日更无忧。
用你自己的声音规模化讲课,减少重复录音,保护嗓子,课程量产效率倍增。
建立跨语种统一品牌声线,出海短剧、电商带货、客服播报一键多语言输出。
粤语、川话、陕话等方言朗读;为视障用户保存亲人声线,制作个性化有声陪伴内容。

模型代差 + 语种覆盖 + 中文理解 + 云原生体验,四重优势一次给齐。
小米 k2-fsa OmniVoice 单阶段 NAR 扩散架构,比传统两段级联 TTS 快一个量级,RTF 0.025 基线。
646 语种训练,低资源语种 CER<5%,是当前开源零样本 TTS 覆盖面最宽的底座。
Qwen3 初始化,多音字上下文自判,“银行/行走”“重量/重复”不再翻车。
不配环境、不占显存,手机浏览器也能跑批量任务。
模型权重 Apache-2.0 免费商用,OmniVoice在线版 API 已被 300+ 平台接入。
关于语言支持、声音克隆、多音字、文件保存与 API 接入的高频问题。
覆盖中英日韩等主流语种,同时搭载 100+ 语种(如泰语、俄语、越南语等)原生配音能力,依托音色跨语言迁移技术,复刻声线切换任意语种仍保留原有音色质感,轻松适配跨境短剧、海外短视频多语言内容生产。
来自 UP 主、出海运营、有声书制作人与职教讲师的使用体验。
OmniVoice在线版每周帮我省下 10 小时录音时间,粉丝完全分不清 AI 和原声,漫剧批量台词一键搞定。
646 语种一个声模打通 5 国配音,品牌声线高度统一,原来外包一周的工作量现在半天就跑完。
20 秒克隆加上语气标签,整本书的角色对话我一个人就能包办,录制流程相当于重做了一遍。
克隆自己的授课原声生成课程音频,语气节奏几乎一模一样,嗓子终于能歇一歇了。