VoxCPM2在线
首页
AI音色库
创建声音模型
声音克隆
声音设计
AI免费降噪
常见问题
VoxCPM2在线
首页
AI音色库
创建声音模型
声音克隆
声音设计
AI免费降噪

VoxCPM2 在线

声音克隆,打开网页就开始

  • VoxCPM 系列最新一代
  • 零样本声音克隆
  • 48k 高保真
  • 免部署免显卡
查看模型对比
VOXCPM2 STUDIO
声音克隆
声音设计
🎙 选择你的声音模型选择声音
上传音频即代表你已获得该声音的授权
2BVoxCPM2 参数规模约 20 亿,基于 MiniCPM-4
200万小时+多语种训练数据官方文档约 236 万小时
30语言 · 9 种中文方言无需额外语言标签
48kHz高保真输出零样本声音克隆
Features

VoxCPM2 在线能做什么

围绕“克隆一个声音、用好一个声音”,全部在浏览器内完成,无需部署 VoxCPM2。

🎙️
核心功能

VoxCPM2 声音克隆

上传一段清晰参考音频,零样本克隆音色,用你的声音朗读任意文字。支持独立参考音频克隆与续写式克隆。

🪄
无需录音

VoxCPM2 声音设计

不用参考音频,用文字描述性别、年龄、音色、口音(如“男声、中年、低沉”),Voice Design 直接生成全新音色。

🎭
可控生成

情绪与风格控制

Style Control 在克隆音色的同时,用自然语言控制情绪、语速、能量与表达方式,一个音色演绎多种语气。

🔇
克隆前处理

AI 降噪

自动过滤参考音频中的背景噪声,提取更干净的音色特征,嘈杂环境下用手机录的音频也能得到可用克隆。

Definition

VoxCPM2 是什么?和 VoxCPM 什么关系?

VoxCPM2 是面壁智能(OpenBMB)开源的多语言可控语音生成大模型,也是 VoxCPM 系列的最新一代版本,参数规模约 20 亿(2B),主打零样本声音克隆、Voice Design 与 Style Control。

VoxCPM 是该系列的早期版本(约 0.6B / 0.8B),VoxCPM2 在其基础上大幅升级。本站 VoxCPM2在线(voxcpmai.com)是基于 VoxCPM 开源模型搭建的在线平台——你不必自己在本地部署 VoxCPM2,打开网页即可完成声音克隆与配音。本站是第三方在线服务,与模型方无官方隶属或背书关系。

Comparison

VoxCPM2VoxCPM 有什么区别?

一张表看懂 VoxCPM 各代差异。日常使用推荐最新的 VoxCPM2。

对比项
VoxCPM0.5B / 1.5
VoxCPM2最新
发布方
面壁智能 / OpenBMB
面壁智能 / OpenBMB
发布时间
2025.09 / 2025.12
2026 最新一代
参数规模
约 0.6B / 0.8B
约 2B
训练数据
约 180 万小时中英
超 200 万小时多语种
语言支持
中文、英文
30 种语言 + 9 种中文方言
声音克隆
续写式零样本克隆
独立参考音频 / 续写克隆
音色设计
Voice Design 自然语言描述
风格控制
Style Control 情绪 / 语速
输出采样率
16kHz / 44.1kHz
48kHz
在线使用
本站支持
本站支持(推荐)
数据来自 VoxCPM 官方 GitHub 与技术报告 · 核对于 2026-08-05
About the model

VoxCPM2 模型介绍

VoxCPM2 是面壁智能(OpenBMB)开源的多语言、可控语音生成大模型,基于 MiniCPM-4,参数规模约 20 亿(2B)。给定一段参考音频即可零样本克隆音色,并用该音色朗读任意文字,无需针对说话人单独训练。

VoxCPM2 在超过 200 万小时多语种语音上训练(官方文档约 236 万小时),支持 30 种语言与 9 种中文方言,采用 tokenizer-free(无分词器)架构,直接建模连续语音表征,输出 48kHz 高保真音频。除声音克隆外,还支持 Voice Design(用自然语言描述生成音色)与 Style Control(控制情绪、语速、风格)。

在 Seed-TTS-Eval 零样本克隆评测中,VoxCPM2 英文 WER 低至 1.84%、中文 CER 0.97%,说话人相似度(SIM)中文 79.5%;主观评测自然度 N-MOS 4.78/5、相似度 S-MOS 4.74/5。相比早期 VoxCPM(约 0.6B)与 VoxCPM1.5(约 0.8B),VoxCPM2 在规模、语言覆盖与可控性上均有提升。

本地运行 VoxCPM2 需要 NVIDIA 显卡与 Python 环境;VoxCPM2在线提供免部署方案——打开浏览器即可使用同款模型能力。

以上数据来自 VoxCPM 官方 GitHub 与技术报告,核对于 2026-08-05。本站为第三方平台,与模型开发团队无关联。

VoxCPM2在线声音克隆操作界面:上传参考音频并输入配音文案
VoxCPM2 声音克隆生成结果:参考音频与生成音频波形对比及在线试听
Benchmarks

VoxCPM2 官方评测数据

Seed-TTS-Eval 零样本声音克隆与主观评测(WER/CER 越低越好,MOS 满分 5)。

4.78/5
零样本克隆 N-MOS 自然度
4.74/5
S-MOS 说话人相似度
0.97%
中文 CER
1.84%
英文 WER

数据来自 VoxCPM2 技术报告与官方 GitHub · 核对于 2026-08-05

How it works

在线用 VoxCPM2 三步出成品

创作者录制参考音频,准备用 VoxCPM2 在线克隆自己的声音
STEP 01

🎤 上传参考音频

上传一段清晰音频(手机录音即可),VoxCPM2 自动提取音色,完成在线声音克隆建模。嘈杂可先降噪。

STEP 02

✍️ 输入文案设风格

粘贴配音文案,选择刚克隆的音色,按需设定情绪、语速等 Style Control 参数。

STEP 03

🎧 生成并下载

点击生成,在线试听满意后下载 WAV / MP3,直接用于视频、有声书或课件。

Online vs Local

自己部署 VoxCPM2,还是用本站在线?

对比项
GitHub 本地部署
VoxCPM2 在线(本站)
硬件要求
需 NVIDIA 显卡 + Python 环境
浏览器打开即可,手机可用
上手时间
安装配置数小时
几分钟内出成品
声音克隆
自己跑推理
上传音频在线克隆
数据位置
完全本地,不出机器
云端处理(见隐私说明)
适合谁
开发者 / 离线大批量 / 数据敏感
想快速出配音的创作者
Use cases

VoxCPM2 在线配音适用场景

短视频创作者使用 VoxCPM2 在线 AI 配音制作口播视频

📱 短视频 / 自媒体口播

录一次自己的声音存进音色库,之后每期视频只需粘贴文案即可用 VoxCPM2 生成同款音色配音,口误重录成为历史。

用 VoxCPM 克隆音色为有声书生成小说旁白配音

🎧 有声书 / 小说旁白

用 VoxCPM2 克隆稳定音色,长篇文本自动断句、连续朗读,配合 Style Control 调整叙述语气,制作效率明显提升。

讲师用 VoxCPM2 在线为培训课件批量生成解说配音

📚 课件 / 企业培训解说

把讲义分章节生成解说音频,讲师音色全程一致;改稿只需重新生成对应段落,无需重进录音棚。

播客主播使用 VoxCPM2 克隆品牌专属音色制作节目口播

🎙 播客 / 广告口播

克隆品牌专属音色,VoxCPM2 一次建模长期复用,音色一致性稳定,配合情绪控制匹配不同调性。

FAQ

VoxCPM2 / VoxCPM 常见问题

VoxCPM2 是什么?和 VoxCPM 是什么关系?
VoxCPM2 是面壁智能(OpenBMB)开源的多语言可控语音生成大模型,也是 VoxCPM 系列的最新一代版本,参数规模约 20 亿(2B),支持零样本声音克隆、Voice Design 与 Style Control。VoxCPM 是该系列的早期版本。本站 VoxCPM2在线基于 VoxCPM 开源模型搭建,无需本地部署即可在线使用。
VoxCPM2 和 VoxCPM 有什么区别?
VoxCPM2 是最新一代:早期 VoxCPM 约 0.6B、VoxCPM1.5 约 0.8B,只支持中英与续写式零样本克隆;VoxCPM2 扩大到约 2B 参数、训练超 200 万小时,支持 30 种语言与 9 种中文方言,并新增 Voice Design 与 Style Control,输出 48kHz。日常使用推荐 VoxCPM2。
VoxCPM2在线需要本地部署吗?
不需要。VoxCPM 是开源模型,自己在 GitHub 部署需要 NVIDIA 显卡与 Python 环境;VoxCPM2在线打开浏览器即可使用,手机也能操作,无需下载、无需显卡。
VoxCPM2在线怎么用?
三步:上传一段清晰参考音频完成 VoxCPM2 声音克隆;输入配音文案,按需设定情绪、语速等风格参数;点击生成后在线试听并下载。全程在浏览器完成。
VoxCPM2 声音克隆需要什么样的参考音频?
一段口齿清晰、无明显噪音的音频即可,手机录制可直接使用。VoxCPM2 支持独立参考音频克隆(无需参考文本)与续写式克隆。录音嘈杂时可先用降噪提取干净音色,克隆更稳。
VoxCPM2 支持哪些语言和方言?
VoxCPM2 模型支持 30 种语言与 9 种中文方言(四川话、粤语、吴语、东北话、河南话、陕西话、山东话、天津话、闽南话)。本站按音质实测逐步开放语种入口,部分语言与方言效果可能有波动,以实际生成为准。
VoxCPM2 的声音设计(Voice Design)是什么?
Voice Design 让你不用参考音频,直接用文字描述音色(如“男声、中年、低沉、播音腔”),VoxCPM2 即可生成对应的全新音色并保存复用,适合为虚拟角色、旁白批量创建声音。
VoxCPM2 能控制情绪和语速吗?
可以。VoxCPM2 的 Style Control 支持在克隆音色的同时用自然语言控制情绪、语速、能量与表达方式。官方也提示可控生成的稳定性仍在优化,同一段文本不同指令下效果可能有差异,建议多生成几版对比。
VoxCPM2在线是免费的吗?
注册即送免费额度,可直接体验 VoxCPM2 声音克隆与 AI 配音;额度用完后可选择付费套餐继续使用。首页示例音频试听不需要注册。
VoxCPM2在线和本地部署有什么区别?
核心是门槛:本地部署 VoxCPM2 需要 NVIDIA 显卡与 Python 环境,适合开发者与离线大批量、数据敏感的用户;VoxCPM2在线打开网页即用,手机可操作,适合想快速出配音的创作者。
VoxCPM2 生成的音频可以商用吗?
是否商用取决于两点:一是你对输入文本与所克隆声音拥有相应权利(本人或已授权声音);二是 VoxCPM 开源模型的许可条款,请以其官方开源协议为准。使用未授权素材产生的风险由使用者自行承担。
可以用 VoxCPM2 克隆别人的声音吗?
仅限本人声音或已获明确授权的声音。未经授权克隆他人声音可能侵犯声音权益并违反法律法规。请勿上传未授权的他人录音、影视片段或名人音频。
本站和 VoxCPM 官方是什么关系?
本站是基于 VoxCPM 开源模型独立搭建的第三方在线服务,与模型方(面壁智能 / OpenBMB)无关联、无授权背书关系。VoxCPM、VoxCPM2 为其对应开源模型名称。
为什么克隆出来的声音听起来不稳?
通常是参考音频过短或背景噪音过多。建议在安静环境重录一句更完整清晰的话,或先开启降噪;长文本分段生成、同段落用同一音色以保持一致。多数问题换一条更清晰的参考音频即可改善。
VoxCPM2 支持哪些音频格式?
上传参考音频与下载生成音频均支持常见的 WAV、MP3 格式,生成后可在线试听再下载到本地。
我上传的音频会被保存吗?
你在本站创建的 VoxCPM2 声音模型仅供本人使用。参考音频与生成记录的保存与删除规则以隐私政策为准,需要长期留存的音频请及时下载。
VoxCPM2 生成的内容有 AI 标识吗?
有。根据《互联网信息服务深度合成管理规定》等要求,本站生成的音频会添加 AI 生成标识。请在对外发布时保留标识,不要用于伪造他人言论、诈骗或误导用途。
VoxCPM2 的生成速度和音质怎么样?
VoxCPM2 输出 48kHz 高保真。Seed-TTS-Eval 零样本克隆评测中英文 WER 1.84%、中文 CER 0.97%,主观自然度 N-MOS 4.78/5、相似度 S-MOS 4.74/5(数据来自官方技术报告)。在线生成速度取决于文本长度与当前负载。

🛡️ 安全使用说明

  • 克隆边界:仅可克隆本人声音或已取得明确授权的声音;请勿上传未授权的他人录音、影视片段或名人音频。
  • 内容边界:禁止将生成音频用于伪造他人言论、诈骗、骚扰、虚假宣传或其他违法违规用途。
  • AI 标识:本站生成的音频按深度合成相关规定添加 AI 生成标识,对外发布时请予以保留。
  • 合规说明:本站为基于 VoxCPM 开源模型搭建的第三方平台,与模型方无官方隶属或背书关系;商用请确保你对输入素材与克隆声音拥有相应权利。

READY WHEN YOU ARE

现在开始,用 VoxCPM2 克隆你的第一个声音

免下载、免显卡、免部署,注册即送免费额度,打开网页即用。

首页
声音模型
声音克隆