图音成片

单图音频驱动(180s) · OmniHuman 双引擎
人物/主体图片(必填)
单张 jpg/png,< 5MB,< 4096×4096;支持真人 / 动漫 / 宠物
音色
0/3000复制清空
声音克隆(可选)· 复刻你的声音做专属口播音色
上传 10~30 秒清晰人声(wav/mp3,无背景音乐、无杂音)
标准档:单图音频驱动,保持原图比例,最长 180 秒,约 0.3 元/秒;高清档:OmniHuman 1.5,1080P/720P,最长 60 秒,1 元/秒。文案最长约对应 120 秒语音(TTS 单次上限)。
注:智能生成的内容仅供参考,不代表平台立场
档位
分辨率

图音成片

一张人物图 + 一段文案 = 数字人开口说话的口播视频
人物图
1 张·真人/动漫/宠物
+
文案+音色
系统合成语音
口播视频
图音成片
SevenAISEVENAI

欢迎登录

或
深圳市文恩传媒有限公司 · 粤ICP备 ________ 号

模型接入设置

Key 保存在本机 proxy-config.json(由本地代理读取),浏览器不会拿到明文。正式上线时把代理这层搬到服务器上,前端永远不碰 Key。