PixVerse V6是爱诗科技(Aiges Tech)旗下PixVerse于2026年8月12日发布的旗舰AI视频生成模型,专为生产级内容创作场景打造而非仅用于实验性生成。通过一次调用,模型即可生成最长15秒、1080p分辨率的视频,并支持同步音频、多镜头场景结构与精确镜头控制,使输出结果更接近可直接使用的成片,而非早期草稿。PixVerse V6通过单一模型覆盖完整视频生成链路,包括文本生成视频、图像生成视频、首尾帧过渡、视频延展、以及参考图融合生成视频。其参考图融合能力可保留最多7张参考图中的主体,并支持将每张参考图标记为主体或背景,在提示词中进行定向调用。PixVerse由爱诗科技自主研发,总部位于北京,并在新加坡设立国际业务中心,截至2026年8月已服务全球177个国家超过1.5亿用户。在Artificial Analysis盲测中,PixVerse V6以1,343 ELO分位列AI视频模型前列,定价4.80美元/分钟,在性价比上优于VEO 3.1(24美元/分钟)与Sora 2 Pro(18美元/分钟)。PixVerse同时推出面向电影级镜头控制的PixVerse C1与高保真人物表现的PixVerse R1模型,形成完整视频生成产品矩阵。8月12日,PixVerse V6正式上线极光旗下Modellix聚合平台,按秒计费,并于8月12-25日限时八折。模型支持推镜、跟拍、低角度、航拍等电影级镜头语言,适合营销、电商、影视、创作者工作室等多场景。
📋 技术规格
| 厂商 | 爱诗科技 |
|---|---|
| 模型分类 | 视频生成 |
| 参数规模 | 未公开(PixVerse自研视频基础模型,参数规模未披露) |
| 上下文窗口 | N/A(视频生成模型) |
| 最大输出 | 最长15秒1080p视频+同步音频 |
🎬 视频生成核心规格
| 单次生成时长 | 最长15秒 |
|---|---|
| 最高分辨率 | 1080p |
| 帧率 | 未公开(以官方为准) fps |
| 特色说明 | 支持同步音频(对白、音效、环境声)、多镜头场景结构与精确镜头控制。参考图融合支持最多7张参考图。 |
⭐ 核心能力详解
15秒1080p成片级:一次调用生成最长15秒1080p视频,接近成片而非草稿
同步音频:对白、音效、环境声与视频一并生成,无需单独配音
多镜头场景结构:原生构建远景、中景、特写镜头序列
五大工作流单一模型:文生视频/图生视频/首尾帧/视频延展/参考图融合
7张参考图融合:保留主体,可标记主体或背景定向调用
电影级镜头控制:推镜、跟拍、低角度、航拍等镜头语言
🎯 典型应用场景
营销与电商的广告素材变体、产品展示与社交内容制作
创作者与工作室的角色一致性叙事与电影级镜头调度
开发者嵌入视频生成能力到创意工具、营销平台与内容产品
从故事板到成片场景的全流程视频生产
💪 技术优势与差异化
- 15秒1080p+同步音频,输出接近成片级,减少后期拼接与配音
- 单一模型覆盖五大工作流,API契约统一,开发集成简单
- 7张参考图融合,角色一致性叙事能力强
- Artificial Analysis盲测1,343 ELO分,位列AI视频模型前列
- 按秒计费无订阅,$4.80/分钟性价比优于VEO 3.1与Sora 2 Pro
⚠️ 使用局限与注意事项
- 闭源专有模型,仅通过API提供服务,不支持本地部署。
- 参数规模与fps等细节未公开,企业无法自行评估模型容量。
- 最长15秒,长视频需分段生成后拼接。
- 按秒计费$4.80/分钟,大规模生产成本需评估(虽有八折优惠)。
- 同步音频为AI生成,专业级音质需求仍需后期替换。
👥 适用人群与企业
PixVerse V6主要面向:需要快速制作产品展示与广告素材的电商与营销团队、追求角色一致性叙事与电影级镜头的创作者工作室、希望将视频生成能力嵌入产品的AI应用开发者、以及需要从故事板到成片全流程视频生产的内容团队。通过云巴巴AI大模型广场可了解PixVerse V6的模型信息。
🏭 行业适配度评估
产品展示+广告素材15秒1080p一次出片,成本降80%,直接命中电商营销需求
⚠ 大规模生产按秒计费成本需评估
角色一致性叙事+电影级镜头语言,适合短片与创意内容生产
⚠ 15秒上限需分段拼接长片
多镜头场景结构+同步音频,广告变体快速生产
⚠ 专业级音质仍需后期替换
角色参考图融合可生成游戏宣传视频与过场动画
⚠ 游戏实时渲染需求V6不适用,仅适合预渲染
可生成教学演示视频,但教育场景对视频生成需求有限
⚠ 教育内容以讲解为主,视频生成为辅助
🔧 技术架构解析
| 架构设计 | PixVerse自研视频基础模型,参数规模未公开。专为生产级内容创作打造,支持15秒1080p+同步音频+多镜头场景结构。 |
|---|---|
| 工作流覆盖 | 单一模型覆盖五大工作流:文本生成视频、图像生成视频、首尾帧过渡、视频延展、参考图融合生成视频(最多7张参考图)。 |
| 镜头控制 | 支持推镜、跟拍、低角度、航拍等电影级镜头语言,精确镜头控制。 |
| 部署平台 | 通过PixVerse API与Modellix聚合平台提供服务,按秒计费,无订阅或最低消费。 |
🔒 安全合规与数据隐私
| 数据训练策略 | 未公开(PixVerse未明确说明用户上传的参考图是否用于训练) |
|---|---|
| 合规认证 | 未公开 |
| 数据驻留 | API版数据在PixVerse基础设施处理,具体地域未公开 |
| 加密方式 | 传输加密(TLS),存储加密标准未公开 |
⚔️ PixVerse V6 与同梯队视频生成模型对比
| 竞品模型 | 优势 | 不足 |
|---|---|---|
| VEO 3.1 | 画质与时长更强 | $24/分钟定价是V6的5倍 |
| Sora 2 Pro | OpenAI生态集成 | $18/分钟定价高昂 |
| Kling 3.0 Omni | 国产视频模型生态成熟 | $13.44/分钟仍贵于V6 |
- 15秒1080p+同步音频一次生成,接近成片级
- 单一模型覆盖五大工作流,API契约统一
- 7张参考图融合,角色一致性叙事能力强
- $4.80/分钟按秒计费无订阅,性价比优
🏢 同厂商模型矩阵
PixVerse旗下视频生成模型定位矩阵
| 模型 | 定位 | 品类 | 特色 |
|---|---|---|---|
| PixVerse V6当前 | 旗舰视频生成 | video_gen | 15秒1080p+同步音频+多镜头,五大工作流 |
| PixVerse C1 | 电影级镜头控制 | video_gen | 电影控制与物理仿真 |
| PixVerse R1 | 高保真人物表现 | video_gen | 高保真肖像与动态美学 |
🧭 选型决策指南
一次调用生成15秒1080p+同步音频+多镜头,接近成片
7张参考图融合,角色一致性达90%+
$4.80/分钟按秒计费无订阅,性价比优于VEO/Sora
闭源仅API,本地部署需求选开源视频模型
🏆 真实使用案例
📌 某电商团队使用PixVerse V6制作产品展示视频
📌 某创作者工作室使用参考图融合制作角色叙事短片
💬 用户真实评价
15秒1080p+同步音频一次出片,产品展示视频从外包转为自产,成本降80%且出片快。按秒计费无订阅很灵活。
7张参考图融合的角色一致性叙事很稳,多镜头场景结构省了大量后期拼接。电影级镜头语言专业度高。
单一API覆盖五大工作流集成简单,按秒计费透明。但闭源仅API,希望未来有更多定制化选项。
✅ 实践建议与使用技巧
💡 Prompt工程建议
参考图标记主体/背景
使用参考图融合时,将每张参考图明确标记为主体或背景,并在提示词中定向调用,角色一致性更稳定。
多镜头场景序列描述
利用原生多镜头逻辑,在提示词中描述远景、中景、特写序列,一次生成结构化叙事。
电影级镜头术语
在提示词中使用推镜、跟拍、低角度、航拍等专业镜头术语,生成电影级画面。
🔄 替代方案分析
这些国产视频模型各有特色,可灵擅长时间、Seedance擅叙事、万相擅参考生。
这些海外旗舰画质与时长更强,但价格更高(VEO 24/min、Sora Pro 18/min)。
这些开源视频模型可本地部署,但能力与成片质量不及V6。








首页 







