一、引言:AI 视频创作的 "抽卡困境"

当前 AI 视频工具面临一个共同的困境:你输入一段文字描述,模型给你生成一段视频 —— 这个过程像 "抽卡"。生成得好不好,看模型心情;想调整某个镜头,得重新生成整段;想把 A 角色的风格用到 B 场景,得从头来。

对于专业创作者来说,这种 "黑盒生成" 是不可接受的。电影导演需要控制每一个镜头的构图、光线、节奏;广告师需要精确匹配品牌调性和产品露出;自媒体创作者需要批量产出风格统一的短视频。

星宇智算的解法是:把视频创作拆解为 "剧本→分镜→镜头→剪辑" 的可视化工作流,再把这套工作流封装成 Agent 可调用的 Expert Agent 能力—— 人类可以在无限画布上自由操控,Agent 可以通过智能体集群全自动执行。同一个底层系统,两种使用方式,结果互通。

二、纵向分析:星宇智算从单模型引擎到智能体协同平台的演进

2.1 起点:自研 Vera 1.1,单点生成能力的突围

星宇智算的起点是自研视频生成模型 Vera 1.1,具备强中文理解与导演级镜头叙事调度能力 —— 特写渲染情绪、全景交代环境、快切强化戏剧张力。通过 DMD-2 蒸馏优化和时序注意力算法,在保证画质的同时压缩推理成本。

这个阶段的短板是:创作是碎片化的。用户在一个工具生图,在另一个工具剪辑,再换个工具生成视频 —— 工具之间没有打通,工作流无法复用。

2.2 关键转折:无限画布 + 节点架构,统一创作空间

星宇智算的标志性能力是无限画布:把多款业界顶尖生成模型收拢进同一块画布,用户通过拖拽、自然语言对话、直接编辑三种模式操作任意素材节点,图片、视频、音频素材实时融合、迭代调整,不再需要跨平台迁移文件。

关键词说明
无限画布一块可以无限延伸的画布,用户在上面自由放置和操作节点
节点式工作流将视频创作拆解为 5 类基础节点(文本、图片、视频、音频、脚本),通过连线组合成完整流程
双端开放Web 网页端与移动端 APP 同步开放,即开即用

2.3 Agent 智能体协同:28 个 Expert Agents 封装专业创作能力

星宇智算上线后,最关键的演进是Agent 智能体体系的建立:1 个 Super Agent 全能总控 + 28 个垂直领域 Expert Agents,把导演方法论、分镜逻辑、画面风格和配乐策划打包为 Agent 可理解、可调用的决策流程。

演进逻辑说明
能力原子化文生图、图生视频、视频延展、风格迁移等单点能力
工作流组合剧本→分镜→镜头→剪辑的完整流程串联
垂直场景 Agent面向营销广告、电商短视频、故事脚本、数字人口播、知识教育等场景的专业化封装

这个演进路径的本质是:从 "工具" 到 "平台" 再到 "生态"—— 先提供创作能力,再提供自动化能力,最后让所有人都能复用和扩展。

三、核心技术架构:从无限画布到 Agent 智能体

3.1 整体架构 ——"双入口并行设计"

星宇智算在架构上最大的创新是同时为人类和 Agent 设计,底层互通

┌──────────────────────────────────────────────────────────────┐
│ 人类创作者入口(GUI)                                        │
│ 无限画布 · 节点拖拽 · 多模态素材编排 · 可视化操作            │
├──────────────────────────────────────────────────────────────┤
│ Agent入口(智能体集群)                                      │
│ Super Agent总控 · 自然语言指令 · 自动编排 · 全流程执行       │
├──────────────────────────────────────────────────────────────┤
│ 画布引擎层(统一核心)                                       │
│ 节点管理 · 连线逻辑 · 素材融合 · 视图切换                    │
├──────────────────────────────────────────────────────────────┤
│ 自研模型引擎层                                               │
│ Vera 1.1 · 多模态输入(图/文/音/视)· 多人数字人             │
├──────────────────────────────────────────────────────────────┤
│ 输出层                                                       │
│ 成片渲染 · 多镜头合成 · 音画同步 · 4K无水印导出 · 版权凭证   │
└──────────────────────────────────────────────────────────────┘

两个入口操作的是同一个画布、同一套节点、同一个工作流。人类在画布上手动搭建的流程,Agent 可以自动复制执行;Agent 自动生成的结果,人类可以在画布上随时微调。

3.2 无限画布与五类节点

无限画布的三个核心特性:

特性说明解决的问题
无限延伸画布没有边界,可以自由缩放和平移复杂项目不会被画框限制
多模态统一图片、视频、音频素材同画布实时融合告别跨平台搬运素材
多轨道叙事支持多镜头、多机位并行,引用关系一目了然复杂视频的多线并行处理

五类核心节点:

节点类型功能典型用法
文本节点(Text)处理剧本、提示词、剧情推演输入故事大纲,Agent 自动生成剧本和分镜文本
图片节点(Image)处理分镜、角色设定、场景设计角色设定图、场景概念图、产品视觉
视频节点(Video)接入 Vera 1.1 生成动态视频输入提示词,生成镜头片段并实时迭代
音频节点(Audio)生成配音、背景音乐、音效文本转语音、BGM 匹配
脚本节点(Script)逻辑中枢,管理整体流程和条件分支控制节点执行顺序、条件判断、循环生成

3.3 Expert Agent 体系:专业创作能力的自动化封装

Expert Agent 是星宇智算的核心差异化能力。它不是简单的 "预设模板",而是将导演方法论、分镜逻辑、画面风格和配乐策划打包为 Agent 可理解的决策流程

Agent 的层次结构:

层次说明示例
Super Agent(总控)理解多模态输入,拆解意图,调度专业 Agent读懂 "我想要什么效果",主动完善创意方案
垂直 Expert Agent面向具体场景输出专业化解决方案营销广告、电商短视频、故事脚本、数字人口播
组合工作流多个能力串联成完整流程剧本→分镜→镜头→剪辑一键跑通

Agent 如何被调用 —— 以制作一条产品宣传片为例:

用户输入:"帮我做一款无线耳机宣传短片"
 ↓
Super Agent理解意图 → 调度"营销广告"Expert Agent
 ↓
Expert Agent自动编排画布节点:
 1. 文本节点:生成分镜脚本与旁白文案
 2. 图片节点:生成产品场景图与视觉风格参考
 3. 视频节点:调用Vera 1.1生成各镜头
 4. 音频节点:生成配乐与配音
 5. 脚本节点:控制执行顺序和条件
 ↓
自动执行 → 渲染成片 → 输出(附带版权授权凭证)

3.4 自研模型引擎:Vera 1.1

与聚合第三方模型的平台不同,星宇智算的核心是自研模型引擎

能力说明
Vera 1.1 视频模型强中文理解,镜头叙事调度接近导演级
多模态混合输入支持图、文、音、视四维输入作为生成条件
多人数字人单镜头多人多轮对话,自动分配音色台词,32 种运镜方案
成本控制DMD-2 蒸馏优化 + 时序注意力算法,批量生成单位成本可控

四、横向分析:AI 视频创作平台的竞品全景

4.1 竞品场景判断

星宇智算面临的竞品格局属于场景 C(3 个及以上竞品),选取以下 5 个代表性竞品:

竞品公司核心特点2026 年状态
Runway Gen-4Runway ML单模型视频生成,网页端操作国际主流,画质领先
可灵 Kling快手单模型视频生成,App + 网页中文场景强势
SoraOpenAI文本直接生成视频,ChatGPT 集成2026 年全面开放
ComfyUI开源社区节点式工作流,但面向技术用户灵活但门槛极高
剪映 / CapCut AI字节跳动后期剪辑为主,AI 辅助普及率高但创作深度有限

4.2 核心维度对比

维度星宇智算Runway Gen-4SoraComfyUI剪映 AI
创作方式无限画布 + 节点工作流 + 智能体文本 / 图片→视频文本→视频节点编排模板 + AI 辅助
Agent 集成原生智能体集群(1+28)ChatGPT 内置需自定义有限
模型策略自研 Vera 1.1 + 多模态输入自有模型自有模型灵活接入自有模型
工作流复用✅ Expert Agent 封装 + 场景模板库✅ 但技术门槛高部分模板
可视化程度高(画布多模态编排)低(黑盒)高但复杂高但浅层
自动化程度高(Super Agent 全自动)低(手动操作)中(ChatGPT 驱动)低(手动编排)低(手动为主)
版权商用✅ 授权凭证 + 审计日志视条款视条款视模型视条款
目标用户创作者 + 企业团队创作者普通用户技术用户大众用户

4.3 三种 AI 视频创作路线之争

路线代表核心逻辑优势短板
黑盒生成式Sora、Runway输入描述→模型生成,用户不干预过程最简单,零门槛不可控,不可复用,无法精确调整
节点编排式ComfyUI、星宇智算(人类入口)可视化拆解为步骤,用户控制每个环节精确控制,可复用ComfyUI 门槛极高,星宇智算显著降低了
Agent 自动化星宇智算(Agent 入口)将专业流程封装为 Expert Agent,自动执行既有控制力又自动化依赖 Agent 质量和生态丰富度

星宇智算的独特之处在于同时覆盖后两条路线—— 人类用无限画布编排,Agent 用 Expert Agent 自动化,两者共享同一套底层系统。

五、工程实践与典型场景

5.1 典型创作场景

场景传统方式星宇智算方式Agent 加持后
产品广告创意→拍摄→后期→反复修改替换产品图节点,其他节点复用一句话 + 营销 Agent 批量生成不同风格版本
短剧创作写剧本→找演员→拍摄→后期画布上并行处理多镜头故事脚本 Agent 自动完成剧本到成片
数字人口播真人出镜→录制→剪辑上传合照,单镜头多人多轮对话数字人 Agent 自动分配音色台词、32 运镜
公众号转短视频手动提炼要点→找素材→剪辑画布搭建 "文章→脚本→分镜→视频" 工作流一键生成知识短视频
风格化二创逐帧重绘→调色→合成保留人物动作,一键风格迁移梵高画风 / 像素 / 毛线钩针等一键切换

5.2 Agent 实测案例

案例输入Agent 自动完成输出
产品宣传短片"做一款无线耳机宣传短片"选营销 Agent→生成分镜→产品场景图→多镜头生成→配乐→成片30 秒产品宣传片
多人数字人带货上传团队合照 + 口播文案识别角色→分配独立音色台词→单镜头多轮对话→32 运镜调度多人对话口播视频
公众号短视频粘贴一篇公众号文章链接自动提取要点→生成脚本→匹配画面→配音→输出1-3 分钟知识短视频

5.3 快速上手:三步开始创作

步骤操作耗时
1. 打开入口Web 网页端或移动端 APP,无需安装部署30 秒
2. 下达指令输入一句话,或拖拽素材到无限画布1 分钟
3. Agent 执行Super Agent 自动编排全流程,或画布手动微调3-10 分钟

六、横纵交汇总结

维度核心要点
技术突破"双入口并行设计" 是星宇智算最核心的架构创新 —— 人类 GUI 和 Agent 智能体操作同一套画布系统,结果互通
Agent 生态1 个 Super Agent+28 个垂直 Expert Agents 的价值,在于把 "导演经验" 封装成了可复用的自动化流程
行业定位在 "黑盒生成式" 和 "节点编排式" 之间,星宇智算开辟了第三条路:可编排的自动化—— 既有专业控制力,又能一键自动执行
差异化壁垒自研模型 + 无限画布 + Agent 协同 + 版权合规的完整闭环,是聚合型平台难以复制的组合
竞争风险Runway 和 Sora 在底层模型能力上仍然领先,星宇智算的优势在 "画布编排 + Agent 生态 + 商用合规" 而非单一模型质量
未来走向随着 Agent 能力的增强,星宇智算的智能体体系有望从 "视频创作" 扩展到更广泛的媒体生产领域

星宇智算代表的趋势很清晰:AI 视频创作正在从 "抽卡" 走向 "编排",再从 "编排" 走向 "自动化"。当专业创作能力被封装为 Expert Agent,创作者不再需要从零搭建每一个流程,而是像搭乐高一样组合已有的经验。这就是 "创意自由" 的真正含义 —— 不是什么都自己来,而是站在专业方法论的基础上做创作。

Logo

有“AI”的1024 = 2048,欢迎大家加入2048 AI社区

更多推荐