登录社区云,与社区用户共同成长
邀请您加入社区
AI视频生成的门槛,已经低到"一句话出片"。但"能用"和"好看"之间,隔着一条巨大的鸿沟,而这座桥,几乎完全由提示词搭建。这套6维公式、9种运镜、5条铁律,如果你能真正理解并运用,出片成功率从 50% 提升到 80% 以上,绝不是空话。剩下的 20%,交给你的创意和反复尝试。模型的上限决定了你能走多远,而提示词的水平,决定了你现在能站多高。顺便提一句,如果你是带团队做AI视频,Seedance 2
**静态动漫化**:基于GAN(生成对抗网络)的深度学习模型,能够识别照片中的物体、人物、场景,并自动匹配最合适的动漫风格(如宫崎骏风、新海诚风、赛博朋克风等)。- **运动范围受限**:对于大幅度动作(如跑步、跳跃),AI生成的视频可能出现边缘扭曲或模糊。- **视频特效增强**:支持添加粒子特效(飘落的樱花、闪烁的星光)、动态背景(流动的云、波光粼粼的水面)以及镜头运镜(推拉摇移)。Anime
本文提出了一种名为StableWorld的方法,通过智能地“扔掉”那些开始变模糊或变形的历史画面,只保留清晰的画面作为参考,从而让AI生成的长视频在长时间互动中保持稳定,不再“崩坏”。
北大Open-Sora Plan:普通人实现电影级AI视频制作
浙大联合腾讯混元:AI终于学会"边看边记忆",让虚拟世界更真实
清华发明AI"注意力瘦身术":视频生成速度提升16倍的神奇技术
港大用AI视频生成技术让机器人拥有"透视眼":首次实现超视野导航
字节跳动推出新一代AI视频生成模型Seedance2.0,采用创新B-DiT架构实现音视频同步生成。该模型具备四大核心能力:多镜头叙事、原生音画同步、多模态输入控制和2K电影级输出,可广泛应用于影视、广告、游戏等领域。目前平台已开放Seedance1.5Pro版本,支持1080P高清视频生成;更强大的2.0版本将于春节后上线,提供导演级叙事功能和2K分辨率。新用户可免费体验1.5Pro版本,老用户
字节跳动推出新一代B-DiT架构AI视频生成工具Seedance2.0,具备四大突破性能力:导演级多镜头叙事、原生音视频同步、精准可控创作和2K电影级输出。该工具支持微短剧、广告、游戏开发等场景,生成速度比同类快30%。目前Seedance1.5Pro已开放使用,提供1080P高清视频生成;更强大的2.0版本将于年后上线,新增原生音画同步和导演级叙事功能。新用户可限时免费体验1.5Pro版本,老用
最新视频生成模型测评
加州大学洛杉矶分校推出WorldBench:AI模型物理学新"考试"系统
本期热榜包含11项目,覆盖 AI 智能体开发、终端交互、电子书管理、无限视频生成等多个热门领域,TypeScript 语言在 AI 智能体场景中应用广泛,轻量级工具与大型框架共同占据热榜席位。
腾讯突破:AI实现对话到电影的完整自动化制作
KAIST团队突破视频生成瓶颈:让AI学会"自我反思"修正动作错误
UNC与FieldAI联手:让AI也能用"草图预演"来创作更逼真的物理视频
让AI像导演一样规划视频:杜克大学团队让视频生成告别"随机发挥"
最近比较火的,AI 森林治愈系的画风,一个充满自然气息的森林场景,主体对象是一只可爱的卡通小生物,它有着圆滚滚的身体和两个小红点,看起来非常可爱。本节介绍如何使用豆包即梦也快速实现这种AI森林治愈系风格视频。
AI 漫导(DirectorAI)真的让 “人人都是漫剧导演” 从口号变成现实!不用学 Pr、不用画分镜、不用写完整剧本,手机就能让脑洞落地,不管是记录生活、分享创意,还是做账号涨粉,都超实用
《KlingAvatar2.0:多模态协同推理的数字人生成框架》提出了一种创新的时空级联架构,通过多专家协同导演实现高分辨率、长时长数字人视频合成。该系统采用两阶段生成流程:首先生成低分辨率全局"蓝图",再通过时空上采样细化高分辨率子片段。创新性地引入音频/视觉/文本三位专家组成的协同推理导演模块,通过多轮对话解决多模态指令冲突,并新增"负面导演"优化生成质
UniMAGE:统一导演模型实现连贯音视频生成 摘要:本文提出UniMAGE,一个创新的统一导演模型,通过整合剧本创作与关键帧生成来解决现有AI视频创作系统叙事断裂的问题。该模型采用混合Transformer架构,创新性地设计了"先交错后解耦"的双阶段训练范式:交错概念学习阶段促进文本-图像的深度理解,解耦专家学习阶段则分离剧本与图像生成以增强灵活性。
石溪大学解锁AI视频生成中的重力难题:让虚拟世界服从物理定律
Synthesia是一款革命性AI视频生成平台,用户仅需输入文本即可快速创建专业视频,无需演员或复杂设备。主要功能包括多样化AI虚拟形象、文本转语音、可定制模板、多语言翻译和互动视频元素。平台提供三种定价方案(起动机18美元/月、创作者64美元/月及企业定制),支持65种语言,已创建超1000万视频。优势在于节省成本、操作简便且支持协作,但可能无法完全替代专业视频制作。由伦敦大学学院研究人员创立,
大连理工大学联合快手科技推出革命性AI视频生成框架
视频AI学会了空间思维:Netflix的新模型让机器拥有真正的方向感
港中大与牛津等联合发现:AI生成视频骗过顶级检测模型
这是一个基于Coze平台的智能体开发项目,能够根据用户输入的历史人物名称,自动生成该人物的生平视频。项目通过多步骤的AI处理流程,将文字描述转化为生动的视频内容。(本项目中使用的图像生成和视频生成都是Coze平台的付费功能,需要自行充值资源点才能使用)
中科院突破:语义空间技术提升AI视频生成速度十倍
KAIST AI团队革命性突破:无需深度估计也能让视频自由变换视角
精度与统一性的两难困境:现有的专家模型依赖掩码,精度高但模型无法统一;而统一的上下文模型虽然架构简洁,但缺乏显式的空间提示,导致指令与区域映射微弱,定位不准。长视频外推能力缺失:现有模型通常难以处理超出训练时长的视频,简单的时序拼接会导致位置编码失效,产生运动错位或伪影。VideoCoF 的提出,打破了视频编辑领域长期存在的“精度 vs 统一性”僵局。通过引入帧链的推理机制(Chain-of-Fr
本文提出了一种基于多模态大语言模型(M-LLM)的自适应视频帧选择方法,以提高视频理解效率。针对现有均匀采样方法可能导致关键帧丢失的问题,该方法通过轻量级帧选择器,结合空间和时间双重监督信号,智能选取与问题相关的视频帧。实验表明,该方法在中长视频问答任务上显著提升性能(最高+3.7%),并能用更少帧数达到更好效果(4帧接近32帧的均匀采样效果)。核心创新在于问题导向的帧选择策略,仅需1.5B参数即
当AI学会了想象:阿里和中科院如何让视频生成模型突破创意的边界
香港科大团队用AI创造互动视频世界:手绘轨迹驱动AI角色表演
评估对象涵盖开源图像生成(StoryDiffusion, OmniGen2)、商业闭源模型(MOKI, Doubao, MorphicStudio)、多模态大模型(GPT-4o, Gemini)及视频生成模型(Sora2, Vlogger),揭示不同技术路线的结构性优势与短板。如果把“故事可视化”理解成一次跨媒介的“编码—传输—解码”:文本剧本(编码)→ 模型生成图像/分镜(传输)→ 观众在多镜头
快手推出Kling-Omni:一个AI模型搞定所有视频制作需求
达特茅斯学院突破:AI视频中人物身份跨场景识别
InfiniteTalk是一款先进的AI数字人视频生成工具,能够将静态图像与音频结合,生成无限时长的逼真说话视频。该工具采用创新的音频驱动框架,实现毫秒级唇形同步,并保持人物特征稳定。支持480P/720P分辨率,单GPU即可处理长视频生成,多GPU可扩展性能。主要应用于教育、企业宣传、自媒体和影视制作等领域,支持通过官网或本地部署使用。技术特点包括智能帧插值、情感映射和高效内存管理,提供量化模型
AI视频生成技术正处于高速迭代的关键阶段,一边在分辨率、可控性等核心指标上实现突破性进展,具备了专业级应用潜力;一边仍面临时序一致性、物理逻辑等核心瓶颈。本文基于北京大学相关研究成果,系统梳理AI视频生成的能力现状、评估体系与主流模型,为行业探索与实际应用提供参考。
AI视频技术正以数据驱动、模型赋能的方式重塑视觉内容创作,其背后是复杂的技术范式演进、精密的架构设计与高质量数据支撑。本文将基于北京大学相关研究内容,系统拆解AI视频生成的核心逻辑、技术架构、关键组件及训练数据核心要素,带大家全面理解这项革命性技术。
香港科大推出BiCo:让AI像艺术家自由组合图片和视频中的任意元素
HyperAI超神经作为 COSCon’25 的联合出品社区,于 12 月 7 日举办了「产研开源协同论坛」。本文为 4 位讲师的深度分享精华摘要,后续我们还会以视频的形式分享完整演讲,敬请期待!
本文提出了 GigaWorld-0,一个可扩展且可控的世界模型,旨在作为具身 AI 的高保真数据引擎。通过将逼真的视频生成与几何一致、物理合理的3D场景仿真相结合,GigaWorld-0 能够高效合成多样化、指令驱动的交互数据
伊利诺伊大学与谷歌:AI如何让视频合成像"拆积木再拼装"一样自然
Tuna是一个创新的统一多模态模型,通过独特的统一视觉表示设计,在一个框架内实现了图像/视频理解、生成和编辑功能。该模型将VAE编码器与表示编码器直接连接,形成兼顾语义理解和细节生成的统一表示空间。实验表明,Tuna在多个基准测试中达到SOTA水平,性能优于现有解耦模型和统一模型。消融研究验证了其统一表示设计的优越性,证明了理解和生成任务间的协同效应。Tuna的成功为开发更高效的多模态AI系统提供
LongCat-Video 基于 136 亿参数的视频生成大模型,同时支持文字转视频、图片转视频和视频续写,让创意能够持续往前推进。它不是只会做几秒炫酷短片,而是从训练阶段就融入了长时序逻辑,让光影不飘、角色不丢、剧情不突兀,几分钟的视频也能顺畅连贯。效率方面也非常能打:720p、30fps 的长视频几分钟即可生成,再配合强化学习不断提升文本对齐、画质与动作一致性,让开源模型也能拥有行业级竞争力。
针对您的环境,最简单、最稳妥的部署的方法是使用官方提供的。这种方式自带 Python 环境,不需要您自己在系统中配置复杂的 Python 或 CUDA 环境,解压即用。
在图生视频任务中,LongCat-Video 在视觉质量上值得关注,得分领先 Wan2.2 等其他模型,表明其在生成画面质量方面的突出优势。在这一框架中,视频生成模型通过其生成过程,逐步压缩并学习几何、语义、物理等多种知识形态,将示例图片上传后,输入 Prompt,在「Advanced Options」中可以对生成视频的负面提示词、分辨率、生成过程的随机性起点等参数进行更多设置,以实现更理想的生成
模型结合动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型,可精准解析文本、表格、公式、图表等复杂文档结构,同时支持 109 种语言。依托高效量化技术与推理优化策略,SmolLM3-3B 能在资源受限的设备上稳定运行,并在多项任务中实现接近更大模型的表现,非常适合本地化部署与移动端 AI 应用落地。DeePMD-kit_Example 是 DeePMD-kit 提供的官方示例集,涵盖多
【摘要】聚焦二次元漫剧生产,深度横评Sora2、可灵、即梦三大主流AI视频模型。通过系统性列表化对照,精细剖析其在角色一致性、镜头控制与生产效率上的差异,并提供一套可落地的技术选型与工作流范式。
【摘要】探讨AIGC漫剧视频生成工具的选型框架与评测体系。聚焦于生产目标、技术指标、成本控制与工作流整合,为实现风格稳定与规模化产能提供决策依据。