为什么说提示词是决定视频质量的天花板
用 MiniMax + RunningHub 从提示词到成片的完整流水线实战记录
转换即梦版本的提示词
今天做了一件一直在想但没认真落地的事——把飞书多维表格里AI视频即梦专属的提示词通过自动转换,批量跑成了真正的15秒视频。
总共处理了6条记录,覆盖了完全不同的题材:
| No | 类型 | 题材 | 参考图 | 耗时 | RH币消耗 |
|---|---|---|---|---|---|
| 1 | 影视短剧 | 宫廷权谋(红衣皇妃 vs 素衣妃子) | 3张角色三视图 | ~8分钟 | ~110币 |
| 2 | 仙侠特效 | 修仙武者御剑大战穷奇 | 2张角色三视图 | ~8分钟 | ~95币 |
| 3 | 国风动画 | 哪吒大战敖丙+银白巨龙 | 3张角色三视图+巨龙 | ~9分钟 | ~130币 |
| 4 | 儿童创意 | 儿童房纸飞机奇幻冒险(一镜到底) | 1张场景参考 | ~7分钟 | ~87币 |
| 5 | 商业广告 | 汽车品牌广告 | 4张多角度参考 | ~10分钟 | ~122币 |
| 6 | 游戏演示 | 黑神话风格3A游戏UI | 1张角色群像 | ~8分钟 | ~86币 |
总消耗:约630 RH币,生成15张参考图 + 6条15秒视频。
提示词网上找到的,大都是适配即梦的,本文的提示词和场景也是摘自网络,要转换为minimax的适配提示词,因为:提示词才是决定视频质量的天花板,而参考图和模型只是帮你逼近这个天花板。
为什么说提示词是最重要的
先说结论:在 MiniMax 这类结构化提示词驱动的视频生成模型中,提示词决定了视频的"剧本质量",参考图决定了"演员长什么样",而模型本身决定了"拍摄设备"。你不可能用一个粗制滥造的剧本拍出好电影,哪怕演员是顶级的、摄影棚是顶级的。
我今天的6条视频,使用的模型完全相同(MiniMax H3)、分辨率完全相同(1152x640)、时长完全相同(15秒),但最终质量差异非常大。原因只有一个:提示词的精细程度不同。
宫廷权谋剧和哪吒大战敖丙这两条,提示词是经过精心设计的,每一个镜头都有明确的机位、动作、情绪和时间码;而有些条目因为提示词颗粒度不够,生成的视频就明显"散"——缺少节奏感,镜头之间缺乏逻辑联系。
下面我会把几条关键视频的完整提示词原文贴出来,逐段拆解每一部分的作用。你会发现,一段高质量的AI视频提示词,本质上就是一份微缩版的专业影视剧本。
MiniMax 提示词的六段式结构
MiniMax 使用的是一套严格的六段式结构化提示词。这不是建议,是硬性要求——缺少任何一段,模型的表现都会明显下降。这六段分别是:
1. subject_definitions —— "演员表":每张参考图是谁、穿什么、长什么样 2. summary —— "一句话故事梗概":15秒讲什么事 3. retention_analysis —— " continuity清单":什么必须保持一致,什么绝对禁止 4. detailed_description —— "分镜脚本":每一秒的画面、机位、动作、对白 5. overall_soundscape —— "拟音清单":环境音、动作音效 6. non_diegetic_music —— "配乐指示":BGM的风格、节奏、乐器、情绪曲线 ```subject_definitions: <Picture 1> 严格负责红衣上位皇妃的身份与造型:身穿红色丝绸贵妃服饰,发髻高挽簪着步摇发簪,妆容精致艳丽,气势凌人,面容凶狠、眼含嫉妒怒意。面部、发型、服装颜色与版型均以图1为准,全片不得漂移。 <Picture 2> 严格负责素衣下位妃子的身份与造型:身穿素色轻纱妃嫔服饰的年轻妃子,面容清丽、神情柔弱。面部、发型、服装均以图2为准,全片不得漂移。 <Picture 3> 严格负责皇上的身份与造型:身材高大强壮的帝王,神情威严,满面怒容。面部、体型、龙袍服饰均以图3为准,全片不得漂移。 summary: 一段15秒真人实拍质感的古装宫廷权谋剧片段。红衣皇妃居高临下推倒素衣妃子,拔下发簪欲刺,皇上突然现身攥住手腕阻止并呵斥,素衣妃子最终露出狡诈得意的笑容。 retention_analysis: <Picture 1> 红衣皇妃(appears in [Shot 1-4]):fully_preserved - 红色丝绸服饰、步摇发簪、凶狠嫉妒表情全程保持一致。 <Picture 2> 素衣妃子(appears in [Shot 1-6]):fully_preserved - 素色轻纱、柔弱面容、倒地姿态全程保持一致。 <Picture 3> 皇上(appears in [Shot 3-5]):fully_preserved - 高大强壮体型、威严神情、龙袍服饰全程保持一致。 场景不变量:紫禁城后宫长廊的朱红廊柱、红墙宫檐、砖石地面保持不变。 风格不变量:真人实拍质感古装宫廷权谋剧,高品质古装影视剧写实服化道。 绝对禁止:字幕、画面文字、LOGO、水印。 summarized_description: The target video is in a 真人实拍质感古装宫廷权谋剧 style with 明亮通透的自然日光。 [Shot 1] 0s-4s,全景,固定机位。红衣皇妃与素衣妃子在长廊中对峙。<Picture 1> (S1) 向前逼近一步,双手猛力一推。<Picture 2> (S2) 失去重心向后踉跄倒地,手肘撑地。<Picture 1> (S1) 居高临下俯视,面容凶狠眼含嫉妒。<Picture 1> (S1) says, <d>[Chinese] 我让你知道什么叫规矩!什么叫体统!</d> [Shot 2] 4s-7s,中近景,荷兰角,高机位俯拍。<Picture 1> (S1) 右手伸向发髻拔下步摇发簪,单手高高举起,簪尖朝下对准地上 <Picture 2> (S2),身体前倾作势刺下。<Picture 2> (S2) 瞳孔骤缩,双手抬起挡在脸前,发出一声惊叫。 [Shot 3] 7s-9s,近景,荷兰角,手持镜头。就在发簪将要刺下的瞬间,一只强壮有力的手臂从画侧猛然伸入,五指紧紧攥住 <Picture 1> (S1) 高举发簪的手腕,动作戛然而止。 [Shot 4] 9s-10s,中景,固定机位。<Picture 1> (S1) 顺着抓住她手腕的手臂望去,双眼骤睁、脸色大变,又惊又恐。<Picture 1> (S1) 倒吸一口凉气。 [Shot 5] 10s-12s,反打镜头,固定机位。抓着手腕的是 <Picture 3> (S3),镜头聚焦 <Picture 3> (S3) 上半身近景,满面怒容。<Picture 3> (S3) says, <d>[Chinese] 有朕在,不许任何人伤害她!</d> [Shot 6] 12s-15s,固定机位,双人前后景镜头。越过 <Picture 3> (S3) 的肩膀聚焦后景处仍倒在地上的 <Picture 2> (S2) 上半身和脸部。<Picture 2> (S2) 缓缓放下挡在脸前的双手,眼中的惊恐悄然褪去,嘴角勾起一丝狡诈得意的笑容。 overall_soundscape: 宫苑安静,偶有微风。衣料摩擦声、身体倒地的闷响、发簪从发髻抽出的细微金属响动、素衣妃子短促的惊叫、手腕被攥住的闷响、衣袖急停摩擦声。四周安静,人声突出。环境安静,仅衣料轻微摩擦。 non_diegetic_music: 无配乐、禁止生成BGM。逐段拆解
subject_definitions(演员表):注意"严格负责"这个词的重复使用,以及"均以图X为准,全片不得漂移"的硬约束。这不是在"描述"角色,是在给模型下达造型锁定指令。每张参考图对应哪个角色、负责哪些视觉属性(面部、发型、服装颜色与版型),写得越具体,模型"认人"就越准。
retention_analysis(场记清单):appears in [Shot 1-4]这类时间区间标注极其关键。它告诉模型"这个角色只在Shot 1到Shot 4出现",避免了角色在不该出现的镜头里"串场"。fully_preserved标签强调了哪些属性必须帧帧一致。而"绝对禁止"列表里的"字幕、画面文字、LOGO、水印"是所有提示词都应包含的标准防护项——AI视频模型非常容易"自作主张"地加上水印或字幕。
detailed_description(分镜脚本):这是整段提示词的灵魂。每个Shot都有四个核心要素:时间码(0s-4s)、景别(全景/中近景/近景/特写)、机位(固定机位/荷兰角/手持/反打镜头)、动作描述。Shot 3(7s-9s)只用了2秒,但描述了一个"手臂从画侧猛然伸入攥住手腕"的紧凑动作——这种精确的节奏控制在AI视频生成中尤其重要,因为模型对时间跨度的理解直接影响镜头的连贯性。
overall_soundscape(拟音清单):虽然MiniMax生成的"声音"目前还很初级,但详细的音效描述会间接影响画面的节奏感。“发簪从发髻抽出的细微金属响动"这种具体的声音描述,实际上在引导模型"注意这个动作的细节”。
non_diegetic_music(配乐指示):这条选择了"无配乐",因为宫廷权谋剧的安静更能衬托紧张感。这个选择本身就是一种创作决策。
案例二:哪吒大战敖丙 —— 中国水墨动画美学
这条视频的艺术风格控制做得最好。它的目标是20世纪80年代上海美术电影制片厂的水墨动画质感,提示词在风格描述上花了大量篇幅,最终效果确实呈现出一种独特的"复古中国风"。
完整提示词原文
subject_definitions: <Picture 1> 严格负责哪吒的造型:少年神话英雄形象,头扎双髻,双脚各踏着一只风火轮,手持火尖枪,战斗状态,面容凌厉。 summary: 一段15秒中国水墨与水粉手绘2D动画质感的神话战斗视频,参考20世纪80年代上海美术电影制片厂经典动画美学。 retention_analysis: 人物不变量:哪吒的双髻、风火轮、火尖枪、战斗姿态全程一致;敖丙铜锤、银白色巨龙形态保持一致。 场景不变量:东海海面波涛汹涌、连绵礁石海岸线、乌云密布天空、海面中心巨大漩涡、空间分三层(海面/漩涡上空对峙空域/漫天乌云)。 风格不变量:中国水墨与水粉手绘2D动画质感,传统矿物颜料色彩,大胆简洁轮廓,柔和手绘边缘扩散,略微模糊的绘画边缘,细腻水粉洇染质感,不完美的笔触轮廓,模拟动画电影颗粒,浓郁中国奇幻美学。 绝对禁止:字幕、画面文字、LOGO、水印。 detailed_description: [Shot 1](0s-2s)远景大全景,缓慢推进。乌云密布的东海海面上,哪吒背对镜头双脚各踏风火轮手持火尖枪悬空漂浮在左侧空中;画面下方海面中心惊涛波动,巨大漩涡正在加速旋转。 [Shot 2](2s-4s)中景,荷兰角,手持拍摄轻微晃动。镜头聚焦海面上的漩涡中心,漩涡中心升起一股上升浪涛,敖丙人形态双手持铜锤乘浪涛从海中飞升到空中。 [Shot 3](4s-6s)全景,侧向机位轻微横移跟拍。哪吒脚下风火轮火焰猛地喷涌,从左侧疾速冲刺到敖丙面前,火尖枪直刺而出;敖丙双锤交叉迎上,两件兵器当空相击。 [Shot 4](6s-8s)中近景,稳定机位。两人近距离连续交锋数招:火尖枪刺出被铜锤砸开,枪尖横扫被双锤上格,火星飞溅。 [Shot 5](8s-10s)中景,手持拍摄。哪吒枪尖格开敖丙压下的铜锤,借力迅速向后悬空滑退拉开身位,随即转身侧身奋力抬腿踢出脚下其中一只风火轮;风火轮脱脚而出拖着火焰尾迹如炮弹般朝敖丙飞去。 [Shot 6](10s-12s)轻微荷兰角,从中景快速拉开至全景。风火轮轰然击中敖丙胸口爆开一团火花与气浪;敖丙被冲击力打得向后倒飞坠入下方海面漩涡之中,激起冲天水花与浪柱。 [Shot 7](12s-15s)中景,荷兰角顶视角俯拍。镜头聚焦敖丙落海位置,海平面猛然翻涌水下传来沉闷轰鸣,巨浪滔天而起,一头银白色巨龙盛着滔天巨浪从海中破浪跃出,头部直冲镜头而来,巨龙在空中昂首张开大嘴发出震耳欲聋的吼叫,龙须飞扬水花四溅。 overall_soundscape: (海浪翻涌、高空风啸、漩涡水流旋转声、兵刃相撞金属脆响、风火轮火焰呼啸、水下沉闷轰鸣、龙吼、巨浪崩落声等具体音效描述) non_diegetic_music: (中国大鼓/堂鼓/琵琶/古筝/二胡/笛子编制,按Shot分段设计节奏,从压抑蓄势到锣鼓急急风到最终唢呐齐奏主题,完整配乐方案)这条提示词做对了什么
1. 风格锁定极其精准:retention_analysis里的风格不变量写了整整三行——“中国水墨与水粉手绘2D动画质感,传统矿物颜料色彩,大胆简洁轮廓,柔和手绘边缘扩散,略微模糊的绘画边缘,细腻水粉洇染质感,不完美的笔触轮廓,模拟动画电影颗粒,浓郁中国奇幻美学”。这不是在"建议"一种风格,而是在用九个具体的技术特征来定义风格。每一个形容词都对应一个视觉属性:"不完美的笔触轮廓"排除了CG级光滑渲染,"细腻水粉洇染质感"锁定了色彩过渡方式,"模拟动画电影颗粒"控制了画面噪点。
2. 空间分层意识:场景不变量里写了"空间分三层(海面/漩涡上空对峙空域/漫天乌云)"。这个分层描述帮助模型理解了画面的纵向空间结构,而不是把所有东西拍扁在一个平面上。
3. 动作设计有"武戏节奏":7个Shot的节奏是「大远景定场→中景亮相→全景冲刺交锋→中近景近战→中景拉开距离→全景远程命中→中景反转收尾」,这是一个经典的**“远-近-远-近-远”**的武戏镜头节奏。Shot 5的"踢出风火轮"是一个关键的"武器分离"设计——风火轮脱离哪吒独立飞行,给Shot 6的远程命中创造了空间,也让Shot 7的"巨龙从海中跃出"有了戏剧铺垫。
案例三:汽车广告 —— 4张参考图的商业片
这是参考图使用最复杂的一条。原始提示词定义了5张Picture,但API最多只支持4个图片节点,所以必须做取舍。
提示词中的Picture定义策略
原始提示词定义了5个Picture:
- Picture 1:车辆侧面夕阳剪影构图
- Picture 2:整车座舱空间
- Picture 3:驾驶舱方向盘
- Picture 4:外观主体
- Picture 5:外观主体(另一角度)
最终决策:保留Picture 4/5(外观)、Picture 2(座舱)、Picture 3(驾驶舱),放弃Picture 1(夕阳剪影)。理由是:车辆的外观造型和内饰细节是"硬性约束",必须靠图参考才能保持一致;而夕阳剪影只是"氛围参考",可以用文字描述替代。这个优先级判断——造型 > 空间 > 氛围——是参考图使用的核心原则。
关键提示词片段
subject_definitions: <Picture 1> 车辆侧面夕阳剪影构图、金色时刻光线和旅行氛围参考,不参考因逆光产生的深色车身颜色。 <Picture 2> 整车座舱空间、浅色座椅、三排座椅布局、全景天幕及内饰配色参考。 <Picture 3> 驾驶舱、方向盘、中控台材质与设计细节参考。 <Picture 4> 外观主体参考:严格保持车辆真实车型设计、车身比例、车头造型、车窗轮廓、悬浮式深色车顶、隐藏式门把手、轮毂以及白色/浅灰白车漆。 <Picture 5> 外观主体参考(另一角度)。 retention_analysis: 车辆不变量:理想i8车型、车身比例、车漆(白色/浅灰白)、轮毂、车窗、灯组与内饰全程保持一致,不改变车型。 风格不变量:高端新能源汽车商业广告,真实真人实拍摄影质感,年轻家庭lifestyle advertising,现代、温馨、轻快、清新而高级。 绝对禁止:字幕(除最后品牌文字外)、LOGO、水印。 detailed_description: [Shot 1](0s-3s)低机位前侧45度汽车英雄镜头。清晨晴朗的现代住宅社区,理想i8停在道路旁,阳光从建筑与树木之间洒下。镜头沿车头缓慢横向滑动并轻微推进,清晰掠过流畅的前舱盖、黑色前风挡区域、车身曲面与前轮。 [Shot 2](3s-6s)车辆侧面中广景。年轻母亲打开后排车门,孩子开心地率先坐进车内,父亲将旅行包轻松放入车中。摄影机沿车身从后向前平稳滑动。 [Shot 3](6s-9s)车内镜头。完整还原浅色豪华内饰座舱。阳光沿浅色方向盘边缘滑过,摄影机顺势向后缓慢移动,展示宽敞明亮的三排座舱与全景天幕。 [Shot 4](9s-12s)户外动态驾驶镜头。低位侧后方跟车摄影,摄影机与车辆保持相近速度,背景形成自然流动感。 [Shot 5](12s-15s)傍晚金色时刻。理想i8从画面一侧缓慢驶入并停下,远处天空呈柔和橙金色与淡粉色渐变,落日映在车窗与车身表面。结尾简洁出现品牌文字:「理想i8,家人的每一程,都值得期待。」商业广告提示词的特殊技巧
1. Picture 1 的"排除声明":“不参考因逆光产生的深色车身颜色”——这句话极其关键。逆光剪影图会让车身看起来是深色的,但理想i8的实车是白色/浅灰白。如果不写这个排除声明,模型可能会把车漆"学习"成深色。当参考图和实际需求有矛盾时,必须在提示词中显式声明"不参考什么"。
2. "车辆始终是主要视觉主体"的硬约束:人物(年轻父母+孩子)只是"生活氛围的组成部分"。如果不写这句话,模型可能会把人物拍得比车还大,变成"家庭vlog"而不是"汽车广告"。在商业广告类提示词中,明确告诉模型"谁是主角"是控制画面重心最直接的方式。
3. 镜头语言的专业化:“低机位前侧45度汽车英雄镜头”——“hero shot"是汽车广告的行话,“低位侧后方跟车摄影"对应的是"tracking shot”。使用专业影视术语而不是"从侧面拍”"跟着车拍"这种大白话,能显著提升模型对画面的理解准确度。
案例四:儿童房纸飞机 —— 一镜到底的创意融合
这条视频的概念最有趣:真实儿童房 + 二维手绘动画特效融合。MiniMax对这种"真实场景中浮现手绘动画"的概念执行得很有创意。
完整提示词原文
subject_definitions: <Picture 1> 儿童房场景环境参考:真实温馨儿童房,浅木色小书桌、蜡笔画纸、彩色积木、低矮儿童床、淡蓝色被子、云朵动物地毯、毛绒兔玩具、星月吊饰、布艺游戏帐篷。温暖晨光从窗户照入。 summary: 一段15秒真人实拍质感的儿童创意视频,融合二维手绘动画特效。严格采用5-6岁儿童第一人称视角。 retention_analysis: 场景不变量:儿童房布局、家具位置、光线角度保持稳定。纸飞机飞行轨迹连贯。 风格不变量:真人实拍写实儿童房 + 二维儿童手绘动画特效融合。手绘部分始终保持蜡笔、彩铅质感。 绝对禁止:字幕、画面文字、LOGO、水印。 detailed_description: [Shot 1](0s-3s)镜头看向儿童书桌,一架普通白纸折成的纸飞机静静躺在画纸上。孩子伸出小手轻轻碰它,纸飞机突然抖动,边缘浮现鹅黄、天蓝色蜡笔线,自行滑过桌面飞起。 [Shot 2](3s-6s)纸飞机穿过彩色积木,尾部拖出蜡笔彩线,积木表面浮现歪歪扭扭的手绘门窗和小旗。 [Shot 3](6s-10s)纸飞机掠过床边毛绒兔,飞机飞上床铺,淡蓝色被子表面出现柔软的手绘白云线条。 [Shot 4](10s-13s)纸飞机绕星星、月亮和星球吊饰飞行,几个吊饰之间浮现黄色星星、蓝色行星。 [Shot 5](13s-15s)纸飞机突然加速绕儿童房最后飞一圈,化成红黄蓝绿的二维蜡笔小星星,形成短暂的儿童涂鸦银河。孩子在房间中央张开双手,纸飞机摇摇晃晃落回掌心。温柔结束。 overall_soundscape: 纸张划过空气的沙沙声、袜子踩木地板和地毯声、积木轻碰、被子摩擦、吊饰碰撞、帐篷布料摩擦、孩子轻微喘息和开心惊呼。手绘特效仅加入极轻的蜡笔摩擦声、柔和"咻""啵"和小铃音。 non_diegetic_music: 无。这条提示词的独到之处
1. “严格采用5-6岁儿童第一人称视角”:这句话直接定义了摄影机的高度、运动方式和构图逻辑。模型会据此让镜头保持低机位、带手持晃动、偶尔看到孩子的手但不会出现完整正脸。一个视角约束就同时控制了机位、运动和构图三个维度。
2. 手绘特效的"依附原则":即梦提示词版本里有一句非常关键的话——"所有幻想必须依附真实儿童房物件,不切换到真正的森林、城市或宇宙。"这防止了模型"放飞自我"把场景切换成纯动画世界。在融合类提示词中,显式定义两种风格的边界在哪里、谁主导谁辅助,是避免风格崩溃的核心。
提示词质量对比:好与差的差距在哪里
通过这6条视频的对比,我总结出了几条判断提示词质量的标准:
1. 时间码的精确度
❌差的写法:“前半段全景,后半段近景,最后特写”
✅好的写法:“[Shot 1](0s-4s)全景,固定机位。」「[Shot 2](4s-7s)中近景,荷兰角,高机位俯拍。”
精确到秒的时间码让模型能理解每个镜头的时长权重。"前半段"可能是7.5秒,"后半段"也可能是7.5秒,但如果你想要的是一个3秒的定场+4.5秒的快速交锋,就必须写精确时间码。
2. 机位描述的专业度
❌差的写法:“拍车的侧面”“跟着车跑”“从上面拍”
✅好的写法:“低机位前侧45度汽车英雄镜头”“低位侧后方跟车摄影”“荷兰角顶视角俯拍”
专业影视术语(hero shot、tracking shot、Dutch angle、over-the-shoulder)比大白话的信息密度高得多。MiniMax的训练数据中必然包含大量影视专业内容,使用专业术语能更精准地激活相关的视觉模式。
3. retention_analysis 的颗粒度
❌差的写法:“角色保持一致,场景不变”
✅好的写法:“<Picture 1> 红衣皇妃(appears in [Shot 1-4]):fully_preserved - 红色丝绸服饰、步摇发簪、凶狠嫉妒表情全程保持一致。”
后者做到了三点:指定了哪个角色在哪些镜头出现、标记了fully_preserved表示全量保持、列出了需要保持的具体属性(服饰、发簪、表情)。这种颗粒度是角色一致性的根本保障。
4. detailed_description 的动作可拍摄性
❌差的写法:“两人在空中大战,打得非常激烈,最后哪吒赢了”
✅好的写法:“哪吒脚下风火轮火焰猛地喷涌,从左侧疾速冲刺到敖丙面前,火尖枪直刺而出;敖丙双锤交叉迎上,两件兵器当空相击。”
好的动作描述必须能被摄影机拍出来。"打得非常激烈"是一个抽象评价,摄影机不知道怎么拍;"从左侧疾速冲刺到面前,枪直刺而出,锤交叉迎上,当空相击"是一个具体的动作序列,每个动词都对应一个可拍摄的瞬间。
完整流水线:从提示词到视频
说完了提示词的重要性,简单回顾一下完整的技术流水线:
飞书表格读取提示词 → 角色分析 → 文生图(三视图/参考图) → 用户确认 → 图片上传 → 提交视频生成 → 轮询下载第一步:提示词反推资源
拿到一段结构化提示词后,首先要分析:这段视频需要几个角色?每个角色需要什么角度的参考图?场景是否需要独立参考?
原则很简单:提示词里定义了几个<Picture N>,就生成几张对应的参考图。参考图的质量直接决定最终视频的质量——一张好的角色三视图能让模型"认准"演员,一张差的参考图则会让角色在视频里"漂移"。
第二步:文生图生成参考图
用 Kolors 模型生成角色三视图。三视图提示词的关键词模板:
使用工作流为 Z-image text-to-image-文生图(完美支持中文字+超自然)【Agent必备】 下载https://www.runninghub.cn/ai-detail/2088920592350277634?inviteCode=oga1ahgc 角色名_人脸三视图,正面侧面背面三个角度特写,[外貌特征描述],白色背景,角色设计参考图第三步:用户确认(关键!)
生成完参考图后,一定要给用户看一眼再提交视频。参考图一旦提交视频生成,角色形象就会锁死。这一步看似多花了时间,实际上省去了大量返工成本。
第四步:图片上传 + 提交视频生成
将参考图上传到 RunningHub,获得fileName,然后与结构化提示词一起提交到 MiniMax 视频生成工作流。
核心参数对应:
nodeId=132→ 时长(必须与提示词一致,通常为15)nodeId=137/166/167/168→ 参考图(每张图一个独立节点)nodeId=138→ 完整的结构化提示词
使用工作流为 MiniMax H3稳定加速版(全能参考加速版本支持自定义音频)-支持5参考图版本 工作流地址https://www.runninghub.cn/ai-detail/2090774740146413570?inviteCode=oga1ahgc第五步:轮询等待(5-8分钟)+ 下载
每2分钟轮询一次任务状态,视频生成完成后下载结果。
未来计划
短期(1-2周)
- 提示词优化:基于今天的生成结果,回头优化几条效果不够理想的提示词,重点调整
retention_analysis和分镜描述的颗粒度 - 自动化流水线:把流程封装成一键脚本——读取飞书→自动分析角色→生成参考图→自动提交→下载→回写表格
中期(1个月)
- 批量扩展:从8条扩展到50-100条的规模,测试流水线的稳定性和一致性
- 音频集成:探索 TTS 配音 + BGM 自动匹配,让视频从"默片"升级为"有声片"
- 质量评估体系:建立评分卡(角色一致性、运镜流畅度、画面质量、音画同步),量化追踪每条视频的质量
长期
- 多模型对比:除 MiniMax 外,测试可灵、Pika、Sora 等模型在相同提示词下的表现差异
- 工作流产品化:把这套流水线包装成可复用的SaaS工具或API服务
- 探索更长时长:从15秒拓展到30秒、60秒
本文基于真实的视频生成实战经验,所有提示词均为原版即梦的提示词转换为minimaxh3专门的提示词风格。
关注gc随笔获得更多实际应用案例。
