先说清观众应该感到什么
主题、受众、时长、平台与情绪决定全部后续选择。没有作品定义,模型输出只会成为无方向的素材。
横屏和竖屏不是导出选项,它会改变人物位置、运动方向和字幕安全区。
不同类型决定事实密度、品牌露出、情绪强度与镜头平均时长。
AI 可以扩写与压缩,但不应替人决定事实立场和情感方向。
如果任何漂亮画面都能被保留,说明作品命题仍然不够清楚。
生成只负责产生候选画面。作品需要先定义叙事,再建立资产、分解镜头、选择模型、保持连续性,最后由剪辑把镜头重新组织成意义。
主题、受众、时长、平台与情绪决定全部后续选择。没有作品定义,模型输出只会成为无方向的素材。
横屏和竖屏不是导出选项,它会改变人物位置、运动方向和字幕安全区。
不同类型决定事实密度、品牌露出、情绪强度与镜头平均时长。
AI 可以扩写与压缩,但不应替人决定事实立场和情感方向。
如果任何漂亮画面都能被保留,说明作品命题仍然不够清楚。
保留人物目标、冲突、变化与关键意象;删掉无法在画面中成立的抽象说明。
先找“发生了什么变化”,再决定需要几个画面承载。
“孤独”可以表现为空旷空间、背向人群、缓慢动作与低照度,而不是直接写进生成指令。
一个镜头同时承担事实、人物、转场和情绪,通常会导致观看重点不明确。
模型擅长形成表达候选,不擅长承担事实责任。
人物外观、服装、道具、场景布局、光线方向和色彩基准先成为资产,镜头才能围绕同一个世界展开。
正面照不能解释侧脸、背影和全身比例。重要角色还要写明不可修改特征。
地标、商品与品牌物料有明确结构,完全依赖文生视频容易产生“像真的但并不存在”的混合物。
Seed 只影响随机起点,不能单独保证跨镜头人脸、服装、道具和空间关系。
静态图更便宜、更容易修改构图和结构错误;确认后再用图生视频赋予时间。
景别、机位、动作、环境、光线和衔接被写成镜头契约,减少模型自行补全造成的叙事漂移。
再补运镜、声音、连续性与生成方式,镜头才能被不同人员和工具共同理解。
转头、走路、推门、进屋拆成连续镜头,比一个镜头完成全部动作更稳定。
推近、环绕、航拍、拉远同时出现时,模型常用画面变形代替真实摄影机运动。
动作从哪里开始、以什么状态结束,决定它能否接上相邻镜头。
运动、风格、角色连续和精确控制需要不同技术路线。工具选择发生在镜头定义之后。
首尾帧适合转场和状态变化;V2V 适合保留真人表演、动作节奏和摄影机路径。
输入图已经回答画面是什么,指令应聚焦人物、环境、摄影机的变化和不可改变项。
保存模型版本、参考图、Prompt、Seed、比例、时长、日期、候选编号和问题记录。
偶尔最好看不等于生产力;真正比较的是稳定进入时间线的概率和人工修复时间。
人物、道具、空间方向、光线、动作起止和声音线索必须在镜头边界上对得上。
不要只看静止首帧,身份漂移往往发生在转身、遮挡和快速动作中。
看起来都很美的两个镜头,也可能无法组成同一个空间。
手的位置、身体朝向、速度和视线都是剪辑点上的连续性信息。
多出的手指、人物变脸、建筑坍塌和错误道具必须重生成或替换素材。
节奏、留白、转场、环境声、对白与音乐共同建立注意力。最后还要检查比例、字幕、响度和发布版本。
声音不是最后添加的附件;镜头时长、表演和剪辑点应尽早围绕声音设计。
不是所有问题都值得重新生成。叙事允许时,可以用更便宜的镜头解决。
同时检查人脸手脚、文字与 Logo、文化事实、肖像音乐字体授权,以及 AI 内容声明。
作品不仅要播放成功,还要保留素材来源、生成记录和可继续修订的工程文件。
AI 视频真正困难的地方,是把抽象意图逐层翻译成可控制对象。
不直接生成“孤独”,而是设计距离、空间、动作和光线。
人物和场景不再每个镜头重新解释,而是被重复引用。
剪辑选择、声音和节奏决定哪些素材最终拥有意义。