# MiniMax H3 提示词方言 只在目标档案明确写 `target_video_model: minimax-h3` 时使用。推荐档案: ```json { "target_video_model": "minimax-h3", "video_prompt_dialect": "minimax-h3", "video_prompt_language": "en", "native_duration_seconds": {"min": 4, "max": 15}, "supported_generation_modes": ["text", "first_frame", "first_last_frame", "reference"], "audio_generation": "same_pass" } ``` H3 的结构字段用英文;这不等于把中文对白翻成英文。每句中文对白保持原文并写成 `[Chinese] 逐字台词`,由稳定说话人 ID 引出。不要在对白前增加外语、语气词或未写入剧本的开场句。 点名 MiniMax H3 只选定模型与方言,不表示创作者选了文生视频。当镜头需要人物、场景、道具或起始构图一致性时, 先按主 Skill 完成真实图片发现与缺口列表。有任何必要图片仍缺失时,不因 H3 同时支持 Base 模式就默默改用文生视频。 ## Base / 首帧 / 首尾帧 文生视频、首帧和首尾帧使用三段结构: ```text integrated_multimodal_description: [Shot 1] ... overall_soundscape: ... non_diegetic_music: ... ``` - `integrated_multimodal_description` 按 `[Shot 1]`、`[Shot 2]` 写画面、动作、说话人、逐字对白和同步声音; 单镜也保留 `[Shot 1]`。第一镜不加切镜时间戳,后续切镜用 `[Shot 2] At 00:03.500, ...`,时间递增且落在本次生成时长内。 小样本观察到切点接近要求,但仍有偏差;交付要求精确时应检查实际切点并在剪辑中调整。 - `overall_soundscape` 汇总环境声、物理音效和非语言人声,不重复对白;对白事件留在上面的主时间线。 无非画内配乐时写 `non_diegetic_music: N/A`,不要留空让模型补乐——这一条有实测支撑,见 [无对白镜](#无对白镜)。 - 首帧模式从输入帧的可见姿态开始;首尾帧模式只能到达上游已接受终点,不发明过渡后的新状态。 ## 无对白镜 在 `overall_soundscape` 写清全镜的环境声、音效或静默。 **`craft_default`**:优先描述需要的声轨;必要时可以补「无对白」,不因用了否定句判错。 人物嘴部状态按实际表演写,不能把无对白一律改成全程闭嘴。 无非画内配乐时保留 `non_diegetic_music: N/A`。小样本中省略这一层出现过额外配乐, 显式写空可作为 H3 的默认写法,不保证所有生成都遵守。 时间线总结只列本镜实际存在的声音层,不照抄包含对白的模板。 ## 选哪一种模式 模式由本镜「输入参考图」里各槽位的 `用途` 决定,不由“想不想用多模态”决定: | 本镜绑定的图 | H3 模式 | 正文结构 | |---|---|---| | 没有图,且创作者已明确选择文生视频 | Base(文生) | 三段 | | 只有一张 `用途:起始帧` | `first_frame` | 三段 | | 一张 `用途:起始帧` + 一张 `用途:结束帧` | `first_last_frame` | 三段 | | 其他任何组合(起始帧与人物/地点/道具图同时存在,或只有人物/地点/道具图) | `reference`(full-reference) | 六段 | `REF-...` 和 `PLAN-...` 在这张表里同权:模式由 `用途` 组合决定,与图片此刻在不在项目里无关。 创作者在 H3 的网页界面里自己挂图时,正文照这张表写,`顺序` 就是他挂图的次序。 H3 官方另有只给尾帧、由模型推断开场的 L2VA 模式。本套件不使用它:开场由分镜已接受的起点决定, 把它交给模型推断会让 `SHOT-...` 的起点失去权威。因此 `结束帧` 只在同时绑定 `起始帧` 时出现。 第四行是最常见、也最容易写错的一种。H3 的首/尾帧输入与参考输入**互斥**,所以「起始帧 + 角色板 + 场景板」不能拆成 `first_frame` 加 `reference_image`:整组统一走 full-reference,起始帧也以 `reference_image` 送入,正文按下面的标签编号引用。用哪一种模式在《视频提示词.md》里由 `用途` 组合读出, 不写进「生成方式」字段——该字段仍只有「文生视频」和「图生视频」两个值。 ## Full-reference 任何 `reference_image`、`reference_video` 或 `reference_audio` 进入任务时,改用六段结构,段名和正文说明均用英文: ```text subject_definitions: ... summary: ... retention_analysis: ... detailed_description: [Shot 1] ... overall_soundscape: ... non_diegetic_music: ... ``` **这六段是一条提示词,一次整体提交。** 它们是同一个 `MOTION-...` 的可复制正文,从第一段到最后一段 一起放进那一次生成的提示词框,不是六次生成、也不是只提交第一段。三段结构的 Base / 首帧 / 首尾帧同理。 一镜一次生成,所以下一镜换成它自己那条完整正文。 ### 素材标签怎么编号 正文用 ``、`