# MiniMax H3 提示词方言
只在目标档案明确写 `target_video_model: minimax-h3` 时使用。推荐档案:
```json
{
"target_video_model": "minimax-h3",
"video_prompt_dialect": "minimax-h3",
"video_prompt_language": "en",
"native_duration_seconds": {"min": 4, "max": 15},
"supported_generation_modes": ["text", "first_frame", "first_last_frame", "reference"],
"audio_generation": "same_pass"
}
```
H3 的结构字段用英文;这不等于把中文对白翻成英文。每句中文对白保持原文并写成
`[Chinese] 逐字台词`,由稳定说话人 ID 引出。不要在对白前增加外语、语气词或未写入剧本的开场句。
点名 MiniMax H3 只选定模型与方言,不表示创作者选了文生视频。当镜头需要人物、场景、道具或起始构图一致性时,
先按主 Skill 完成真实图片发现与缺口列表。有任何必要图片仍缺失时,不因 H3 同时支持 Base 模式就默默改用文生视频。
## Base / 首帧 / 首尾帧
文生视频、首帧和首尾帧使用三段结构:
```text
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
```
- `integrated_multimodal_description` 按 `[Shot 1]`、`[Shot 2]` 写画面、动作、说话人、逐字对白和同步声音;
单镜也保留 `[Shot 1]`。第一镜不加切镜时间戳,后续切镜用 `[Shot 2] At 00:03.500, ...`,时间递增且落在本次生成时长内。
小样本观察到切点接近要求,但仍有偏差;交付要求精确时应检查实际切点并在剪辑中调整。
- `overall_soundscape` 汇总环境声、物理音效和非语言人声,不重复对白;对白事件留在上面的主时间线。
无非画内配乐时写 `non_diegetic_music: N/A`,不要留空让模型补乐——这一条有实测支撑,见
[无对白镜](#无对白镜)。
- 首帧模式从输入帧的可见姿态开始;首尾帧模式只能到达上游已接受终点,不发明过渡后的新状态。
## 无对白镜
在 `overall_soundscape` 写清全镜的环境声、音效或静默。
**`craft_default`**:优先描述需要的声轨;必要时可以补「无对白」,不因用了否定句判错。
人物嘴部状态按实际表演写,不能把无对白一律改成全程闭嘴。
无非画内配乐时保留 `non_diegetic_music: N/A`。小样本中省略这一层出现过额外配乐,
显式写空可作为 H3 的默认写法,不保证所有生成都遵守。
时间线总结只列本镜实际存在的声音层,不照抄包含对白的模板。
## 选哪一种模式
模式由本镜「输入参考图」里各槽位的 `用途` 决定,不由“想不想用多模态”决定:
| 本镜绑定的图 | H3 模式 | 正文结构 |
|---|---|---|
| 没有图,且创作者已明确选择文生视频 | Base(文生) | 三段 |
| 只有一张 `用途:起始帧` | `first_frame` | 三段 |
| 一张 `用途:起始帧` + 一张 `用途:结束帧` | `first_last_frame` | 三段 |
| 其他任何组合(起始帧与人物/地点/道具图同时存在,或只有人物/地点/道具图) | `reference`(full-reference) | 六段 |
`REF-...` 和 `PLAN-...` 在这张表里同权:模式由 `用途` 组合决定,与图片此刻在不在项目里无关。
创作者在 H3 的网页界面里自己挂图时,正文照这张表写,`顺序` 就是他挂图的次序。
H3 官方另有只给尾帧、由模型推断开场的 L2VA 模式。本套件不使用它:开场由分镜已接受的起点决定,
把它交给模型推断会让 `SHOT-...` 的起点失去权威。因此 `结束帧` 只在同时绑定 `起始帧` 时出现。
第四行是最常见、也最容易写错的一种。H3 的首/尾帧输入与参考输入**互斥**,所以「起始帧 + 角色板 +
场景板」不能拆成 `first_frame` 加 `reference_image`:整组统一走 full-reference,起始帧也以
`reference_image` 送入,正文按下面的标签编号引用。用哪一种模式在《视频提示词.md》里由 `用途` 组合读出,
不写进「生成方式」字段——该字段仍只有「文生视频」和「图生视频」两个值。
## Full-reference
任何 `reference_image`、`reference_video` 或 `reference_audio` 进入任务时,改用六段结构,段名和正文说明均用英文:
```text
subject_definitions: ...
summary: ...
retention_analysis: ...
detailed_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
```
**这六段是一条提示词,一次整体提交。** 它们是同一个 `MOTION-...` 的可复制正文,从第一段到最后一段
一起放进那一次生成的提示词框,不是六次生成、也不是只提交第一段。三段结构的 Base / 首帧 / 首尾帧同理。
一镜一次生成,所以下一镜换成它自己那条完整正文。
### 素材标签怎么编号
正文用 ``、`