You need to agree to share your contact information to access this dataset

This repository is publicly accessible, but you have to accept the conditions to access its files and content.

Log in or Sign Up to review the conditions and access this dataset content.

MiniMax-H3-Reason

中文(默认) | English

517 条测试任务 · 4 个推理场景 · 图片、音频与视频输入 · 数据与工具独立发布

面向视频生成模型的多模态推理评测数据集。为每条任务生成视频,按 case ID 提交结果,通过 GitHub 工具使用具备图像理解能力的裁判模型评估,获得 ADR、VDR、AVIR 和 MSR 四个场景的任务成功率。

四个评测场景的真实输入示例

下载与评估 · 浏览任务清单 · 模型接入与自动评估 · 补充概览

真实输入示例

每个场景展示 6 条,共 24 条。 预览尺寸为 240 × 160 像素,保留原始宽高比。下方展示的是源输入素材,并非生成结果或评测成绩。动态预览为最多 6 秒的无声片段;可通过链接打开原始媒体。

ADR · 图片 + 音频

依据场景和提供的声音,生成合理的视频。

示例 示例 示例
ADR-001 · 发声
ADR-001 源输入
图片 · 音频
ADR-005 · 接触
ADR-005 源输入
图片 · 音频
ADR-007 · 机械
ADR-007 源输入
图片 · 音频
ADR-011 · 自然
ADR-011 源输入
图片 · 音频
ADR-015 · 警示
ADR-015 源输入
图片 · 音频
ADR-097 · 音乐
ADR-097 源输入
图片 · 音频

VDR · 视频前缀

预测并生成紧接源视频前缀之后的合理发展。

示例 示例 示例
VDR-001 · 人物
VDR-001 源输入
视频
VDR-003 · 卡通
VDR-003 源输入
视频
VDR-004 · 动物
VDR-004 源输入
视频
VDR-006 · 交通
VDR-006 源输入
视频
VDR-008 · 物理
VDR-008 源输入
视频
VDR-028 · 谜题
VDR-028 源输入
视频

AVIR · 视频 + 音频

遵循每条任务的 prompt:标注音视频矛盾,或预测接下来发生的事件。音频与源视频分别提供。

示例 示例 示例
AVIR-001 · 活动 · 矛盾标注
AVIR-001 源输入
视频 · 音频
AVIR-004 · 制作 · 矛盾标注
AVIR-004 源输入
视频 · 音频
AVIR-006 · 动物 · 矛盾标注
AVIR-006 源输入
视频 · 音频
AVIR-010 · 提示 · 矛盾标注
AVIR-010 源输入
视频 · 音频
AVIR-023 · 动画 · 未来预测
AVIR-023 源输入
视频 · 音频
AVIR-034 · 活动 · 未来预测
AVIR-034 源输入
视频 · 音频

MSR · 同步腕部相机视角

生成两个腕部相机视角中相互同步的操作视频。

示例 示例 示例
MSR-001 · 清洁
MSR-001 源输入
图片
MSR-003 · 倾倒
MSR-003 源输入
图片
MSR-007 · 穿线
MSR-007 源输入
图片
MSR-009 · 形变
MSR-009 源输入
图片
MSR-048 · 组装
MSR-048 源输入
图片
MSR-054 · 控制
MSR-054 源输入
图片

在 Dataset Viewer / Data Studio 中,选择 default 可查看标准的 517 条测试任务;选择 media_preview 可通过图片、音频和视频字段浏览同一批任务。未使用的模态为空。参考答案与提交模板均不在这两个浏览配置中。媒体浏览视图的 URL 指向本仓库 main 分支;本地评估仍使用原始相对路径和 SHA-256 哈希。

发布步骤及浏览器配置见 Hugging Face 指南(英文)。

下载与使用数据

本仓库仅发布数据、参考材料、数据说明和展示素材。模型适配、数据加载 SDK、提交校验和自动评分程序位于 GitHub:MiniMax-H3-Reason。

推荐方式:在 GitHub 项目中安装依赖,然后下载数据:

git clone https://github.com/gulucaptain/MiniMax-H3-Reason.git
cd MiniMax-H3-Reason
python3 -m pip install -r requirements.txt
python3 sdk/download_dataset.py

默认下载到 GitHub 项目的 datasets/MiniMax-H3-Reason/。下载工具将分支解析为具体提交 SHA,按该提交下载 data/ 和 media/,校验任务清单及参考文件哈希,并保存版本记录。后续模型接入、导入视频及评分步骤见 GitHub 使用说明。

也可只下载数据仓库:

python3 -m pip install -U huggingface_hub
hf download gulucaptain/MiniMax-H3-Reason \
  --repo-type dataset --local-dir MiniMax-H3-Reason-data

使用此方式下载后,在 GitHub 的导入或评估命令中指定 --dataset-root /path/to/MiniMax-H3-Reason-data。需要固定版本时添加 --revision COMMIT_SHA。公开数据下载不需要模型 API Key。

仅查看任务元信息可使用 Datasets 库(需另行安装 datasets):

from datasets import load_dataset

tasks = load_dataset("gulucaptain/MiniMax-H3-Reason", "default", split="test")
print(len(tasks))  # 517

此调用只加载任务清单,不会同时下载完整媒体和参考材料。

1. 数据集概览

场景 输入 任务 数量
ADR 首帧图片、音频、prompt 结合画面与声音生成合理视频 146
VDR 视频前缀、prompt 生成紧接前缀的合理续写 100
AVIR 源视频、独立音频、prompt 48 条矛盾标注、23 条未来预测 71
MSR 腕部相机左右并排首帧、prompt 生成同步的双视角操作视频 200
合计 517

包含 734 个源媒体文件,约 749 MB(十进制)。任务 prompt、参考结果和声音文字描述均为英文,原始媒体保持原样。中文 README 不改变数据语言。数据接口版本为 0.1.0。

2. 数据目录

dataset/
├── README.md                    # 默认中文数据卡
├── data/
│   ├── dataset.json             # 版本、数量、清单与参考文件哈希
│   ├── cases.jsonl              # 被测模型唯一任务输入清单
│   ├── assets.jsonl             # 源媒体哈希、大小及来源路径
│   ├── hub/                     # 供 Hub 浏览的媒体视图
│   └── evaluation/
│       ├── references.jsonl     # 参考结果,仅用于评估
│       └── audio_evidence.jsonl # 声音描述,仅用于评估
├── media/                       # ADR、VDR、AVIR、MSR 源媒体
├── docs/                        # 中英文数据卡及发布说明
└── assets/                      # 24 条紧凑预览及补充概览

模型推理仅使用 data/cases.jsonl 及其引用的源媒体。data/evaluation/ 应由评分程序读取,不得传给被测生成模型。

3. 数据字段与任务协议

data/cases.jsonl 为 UTF-8 JSONL,每行一条任务。四个场景的字段统一:

字段 含义
schema_version 接口版本 0.1.0
id 唯一 case ID
scenario、subcategory 场景及子类别
task 具体任务类型
prompt 模型须执行的英文任务文本
inputs 始终含 image、audio、video;未使用的模态为 null
output_spec 输出类型、允许布局、源音频保留要求及视角顺序

媒体对象有 path、sha256,音视频还包含 duration_s。路径相对于数据集根目录,而非 data/。duration_s=null 表示时长未核验,不表示零时长。

场景 / 子任务 task 允许的 layout
ADR audio_conditioned_generation full_video
VDR video_continuation continuation_only、with_prefix
AVIR 矛盾标注 audio_video_annotation annotated_full_video
AVIR 未来预测 audio_video_continuation continuation_only、with_prefix
MSR synchronized_dual_view_generation side_by_side

ADR 必须使用输入音频;preserve_source_audio=false 不允许忽略输入音频。VDR 与 AVIR 预测可仅输出续写,或输出前缀加续写;后一布局须明确续写起点。AVIR 标注保持源时间轴与音频,按 prompt 决定是否添加红圈;预测任务不因场景名为 AVIR 而添加红圈。MSR 左、右画面分别对应左、右腕部相机,两视角表示同一时刻的同一场景。

4. 参考材料、版本与评估

references.jsonl 包含每条任务的 plausible_outcomes,允许多种合理结果。audio_evidence.jsonl 包含声音描述与对应音频哈希,供裁判使用。参考材料与输入分开存放,以避免把答案提供给被测模型。

data/dataset.json 记录任务数量和任务清单、参考答案、声音描述的 SHA-256。data/assets.jsonl 记录源媒体哈希与大小。发布评测结果时,同时记录数据仓库提交、清单哈希、GitHub 代码版本、被测模型及裁判配置。

GitHub 自动评估工具输出四个场景的任务成功率 pass / n(n 包括未知、失败、不支持和跳过的任务),并报告覆盖率;AVIR 还分别报告两个子任务。评分权重、完整输出协议、错误处理和复现步骤见 工具使用说明。

5. 引用(Citation)

如在研究中使用本数据集或评估框架,请引用以下论文:

Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model。

@misc{zhao2026minimaxh3reason,
  title         = {Can MiniMax-H3 Reason About the Physical World? An Evaluation of Omni-Modal Generative Model},
  author        = {Haoyu Zhao and Zihao Zhao and Tianyu Deng and Ziqin Xu and Zihao Zhang and Xudong Wang and Jinxiang Guo and Chen Gao and Ziyi Ye and Yeying Jin and Jiaxi Gu and Zuxuan Wu and Shuicheng Yan},
  year          = {2026},
  eprint        = {2609.18323},
  archivePrefix = {arXiv},
  primaryClass  = {cs.CV},
  url           = {https://arxiv.org/abs/2609.18323}
}
Downloads last month
170

Paper for gulucaptain/MiniMax-H3-Reason