2026-06-30 · Video-MME-Logical
Video-MME-Logical:在动态世界中推理
为什么受控视频任务能够揭示综合视频基准容易掩盖的失败。
问题
模型可能在综合视频基准上表现良好,却主要依赖识别能力、语言先验或静态线索。Video-MME-Logical 提出一个更窄的问题:当场景随时间变化时,模型能否保持并操作其中的状态?
设计
该基准使用可控场景,并覆盖计数、遮挡、追踪、旋转与空间变换等任务族。在保持底层规则可检查的同时,可以系统地调节难度。
公开内容
公开仓库包含论文、数据集、评测代码、精简排行榜、代表性图表与复现指南。本笔记只总结这些材料,不额外引入超出公开资料的结论。