MineExplorer - 美团推出的开放世界分钟级长程任务评测基准
来源:互联网
时间:2026-07-25 14:40:45
MineExplorer是什么
先说MineExplorer——这是美团LongCat团队推出的,一个基于Minecraft的开放世界分钟级长程任务评测基准。它包含了813个经过人工验证的任务实例,难度覆盖1到4跳。有意思的是,这些任务指令只给最终目标,隐藏了前置条件,也不枚举依赖图,模型必须自己推断出子任务才行。更关键的是,MineExplorer主动剥离了游戏专有知识,只测试通用的动态探索能力。配套的有一个五智能体协作数据合成框架,加上规则化的里程碑自动评测体系,代码和数据集已经全部开源了。
MineExplorer的主要功能
从功能设计来看,有几个点值得关注:
- :基于Minecraft实时3D沙盒,每个任务跑1800个环境步,模型必须根据动态画面持续调整策略,而不是靠静态截图作答。
分钟级开放世界评测
- :813个1-4跳人工验证实例,指令只给最终目标,隐藏了前置子任务,模型得自己推断依赖图——这才是真正的考验。
隐藏前置多跳任务
- :主动剥离Minecraft专有机制,只保留那些依赖通用世界常识的任务,确保测的是通用能力。
知识解耦评测
- :把子任务转化成可自动执行的里程碑检查器,实现无需人工标注的自动评分,复现性也更好。
规则化自动评测
- :五个Agent协作自动生成任务,涵盖任务选择、场景设计、里程碑设计、专家审查和验证全流程,效率提升明显。
多智能体数据合成
MineExplorer的技术原理
技术层面,有几个核心设计:
- :评测环境是实时运行的物理沙盒,不是静态截图问答。模型每执行一个动作,世界状态就即时更新,模型必须基于最新观测持续决策。
动态环境交互架构
- :每个复合任务定义为四元组τ=(q,s₀,Gτ,Mτ),Gτ是任务依赖图。关键设计在于指令q不枚举DAG中所有节点,智能体必须从环境中推断隐藏前置任务。
隐式DAG任务建模
- :由orchestrator控制五个专业Agent(任务选择器、场景设计师、里程碑设计师、Minecraft专家、验证器)在群聊中协作,分初始化与辩论两阶段生成初稿并修订,相比单智能体有效率提升约30%。
多智能体协作造题流程
- :用LLM裁判对每个原子任务进行领域知识判断,区分通用世界常识与Minecraft专有机制,过滤掉依赖后者的高难度游戏专属任务。
知识过滤机制
- :借鉴ReAct范式,将开放世界探索能力系统拆解为感知、推理、行动三大维度,共14项细粒度指标。
ReAct能力拆解框架
如何使用MineExplorer
使用流程还算清晰,分几步走:
- :克隆GitHub仓库到本地,确保已安装Python 3.9+及Minecraft相关运行环境。
环境准备
- :配置并启动Minecraft沙盒服务端,确保评测环境可以实时运行并接收模型动作指令。
启动评测环境
- :加载MineExplorer提供的813个验证实例,将待测多模态模型接入环境,模型根据实时画面输出动作序列。
运行基准评测
- :评测结束后,系统自动调用规则化里程碑检查器,依据背包物品、坐标区域等量化指标计算TSR与MSR得分。
自动评分
- :运行多智能体数据合成脚本,配置任务跳数,由五个协作Agent自动生成含隐藏前置条件的新任务实例。
自定义任务生成
- :将生成任务作为训练数据输入模型,在Minecraft沙盒中反复执行探索-反馈循环,提升开放世界长程规划能力。
训练与迭代
- :评测报告自动输出各维度得分,支持按模型与难度分层对比。
查看结果
MineExplorer的核心优势
相比现有方案,MineExplorer的优势很明显:
- :基于实时运行的Minecraft 3D沙盒,模型需在3分钟动态交互中持续决策。
首创分钟级开放世界评测
- :指令仅给最终目标,不枚举依赖图,迫使模型自主推断隐藏子任务。
隐藏前置多跳任务
- :主动剥离Minecraft专有机制,保留通用世界常识任务。
知识解耦设计
- :五Agent协作生成任务,相比单智能体有效率提升约30%,支持1-12跳自定义扩展。
多智能体高效造题
- :将子任务转化为可自动执行的里程碑检查器,无需人工标注可量化评分,结果可复现。
规则化自动评测
MineExplorer的项目地址
- :https://github.com/meituan-longcat/MineExplorer
GitHub仓库
- :https://arxiv.org/pdf/2605.30931
arXiv技术论文
MineExplorer的同类竞品对比
跟MineDojo对比一下,差异就很清晰了:
评测目标
任务设计
知识来源
数据合成
评测方式
开源侧重
MineExplorer的应用场景
应用场景其实挺广的:
- :为Claude、GPT、Gemini等顶级MLLM提供动态开放世界长程规划与推理的标准化考场。
多模态大模型能力评测
- :作为Minecraft沙盒练兵场,支持模型在持续交互中提升感知-推理-行动闭环能力。
Agent训练环境
- :为工业界提供开放世界探索能力的横向对比leaderboard,辅助选型与能力边界评估。
模型选型参考
- :推动长程推理、隐式任务分解、视觉grounding与行动对齐等前沿方向研究。
学术研究平台
- :为机器人、自动驾驶等真实物理世界应用提供低成本的能力验证沙盒。
具身智能预研验证
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |