首页 > 教程攻略 > ai资讯 >MineExplorer - 美团推出的开放世界分钟级长程任务评测基准

MineExplorer - 美团推出的开放世界分钟级长程任务评测基准

来源:互联网 时间:2026-07-25 14:40:45

MineExplorer是什么

先说MineExplorer——这是美团LongCat团队推出的,一个基于Minecraft的开放世界分钟级长程任务评测基准。它包含了813个经过人工验证的任务实例,难度覆盖1到4跳。有意思的是,这些任务指令只给最终目标,隐藏了前置条件,也不枚举依赖图,模型必须自己推断出子任务才行。更关键的是,MineExplorer主动剥离了游戏专有知识,只测试通用的动态探索能力。配套的有一个五智能体协作数据合成框架,加上规则化的里程碑自动评测体系,代码和数据集已经全部开源了。

MineExplorer的主要功能

从功能设计来看,有几个点值得关注:

  • 分钟级开放世界评测

    :基于Minecraft实时3D沙盒,每个任务跑1800个环境步,模型必须根据动态画面持续调整策略,而不是靠静态截图作答。
  • 隐藏前置多跳任务

    :813个1-4跳人工验证实例,指令只给最终目标,隐藏了前置子任务,模型得自己推断依赖图——这才是真正的考验。
  • 知识解耦评测

    :主动剥离Minecraft专有机制,只保留那些依赖通用世界常识的任务,确保测的是通用能力。
  • 规则化自动评测

    :把子任务转化成可自动执行的里程碑检查器,实现无需人工标注的自动评分,复现性也更好。
  • 多智能体数据合成

    :五个Agent协作自动生成任务,涵盖任务选择、场景设计、里程碑设计、专家审查和验证全流程,效率提升明显。

MineExplorer的技术原理

技术层面,有几个核心设计:

  • 动态环境交互架构

    :评测环境是实时运行的物理沙盒,不是静态截图问答。模型每执行一个动作,世界状态就即时更新,模型必须基于最新观测持续决策。
  • 隐式DAG任务建模

    :每个复合任务定义为四元组τ=(q,s₀,Gτ,Mτ),Gτ是任务依赖图。关键设计在于指令q不枚举DAG中所有节点,智能体必须从环境中推断隐藏前置任务。
  • 多智能体协作造题流程

    :由orchestrator控制五个专业Agent(任务选择器、场景设计师、里程碑设计师、Minecraft专家、验证器)在群聊中协作,分初始化与辩论两阶段生成初稿并修订,相比单智能体有效率提升约30%。
  • 知识过滤机制

    :用LLM裁判对每个原子任务进行领域知识判断,区分通用世界常识与Minecraft专有机制,过滤掉依赖后者的高难度游戏专属任务。
  • ReAct能力拆解框架

    :借鉴ReAct范式,将开放世界探索能力系统拆解为感知、推理、行动三大维度,共14项细粒度指标。

如何使用MineExplorer

使用流程还算清晰,分几步走:

  • 环境准备

    :克隆GitHub仓库到本地,确保已安装Python 3.9+及Minecraft相关运行环境。
  • 启动评测环境

    :配置并启动Minecraft沙盒服务端,确保评测环境可以实时运行并接收模型动作指令。
  • 运行基准评测

    :加载MineExplorer提供的813个验证实例,将待测多模态模型接入环境,模型根据实时画面输出动作序列。
  • 自动评分

    :评测结束后,系统自动调用规则化里程碑检查器,依据背包物品、坐标区域等量化指标计算TSR与MSR得分。
  • 自定义任务生成

    :运行多智能体数据合成脚本,配置任务跳数,由五个协作Agent自动生成含隐藏前置条件的新任务实例。
  • 训练与迭代

    :将生成任务作为训练数据输入模型,在Minecraft沙盒中反复执行探索-反馈循环,提升开放世界长程规划能力。
  • 查看结果

    :评测报告自动输出各维度得分,支持按模型与难度分层对比。

MineExplorer的核心优势

相比现有方案,MineExplorer的优势很明显:

  • 首创分钟级开放世界评测

    :基于实时运行的Minecraft 3D沙盒,模型需在3分钟动态交互中持续决策。
  • 隐藏前置多跳任务

    :指令仅给最终目标,不枚举依赖图,迫使模型自主推断隐藏子任务。
  • 知识解耦设计

    :主动剥离Minecraft专有机制,保留通用世界常识任务。
  • 多智能体高效造题

    :五Agent协作生成任务,相比单智能体有效率提升约30%,支持1-12跳自定义扩展。
  • 规则化自动评测

    :将子任务转化为可自动执行的里程碑检查器,无需人工标注可量化评分,结果可复现。

MineExplorer的项目地址

  • GitHub仓库

    :https://github.com/meituan-longcat/MineExplorer
  • arXiv技术论文

    :https://arxiv.org/pdf/2605.30931

MineExplorer的同类竞品对比

跟MineDojo对比一下,差异就很清晰了:

评测目标

:MineExplorer测通用开放世界探索能力,剥离游戏专有知识;MineDojo测具身智能体在Minecraft中的任务完成与互联网知识利用能力。

任务设计

:MineExplorer是1-4跳隐藏前置多跳任务,指令不枚举依赖图,需要自主推断;MineDojo是数千个程序化与创意任务,指令明确给出目标与步骤。

知识来源

:MineExplorer仅依赖通用世界常识,主动过滤Minecraft Wiki机制;MineDojo深度整合YouTube视频、Wiki、Reddit等大规模游戏知识库。

数据合成

:MineExplorer是五智能体协作自动生成任务,有效率提升约30%;MineDojo基于互联网多模态数据自动构建任务与奖励函数。

评测方式

:MineExplorer是规则化里程碑自动检查器,覆盖感知/推理/行动14项指标;MineDojo程序化任务用模拟器状态判定,创意任务用MINECLIP视频模型评分。

开源侧重

:MineExplorer是评测基准+可扩展训练环境,支持1-12跳自定义任务;MineDojo是训练框架+评测套件,强调从互联网知识中学习可泛化技能。

MineExplorer的应用场景

应用场景其实挺广的:

  • 多模态大模型能力评测

    :为Claude、GPT、Gemini等顶级MLLM提供动态开放世界长程规划与推理的标准化考场。
  • Agent训练环境

    :作为Minecraft沙盒练兵场,支持模型在持续交互中提升感知-推理-行动闭环能力。
  • 模型选型参考

    :为工业界提供开放世界探索能力的横向对比leaderboard,辅助选型与能力边界评估。
  • 学术研究平台

    :推动长程推理、隐式任务分解、视觉grounding与行动对齐等前沿方向研究。
  • 具身智能预研验证

    :为机器人、自动驾驶等真实物理世界应用提供低成本的能力验证沙盒。