
相比于单一LLM(大语言模型)只能支持多模态的输入和输出,Agent将输入和输出扩展到了
输入与输出的维度跃升使Agent能够在现实环境中自主思考,如人类专家一般执行复杂任务,解决Chatbot类人工智能无法解决的问题。这种“跳出对话框”的突破为人工智能在更广泛领域的创新应用打下了重要基础。
为使Agent掌握形如上述复杂操作的能力,研究人员和开发者已经创建了多个开源数据集,用于训练和评估Agent的能力。在本期分享中,我们为大家整理了当前领域内具有代表性的Agent开源数据集,覆盖从网页交互、软件工程等具体任务场景,到多步推理、动态规划、自我优化等核心认知能力维度。为更清晰地呈现不同数据集的评估侧重点,我们依据其核心评估目标与应用场景,将其划分为三大类别:基础能力评估、场景化交互评估与流程及多步骤任务评估。
基础能力评估旨在测试Agent的核心认知能力(如推理、规划、知识应用等),通常通过静态问题或任务进行,无需与外部环境交互。
简介:PlanBench是一个专为评估LLM在规划和推理方面的能力而设计的Benchmark。它基于自动规划社区中常用的域,特别是国际规划竞赛中使用的域,包含约26,250个提示,涵盖不同的测试用例和规划场景。数据集支持各种Blocksworld规划任务,并适用于自然语言和PDDL(规划领域定义语言)两种类型的提示。
简介:MSAgent-Bench是一个通用的、可定制的Agent框架,插件的训练数据集,包括598k的训练集和对应的验证集,测试集。数据集主要包括四种:AI模型API,通用API,API无关通用sft数据,API检索增强数据。
简介:KAgentBench包含超过3,000个人工编辑的自动化评估数据,用于测试Agent能力。KAgentBench的评估维度包括规划、工具使用、反思、总结和用户画像。
简介:Reflection-Bench是一个基于认知心理学设计的开源评测平台,旨在系统性地评估大型语言模型作为自主代理的能力。该基准围绕七个相互关联的认知维度展开:预测、决策、感知、记忆、反事实思维、信念更新和元反思。它提供七个参数化的认知评测任务,每个任务针对特定的认知过程设计,如异常检测、工作记忆、信念更新、决策制定等。评测系统设计了详细的评估流水线,能直观展示模型在不同认知维度上的能力表现。下图为七个认知维度的测评。
场景化交互评估着眼于在模拟或真实的特定应用场景中测试Agent的操作能力,需与动态环境(如网页、移动界面、工作流程)交互。
简介:WorkArena是一个Benchmark,通过一系列基于浏览器的任务来评估网络代理在执行日常知识工作任务中的表现。它包括两个部分:WorkArena-L1(包含33种基本任务的19,912个独立实例)和WorkArena++(682个任务,用于测试代理的规划、推理和记忆能力)。任务覆盖面广,包括企业内部知识库信息检索、复杂表单填写、服务目录操作、列表筛选、菜单导航及仪表盘数据解读等常见知识工作场景。
简介:tau-bench是一个现实世界领域中的工具-代理-用户交互Benchmark,包括retail和airline两个领域的任务,同时测试代理的工具调用能力 、对话理解能力 以及遵守复杂领域规则的可靠性。
简介:WebLINX 专注于会话式GUI agent,特别强调通过多轮对话进行真实世界的Web导航。WebLINX 提供了跨越155个线多个专家演示,创建了一个具有DOM树和屏幕截图的丰富环境,用于训练和评估能够执行动态、用户引导的导航任务的 agent。此数据集促进了 agent 在新网站和任务上的泛化,其中全面的动作和对话数据提供了关于增强 agent 在真实Web场景中响应能力的见解。
简介:MobileViews提供了来自20000个Android应用程序的600000多个屏幕截图-视图层次结构对。它使用LLM增强的应用程序遍历工具收集,为移九游体育平台动GUI agent 在屏幕摘要、可点击性预测和UI组件识别等任务中提供了高保线 ScreenAgent
:ScreenAgent 提供了一个全面的流程,使 agent 能够自主执行多步骤任务, 包括规划、行动和反思阶段。通过利用带注释的屏幕截图和详细的动作序列,它实现了 UI 元素定位和任务完成的高精度,在准确性方面超越了之前的模型。
:moss-moon-003-sft-plugin所使用的插件增强的多轮对话数据,包含支持搜索引擎、文生图、计算器、解方程等四个插件在内的多轮对话数据。MOSS所使用的多轮对话数据,覆盖有用性、忠实性、无害性三个层面,包含由text-davinci-003生成的约57万条英文对线万条中文对线. 流程与多步骤任务评估流程与多步骤任务评估专注于复杂流程执行、多步骤任务协调或多任务处理能力,可能结合部分环境交互。
简介:AgentBench是首个评估Agent的Benchmark,涵盖8个不同环境,包括新创建的领域(操作系统、数据库、知识图谱、数字卡牌游戏、横向思维谜题)和复杂任务(家庭管理、网上购物、网页浏览)。每个数据集提供Dev和Test两种拆分,支持多轮交互以测试模型的代理能力。框架结构友好,便于使用和扩展。
简介:FlowBench是第一个用于工作流引导代理规划的综合基准数据集。它涵盖了广泛的分类体系(6个领域、22个角色、51种场景)并支持不同的知识格式(文本、代码、流程图),以全面模拟真实世界应用。该基准通过三阶段流程构建:任务收集、工作流组织和会话生成。数据集支持单回合(turn-level)和会话级(session-level)评估,还包括专家级注释和多轮用户-代理互动。
5. 总结在本期Agent开源数据集分享中,我们整理了多个Agent开源数据集,涵盖网页操作、软件工程等多个任务和计划、多步推理、反思等多个核心能力。值得注意的是,相比LLM,由于Agent的数据具有跨模态、轮数多、绝对正确性弱等特点,故这些开源数据以BenchMark为主,且往往需要进一步提取与整合,才能得到格式化、标准化的Agent数据。未来,我们将致力于Agent数据的收集和构建,为Agent在各个领域落地提供数据支撑。

