
评测中,文心助手任务Agent超越Anthropic Claude Opus 4.8-fast、阿里千问Qwen3.7-max、Nemotron-3 Ultra、OpenAI GPT-5.6-luna等海内外主流大模型。 此次PinchBench v2榜单以148项真实企业自动化任务为核心测试标准,覆盖创意内容、写作、数据分析、研究知识、代码运维等多维场景。据榜单数据显示,文心助手任务Agent在创意内容、写作内容等多个赛道获得领先的评测认证,工具调用、多步骤任务自主规划与长程任务执行九游体育体育能力表现突出。此次评测流程,AI搜索团队以Orion Mission Mode的名称,在GitHub上开源。
据悉,文心助手任务Agent依托搜索二十余年技术积累与百度搜索猎户座AI引擎的多智能体框架能力,为智能体应用开发提供了自主可控、高性能的国产化底层模型底座。目前,该核心技术已全面应用于百度App及文心助手。

