最全Agent开源数据集分享系列一

AI Agent测试数据集:MMLU,HumanEval,SRDD,CommonGen AI Agent测试数据集:MMLU,HumanEval,SRDD,CommonGen MMLU侧重于多领域知识理解,HumanEval聚焦代码生成,SRDD用于特定任务或领域评估,CommonGen专注文本生成,它们从不同维度对模型或多智能体系统进行评估。 阅读详情

1. Agent与Agent数据集

1.1 Agent的定义

Agent(智能体)指的是具有自主观察、思考、规划、反思、行为等能力的人工智能系统。

Agent的基本框架

1.2 Agent和LLM的区别

相比于单一LLM(大语言模型)只能支持多模态的输入和输出,Agent将输入和输出扩展到了多步的操作上,例如:

输入与输出的维度跃升使Agent能够在现实环境中自主思考,如人类专家一般执行复杂任务,解决Chatbot类人工智能无法解决的问题。这种“跳出对话框”的突破为人工智能在更广泛领域的创新应用打下了重要基础。

1.3 Agent数据集

为使Agent掌握形如上述复杂操作的能力,研究人员和开发者已经创建了多个开源数据集,用于训练和评估Agent的能力。在本期分享中,我们为大家整理了当前领域内具有代表性的Agent开源数据集,覆盖从网页交互、软件工程等具体任务场景,到多步推理、动态规划、自我优化等核心认知能力维度。为更清晰地呈现不同数据集的评估侧重点,我们依据其核心评估目标与应用场景,将其划分为三大类别:基础能力评估、场景化交互评估与流程及多步骤任务评估。

2. 基础能力评估

基础能力评估旨在测试Agent的核心认知能力(如推理、规划、知识应用等),通常通过静态问题或任务进行,无需与外部环境交互。

2.1 PlanBench

发布方:Karthik Valmeekam, Matthew Marquez, Alberto Olmo, Sarath Sreedharan, Subbarao Kambhampati

下载地址https://github.com/karthikv792/LLMs-Planning,数据集位于“plan-bench”子目录中

发布时间:2023.5

大小:约26,250个任务

简介:PlanBench是一个专为评估LLM在规划和推理方面的能力而设计的Benchmark。它基于自动规划社区中常用的域,特别是国际规划竞赛中使用的域,包含约26,250个提示,涵盖不同的测试用例和规划场景。数据集支持各种Blocksworld规划任务,并适用于自然语言和PDDL(规划领域定义语言)两种类型的提示。

 {
  "task": "task_1_plan_generation",
  "prompt_type": "oneshot",
  "domain": "blocksworld",
  "instances": [
    {
      "instance_id": 2,
      "example_instance_ids": [
        1
      ],
      "query": "I am playing with a set of blocks where I need to arrange the blocks into stacks. Here are the actions I can do\n\nPick up a block\nUnstack a block from on top of another block\nPut down a block\nStack a block on top of another block\n\nI have the following restrictions on my actions:\nI can only pick up or unstack one block at a time.\nI can only pick up or unstack a block if my hand is empty.\nI can only pick up a block if the block is on the table and the block is clear. A block is clear if the block has no other blocks on top of it and if the block is not picked up.\nI can only unstack a block from on top of another block if the block I am unstacking was really on top of the other block.\nI can only unstack a block from on top of another block if the block I am unstacking is clear.\nOnce I pick up or unstack a block, I am holding the block.\nI can only put down a block that I am holding.\nI can only stack a block on top of another block if I am holding the block being stacked.\nI can only stack a block on top of another block if the block onto which I am stacking the block is clear.\nOnce I put down or stack a block, my hand becomes empty.\nOnce you stack a block on top of a second block, the second block is no longer clear.\n\n[STATEMENT]\nAs initial conditions I have that, the red block is clear, the blue block is clear, the yellow block is clear, the hand is empty, the blue block is on top of the orange block, the red block is on the table, the orange block is on the table and the yellow block is on the table.\nMy goal is to have that the orange block is on top of the blue block.\n\nMy plan is as follows:\n\n[PLAN]\nunstack the blue block from on top of the orange block\nput down the blue block\npick up the orange block\nstack the orange block on top of the blue block\n[PLAN END]\n\n[STATEMENT]\nAs initial conditions I have that, the red block is clear, the yellow block is clear, the hand is empty, the red block is on top of the blue block, the yellow block is on top of the orange block, the blue block is on the table and the orange block is on the table.\nMy goal is to have that the orange block is on top of the red block.\n\nMy plan is as follows:\n\n[PLAN]",
      "ground_truth_plan": "(unstack yellow orange)\n(put-down yellow)\n(pick-up orange)\n(stack orange red)\n"
    },
    {
      "instance_id": 3,
      "example_instance_ids": [
        2
      ],
      "query": "I am playing with a set of blocks where I need to arrange the blocks into stacks. Here are the actions I can do\n\nPick up a block\nUnstack a block from on top of another block\nPut down a block\nStack a block on top of another block\n\nI have the following restrictions on my actions:\nI can only pick up or unstack one block at a time.\nI can only pick up or unstack a block if my hand is empty.\nI can only pick up a block if the block is on the table and the block is clear. A block is clear if the block has no other blocks on top of it and if the block is not picked up.\nI can only unstack a block from on top of another block if the block I am unstacking was really on top of the other block.\nI can only unstack a block from on top of another block if the block I am unstacking is clear.\nOnce I pick up or unstack a block, I am holding the block.\nI can only put down a block that I am holding.\nI can only stack a block on top of another block if I am holding the block being stacked.\nI can only stack a block on top of another block if the block onto which I am stacking the block is clear.\nOnce I put down or stack a block, my hand becomes empty.\nOnce you stack a block on top of a second block, the second block is no longer clear.\n\n[STATEMENT]\nAs initial conditions I have that, the red block is clear, the yellow block is clear, the hand is empty, the red block is on top of the blue block, the yellow block is on top of the orange block, the blue block is on the table and the orange block is on the table.\nMy goal is to have that the orange block is on top of the red block.\n\nMy plan is as follows:\n\n[PLAN]\nunstack the yellow block from on top of the orange block\nput down the yellow block\npick up the orange block\nstack the orange block on top of the red block\n[PLAN END]\n\n[STATEMENT]\nAs initial conditions I have that, the blue block is clear, the hand is empty, the blue block is on top of the orange block, the orange block is on top of the yellow block, the yellow block is on top of the red block and the red block is on the table.\nMy goal is to have that the red block is on top of the orange block and the yellow block is on top of the red block.\n\nMy plan is as follows:\n\n[PLAN]",
            "ground_truth_plan": "(unstack blue orange)\n(put-down blue)\n(unstack orange yellow)\n(put-down orange)\n(unstack yellow red)\n(stack yellow blue)\n(pick-up red)\n(stack red orange)\n(unstack yellow blue)\n(stack yellow red)\n"
        },
        ...
    ]
}

2.2 MSAgent-Bench

发布方:通义实验室

下载地址魔搭社区

发布时间:2024.9

大小:2.24GB文件,598k的训练集和对应的验证集,测试集。

简介:MSAgent-Bench是一个通用的、可定制的Agent框架,插件的训练数据集,包括598k的训练集和对应的验证集,测试集。数据集主要包括四种:AI模型API,通用API,API无关通用sft数据,API检索增强数据。

{
    "id":"modelscope_merge_api_527",
    "conversations":[
        {
            "from":"system",
            "value":"你是达摩院的ModelScopeGPT(魔搭助手),你是个大语言模型, 是2023年达摩院的工程师训练得到的。你有多种能力,可以通过插件集成魔搭社区的模型api来回复用户的问题,还能解答用户使用模型遇到的问题和模型知识相关问答。1. {\"plugin_name\": \"modelscope_text-ie\", \"plugin_owner\": \"ModelScopeGPT\", \"plugin_type\": \"default\", \"plugin_schema_for_model\": {\"name\": \"modelscope_text-ie\", \"description\": \"针对中文的文本,根据schema要抽取的内容,找出其中对应信息,并用json格式展示\", \"url\": \"http://109.199.101.10:1485/\", \"paths\": [{\"name\": \"modelscope_text-ie\", \"model_id\": \"/damo/nlp_structbert_siamese-uie_chinese-base\", \"method\": \"post\", \"description\": \"针对中文的文本,根据schema要抽取的内容,找出其中对应信息,并用json格式展示\", \"parameters\": [{\"name\": \"text\", \"description\": \"用户输入的文本\", \"required\": \"True\"}, {\"name\": \"schema\", \"description\": \"要抽取信息的json表示\", \"required\": \"True\"}]}]}}\n\n2. {\"plugin_name\": \"modelscope_text-ie\", \"plugin_owner\": \"ModelScopeGPT\", \"plugin_type\": \"default\", \"plugin_schema_for_model\": {\"name\": \"modelscope_text-ie\", \"description\": \"针对中文的文本,根据schema要抽取的内容,找出其中对应信息,并用json格式展示\", \"url\": \"http://9.32.64.200:5873/\", \"paths\": [{\"name\": \"modelscope_text-ie\", \"model_id\": \"/damo/nlp_structbert_siamese-uie_chinese-base\", \"method\": \"post\", \"description\": \"针对中文的文本,根据schema要抽取的内容,找出其中对应信息,并用json格式展示\", \"parameters\": [{\"name\": \"text\", \"description\": \"用户输入的文本\", \"required\": \"True\"}, {\"name\": \"schema\", \"description\": \"要抽取信息的json表示\", \"required\": \"True\"}]}]}}\n\n3. {\"plugin_name\": \"modelscope_text-ie\", \"plugin_owner\": \"ModelScopeGPT\", \"plugin_type\": \"default\", \"plugin_schema_for_model\": {\"name\": \"modelscope_text-ie\", \"description\": \"针对中文的文本,根据schema要抽取的内容,找出其中对应信息,并用json格式展示\", \"url\": \"http://54.149.78.185:3979/\", \"paths\": [{\"name\": \"modelscope_text-ie\", \"model_id\": \"/damo/nlp_structbert_siamese-uie_chinese-base\", \"method\": \"post\", \"description\": \"针对中文的文本,根据schema要抽取的内容,找出其中对应信息,并用json格式展示\", \"parameters\": [{\"name\": \"text\", \"description\": \"用户输入的文本\", \"required\": \"True\"}, {\"name\": \"schema\", \"description\": \"要抽取信息的json表示\", \"required\": \"True\"}]}]}}"
        },
        {
            "from":"user",
            "value":"按照给定的schema抽取出下面文本对应的信息\nschema:{\"人物\": null, \"地理位置\": null, \"组织机构\": null}\n近日,美国政府宣布将对中国1000多种商品加征关税,并威胁进一步加征关税。"
        },
        {
            "from":"assistant",
            "value":"<|startofthink|>```JSON\n{\"api_name\": \"modelscope_text-ie\", \"url\": \"http://9.32.64.200:5873/damo/nlp_structbert_siamese-uie_chinese-base\", \"parameters\": {\"text\": \"近日,美国政府宣布将对中国1000多种商品加征关税,并威胁进一步加征关税。\", \"schema\": \"{\\\"人物\\\": null, \\\"地理位置\\\": null, \\\"组织机构\\\": null}\"}}\n```<|endofthink|>\n\n<|startofexec|>```JSON\n{\"人物\": [], \"地理位置\": [\"中国\", \"美国\"], \"组织机构\": []}\n```<|endofexec|>\n信息抽取结果:{\"人物\": [], \"地理位置\": [\"中国\", \"美国\"], \"组织机构\": []}。我使用的模型是ModelScope的'damo/nlp_structbert_siamese-uie_chinese-base'模型。这是一个基于StructBERT预训练模型微调训练的通用信息抽取模型。"
        }
    ]
}

2.3 KAgentBench

发布方:KwaiKEG团队

下载地址https://hf-mirror.com/datasets/kwaikeg/KAgentBench

发布时间:2023.12

大小:超过3000条数据

简介:KAgentBench包含超过3,000个人工编辑的自动化评估数据,用于测试Agent能力。KAgentBench的评估维度包括规划、工具使用、反思、总结和用户画像。

Query:
我在一年前租了一套公寓,合同期为两年。但是现在房东要求我提前搬出,因为他想卖掉这套公寓。我不知道我该怎么办。

funcs:
[  ]

Type:
profile

golden_result_list:
[ { "thought": null, "tool_name": null, "tool_args": null, "golden_result": "明白了。首先,我们需要确定这个问题涉及的法律领域是租赁法。根据你所在国家或地区的租赁法规,租赁合同在双方同意的情况下具有法律约束力。请问你的租赁合同中有关于提前终止合同的条款吗?" }, { "thought": null, "tool_name": null, "tool_args": null, "golden_result": "根据你的描述,这个问题涉及到租赁合同和房地产法律。首先,我们需要查看你的租赁合同中关于提前终止合同的条款,以及你所在国家或地区的相关法律法规。这将有助于我们了解你的权益和房东的责任。" }, { "thought": null, "tool_name": null, "tool_args": null, "golden_result": "根据你的描述,这个问题涉及到租赁合同和房地产交易。首先,我们需要查阅你所在国家或地区的租赁法律法规,了解租赁合同的相关规定。同时,我们还需要了解房地产交易的相关法律法规,以便为你提供合适的建议。" }, { "thought": null, "tool_name": null, "tool_args": null, "golden_result": "根据你的描述,这个问题涉及到租赁合同和房地产交易。首先,我们需要查阅你所在国家或地区的房地产交易相关法律法规,以便为你提供准确的建议。" }, { "thought": null, "tool_name": null, "tool_args": null, "golden_result": "根据你的描述,这个问题涉及到租赁合同和房地产法律。首先,我们需要查看你的租赁合同中关于提前终止合同的条款,以及你所在国家或地区的相关法律法规,以便为你提供合适的建议。" } ]

prompt_input:
{
"AutoGPT": null,
"ToolLlama": null,
"ModelScope": null,
"KuaiAgent": null,
"prompt": "你需要扮演一名专业的法律顾问,你必须遵循参考对话流程中的一个步骤回答用户,但不能给出其他任何步骤的回答。\n\n参考对话流程:\n1. 收集提问者的法律问题,了解问题的背景和相关信息。\n2. 分析问题,确定问题涉及的法律领域和相关法律法规。\n3. 根据法律法规,为提问者提供合理的解决方案或建议。\n4. 如果问题涉及多个法律领域,为提问者提供综合性的解决方案。\n5. 提醒提问者在实际操作中遵循法律法规,如有需要可建议寻求专业律师的帮助。\n\n当前历史对话为:\nuser: 你好,我有一个关于租赁和房地产纠纷的问题,我需要你的帮助。\nyou: 你好,我很乐意帮助你。请详细描述一下你的问题,以及涉及的背景和相关信息。\n\n用户当前问题为:\n我在一年前租了一套公寓,合同期为两年。但是现在房东要求我提前搬出,因为他想卖掉这套公寓。我不知道我该怎么办。",
"ReACT": null,
"Kuaiagent": null
}

Memory:
user: 你好,我有一个关于租赁和房地产纠纷的问题,我需要你的帮助。
you: 你好,我很乐意帮助你。请详细描述一下你的问题,以及涉及的背景和相关信息。

2.4 Reflection-Bench

发布方:上海人工智能实验室等

下载地址https://github.com/AI45Lab/ReflectionBench

发布时间:2024.10

大小:共354个任务

简介:Reflection-Bench是一个基于认知心理学设计的开源评测平台,旨在系统性地评估大型语言模型作为自主代理的能力。该基准围绕七个相互关联的认知维度展开:预测、决策、感知、记忆、反事实思维、信念更新和元反思。它提供七个参数化的认知评测任务,每个任务针对特定的认知过程设计,如异常检测、工作记忆、信念更新、决策制定等。评测系统设计了详细的评估流水线,能直观展示模型在不同认知维度上的能力表现。下图为七个认知维度的测评。

3. 场景化交互评估

场景化交互评估着眼于在模拟或真实的特定应用场景中测试Agent的操作能力,需与动态环境(如网页、移动界面、工作流程)交互。

3.1 Workarena

发布方:ServiceNow

下载地址https://github.com/ServiceNow/WorkArena

发布时间:2023.7

大小:682个任务

简介:WorkArena是一个Benchmark,通过一系列基于浏览器的任务来评估网络代理在执行日常知识工作任务中的表现。它包括两个部分:WorkArena-L1(包含33种基本任务的19,912个独立实例)和WorkArena++(682个任务,用于测试代理的规划、推理和记忆能力)。任务覆盖面广,包括企业内部知识库信息检索、复杂表单填写、服务目录操作、列表筛选、菜单导航及仪表盘数据解读等常见知识工作场景。

无数据样例,通过搭建网页服务,并评测执行各类任务的效果
可复现并自行采集数据

3.2 tau-bench

发布方:Sierra Research团队

下载地址https://github.com/sierra-research/tau-bench

发布时间:2024.6

大小:共165个任务

简介:tau-bench是一个现实世界领域中的工具-代理-用户交互Benchmark,包括retail和airline两个领域的任务,同时测试代理的工具调用能力 、对话理解能力 以及遵守复杂领域规则的可靠性。

3.3 Weblinx

发布方:McGill-NLP团队

下载地址https://github.com/McGill-NLP/WebLINX

发布时间:2024.2

大小:2300多个任务

简介:WebLINX 专注于会话式GUI agent,特别强调通过多轮对话进行真实世界的Web导航。WebLINX 提供了跨越155个真实世界网站的2300多个专家演示,创建了一个具有DOM树和屏幕截图的丰富环境,用于训练和评估能够执行动态、用户引导的导航任务的 agent。此数据集促进了 agent 在新网站和任务上的泛化,其中全面的动作和对话数据提供了关于增强 agent 在真实Web场景中响应能力的见解。

 

3.4 MobileViews

发布方:北京邮电大学和清华大学等

下载地址https://huggingface.co/datasets/mllmTeam/MobileViews

发布时间:2024.9

大小:600000多个屏幕截图-视图层次结构对

简介:MobileViews提供了来自20000个Android应用程序的600000多个屏幕截图-视图层次结构对。它使用LLM增强的应用程序遍历工具收集,为移动GUI agent 在屏幕摘要、可点击性预测和UI组件识别等任务中提供了高保真资源。

3.5 ScreenAgent

发布方:吉林大学

下载地址https://github.com/niuzaisheng/ScreenAgent

发布时间:2024.2

大小:约200个截图-操作数据集

简介:ScreenAgent 提供了一个全面的流程,使 agent 能够自主执行多步骤任务, 包括规划、行动和反思阶段。通过利用带注释的屏幕截图和详细的动作序列,它实现了 UI 元素定位和任务完成的高精度,在准确性方面超越了之前的模型。

3.6 MOSS-pluginData

发布方:复旦大学MOSS团队

下载地址https://github.com/OpenLMLab/MOSS

发布时间:2023.7

大小:57万条英文对话和59万条中文对话数据

简介:moss-moon-003-sft-plugin所使用的插件增强的多轮对话数据,包含支持搜索引擎、文生图、计算器、解方程等四个插件在内的多轮对话数据。MOSS所使用的多轮对话数据,覆盖有用性、忠实性、无害性三个层面,包含由text-davinci-003生成的约57万条英文对话和59万条中文对话。

<|Human|>: 黑暗荣耀的主演有谁<eoh>
<|Inner Thoughts|>: 这是一个关于黑暗荣耀的问题,我需要查询一下黑暗荣耀的主演<eot>
<|Commands|>: Search("黑暗荣耀 主演")<eoc>
<|Results|>:
Search("黑暗荣耀 主演") =>
<|1|>: "《黑暗荣耀》是由Netflix制作,安吉镐执导,金恩淑编剧,宋慧乔、李到晛、林智妍、郑星一等主演的电视剧,于2022年12月30日在Netflix平台播出。该剧讲述了曾在高中时期 ..."
<|2|>: "演员Cast · 宋慧乔Hye-kyo Song 演员Actress (饰文东恩) 代表作: 一代宗师 黑暗荣耀 黑暗荣耀第二季 · 李到晛Do-hyun Lee 演员Actor/Actress (饰周汝正) 代表作: 黑暗荣耀 ..."
<|3|>: "《黑暗荣耀》是编剧金银淑与宋慧乔继《太阳的后裔》后二度合作的电视剧,故事描述梦想成为建筑师的文同珢(宋慧乔饰)在高中因被朴涎镇(林智妍饰)、全宰寯(朴成勋饰)等 ..."
<eor>
<|MOSS|>: 《黑暗荣耀》的主演包括宋慧乔、李到晛、林智妍、郑星一等人。<sup><|1|></sup><eom>

4. 流程与多步骤任务评估

流程与多步骤任务评估专注于复杂流程执行、多步骤任务协调或多任务处理能力,可能结合部分环境交互。

4.1 GAIA

  • 发布方:Meta 、 HuggingFace 和 AutoGPT等
  • 下载地址https://huggingface.co/gaia-benchmark
  • 发布时间:2023.11
  • 大小:450道带答案的题目
  • 简介:GAIA是一个GAI的Benchmark,GAIA囊括的真实世界问题需要推理、多模态处理、网页浏览和工具使用能力,下图中可以看出GAIA中问题对Agent能力种类需求、使用工具数量和操作步骤的分布。

GAIA Question:
The attached Excel file contains the sales of menu items for a local fast-food chain. What were the total sales that the chain made from food (not including drinks)? Express your answer in USD with two decimal  places. {
  
  {upload .xlsx}}

FINAL ANSWER: 
$89706.00

4.2 AgentBench

发布方:清华大学等

下载地址https://github.com/THUDM/AgentBench

发布时间:2023.10

大小:8类任务共1091个问题

简介:AgentBench是首个评估Agent的Benchmark,涵盖8个不同环境,包括

数据收集策略:为AI Agent打造高质量数据集 随着人工智能技术的飞速发展,高质量数据集的收集对于AI Agent的训练和应用至关重要。本文将深入探讨数据收集策略,包括数据收集的挑战、策略、质量评估与提升、工具与技术,以及实战案例分析。通过系统性地分析这些核心内容,本文旨在为读者提供套完整的数据收集指南,助力打造高质量的AI数据集。在当今的AI领域,数据是最宝贵的资源之。然而,数据的收集并非易事,特别是在保证数据质量和适用性的同时。 阅读详情

相关推荐

AI大模型探索之路-实战篇9:探究Agent智能数据分析平台的架构与功能

随着数据量的激增和业务复杂性的提升,企业和组织对高效、精准的数据分析工具的需求日益增强。智能数据分析平台因此应运而生,它结合了最新的人工智能技术,尤其是大型语言模型,来解析用户的自然语言查询,并实现这些查询到数据库操作的转换。这种创新不仅提升了数据分析的效率和准确性,还极大地改善了用户体验。本文将详细介绍这平台的架构设计、核心技术、以及实现方法。我们的目标是展示如何构建个功能强大、用户友好且高度可靠的数据分析工具,它将支持交互式数据探索和智能分析,适用于各种业务场景。

寻道AI,探索AI无限可能! 1万+

大模型Agent评测指南:数据分析与多轮工具交互,探索真正的智能!

本文系统梳理了大模型Agent领域的核心Benchmark数据集,聚焦数据分析与多轮对话/工具交互两大场景。数据分析类Benchmark以DataSciBench和DA-Code为代表,覆盖数据清洗、可视化、建模等全流程,采用TFC框架评估代码功能与输出质量;多轮对话类以InfoQuest和ToolBench为典型,前者测试隐藏上下文处理能力,后者基于16,464个真实API构建复杂工具调用场景。研究显示:当前大模型在涉及复杂文本+图表输出、多工具参数传递等严格准确性要求的场景仍需人工干预。未来需开发更贴近

m0_63171455的博客 2795

【图像超分】论文复现:新手入门必备!Pytorch实现SRGAN!手把手详细教程!代码注释详尽!可用于训练自己的数据集!实时验证模型性能!绘制PSNR曲线图!附训练好的各放大倍数的模型权重文件!

【图像超分】论文精读:SRResNet/SRGAN【图像超分】论文复现:万字长文!Pytorch实现SRResNet代码修改无报错!踩坑全记录!适合各种深度学习新手!帮助你少走弯路!附修改后的代码和PSNR最优的模型权重文件!请配合上述论文精读文章使用,效果更佳!与原论文描述不样的实现部分,也即可以修改的部分数据集使用:论文中是ImageNet随机选35000张图像,本文是VOC2012数据集16700张图像。数据集预处理:裁剪大小不同,论文是96×96,本文是88×88。

主要更新底层视觉(去噪、超分等)相关的科研内容,形式为【论文精读】+【论文复现】 6818

Agent综述】Agent在多模态交互的应用

这个工作收集了多模态游戏、机器人和医疗等领域的数据集,包括Minecraft视频数据、虚拟家庭环境数据和医疗图像数据。利用LLMs和VLMs作为智能体,特别是在游戏、机器人技术和医疗保健等领域 - 这篇论文提出了种新的Agent AI框架,通过结合大型基础模型、多模态理解和人类反馈,实现了在多模态环境中的有效感知和行动。研究表明,Agent AI系统在多模态任务中展现出巨大的潜力,特别是在游戏、机器人和医疗等领域。未来的研究可以进步探索如何通过持续学习和自我改进来提高Agent AI系统的性能和适应性。

发现问题,并解决问题,批判性思维 2683

7000长文:文读懂Agent,大模型的下

在深入理解思维链(Chain of Thought, CoT)之前,我们先来认识两个概念,即“语言智能”和“推理”。“语言智能”可以被看作是使用基于自然语言的概念去理解经验事物,并对概念间进行推理的能力。而“推理”更常被理解为根据已知前提推出新结论的过程,这通常涉及到多个步骤并形成了关键的“中间概念”,它们有助于解决复杂问题。当我们让大型模型对复杂问题进行分解,将其转换为步步可解决的子问题,大模型的性能得以显著提升。此时,这些推理的步骤便构成了我们所称的思维链 CoT。

python12345678_的博客 1618

最全大模型学习路径!微调、RAG、Agent网打尽

3个层次6个方向,学完怎么能不算大模型专家呢~😍🌟从基础到进阶,再到实际应用。希望这篇指南对你有所帮助,让你在大模型技术的道路上越走越远!后台私信回复“99”,领取高清大图、了解4大企业级Agent项目详情第层:大模型基础技术 🏠无论你是想进入哪个领域的大模型开发,第步都是选择个合适的大模型。这步非常关键,因为它直接影响到后续的所有工作。🤔🚀选择模型:【开源模型】如Hugging Face的Transformers库中的模型,适合需要高度定制和数据隐私保护的场景。

weixin_59191169的博客 1046

国内大模型+Agent应用案例精选,以及主流Agent框架开源项目推荐

Agent是以大模型为核心的智能体,通过与用户对话的形式,来完成各种任务,它很像个“人”。如果和人做类比,它应该具备以下能力:1.对话式Agent所有资料 ⚡️ ,朋友们如果有需要全套 《》,👉[CSDN大礼包(安全链接,放心点击)]()👈。

2401_84208172的博客 3130

1 2 3 4 5 最全大模型学习路径!微调、RAG、Agent网打尽

3个层次6个方向,学完怎么能不算大模型专家呢~😍🌟从基础到进阶,再到实际应用。希望这篇指南对你有所帮助,让你在大模型技术的道路上越走越远!

weixin_72959097的博客 986

【2025版】最全大模型学习路径!微调、RAG、Agent(非常详细)零基础入门到精通,收藏这篇就够了

最全大模型学习路径!微调、RAG、Agent网打尽 3个层次6个方向,学完怎么能不算大模型专家呢~😍🌟从基础到进阶,再到实际应用。希望这篇指南对你有所帮助,让你在大模型技术的道路上越走越远!后台私信回复“99”,领取高清大图、了解4大企业级Agent项目详情第层:大模型基础技术 🏠无论你是想进入哪个领域的大模型开发,第步都是选择个合适的大模型。这步非常关键,因为它直接影响到后续的所有工作。

leah126的博客 1582

2026 年 - AI 开发者必备:Agent 开源生态图谱

2026年AI开源项目全景概览 GitHub最新数据显示,AI领域呈现爆发式增长,Agent框架成为最热门赛道,AutoGPT以18.4万星位居榜首。个人AI助手OpenClaw以37.5万星成为现象级项目,RAG、推理部署等工具也蓬勃发展。Python仍是主导语言,微软、阿里等企业及开源社区贡献显著。技术趋势显示:多Agent协作、轻量化部署、结构化输出成为关键方向,AI正加速渗透编程、图像生成等各领域。

爱学习的程序员 904

资料分享丨2025年智能分析Agent白皮书(附58页文件下载)

报告指出,在全球数据量激增的背景下,传统决策方式效率低下,难以捕捉关键信息。大模型技术的发展,尤其是DeepSeek等低成本高性能智能体系的出现,为“普惠化智能应用”提供了技术实现路径。企业端聚焦于结构化数据的智能分析与非结构化数据的知识问答两大关键领域。 报告提出了MAGIC框架,涵盖AI Agent的五大关键能力:多模态环境感知、动态复杂推理、面向目标的行动规划、智能工具编排API和持续学习与迭代。通过这些能力,智能分析Agent能够实现从感知到执行再到进化的完整闭环,极大地拓展数据分析的深度与广

qq_46094651的博客 766

最全学习路径】大模型专家进阶:微调、RAG、Agent网打尽,3个层次6个方向全涵盖

🌟从基础到进阶,再到实际应用。希望这篇指南对你有所帮助,让你在大模型技术的道路上越走越远!领取高清大图、了解4大企业级Agent项目详情。

2401_84494441的博客 914

【大模型评测】Agent 评测规范、示例数据集、打分脚本

企业级大模型评测体系构建指南 摘要:本文提出了套完整的企业级大模型(LLM+Agent)评测体系,包含三层结构:能力层(语言/推理/代码/多模态)、行为层(稳定性/安全性)和业务层(任务成功率/成本)。重点介绍了Agent能力分级(0-5级)和评测指标,强调过程级链式裁判方法。提供可复用的Benchmark清单、评分脚本模板和JSON格式的示例数据集,覆盖单任务、多Agent协作等场景。评测体系突出企业需求,注重可解释性、抗PromptHack和防幻觉,为实际业务落地提供标准化评估框架。

xingyu1621@163.com 1638

Agent:大模型落地的新前沿,你可以不懂大模型,但定要知道agent

Agent种能够自主感知环境、做出决策并采取行动的智能实体。在大模型的加持下,Agent具备了更强的感知、理解和执行能力,能够在各种复杂环境中高效运作。

EnjoyEDU的博客 930

文图解Agent智能体:60张图、14个技术点回顾Agent的基本认知

要了解LLM agent是什么,首先来探索LLM的基本能力。传统上,LLM不过是个接个地进行下个token预测。通过连续采样许多token,可以模拟对话,并使用LLM对问题给出更详细的答案。然而,当继续“对话”时,任何给定的LLM都会展示出它的个主要缺点,它不记得对话。

m0_59235245的博客 1155

LLM之Agent(五)| AgentTuning:清华大学与智谱AI提出AgentTuning提高大语言模型Agent能力

给模型提供当前的指令和必要的信息。在ChatGPT带来了大模型的蓬勃发展,开源LLM层出不穷,虽然这些开源的LLM在各自任务中表现出色,但是在真实环境下作为AI Agent仍与商业模型的效果存在较大差距,比如ChatGPT和GPT-4等。收集到轨迹后,执行参考SQL语句并将结果与来自GPT-4的结果进行比较,过滤掉错误的答案,只收集正确的轨迹。考虑到现有的对话模型通常包括两个角色,用户和模型,ui表示来自用户的输入,ai表示来自的响应模型每个轨迹都有个最终奖励r∈[0,1],反映了任务的完成状态。

wshzd的博客 2114

商汤AI Agent把打工玩明白了

西风 发自 凹非寺量子位 | 公众号 QbitAI家人们,商汤国产大模型也能把工具用明白了!处理任务时,把要用的工具按顺序摆好都是小case。还能把任务拆成子任务,知道每个子任务要用啥工具。你没听错,为探究LLM的任务规划和工具使用能力,商汤最近为基于LLM的AI智能体量身打造了个框架。结果发现AI处理任务时,引入统工具-子任务生成策略,性能还能再次得到显著提高。网友直接被惊掉下巴:自然语...

量子位 412

C语言实现惯性导航初始对准全部核心代码

惯性导航初始对准包括间接粗对准和卡尔曼滤波精对准,其中。为基于卡尔曼滤波的精对准,其中。

十八与她的博客 2254

Windows Management Framework 5.1

Windows Management Framework 5.1 includes updates to Windows PowerShell, Windows PowerShell Desired State Configuration (DSC), Windows Remote Management (WinRM), Windows Management Instrumentation (WMI). Release notes: https://go.microsoft.com/fwlink/?linkid=839460

上一篇: 模型评测新范式:多源文档解析创新评测框架OmniDocBench
下一篇: 突破知识传统依赖:模型内在推理能力评估的基准测试集 KOR-Bench
整数智能
博客等级 码龄2年 208粉丝 19原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值