前言为了解放生产力人们发明了算法去控制、代替重复劳动的工作。随着大语言模型LLM的发展人们不再偏好局限性的算法而利用 LLM 的思考规划能力并为其赋予可以格式化调用的工具如 api进一步的满足人们不同的需求。同时外部工具的引入更加先进的 Prompt Engineering 技术RAG、KAG 等外部信息库的补充也进一步增强了 LLM 能力。本文尝试从 Single Agent以 Camel-ai.org 为代表的一系列 multi-agents 框架Agents Universe 的构建与统一化协议AI for science、Applications 分析与介绍。1、What is agent?什么是智能体在强化学习中通常把智能体看做是一个决策实体在环境中采取行动并通过与环境的交互来学习如何最大化其长期回报的实体。在应用层面我们将大语言模型接入各种应用 api引入知识图谱 RAG、思维链 CoT 等技术让 LLM 不仅有预训练的丰富知识还可以利用各种工具完成更具体的、更丰富的任务成为一个能力更加强悍的智能体。智能体通常由三个部分组成Planing ReasoningMemoryTool use Action1Planing看作是对问题进行一个总体的规划通过提示词让 LLM 思考该如何回答这个询问或完成这个问题。比如 LLM 尝试规划一条 Step by step 的解决问题路径或是将主任务分解几个小任务接下来再这个一个一个解决问题。通常有如下四种方案将复杂任务分解为多个子任务然后逐一规划解决每个子任务。生成多个备选计划并通过某种搜索算法选择最优计划执行通过LLM形式化任务然后使用外部规划器来生成计划。先生成计划然后进行反思最后根据反思结果精炼计划。2ReasoningLLM 需要对过去的行为进行自我批评和反思从错误中吸取教训并为未来的步骤进行改进加入反思会显著提高 LLM 的回答质量。关于 LLM 推理可以参考 Lilian Weng 的博客和 Prompt Engineering Guide 网站。基础的 Chain of Thoughts 链状推理在大部分场景足够使用。最近也看到很多有意思的研究快慢思维协调的 Talker-Reasoner 系统talker 快速反应 reasoner 深度思考二者即可分开工作也可协同反应慢思考在面部识别、有存在异常干扰的数据分类任务上表现不如快思考逆向规划类似于传统搜索算法中的A*算法不仅有前向的思维链思考还有从目标逆向的思考思维马尔可夫链 MCoT与传统的多步推理不同MCoT 将每一步推理视为一个状态转换过程并且在简化问题后清除上下文缓存从而支持更长的推理路径Stream of Search (SoS)通过 CoT 生成的包含正确答案和错误尝试的数据对 LLM 微调让其学习搜索与回溯的能力动态推理 DOTS给定一些推理策略让 LLM 能够根据问题的具体特征和自身的能力让自己选择最优的推理策略一个有趣的观点从信息论角度来理解 CoT 的作用其实关于 LLM 推理的问题其实可以建模成熟悉的数据结构链也好CoT树也好ToT图也罢GoT结合传统数据结构的搜索回溯算法去进行推理路径的选择。或是建模成优化问题关注 Explore 和 Explicit或许与快慢思考有一定对照关系去探索尝试。除了 prompt 设计外越来越多的是在RL偏好对齐或者 SFT 层直接对思维链数据进行训练锻炼模型的思考能力。3Memory人类的记忆可大致分类为感官记忆、短期记忆、长期记忆与之对应为大模型的多模态输入时的原始嵌入表示对话交互以及在外部储存的对话中提取的信息。前二者是模型本身架构的限制通常在 128k 上下文长度最多 8k 的生成内容。为了有效增强与 LLM 对话的准确性和丰富性引入可以视为长期记忆的外部知识检索库如 RAG 技术。关于知识检索与计算机系统的文件系统、数据库检索有一定的相似性。4Tool Use Action通过 Json 格式化输出调用所需要使用的 api 接口或是其他资源工具让 LLM 不止停留在说而可以做。同样每一次工具调用得到反馈我们也可以进行一次反思总结。同时每一次 action 都随着反馈进行 reasoning 和优化 LLM 下一步的决策如 StepTool为每一步工具调用涉及奖励进行分布强化学习每一步后进行选择优化。因为 LLM我们现在可以使用自然语言去操控一个个软件进一步的还可以操控其他智能体/模型。1. 最基础的操控类似于 Google Search apiDeepL(一个翻译软件) api 等等。一个有趣的例子是让 LLM 帮你订一张机票其中通过对网页 html 代码的交互进行本文的思路是将整个订机票的流程拆解成一次次 html 的查找与虚拟的鼠标点击对于每次给定 item 的点击操作在 html 源码中查找 k 个大概率与之此 item 相关的指令再选出最可能的执行操作。在上图中左侧即是目前已经执行的操作序列、对任务的描述和目前所在网页的html源码右下角即是选出来的k个最可能指令.2. LLM control LLM/Agent。如 HuggingGPT 框架用 LLM 作为任务规划器根据 Planing 结果选择 HuggingFace 平台中可用的模型并根据执行结果总结。3. 日前爆火的 Claude 新功能 computer use 和智谱的 AutoGLM 与传统的 api 交互有所不同其通过 VLM(视觉语言模型)操控如下是一个自动导航的例子有趣的是斯坦佛 Yang Diyi 老师等发现了弹窗攻击对 VLM 决策的干扰极大并且要求 Agent 忽略弹窗或包含广告提示等基本防御技术对攻击无效。Profile(optional)有时有 Role playing 角色扮演任务的需求需要对 agent 添加角色资料的描述。这将在后面 AIsociety science 的讨论提到。出于不同的需要我们可以大致将 Agent 分为如下几类Agent 的研究是具有潜力的我认为其是学术和工业应用 gap 最小的方向。国内如扣子等平台每个人都可以定制搭建自己的 Agent又或者通过 cameldspylangchain 等成熟的库编写代码搭建。2、About multi-agents基于单智能体的思维局限性长思维链条任务的表现不佳等因素人们又尝试探索多智能体 multi-agents 之间的合作是否会带来更好的任务表现。具体的讲多智能体相对于单智能体能够提升回答的准确性与一致性可以有效减少LLM的幻觉问题。多智能体系统可以将任务分段从而可以处理更加复杂的任务同时可以容纳更长的上下文长度清华 NLP 实验室的 MiniCPM 3.0 无限上下文的方案后问详细介绍同时可以并行处理任务。通过角色扮演不同的智能体可以带来不同的视角使得任务回答更加全面完善。多智能体间也可以通过协作结合不同模型的优势解决问题。如下图单个智能体的思维链无论是 Chain of Thought(CoT) 还是 Tree of Thought(ToT)我们将每一个 step 替换成一个 LLM 来做每个 LLM 专注于自己的子任务只负责一个小的 step。又或者是参照常见任务中人类合作的模式搭建 Agent 工作流 workflow。由清华 NLP 组开发的 ChatDev模拟软件开发的工作流程项目经理明确需求工程师编写具体代码进行检查和测试从而提高所生成代码的一致性完成度和质量。模拟生化实验室中的配置博士生-导师架构动态加入科研助理本科生实验实习助理以设计科学实验。By PKU-HMI Lab关于 Teacher-student 框架除了传统的多智能体协作外可以讨论的话题还有知识蒸馏 Knowledge Distillation用大模型去训练小模型从而逐渐的减少学生老师间的通信对齐学生和老师在该任务下的能力如老师为 GPT-4学生为 GPT-3.5。常见的知识蒸馏通常在监督微调SFT与强化学习微调RL层微调近年来也有不少 In-context learningICL与之相似的通过对话讨论也有一定的蒸馏效果。关于知识蒸馏更多的讨论可参加下图原文多智能体与单智能体的研究类似主要聚焦于多智能体之间的通信Planing Reasoning,架构Memory和外部工具使用Tool use Action。关于多智能体框架目前主流的有 Camel-AICrewAILangGraph皆为较活跃的维护社区Openai 的 SwarmmetaGPT微软的 AutoGenMagentic-One。这里向大家介绍 Camel AI 框架也是最早提出并且持续更新维护的多智能体系统。构建一套多智能体合作解决问题的机制最重要的就是多智能体之间的通讯。3、applications: AI Society Science基于大语言模型的快速迭代和智能体的发展其在各个领域都有了极为广泛的应用。Agent-as-a-Judge: Evaluate Agents with AgentsFrom Persona to Personalization: A Survey on Role-Playing Language AgentsFrom Persona to Personalization: A Survey on Role-Playing Language AgentsExchange-of-Thought: Enhancing Large Language Model Capabilitiesthrough Cross-Model CommunicationExchange-of-Thought: Enhancing Large Language Model Capabilitiesthrough Cross-Model CommunicationThe Oscars of AI Theater: A Survey on Role-Playing with LanguageThe Oscars of AI Theater: A Survey on Role-Playing with LanguageTWO HEADS ARE BETTER THAN ONE: A MULTIAGENT SYSTEM HAS THE POTENTIAL TO IMPROVESCIENTIFIC IDEA GENERATION适当的团队规模和讨论轮数能够显著提升创新性。过大的团队规模或过多的讨论轮次可能导致协调困难和创意枯竭从而降低创新性表现。同时团队成员之间存在首次合作的人数比例在 50 %时团队的创新性达到最高这表明在新旧成员合理混合的情况下团队不仅能发挥已有的协作默契还能在多样化的视角中产生更多新颖想法。PROAGENT: FROM ROBOTIC PROCESS AUTOMATIONTO AGENTIC PROCESS AUTOMATIONUsing Large Language Models forHyperparameter OptimizationAFLOW: AUTOMATING AGENTIC WORKFLOW GENERATIONAFLOW: AUTOMATING AGENTIC WORKFLOW GENERATIONAFLOW: AUTOMATING AGENTIC WORKFLOW GENERATION多是 SFT 和 RL 阶段近些年有了一些 In-context-learning。AGENTVERSE: FACILITATING MULTI-AGENT COLLABORATION AND EXPLORING EMERGENT BEHAVIORS其中三个智能体的合作方式有 Vertical Structure 和 Horizontal Structure 两种。AGENTVERSE: FACILITATING MULTI-AGENT COLLABORATION AND EXPLORING EMERGENT BEHAVIORSCamel-ai.orgCamel-ai.org最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】