前言LLM只能针对问题进行回答与分析?这种「隔靴搔痒」的体验也许就要被终结了最近微软推出了一项名为「大型行动模型」Large Aciton ModelLAM的创新技术标志着大模型从语言理解向实际执行任务的转变。与传统的LLM不同LAM不仅能理解用户的自然语言指令还能将这些指令转化为具体的行动步骤在软件环境中自主执行文档编辑、表格处理等任务。虽然这实际上并不是一个全新的概念但LAM是首款能够操作Microsoft Office来执行任务的模型。论文链接https://arxiv.org/pdf/2412.10047不同于GPT-4o等负责处理和生成文本的传统语言模型LAM可以将用户请求转化为实际操作。例如同样是给一个男人买夹克LLM只能给出文本步骤而LAM却可以直接像女朋友一样挑选款式并网购。哪个更加有实际效用这就自不必多说了。毕竟谁不想有个能直接替自己去解决一些生活琐碎的「分身」呢LAM能够理解用户通过文本、语音或图像等各种输入方式表达的需求并将这些需求转化为详细的逐步计划。执行过程中LAM能将复杂的任务分解为多个子任务根据实时情况调整其行动策略以应对执行过程中的意外情况。此外LAM还能自主探索与学习独立探索新的解决方案。让LLM行动起来LAM通常建立在LLM的基础上但是从LLM到LAM的过渡却并没那么容易如下图所示。从LLM到LAM的转变将LLM转化为功能性LAM的过程涉及多个复杂的阶段每个阶段都需要大量的努力与专业知识。首先需要利用LLM来处理用户数据集并生成对应的文本输出将任务分解为行动与相应的计划。经过微调之后接受了任务要求的LAM就能输出对应的文本格式的行动输出。最后将其输出反馈给智能体让其与环境不断地实时交互。如何开发LAM既然LAM能够为我们执行任务化为我们的「分身」来帮我们与世界互动那么如何开发与部署LAM就是一个关键的问题。LAM的训练过程包括以下关键步骤任务分解与规划模型首先学习将任务分解为逻辑步骤并生成详细的执行计划。行动生成与执行将用户意图转化为具体的行动指令包括图形用户界面操作、API调用等。动态调整与优化在执行过程中LAM能根据反馈调整其行动策略以提高成功率和效率。从奖励机制学习通过奖励机制进行微调训练进一步优化模型的性能。阶段1任务分解与规划在初始阶段模型将任务分解为逻辑步骤。研究人员以Mistral-7B作为基础模型收集了来自多个来源的76,672个任务-计划对( , )包括应用帮助文档、WikiHow和历史搜索查询。在此阶段不会生成具体的行动但模型获得了强大的规划能力为后续的动作执行提供了重要基础。阶段2行动生成与执行在此阶段作者引入了由GPT-4o标注的任务-动作轨迹让LAM向先进的AI模型GPT-4o学习。将学习到的任务规划转化为可执行的动作从GPT-4o的成功经验中汲取知识和策略更好地理解和处理复杂任务。本文中的示例应用是Microsoft Word在该环境下共收集了2,192个成功的专家轨迹。每个轨迹由一系列状态-动作对( , )组成。通过对这些成功的行动序列进行学习我们获得了LAM2。阶段3动态调整与优化之后我们让模型尝试解决GPT-4o失败的任务通过ReAct机制与环境进行交互。首先从GPT-4o失败的任务中采样2,284个任务并收集了LAM2生成的496个成功轨迹将这些数据与2,192个GPT-4o成功轨迹相结合形成了一个增强数据集。在这一阶段LAM会自主探索新的解决方案尝试解决那些曾难倒其他AI系统的问题拓展自身能力边界增强对不同任务和场景的适应性。阶段4从奖励机制中学习尽管模型在前述阶段有所改进但未能充分利用失败所带来的学习机会。因此论文引入了强化学习来解决这些问题。通过基于奖励的训练对系统进行微调根据模型执行任务的结果给予相应的奖励或惩罚引导模型不断优化行为策略以达到更好的效果。可以看到训练LAM的过程包括四个步骤首先模型学习如何将任务分解为逻辑步骤。其次通过先进的AI系统如GPT-4o学习如何将计划转化为具体行动。然后LAM会独立探索新的解决方案。最后通过奖励机制进行微调训练。表中总结了每个阶段使用的训练数据。LAM数据收集与构建众所周知数据是训练LLM的基石。类似地LAM在监督微调阶段也需要经过精心准备的以行动为导向的高质量数据。因此研究者采用了两阶段的数据收集任务-计划数据和任务-行动数据如下图所示。任务-计划数据在这一阶段研究者收集包含任务和对应计划的数据。任务是用自然语言表达的用户请求而计划是为完成这些任务而设计的详细步骤。例如「如何在Word中更改字体大小」会有一个对应的计划概述完成该任务所需的步骤。这些数据用于微调模型以生成有效的计划并提升其高层次的推理和规划能力。构建任务-计划数据的流程任务-行动数据在这一阶段任务-计划数据被转换为任务-行动数据包括任务、计划和执行这些计划所需的相应动作序列。任务和计划被细化为更具体且能够在特定环境中执行的内容。构建任务-行动数据的流程经过上述图中的4个处理步骤后最终生成的动作序列类似于select_text(texthello)或者是click(onButton(20), howleft, doubleFalse)也就是能够直接与环境交互的可执行指令。总的来说任务-计划数据旨在增强模型的高层次规划能力使其能够根据用户请求生成详细的逐步计划。而任务-行动数据则侧重于通过将每个计划步骤转化为具体、可执行的步骤或序列从而赋予模型执行这些计划的能力并能接受环境的实时反馈。数据收集和准备流程确保模型能够同时进行高层次规划和低层次行动执行从而弥合了LLM生成计划与能够采取可执行行动之间的差距。LAM的在线评估我们将训练完成的LAM集成到GUI智能体UFO中使模型预测的行动能够在Windows操作系统中有效执行并与环境进行交互。UFO智能体通过接受自然语言的用户请求并与Windows应用程序的UI控件进行互动完成具体任务。我们采用以下指标对 LAM 的性能进行全面评估1. 任务成功率Task Success Rate, TSR: 成功完成任务的数量占尝试总任务数量的百分比。任务完成时间: 从初始请求到最终动作完成的总时间。3. 任务完成步骤: 智能体成功完成每个任务所执行的总动作步骤数量。4. 平均步骤延迟: 每个动作步骤的平均耗时。LAM在Word测试环境中的成功率为71%而GPT-4o在无视觉信息输入的情况下成功率为63%。此外LAM的执行速度也更快每个任务仅需30秒而GPT-4o则需要86秒是LAM的2.8倍。实验结果突显了LAM作为仅使用文本的模型的优势使LAM成为实际应用中有效的解决方案。未来展望LAM的推出为办公自动化、复杂任务处理等领域带来了新的可能性。例如在Microsoft Office中LAM可以自动执行文档编辑、表格处理等任务极大地提高工作效率。此外LAM还有潜力在更多领域发挥重要作用。LAM展示了其发展潜力在商业化落地中仍然面临一些挑战例如控制机器人系统的LAM可能会误解指令并导致损害金融或医疗应用中如果执行错误动作可能带来严重的后果。然而研究人员相信LAM代表了AI发展的一次重要转变预示着AI助手将能更积极地协助人类完成实际任务。行动胜于言辞LAM的推出标志着人工智能从语言理解向任务执行的转变开启了AI自主的新时代。从生成语言到执行具体动作大模型将能在现实世界中产生直接影响这是迈向AGI的关键一步。未来随着技术的不断发展LAM将在更多领域发挥重要作用为我们的生活和工作带来更多便利和惊喜。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】