文档教程知识库【免费下载链接】developer-roadmapInteractive roadmaps, guides and other educational content to help developers grow in their careers.项目地址https://gitcode.com/GitHub_Trending/de/developer-roadmap点击查看免费下载导读本指南围绕 developer-roadmap 的 AI Agents 学习路线图 中 LangSmith 这一核心观测与评估主题展开系统讲解如何利用 LangSmith 对 LLM 应用与 Agent 的每一次运行进行逐步追踪Tracing、在开发阶段构建评估数据集并运行自动化测试以及在生产环境中通过仪表盘监控成本与延迟。读完本文你将掌握 LangSmith 从调试到测试再到监控的完整使用路径并理解它与 LangChain、LangGraph 的搭配方式以及脱离框架独立使用的方法。LangSmith 是什么面向 Agent 的可观测性与评估平台在 AI Agents 学习路线图中LangSmith 被定位为调试、测试、监控 LLM 应用包括 Agent的专门平台。其核心价值在于三个互补的能力面调试Debugging通过追踪Tracing记录一次运行的每一个步骤包括输入、输出与中间推理过程测试Testing支持构建评估数据集并针对数据集运行自动化测试以衡量质量随时间的变化监控Monitoring在生产环境通过仪表盘跟踪成本与延迟等运行指标。LangSmith 由 LangChain 团队构建与 LangChain 和 LangGraph 应用搭配最为常见但它可以脱离这些框架独立使用即不依赖 LangChain 的代码同样可以被追踪与评估。路线图中另一份 LangSmith 主题文档对此做了更直观的补充LangSmith 是一个Web 工具它记录 Agent 对语言模型的每一次调用、所使用的输入以及得到的回答帮助开发者看清并修复 AI Agent 正在做什么。因此它的本质是把 Agent 内部不可见的推理过程转化为可检索、可回放、可量化的记录。逐步追踪Tracing看清 Agent 每一步在做什么追踪记录什么LangSmith 的核心机制是 Tracing即对一次 run运行的每个步骤进行记录。结合路线图中 结构化日志与追踪 主题的定义可以更好地理解这一点结构化日志以一致的、机器可读的格式记录 Agent 的执行过程比如调用了哪个工具、使用了什么参数、每一步耗时多久追踪Tracing把这些零散的日志条目串联成一次完整运行的全貌。对于多步骤 Agent多智能体、工具调用、反思循环等来说这种全貌视图是调试复杂行为的关键。LangSmith 在这一层面提供的具体能力包括能力说明记录每次 LLM 调用记录 Agent 对模型的每一次请求、输入与返回结果记录输入/输出/中间推理在每个步骤层面保存输入、输出以及中间的推理过程逐步回放可以对任意一个步骤进行回放replay还原当时的状态标记与检索为运行打上标签tag便于快速搜索定位为什么 Agent 尤其依赖追踪Agent 与普通单轮 LLM 调用不同它包含工具调用、循环、条件分支与多步推理任何一个环节出错都会导致最终结果错误。追踪的价值就在于把哪一步出了问题变成可定位的事实而不是靠猜测。LangSmith 正是为此设计的每一步的输入、输出与中间推理都被记录下来开发者可以沿着轨迹逐层排查。调试回放步骤、对比提示词、定位错误回放任意步骤LangSmith 允许开发者回放replay任意一个步骤这在排查 Agent 行为时非常实用。当一次运行结果异常时可以打开该次运行的追踪视图定位到异常步骤查看其输入与输出回放该步骤验证相同输入是否稳定复现问题。对比不同提示词版本由于每次运行都会记录完整的输入输出开发者可以在相同输入下运行不同版本的提示词并通过追踪结果直接对比它们的行为差异。这实际上是用真实运行记录做实验比离线猜测提示词效果更加可靠。度量与检索LangSmith 还能测量并展示成本cost、速度speed与错误率error rate并为运行打上标签tag以便快速检索。当需要排查某类请求的共性问题时通过标签筛选即可精准定位到相关运行记录。评估构建数据集自动化测试质量随时间的变化评估数据集与自动化测试LangSmith 的第二个核心能力是评估Evaluation。它支持存储测试集test sets把一批输入-期望输出对保存下来作为回归测试的基准运行快速检查quick checks在数据集上自动运行评估判断新代码是否让 Agent 变差衡量质量随时间的变化通过多次运行评估结果观察质量指标在版本迭代中的走势。结合路线图中 要跟踪的指标 主题可知评估时可以选择正确性类指标准确率、精确率、召回率、F1、排序类指标如 mean average precision、ROC-AUC、体验类指标响应时间、延迟、失败率以及安全类指标有毒或偏见输出的计数等。LangSmith 为这些评估提供数据集管理与自动化执行的载体使得每次改动后跑一遍测试集成为可落地的工程实践。在追踪记录上直接运行评估LangSmith 还支持直接在已记录的追踪traces上运行评估run evals directly on logged traces。这意味着不必额外构造评估样本而是可以直接复用生产环境或开发环境中真实发生的运行记录作为评估输入让评估更贴近真实使用场景。人工评估的配合对于数字指标难以覆盖的维度如隐藏偏见、措辞是否清晰、行为是否让用户感到合理可以结合路线图中 人在回路评估 主题的做法引入真实用户、领域专家或众包人员对 Agent 输出进行人工评判再结合自动评估结果共同驱动迭代。生产监控成本、延迟与错误率的仪表盘LangSmith 面向生产环境的监控能力包括成本追踪跟踪每次运行、每个模型调用的 token 消耗与费用延迟追踪监控每一步与整条链路的响应时间错误率追踪统计失败运行的比率及时发现异常仪表盘可视化通过图表charts集中展示上述指标让团队对生产状态一目了然。这些指标与路线图中响应时间、延迟、失败率等运行监控指标一一对应。对于已上线的 Agent持续监控成本与延迟不仅是质量保障也是成本治理的必要手段——Agent 的多步循环会显著放大单次调用的成本LangSmith 的成本追踪正好用于识别哪类任务最烧钱。与 LangChain、LangGraph 的搭配及独立使用生态定位LangSmith 由 LangChain 团队构建与两个框架天然配合LangChain作为构建 LLM 应用的框架提供连接数据源、串联调用、构建 Agent 的抽象见路线图中 LangChain 主题LangGraph用于构建有状态、图结构的 Agent 工作流通过 state状态与 edge边组织 Agent 的推理过程见路线图中 LangGraph 主题。LangSmith 会自动捕获 LangChain 运行的追踪信息automatically captures traces of LangChain runs这是其开箱即用的体验来源。对于 LangGraph 构建的复杂图式 Agent每一步节点执行同样会被记录便于在图上排查状态流转问题。框架无关独立使用LangSmith 并非绑定 LangChain 生态的封闭产品——它可以脱离框架独立使用也适用于非 LangChain 代码works with non-LangChain code。这意味着使用其他框架或自研编排逻辑的 Agent 也可以接入 LangSmith 的追踪与评估能力开发者可以只引入 LangSmith 相关客户端对自己的代码进行插桩获得相同的调试、测试与监控体验。这种框架无关性使其成为 AI Agents 技术栈中通用的观测层组件而非某个框架的附属品。在 AI Agents 学习路线中的定位在 roadmaps/ai-agents 目录的学习路线中LangSmith 与 LangChain、LangGraph 共同构成构建-编排-观测的完整链条用 LangChain 组装 LLM 能力用 LangGraph 编排有状态的多步 Agent 流程用 LangSmith 观测、调试、评估与监控整个系统。与之相邻的观测类主题如 结构化日志与追踪、要跟踪的指标从概念层面解释了为什么需要追踪与应该追踪什么而 LangSmith 则是这些概念的具体落地工具。此外ai-engineer 路线图 中的 LangSmith 主题还补充了在已记录追踪上直接运行评估与自动捕获 LangChain 运行追踪两个能力点可作为交叉参考。小结LangSmith 的价值可以概括为一句话让 AI Agent 的行为可观察、可验证、可度量。它通过逐步追踪解决调试问题通过评估数据集与自动化测试解决质量问题通过成本/延迟/错误率仪表盘解决生产监控问题与 LangChain、LangGraph 搭配时开箱即用脱离它们也能独立工作。在 AI Agents 的开发流程中尽早引入这样的可观测性与评估体系是保证 Agent 从原型走向可靠生产的关键一步。延伸阅读仓库内相关文档LangSmith本主题文档LangSmith 补充介绍LangChain 主题LangGraph 主题结构化日志与追踪要跟踪的指标人在回路评估ai-engineer 路线图中的 LangSmith 主题赞分享文档教程知识库【免费下载链接】developer-roadmapInteractive roadmaps, guides and other educational content to help developers grow in their careers.项目地址https://gitcode.com/GitHub_Trending/de/developer-roadmap点击查看免费下载相关推荐ModelEngine/app-platform模型监控与评估全链路实践指南ModelEngine/app platform模型监控与评估全链路实践指南 引言为什么模型监控与评估如此重要 在大模型应用开发中模型性能的稳定性和可靠人工智能大模型AI 应用低代码后端前端流程编排RAGNuclide工作集加密工具AES与GPG加密方案对比Nuclide工作集加密工具AES与GPG加密方案对比 在现代开发环境中代码安全已成为团队协作的关键环节。Nuclide作为基于Atom构建的开源IDE集文档教程知识库如何实现Astron Agent全链路可观测性企业级监控与运维实践指南如何实现Astron Agent全链路可观测性企业级监控与运维实践指南 Astron Agent作为下一代超级智能体构建平台其企业级监控与可观测性能力是保障人工智能AI AgentAgent 编排RPA后端前端企业应用上一篇Visual C 运行库 AIO 完整指南5 分钟一键装齐 2005 到 2022 全部版本下一篇VK视频下载完整指南3种方法把视频保存到本地创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考