WorkBuddy实战指南:从零自建专属AI专家,配置提示词与Skill全拆解
发布时间:2026/9/11 9:31:13 作者:尧图编辑部 阅读量:1,286

不必报太大期望也别把它当成陌生人开发的另一个对话机器人。WorkBuddy这个工作台最核心的价值就一句话它允许你自己给自己造一个角色一个真正懂你业务的“专家”——你定它的性格、知识边界、说话方式以及它手里能用的工具。这类东西行业里现在叫“智能体编排”但叫法不重要重要的是它把“用AI”从“问一句答一句”升级成了“训练一个替你干活的搭档”。这篇实战攻略我会把从零创建“专家”的全过程、提示词设计逻辑、Skill技能挂载、连接器对接外部数据以及我踩过的几个坑全部拆开讲清楚。不管你是程序员、产品经理、运营还是经常要写材料、报课题、整理表格的职场人只要你能说清楚“我想要一个什么样的助手”这篇攻略就能帮你把它造出来。整个过程不需要写代码但需要你对自己要做的事有清晰的认知。1. 先搞清楚WorkBuddy到底是个什么东西1.1 一个能自己造“专家”的AI工作台先说个容易混淆的概念。现在行业里常说的“混合专家模型”是模型层面的技术意思是把多个专用模型按路由机制组合成一个大的模型系统。WorkBuddy里的“专家”跟它是一种思想上的呼应但完全是用户侧的产物你在WorkBuddy里创建的每一个“专家”本质上是一份完整的AI行为配置包含了系统提示词、启用的模型参数、挂载的Skill技能、连接的外部数据源以及它能够触发的工具权限。说得直白一点普通AI对话相当于“你走到哪个窗口就找哪个柜员办事”WorkBuddy里自建专家相当于“你自己设定一个专属柜员的岗位职责、服务话术、业务权限再把他安排到固定窗口”。WorkBuddy有桌面客户端、命令行Linux/Ubuntu可用、Web网页版数据可以本地部署。这就意味着同一个专家配置文件在公司内网服务器、个人电脑、网页端都能跑不锁定平台。安装完之后你会在工作台左侧看到类似“专家列表”“Skill库”“连接器”这样的模块不同版本命名可能有差异但逻辑一致。1.2 专家、Skill、连接器三者的关系刚开始用的时候很多人会被这三个概念搞晕。我打个比方专家是一个人Skill是他掌握的能力连接器是他能触达的外部资源。专家定义了“他是谁、什么立场、用什么语气、懂什么知识边界”Skill定义了他“会做什么动作”比如读取PDF并总结、调用Python脚本跑数据分析、执行UI自动化测试连接器定义了他“能连什么系统”比如钉钉多维表、Obsidian笔记库、企业微信、数据库、Webhook接口。这三者的关系是专家调用Skill来执行任务Skill执行时可能需要连接器去外部系统取数或写回。所以创建专家不是只填一个名字和一段提示词那么简单它是一个三层装配的过程。明白了这个逻辑后面配置起来就不会乱。1.3 为什么我劝你不要直接用预设模板市面上很多类似工具都提供了大量预设的“专家模板”WorkBuddy也有官方/社区的专家库可一键安装比如“文案专家”“数据分析师”“IT运维助手”。对刚上手的人来说装个模板确实能立刻用但体验一段时间后你会发现两个问题一是通用模板不贴合你所在的行业场景回答大而全、不痛不痒二是它不了解你的数据、你的流程、你的口径没法真正承接业务。很多人在这一步就得出结论“AI没用”。实际上不是AI没用是你没有给它灌注你的业务规则。自己创建专家本质上就是在做“知识灌注 行为约束 工具授权”这三件事。只有你自己最清楚你天天要处理的是什么格式的表、什么口径的话术、什么类型的报告。这个定制过程才是WorkBuddy所有功能里投入产出比最高的一件事。2. 创建专家的核心细节与配置逻辑2.1 创建入口与基础信息配置无论桌面端还是网页版新建专家的入口基本都在主界面的右上角或侧边栏“专家管理”区域点“新建专家”后会弹出一个配置面板。需要填的基础信息包括名称建议用行业职责的命名方式比如“课题评审专家”“季度复盘文案助手”方便后面在列表里快速识别。头像/图标随意但建议有区分度。描述一句话说明这个专家是干什么的这部分会用于列表展示有时候也会被系统用来做专家自动匹配尽量写清楚边界。系统提示词System Prompt这是整个配置的核心后面单独讲。模型选择WorkBuddy一般会列出工作台可用的模型列表如果本地部署接入过开源模型也可以手动填模型标识。参数区温度、上下文长度、回复长度上限等。基础信息不需要填到完美再开始先随便填个大概跑通流程比一步到位更重要。2.2 系统提示词自建专家的灵魂系统提示词决定了专家90%的行为表现但很多人的提示词就是一句话“你是一个专家”。这等于什么都没说。我写提示词的通用框架分为六个要素身份定义这个专家是什么角色在什么场景下服务谁。知识边界它懂什么领域不懂什么领域遇到边界外问题怎么回应。任务模型它主责完成哪几类任务每类任务的标准输出格式是什么。规则约束什么不能做什么必须做涉及合规、安全、保密时怎么办。表达风格语气、篇幅、是否用表格清单、是否给依据。输入输出示例给它一两个“坏回答”和“好回答”的对比比写十句抽象要求都管用。举个例子如果你想创建一个“申报书评审专家”系统提示词里不要只说“请评审申报书”而应该写清楚评审维度有哪些选题意义、研究基础、技术路线、创新性、可行性、预算合理性、每个维度权重多少、产出成果必须包含“总体评分逐维度评语修订建议”。这一步做好了专家才会真的像一个老评审而不是一个夸夸其谈的空壳。2.3 模型、温度与上下文参数怎么选配置参数时最常被忽略的是“温度”和“上下文长度”这两个对专家表现的影响极大。温度控制随机性。日常写文案、头脑风暴温度可以设在0.8以上让输出更发散。但如果你建的是一个评审专家、审计专家、合规检查专家温度一定要调低建议0.1到0.3之间否则同一个申报书让它评两次可能得出两种完全不同的结论这在业务上是没法用的。判断标准很简单你的专家是“求稳”还是“求新”。上下文长度则决定专家能同时参考多少材料。评审类任务往往要读全申报书还要对比往年材料建议基于本地部署的模型能力把上下文调到当前模型的最大支持范围。这里有个小技巧如果一次塞不进去所有材料可以把长文档拆成评审切片让专家分步评审再汇总比强行塞入效果好得多。2.4 Skill插件的挂载与自定义写法Skill可以理解成给专家装上的“工具包”。WorkBuddy自带了一批官方Skill比如文档解析、网页阅读、代码执行等直接挂载即可。但想让专家真正贴合业务场景还是要学会自己写专用Skill或者安装社区里别人写好的Skill。Skill一般包含一个描述文件说明这个Skill的触发条件和功能以及若干执行脚本或提示词模板。以我自建的一个“PDF申报书抽取”Skill为例它的作用是从申报书中按章节抽取关键字段输出结构化JSON再传给评审专家做打分。这么一拆专家的任务就变成了两步先抽取、再评审每一步都聚焦输出质量明显比一次性硬啃要高。自定义Skill不需要从零开始。工作台提供“创建Skill”入口你只需要给Skill起名、写清楚它能干什么、粘贴上执行模板再用几个样例测试一下效果就可以保存使用了。社区里关于写作、编程、数据分析的Skill非常多先装现成的再改造成自己的效率最高。3. 实战从零创建一个课题评审专家3.1 明确角色定位与应用场景这一段我拿自己实际创建过的一个专家来拆解方便你照着做。当时的需求是每年单位要收几十份课题申报书人工初筛工作量很大看完一份平均要30分钟而且不同人评审口径不一致。我需要一个“课题评审专家”能自动读申报书、按统一标准打分、输出可复核的评审意见帮我把初筛时间压缩到5分钟以内。这个场景就决定了专家的核心能力文本解析读取PDF或Word申报书、结构化抽取提取题目、团队、预算、路线等字段、规则评审按预设维度打分量化和定性评价、输出报告统一格式的Word/表格评审意见。想清楚角色定位之后后面所有配置都有明确目标不会漫无目的。3.2 可直接抄作业的提示词模板我最终使用的系统提示词核心框架长这样你可以照着替换你是一名资深科研课题评审专家具有15年以上基金项目、横向课题评审经验。 主要任务对输入的课题申报书进行初筛评审。 评审维度及权重百分制 1. 选题意义15分是否贴合当前产业/行业痛点是否有明确的应用价值。 2. 研究基础20分申报团队前期成果、数据积累、实验条件是否支撑课题目标。 3. 技术路线25分研究思路是否清晰、技术路线是否可行、关键节点是否明确。 4. 创新性20分与现有方案相比是否有实质创新不是简单拼凑。 5. 可行性10分时间节点、经费预算、人员投入是否合理。 6. 预期成果10分产出是否具体可衡量是否具备转化或发表可能性。 硬性否决项命中任意一项直接判定不通过 - 申报书存在明显抄袭或内容拼凑痕迹 - 预算明显不合规 - 研究内容与课题指南方向完全不符 输出格式要求 先给出总体评分百分制和是否通过初筛的结论然后按维度依次输出评分、依据必须引用申报书原文字段、修改建议。最后用250字左右总结核心判断理由。 禁止输出没有依据的笼统评价每条判断必须对应申报书具体文字。这套提示词的关键不在于文采而在于把评分规则、否决条件、输出格式全部显性化。评审是高风险输出宁可保守也不能让模型自由发挥。3.3 挂载Skill让专家能读文件、跑评审提示词配好之后接着要做的是给这个专家挂载处理文件的能力。我在Skill库中选取了“文档解析”官方Skill同时自定义了一个“申报书字段抽取”Skill。自定义Skill的实际执行逻辑不复杂就是把文档内容按预设字段切分输出JSON再把JSON交给专家提示词去评审。这里要特别提醒一个常见误区不要试图把整个几十页申报书全塞进上下文再让专家直接评分。上下文塞满之后模型对中间段落的关注度会下降导致漏看关键信息。正确做法是用“抽取-评审”两段式第一步用Skill抽取结构化字段第二步基于抽取结果做评分。这样做还能顺带解决一个实际问题——申报书里大量内容是格式性套话真正对评审有决策价值的信息就那几千字。挂载Skill之后记得用至少三份不同质量的申报书做测试一份优质、一份中等、一份明显低质。看三份的输出结论是否有区分度。如果全都打八十几分说明提示词里的评分标准还不够锐利就回去调整各维度的判定描述。3.4 用连接器同步外部数据以钉钉多维表为例评审结果不能只停留在对话里得落到业务系统里方便后续流程追踪。这一步就需要用到连接器。我当时的做法是让专家每完成一份评审自动把结构化结果同步到钉钉多维表形成一张“申报书初筛台账”。配置步骤在“连接器”模块找到钉钉多维表完成账号授权然后选择目标数据表把评审输出的JSON字段与表格列做映射。比如“评分”对应“总分”列、“评审结论”对应“是否通过”列、“修改建议”对应“意见”列。WorkBuddy的定时同步功能在这里很实用可以设定每天固定时间把新增评审结果推送到多维表不用人工搬运数据。连接器真正强大的地方在于它打通了AI行为和业务流程之间的闭环专家在对话里完成判断数据自动进入业务表业务表后续可以被其他系统消费。如果你想做更复杂的联动比如评审通过后自动触发邮件通知申报人、自动生成修订版申报书Word文档原理都是一样的——通过连接器把专家输出的结构化数据转发到下一个节点。3.5 测试、调试与版本管理自建专家不是配一次就完事的。我迭代这个评审专家超过二十个版本每次调整都是这样做的找三到五份历史申报书跑一遍记录输出结果中哪些评审意见与人工评审结论不一致分析是提示词的问题还是抽取Skill丢字段的问题再针对性地改。WorkBuddy对专家的历史配置支持版本记录每次点击保存都会变成一个新的历史版本可以随时回滚。这一点太重要了。不要怕改坏反正有回滚兜底。但回滚不是目的真正有效的工作习惯是每次改动只动一个变量。改提示词就别同时改温度参数先把提示词调整完测试通过再去动参数。一次只改一个点出了问题你才能准确定位。4. 常见问题与排查技巧实录4.1 网络连接失败3002最容易碰到的启动门槛不少人在第一次安装、登录后建专家时遇到“网络连接失败3002”。这个报错我排查过多次绝大多数情况有三种原因第一种是本地网络环境特殊性导致的连接中断。WorkBuddy在启动、拉取模型列表、同步专家配置时需要访问服务端部分办公网络对非标准端口或长连接有限制导致握手失败。解法是把所在网络的防火墙策略放行对应域名和端口或者切换到Web网页版验证是不是客户端专有问题。第二种是本地部署模式下的服务地址配置错误。如果你配置过本地模型或自定义服务源检查baseURL是否填错、协议是否为https、路径是否带了多余斜杠。3002这个错误码常常出现在“客户端连得上、服务端返回异常”的场景。第三种是时间不同步或鉴权过期。机器时间偏差超过5分钟很多基于TLS的请求会直接断掉。先校准系统时间再重新登录账号往往就好了。我的排查顺序是先确认网络连通性再确认服务地址配置最后重登能解决九成问题。4.2 启动非常慢多半不是软件问题WorkBuddy启动慢是高频吐槽。实测下来启动慢多半跟软件本身没关系是这三个原因一是自启时加载了太多Skill每个Skill都要做规则初始化和索引装了几十个Skill之后启动速度肉眼可见下降二是历史对话记录没有定期清理整个会话库加载耗时剧增三是机器内存本身吃紧而WorkBuddy的桌面端基于Electron类框架属于内存大户。解决办法把不常用的Skill停用而不是删除停用后不参与加载但保留配置定期把重要对话导出或归档清理本地会话数据关掉客户端里无关的后台同步开关。如果公司允许优先用Web版跑日常轻量任务桌面端留给数据密集型任务。4.3 历史对话记录与本地记忆迁移要换电脑或重装系统时最担心的是历史对话和本地记忆丢。WorkBuddy的历史记录和记忆默认存在本地数据目录重装前先做一次完整备份。备份方式是在设置里找到“数据导出”把对话历史、专家配置、Skill配置打成一个压缩包迁移到新机器后在对应位置执行导入。如果你还手动改过配置文件比如修改过模型参数或连接器授权信息记得导出的包里要同时包含config目录而不仅仅是对话数据。这个细节我身边好几个同事都踩过导出来一堆对话记录但自己建的专家全没同步过去结果到新机器上还得重新搭一遍。官方同步机制有效的前提下建议仍然保留一份本地压缩备份双保险。4.4 其他几个容易踩的坑Skill图标/快捷方式“删不掉”怎么办很多时候不是WorkBuddy的问题而是安装某个Skill时自动生成的操作系统级快捷方式或开机自启项。到操作系统的启动项管理里禁用或删除对应条目再回来在软件里卸载Skill即可。C盘空间被WorkBuddy占满桌面端会把模型缓存、会话数据、Skill临时文件都放在用户目录下运行一段时间可能占几个GB。设置里把缓存目录改到其他盘并定期清理无用的历史会话附件。与CodeBuddy的定位混淆两者定位不同CodeBuddy更侧重编码开发场景WorkBuddy更偏日常通用工作台。如果一个偏工程化编码、一个偏业务自动化自己创建“专家”这种做法在WorkBuddy里的自由度更高因为它面向的是非程序员用户。4.5 自建专家常见问题速查表问题现象主要原因排查/解决建议网络连接失败 3002网络策略、服务地址错误、鉴权过期先试网页版再校准时间、检查地址、重登启动非常慢Skill加载过多、历史数据大、内存不足停用不常用Skill、清理历史、优先用Web版评审结论两极分化缺乏区分度提示词评分标准不锐利、温度太高细化各维度判定规则、温度调至0.1-0.3专家回答跑题、不看业务口径系统提示词缺少知识边界和规则约束补充六要素框架写明不能做什么长文档评审漏信息上下文塞太满模型注意力分散改用“抽取-评审”两段式先结构化抽取本地记忆/专家配置丢失迁移前未完整导出导出压缩包时要同时包含config目录钉钉多维表同步失败授权过期、字段映射不一致重新授权并检查JSON字段与表格列名对应关系4.6 一个百试百灵的调优小技巧最后再送一个自建专家的调优技巧。当你觉得专家输出“好像哪里不对但说不出到底哪里不对”时最快的定位方法是把同样的问题分别扔给一个没有挂任何Skill的空白专家、一个挂了Skill但提示词很简单的专家、一个完整配置的专家对比三者输出的差异。差异如果在“有没有按格式输出”问题出在提示词差异如果在“回答里没有引用具体数据”问题出在Skill没把数据灌到位。用这种AB对比的方式定位问题比凭感觉反复改提示词高效太多。这个思路用到任何自建专家场景都成立。我个人的体会是自建专家这件事真正拉开差距的从来不是模型选得有多强而是你有没有把业务规则拆够细、把工具链接得够顺。WorkBuddy只是把这套改造的门槛降到了普通人都能操作的程度。按这篇攻略跑通一个专家之后你自然会开始琢磨你的岗位里还有哪些重复判断可以交给下一批专家来分担。