版权与内容来源声明本文为原创整理。文中涉及官方文档、开源仓库、论文与公开报道的内容均在附表 A 中标注来源引用官方原文保持原样不作改写。文中命令、版本号与界面截图以本文成文时的实测/核验结果为准标注「待验证」的部分请以你本地环境实际输出为判断依据。本文不推荐任何不合规的软件获取方式也不对任何收益结果作承诺。转载请注明出处。第1章 档案人转大模型最容易被低估的是「字段」1.1 两种最常见的翻车张冠李戴与答非所问做企业知识库的人用不了几周就会撞上两个毛病。第一个是张冠李戴。用户问「A 项目的验收标准是什么」模型却把 B 项目的验收条款答了出来。这两份文件往往出自同一个单位、用同一套模板、措辞高度相似向量检索把人话和资料都转成一串数字再按数字远近找相似内容的技术从字面上分不清它们属于谁。第二个是答非所问。检索确实命中了同一主题但抓回来的是层级不对的碎片用户要的是文件级的具体规定命中的却是案卷级的概括说明或者反过来要一个全宗级的总体情况返回一堆零散条款。很多人第一反应是「换个更贵的模型」或者「把提示词写得更长」。但这两类问题绝大部分不是生成环节造成的而是检索阶段就没有把「归属」和「层级」约束住。1.2 你的旧经验里最值钱的不是「整理」是「著录」档案工作里有一件事几乎每天都在做却很少被当成技术能力来看著录。用大白话说著录就是对档案的内容和形式特征进行分析、选择、记录形成一条条可以检索的目录数据。这件事和搭建知识库做的事本质是同一件——给一份资料打上结构化的标签让它在需要的时候能被准确地找出来。差别只在于你原来是在档案管理系统里填字段现在是在向量库里写元数据。字段还是那些字段只是标准换成了 JSON。1.3 本文的判据先有字段再谈切分本文只讲一件事判据也只有一条先有字段再谈切分。一份资料如果在检索时无法被「它属于谁」和「它在哪一级」这两个约束框住那无论你怎么切结果都是碰运气。反过来字段定好了切分方式反而有较大容错空间。注意本文不讨论分块大小与切分策略那是另一条线的问题。现象表面原因真正缺的东西字段能不能治张冠李戴文本太像模型记混记录缺少「归属」字段能前置过滤答非所问命中了同主题碎片记录缺少「层级」字段能层级过滤引用错行拼接了不同来源记录缺少「主键」字段能来源可回溯答不出根本没召回到检索词与字段不匹配部分需先用字段缩小范围第2章 把「著录层级」翻译成知识库的「粒度与归属」2.1 全宗、类别、案卷、件四级各回答什么问题DA/T 18-2022《档案著录规则》在修订时确立了多级著录模型著录层级覆盖全宗、类别、案卷、文件件。四个层级不是并列的四个标签而是一条从粗到细的隶属链。用大白话解释一下这四个词全宗同一个立档单位形成的全部档案的总和可以理解成「这一摊资料是谁的」类别按分类方案划出的档案门类回答「属于哪一类业务」案卷围绕同一事由、成套的一组文件回答「围绕哪件事」件最小归档单位回答「具体是哪一份」。值得注意的是修订解读里提到一个本土化处理国际上的多级著录一般从全宗往下著录而我国实践中常采用「从文件著录起逐级向上著录到案卷、类别和全宗」。这个差别对做知识库很有启发——你手里的目录数据大概率是从最小的「件」开始往上长的。2.2 层级映射到知识库一条记录该挂在哪一级把四个层级翻译成知识库的设计语言就是「粒度」和「归属」两件事。著录层级档案里的含义知识库里的角色适合承载的内容常见问法全宗一个立档单位的全部档案归属域 / 最外层过滤键单位概况、沿革「某单位总体情况」类别分类方案下的档案门类业务域过滤键业务规则、制度「某类业务的规则」案卷围绕同一事由的一组文件上下文容器一件事的完整过程「某件事的来龙去脉」件最小归档单位最小召回单元具体条款、正文「某条规定原文」关键判断是这一句用户的问题本身往往就带着层级信息。「某单位总体情况」指向全宗级「某条规定原文」指向件级。如果你在检索时能先把这个层级锁定就已经消掉了大半的答非所问。2.3 归属字段解决「张冠李戴」的那把锁张冠李戴的根因只有一个同一主题下存在多个归属。A 项目和 B 项目都有「验收标准」向量空间里它们几乎贴在一起。治它的办法不是让模型更聪明而是让每条记录都带上一把锁——归属字段。只要记录里明确写着fonds_no全宗号代表它属于哪个立档单位检索时先按这个字段过滤B 项目的资料根本没机会进入候选集模型也就无从答错。第3章 把「档号体系」翻译成「结构化主键」3.1 档号的构成与唯一性DA/T 13-2022《档号编制规则》对档号的定义是「以字符形式赋予档案的一组唯一代码用于反映、固定和识别档案排列顺序」。注意「唯一」两个字——这正是知识库里「主键」的职责。截至 2026-10-03该标准为现行版本2022-04-07 发布、2022-07-01 实施代替 DA/T 13-1994。它把档号结构按整理方式分成两种按卷整理全宗号 - 类别号 - 案卷号/组号/册号 - 件号/页号按件整理全宗号 - 类别号 - 件号。其中类别号内部还可以再细分一级类别号档案门类代码、二级及三级类别号、项目号、目录号、年度、保管期限代码、机构/问题代码。标准还区分了必选元素与可选元素——按件整理时全宗号、一级类别号、年度、保管期限代码、件号是必选项。对做知识库的人来说这里有一个非常重要的读法档号天生就是一条「结构化主键」。它把「谁的、哪一类、哪一件」压缩进了同一个字符串且唯一、可排序、可回溯。3.2 档号元素 → 元数据字段一张对照表不要直接把档号当成一个整体字符串存进去那样过滤时还要做字符串解析。更好的做法是拆成独立字段每个字段单独可过滤。档号元素建议字段名类型作用必选全宗号fonds_no字符串归属过滤治张冠李戴是档案门类category_code字符串业务域过滤是年度year整数时间范围过滤是保管期限retention字符串有效期过滤是案卷号file_no字符串上下文归组按卷时是件号item_no字符串精确定位到件是完整档号archive_id字符串唯一主键、来源回溯是3.3 主键设计的三条纪律第一唯一性优先于可读性。archive_id必须能唯一定位一条记录重复了就说明整理阶段存在重号要回去查整理而不是在检索层补救。第二拆字段不拆语义。档号里的层级含义要用独立字段表达而不是靠程序去 split 那个字符串。第三字段名用小写加下划线统一命名避免同一含义出现多个写法。这一条看着琐碎但它直接决定了后面过滤条件能不能写得干净。第4章 字段定下来之后检索怎么用它们做前置过滤4.1 前置过滤与事后过滤差别很大Qdrant 官方教程在讲 payload filtering对记录附加的结构化信息做条件筛选时有一句原话**「Payload filtering lets you apply hard conditions during HNSW traversal, not after retrieval.」**意思是硬性条件在向量索引遍历的过程中就直接生效而不是等检索返回结果之后再剔除。Milvus 官方文档也说明除 ANN 搜索外它还支持通过 query 进行 metadata filtering并可以把标量过滤表达式与向量检索组合使用。这个差别值得单独强调对比项前置过滤事后过滤生效时机进入候选集之前拿到结果之后候选集大小从一开始就缩小先大后小可能不够结果数量稳定可控可能被削到只剩一两条性能配合索引更好大量结果被浪费建议本文推荐仅作兜底4.2 过滤键与向量检索的分工一句话说清分工字段负责「谁有资格进入候选集」向量负责「在候选集里谁最相关」。这一步想清楚很多设计就顺了凡是可以精确判断的属于哪个全宗、哪一年、什么门类、哪一级全都交给字段凡是模糊的、语义层面的这段话和问题像不像才交给向量。把确定性的事交给确定性手段这是档案工作最熟悉的原则。4.3 一份可用的字段清单下面这份清单可以直接作为设计的起点具体取值按你单位的分类方案调整。⚠️代码待验证必选过滤键 fonds_no 全宗号 —— 归属域 category_code 档案门类 —— 业务域 year 年度 —— 时间范围 retention 保管期限 —— 有效期 level 著录层级 —— fonds / series / file / item 可选过滤键 file_no 案卷号 item_no 件号 org_code 机构/问题代码 主键 archive_id 完整档号 过滤逻辑示例 fonds_no 本单位 AND category_code 文书 AND year 2020 AND level item第5章 动手一个最小可跑的字段加过滤例子5.1 目录数据转元数据先把一条目录数据写成向量库能接受的元数据。注意字段名和执行层级是一一对应的。⚠️代码待验证{archive_id:某全宗-文书-2019-永久-0001-0007,fonds_no:某立档单位,category_code:文书,year:2019,retention:永久,file_no:0001,item_no:0007,level:item,title:某项目验收标准件级原文,text:本条为件级正文记录该项目的验收标准原文……}这里archive_id是主键fonds_no管归属level管层级剩下的字段用于各种精确过滤。5.2 带过滤的检索下面的写法参照 Qdrant 官方文档里的过滤 API 形态query_points加query_filter。注意query_filter是随检索一起提交的属于前置过滤。⚠️代码待验证fromqdrant_clientimportQdrantClient,models clientQdrantClient(urlhttp://localhost:6333)resultsclient.query_points(collection_namearchives,queryquery_vector,query_filtermodels.Filter(must[models.FieldCondition(keyfonds_no,matchmodels.MatchValue(value某立档单位),),models.FieldCondition(keylevel,matchmodels.MatchValue(valueitem),),],must_not[models.FieldCondition(keyretention,matchmodels.MatchValue(value已过期),),],),limit5,)must里的条件必须同时成立must_not用来排除。这样「某个单位的件级原文」才会被召回其他单位的、以及案卷级的概括说明在这一步就已经被挡在外面。5.3 怎么验证过滤真的生效只跑通不算数要证明过滤确实起了作用。做法很简单同一段问题跑两次一次带过滤、一次不带对比候选集。⚠️代码待验证defrun(query_vector,with_filter:bool):fltmodels.Filter(must[models.FieldCondition(keyfonds_no,matchmodels.MatchValue(value某立档单位),)])ifwith_filterelseNoneresclient.query_points(collection_namearchives,queryquery_vector,query_filterflt,limit5,)return[(p.payload.get(fonds_no),p.payload.get(level))forpinres.points]print(无过滤,run(query_vector,False))print(有过滤,run(query_vector,True))判断标准带过滤的结果里不应出现目标单位以外的fonds_no也不应出现level不等于item的记录。如果没有过滤时张冠李戴、加了过滤就干净了就说明字段确实在干活。一份可直接照做的字段设计清单上面这套「归属键 层级键 主键」的写法我在资料包里整理成了一页可打印的对照清单配合企业知识库的例子一起放好了。放在资料包里扫码即可获取第6章 转行者要补什么怎么做出可交付的项目6.1 要补的三块能力档案人的优势在「信息组织」短板通常在「工程实现」。需要补的其实就是下面三块且都和你原有经验能接上。要补的能力具体内容和你旧经验的接口概念转译元数据、向量、Embedding把文本转成数字向量的模型相当于著录字段的数字化动手实现向量库读写、过滤查询、批量入库相当于目录数据库建库效果验证构造问题集、对比过滤前后结果相当于检索质量检查不需要先成为算法专家。这三块里真正需要写代码的是第二、第三块而且都是可以照着官方文档抄起步的。6.2 一个可交付项目的验收清单判断一个知识库项目能不能写进作品集看下面几条是否都成立有明确的字段设计文档说明每个字段的含义、类型、是否必选有一套真实的目录数据入库而不是几十条编造的样例有可复现的验证脚本能展示过滤前后候选集的变化有失败案例说清楚哪类问题这套字段还治不了有来源可回溯每条回答能指回具体的archive_id。6.3 简历与面试里怎么说这段经验不要说「我做过一个知识库」要说清三件事你负责的是字段与过滤设计你用什么判据判断过滤生效你踩过什么坑、怎么定位的。第二点最能体现你和其他候选人的区别——很多人只会说「我接了向量库」说不清「怎么证明它没答错」。第7章 常见误区与边界7.1 字段越多越好吗不是。字段是双刃剑字段太少过滤不够字段太多一是入库成本上升二是必填字段一多老数据就大量缺失反而让过滤条件写不下去。建议先只做必选字段跑通之后再逐步增加可选项每一项都要回答「不加它会导致哪种错误」。误区后果建议做法字段越多越好入库成本高、老数据缺失先必选后可选必填字段过多过滤条件写不下去只把归属和层级设为必填字段名不统一过滤条件写错统一小写加下划线命名只存完整档号无法精确过滤拆成独立字段忽略索引过滤查询变慢为常过滤字段建索引7.2 层级不对齐、字段缺失时怎么办现实中你会遇到只有案卷级目录、没有件级正文的情况。这时不要硬拆而是以实际著录层级为准有哪一级就标哪一级level字段如实填写。检索时按level过滤让用户明确知道当前命中的是案卷级还是件级比强行拼凑要诚实得多。字段缺失时用统一占位值而不是留空避免过滤条件出现歧义。7.3 合规与安全边界把档案数据接进知识库有几条法律边界要心里有数条号原文已逐字核对《中华人民共和国档案法》第三十七条电子档案应当来源可靠、程序规范、要素合规电子档案与传统载体档案具有同等效力。《中华人民共和国档案法》第四十条档案馆负责档案数字资源的收集、保存和提供利用。有条件的档案馆应当建设数字档案馆。《中华人民共和国档案法》第四十一条国家推进档案信息资源共享服务平台建设推动档案数字资源跨区域、跨部门共享利用。这说明「用先进技术做数字化利用」本身是法律鼓励的方向。但同时要记住未开放档案、涉密档案的利用有严格规定把数据接进模型前先做密级与开放属性的字段并在过滤环节强制生效——这一步不是技术选项是合规底线。转行路线怎么选如果你是从档案、出版、资料岗转过来的建议先看清楚自己「信息组织」这块经验能直接复用到哪里。资料包里有一份学习路线图里面专门标出了传统岗位转过来的能力对照。放在资料包里扫码即可获取附表 A本文引用事实与出处对照表序号事实出处本文位置1DA/T 18-2022《档案著录规则》2022-04-07 发布、2022-07-01 实施代替 DA/T 18-1999现行状态国家档案局官网通知saac.gov.cn全国标准信息公共服务平台std.samr.gov.cn第2章2DA/T 18-2022 确立多级著录模型著录层级含全宗、类别、案卷、文件件新增「多级著录」「著录层级」「著录单元」「著录主体」等术语《档案著录规则》修订解读国家档案局科研所《中国档案》2022 年第 9 期海口市档案馆网站转载第2章3DA/T 18-2022 著录项目为 7 大项 35 小项约束性分「必著」「选著」「有则必著」同上修订解读第2章4DA/T 13-2022《档号编制规则》2022-04-07 发布、2022-07-01 实施代替 DA/T 13-1994档号构成元素与按卷/按件两种结构国家档案局官网通知saac.gov.cnDA/T 13-2022 修订解读安康市档案局公开文件PDF第3章5DA/T 22-2015《归档文件整理规则》2015-10-25 发布、2016-06-01 实施代替 DA/T 22-2000国家档案局官网通知 档发〔2015〕6 号saac.gov.cn第3章6《中华人民共和国档案法》2020-06-20 修订通过主席令第四十七号自 2021-01-01 起施行全文共 8 章 53 条国家档案局官网全文saac.gov.cn中国人大网转载新华社通稿npc.people.com.cn第7章7《档案法》第四条、第十九条、第三十七条、第四十条、第四十一条原文国家档案局官网全文saac.gov.cn第7章8Qdrant 官方文档可在检索时对 payload 设条件建议为常过滤字段创建 payload 索引且最好在写入数据前创建Qdrant 官方文档 Filtering 页qdrant.tech第4章9Qdrant 官方教程原话payload filtering 在 HNSW 遍历过程中施加硬条件而不是检索之后再过滤Qdrant 官方教程 Payload Filtering 页qdrant.tech第4章10Milvus 官方文档除 ANN 搜索外支持通过 query 进行 metadata filtering标量过滤表达式可与向量检索组合Milvus 官方文档 Query 页、JSON Field 页milvus.io第4章11待验证把「全宗-类别-案卷-件」直接对应为知识库的技术切分粒度是本文的工程类比不是标准规定本文作者说明标准文本未作此规定第2章12待验证第5章 json / python 示例未在真实向量库实例上运行仅按官方文档 API 形态编写请以本地实际输出为准本文作者说明第5章附表 B术语速查表术语一句话解释本文哪里用到著录对档案内容和形式特征进行分析、选择、记录形成目录数据第1章著录层级档案著录所处的级次多级著录含全宗、类别、案卷、件第2章全宗同一个立档单位形成的全部档案的总和第2章案卷围绕同一事由、成套的一组文件第2章件最小归档单位一份文件即一件第2章档号以字符形式赋予档案、用于反映和固定排列顺序的唯一代码第3章元数据描述一份资料「是什么、属于谁、在哪一级」的结构化信息第3章主键能唯一定位一条记录、不重复的标识字段第3章过滤键检索时用来先缩小范围的字段第4章前置过滤在进入候选集之前就用条件筛掉不符合的记录第4章RAG检索增强生成先查资料再让模型作答的方式第4章向量检索把文本转成数字向量按距离找相似内容的技术第1章Embedding把文本转换成数字向量的模型第6章payload随向量一起存储的结构化附加信息即元数据第4章写在最后这篇用到的资料写这篇文章时把相关的官方文档和源码又翻了一遍顺手也整理了几份配套的东西大模型学习路线图从零基础到能自己动手做 Agent按阶段说明每一步该学什么、哪些可以先跳过《LangChain LangGraph MCP 智能体开发实战》视频课7 个模块从私有化部署、EmbeddingRAG 到 MCPAgent 全流程AI 大模型知识库在线可查Agent Skills 从入门到落地、Claude Skills 完全指南等专题按目录浏览即可640 套 AI 大模型行业报告 经典 PDF 书籍看行业落地案例和别人怎么做的时候用得上大模型零基础到精通教学视频跟着敲一遍比只读文档快得多资料是我自己整理的放在下面这个码上扫码即可获取添加时备注「AI」优先通过。资料按「先路线、再动手、最后查漏」的顺序整理好了建议先看学习路线那一份照着它挑一条适合自己当前基础的路径再往下看。