如何用graphify把PDF论文变成知识图谱?完整工作流指南
发布时间:2026/8/29 15:51:39 作者:尧图编辑部 阅读量:1,286

如何用graphify把PDF论文变成知识图谱完整工作流指南【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify你有没有读过几百篇 PDF 论文却记不住它们之间的联系graphify是一个开源知识图谱工具把它装进 Claude Code、Cursor、Codex、Gemini CLI 等 AI 助手就能把整个目录——代码、文档、SQL 配置、甚至PDF 论文——自动变成一张可查询的知识图谱。PDF 的文本先在本机用 pypdf 抽取再由 AI 助手做语义抽取最终生成带社区结构的图谱让你用自然语言提问而不是逐篇翻阅 PDF。下面这条完整工作流从安装到查询只需 5 个步骤全部本地可控。一、准备工作安装 graphify 与 PDF 解析组件先确认本机有 Python 3.10推荐装uv然后执行两条命令uv tool install graphifyy # 安装 CLI注意 PyPI 包名是双 y 的 graphifyy uv tool install graphifyy[pdf] # 加装 PDF 解析组件pypdf markdownify再把 graphify 注册到你的 AI 助手graphify install # 默认注册到 Claude Code graphify install --platform codex # 或 Cursor / Codex / Gemini CLI 等 20 平台 如果提示graphify: command not found运行uv tool update-shell后重开终端即可。PDF 解析依赖声明在 pyproject.toml 的pdf可选组件里具体解析逻辑位于 graphify/detect.py 的extract_pdf_text函数——它逐页抽取 PDF 文本层全程不出本机。二、把 PDF 论文放进语料库3 种方式方式操作适合场景① 本地文件夹把paper1.pdf、paper2.pdf放进./papers/目录已经下载好的论文② 一键抓取在助手里输入/graphify add https://arxiv.org/abs/1706.03762直接加 arXiv 论文或 PDF 链接③ 目录监听/graphify ./papers --watch论文持续新增自动同步方式②由 graphify/ingest.py 实现arXiv 链接会抓取摘要与元数据存为 MarkdownPDF 链接则直接下载为.pdf文件随后自动触发增量更新。完整规则可参考技能参考文档 graphify/skills/claude/references/add-watch.md。三、一条命令构建图谱/graphify .之后发生了什么在 AI 助手中输入/graphify ./papersgraphify 会分三遍处理语料原理见 docs/how-it-works.md代码结构遍tree-sitter 本地 AST 解析零 API 调用纯论文语料会跳过此遍媒体遍视频/音频本地转写纯论文场景同样跳过语义遍AI 助手并行读取 PDF 抽取后的文本识别概念、实体、引用关系如FlashAttention 算法、IO-Aware Attention输出节点与边。随后用 Leiden 算法做社区检测把强相关的概念聚成主题簇并给每条边打上置信标签EXTRACTED原文直接可见、INFERRED模型推断带 0.55–0.95 置信分、AMBIGUOUS需人工复核。构建完成后你会得到三个文件输出文件用途graphify-out/graph.html浏览器打开即可点击节点、筛选社区、搜索概念graphify-out/GRAPH_REPORT.md图谱报告核心概念God Nodes、意外连接、建议提问graphify-out/graph.json完整图谱数据随时查询无需重读 PDF项目里就有真实案例worked/karpathy-repos/GRAPH_REPORT.md 展示了 49 个文件含 5 篇论文 PDF生成的图谱——FlashAttention 论文被单独聚成一个社区内存随序列长度线性扩展等实验结论都成了可查询的节点。四、查询知识图谱query / path / explain 三件套图谱建好后问图谱而不是翻 PDF提问/graphify query FlashAttention 如何降低显存占用—— 返回与问题相关的子图附带出处文件追链路/graphify path FlashAttention GPT 训练速度—— 找出两个概念间的最短路径逐跳解释解释概念/graphify explain Tiling for Attention—— 列出该节点的全部连接与来源。每个答案都能溯源到具体 PDF 的具体位置这是向量检索做不到的结构 出处双重保证。五、进阶技巧增量更新与深度抽取论文有更新运行/graphify ./papers --update只重新抽取变更的文件未改动部分走 SHA256 缓存省时省钱关系抽得不够细加--mode deep开启深度语义抽取能发现更弱的跨论文关联详见 graphify/llm.py 中的深度模式提示词;批量/CI 场景无界面提取graphify extract ./papers --backend gemini也支持 claude、openai、ollama 本地模型等 8 种后端隐私放心PDF 文本抽取完全本地只有语义遍会调用你 AI 助手当前会话的模型代码语料甚至可加--code-only完全离线。不想每次手动触发安装 git 钩子让提交后自动重建graphify hook install六、常见问题速查问题解决办法扫描版 PDF 没有文字层抽取结果为空建议先 OCR 或换用带文字层的 PDF图谱节点太少检查 API/模型配置确认语义遍正常运行查询结果不相关用graphify query前先确认图谱已包含目标论文--update后重试想看源码git clone https://gitcode.com/GitHub_Trending/graph/graphify后重点看 graphify/extract.py 与 graphify/cluster.py写在最后从一堆 PDF 论文到一张可提问的知识图谱graphify 只做对了一件事把读论文变成查图谱。概念、实验结论、跨论文引用全部结构化且每条关系都能说出出处。如果你常泡文献这条工作流值得花 5 分钟搭一次——一次构建长期复用。【免费下载链接】graphifyTurn any codebase, with its docs, SQL schemas, configs, and PDFs, into a queryable knowledge graph. A /graphify skill for Claude Code, Cursor, Codex, and Gemini CLI: local deterministic AST parsing, every edge explained, no vector store.项目地址: https://gitcode.com/GitHub_Trending/graph/graphify创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考