sepia科研基础全梳理:17项实证研究如何撑起这套去AI味方法论
发布时间:2026/9/30 17:28:45 作者:尧图编辑部 阅读量:1,286

sepia科研基础全梳理17项实证研究如何撑起这套去AI味方法论【免费下载链接】sepiaDe-AI writing skill for any Agent Skills-compatible agent (77 via the Skills CLI), with native plugins for Claude Code, Codex, Grok Build, and Antigravity. Narrative-architecture repair for fiction, venue-matched rules for professional prose. Based on StoryScope (arXiv:2604.03136).项目地址: https://gitcode.com/gh_mirrors/sepia3/sepiasepia是一款装在 AI 编程代理里的去AI味写作技能de-AI writing skill它让 Claude Code、Codex、Grok Build 等 77 个兼容 Agent Skills 的代理在写小说、发版说明、事故复盘、技术文章时产出不被识破的人味文字。它的底气不来自经验之谈而是来自仓库里一份逐条钉死出处的研究账本 research/sources.md——17 项实证研究每项都标注了语料规模、模型版本、研究范围和可信度等级。这篇文章带你把这份科研底牌一次看穿 先看懂账本17项实证研究的全景分层打开 research/sources.md17 项一级研究按能信到什么程度分层管理层级证据等级代表研究能信到什么程度叙事结构层measured studyStoryScope、LAMP、SlopShape有语料有数字但每篇只测一个模型版本风格/词汇层measured studyMeasuring AI Slop、Reinhart 等同上且结论受文类限制节奏句法层measured studyDesaire、Gude、朱君辉等 16 篇互相矛盾的项目直接不转成规则检测器层vendor report / measuredPangram 系列、Epoch AI厂商自报数字独立样本不够验证一个关键设计研究只报告关联和分类器成绩不验证 sepia 的处方。凡是 sepia 自己推出的操作规则文件里都标注Sepia inference。这份证据边界声明写在账本末尾是整个项目的诚实底色。叙事架构层AI小说为什么一眼假这是 sepia 最核心的主张来自账本里分量最重的三项研究 StoryScopeUMD Google DeepMind10,272 个写作提示 × 人类与 5 个大模型 61,608 篇短篇小说提炼出 304 个可解释的叙事特征。结论震撼——只靠叙事结构特征AI 小说检测器就达到93.2% macro-F1把表面风格洗掉也没用93.9%。摘要全文见 research/storyscope.md。30 个核心特征揭示了 AI 小说的结构病主题说教AI 让叙述者跳出来说明主题的比例 77%人类只有 52%感官表演过剩情绪全写成身体反应show dont tell被执行成教条结构过度流线79% 没有支线69% 结局全靠主角个人抉择回避真实世界人类点名真实作品/品牌的比例是 AI 的 2 倍47% vs 24%LAMPCHI 202518 位 MFA 专业作家编辑 1,057 段 AI 文本做出 8,035 个细粒度编辑归纳出 7 类AI写作痕迹陈词滥调、冗余铺陈、紫 prose、烂句式、缺细节、怪词、时态漂移。最重要的数字专业作家的编辑操作是74% 替换 / 18% 删除 / 8% 插入——这条比例直接写进了 sepia 的最小改动原则。详见 research/citations-style.md。SlopeShape2026 预印本把 StoryScope 方法搬到商业博客187 个结构特征单独就能到98.0 macro-F1。叙事层一眼假在专业文体上得到了一次独立复现。sepia 据此把小说改稿排成两遍Pass 1 修叙事架构narrative-pass.md→ Pass 2 修表面风格style-pass.md。风格词汇层AI词表与句法指纹三个研究把AI味词汇从玄学变成了清单Measuring AI Slop19 位专家定义 职业编辑在 150 篇新闻上做 span 级标注收敛出 3 个主题 7 个代码密度低、相关性差、模板腔等。一个反直觉发现LLM 拿着完整标注指南也无法识别自己文中的 slopκ≈0——所以 sepia 的自评必须逐维度分开检查不能整份指南一次丢给模型。Reinhart et al.PNAS 2025用 Biber 66 维特征对比人类与 6 个模型的续写。结论元凶是指令微调base model 贴人类instruct 版偏差急剧放大模型变大也不更像人。GPT-4o 的过用构式如现在分词子句527%、名物化214%高频词如tapestry出现在 23% 的输出里、delve、intricate。Russell et al.ACL 20255 位高频 ChatGPT 用户就是顶级检测器——三人多数决在 300 篇里只错 1 篇99.3%。论文附赠 15 类专家线索AI 词汇 53.1%、固定三项列举、回避破折号、63% 的 GPT-4o 文章里住着 Emily 或 Sarah……和一份完整 AI 词汇表。最扎心的一行简单改写paraphrase完全无效AI 词汇提及率反而从 69.8% 升到 88%——这正是 sepia 两阶段协议先列缺陷清单再逐项改的由来。节奏句法层唯一站得住的硬信号rhythm-syntax.md 汇总了 16 篇量测研究结论克制得漂亮✅句长离散度人类 LLM是唯一跨研究、跨语言、跨模型世代方向一致的信号DesaireScience 段落、Gude纽约时报导语、Muñoz-Ortiz、朱君辉HC3 中文都指向同一个方向❌ 句长平均值随模型世代反转2023 base 模型偏短2025 对齐模型偏长——所以 sepia 不写任何绝对句长门槛❌ 标点密度、段落长度在不同语料里方向相反——全部列入白名单style-pass.md §7不作为 AI 证据对中文sepia 单独维护了校准文件 languages/zh.md背后是 zh-news-corpus.md约两千篇繁体中文长篇新闻的私有量测。有趣的发现台湾编辑圈流传的不是…而是句型其实在约三成人类文章里出现——单一出现不是信号真正接近零的是综上所述每十万字 0 次和总结式收尾169 篇细读仅 7 篇。检测器研究为什么sepia不追检测器detectors.md 回答了一个新手常问的问题为什么sepia不以骗过AI检测器为目标最强商业检测器 Pangram 在输入端先把标点字形压平破折号→双连字符厂商明说AI tells 不是模型输入——它学的是分布不是字形检测器版本漂移极大3.0/3.3/4 是三套系统分数双峰、上下文不稳定真正可操作的发现来自Shan et al. 2026AI改稿和 AI生成的指纹不同——改稿的主信号是内容词比例骤降d −3.10。所以 sepia 的 refactor 模式加了删除测试把自己加进去的每个字划掉一次句子还通就是填料删读者端证据与证据边界最后两层保障读者端124,615 则 ICLR 人类审稿 vs 81,850 则冻结 LLM 审稿的对比显示人类审稿人对句长变异的奖励逐年为正LLM 审稿读不到。sepia 的标准是训练有素的专家读者不是黑盒检测器证据边界每个数字都绑定在语料、模型世代和语言上被咨询但没有可用数字的论文如 GPTZero 的burstiness 公式被明确记录为不转成规则避免网络流传数字被二次引用如何上手这套去AI味方法论 整套科研底座对应到运行时就是四个入口文件技能总纲与路由skills/sepia/SKILL.md独立技能sepia-review只诊断不修改、sepia-refactor最小改动、sepia-recreate全文重写、sepia-write新内容评分标尺skills/sepia/references/rubric.md克隆仓库即可在任意兼容代理中使用git clone https://gitcode.com/gh_mirrors/sepia3/sepia一句话总结17 项研究告诉 sepia 三件事——AI 味的核心在叙事结构而非词汇93.2%、修文要多删少加74/18/8、唯一的节奏硬信号是句长离散度。而它同样诚实地告诉读者哪些规则是研究测出来的哪些只是编辑推断。这份边界感正是它区别于换词软件的地方 ✍️【免费下载链接】sepiaDe-AI writing skill for any Agent Skills-compatible agent (77 via the Skills CLI), with native plugins for Claude Code, Codex, Grok Build, and Antigravity. Narrative-architecture repair for fiction, venue-matched rules for professional prose. Based on StoryScope (arXiv:2604.03136).项目地址: https://gitcode.com/gh_mirrors/sepia3/sepia创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考