ARIS 自进化闭环源码剖析/meta-optimize 与 /meta-apply 如何持续改进工具【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleepARISAuto-Research-In-Sleep是一套面向自主机器学习研究的轻量级纯 Markdown 技能系统而它最独特的设计是自进化闭环/meta-optimize负责分析你的真实使用日志、找出工具链的短板并产出改进补丁/meta-apply则作为唯一的落地闸门在跨模型陪审团评审和人类批准后才把补丁真正写入技能库。本文带你从源码层面拆解这个闭环——数据从哪来、决策由谁做、以及它为什么不会失控。一、什么是自进化闭环ARIS 在优化它自己很多工具优化的是产出物论文、代码而 ARIS 的自进化闭环优化的是harness 本身——也就是包裹在 LLM 外层的那套技能提示词、默认参数、收敛规则和工作流编排。可优化组件示例是否可自动优化SKILL.md 提示词评审员指令、质量门槛、步骤描述✅默认参数difficulty: medium、MAX_ROUNDS: 4、阈值 6/10✅收敛规则评审循环何时停止、重试次数✅工作流顺序技能链的调用顺序✅MCP 桥接配置评审模型路由属于基础设施❌这个设计源自 Meta-Harness 的核心洞察harness 的设计与模型权重同样重要而 harness 工程可以通过记录执行轨迹 用轨迹指导改进来部分自动化。注意闭环优化的是工具而不是研究产物本身——论文和实验仍由常规工作流负责。完整技能清单可参见 docs/SKILLS_CATALOG.md 中对这两个技能的定位前者是外环自进化分析器后者是特权落地闸门。二、闭环第一步/meta-optimize 把使用历史变成补丁1. 被动埋点零成本的数据采集自进化的燃料是真实使用数据。ARIS 通过 Claude Code 的钩子机制在正常使用时静默记录一切——你完全无感。配置模板 templates/claude-hooks/meta_logging.json 在 5 类生命周期事件上挂了同一个记录脚本PostToolUse工具调用后、PostToolUseFailure工具失败、UserPromptSubmit用户提交、SessionStart/SessionEnd会话起止。真正的解析逻辑在 tools/meta_opt/log_event.sh它把钩子传来的 JSON 提炼成结构化事件双写到项目级.aris/meta/events.jsonl和全局~/.aris/meta/events.jsonl用于跨项目趋势分析。每行 JSONL 长这样{ts:2026-09-19T08:12:03Z,event:skill_invoke,skill:auto-review-loop,args:difficulty: hard} {ts:2026-09-19T08:15:41Z,event:tool_failure,tool:Bash,input_summary:python train.py}技能调用、工具失败、斜杠命令、用户改参、会话模型session_start的model字段……全是分析原料。2. 五种分析从用了什么到卡在哪里skills/meta-optimize/SKILL.md 定义了完整的分析工作流核心是五类挖掘频率分析哪些技能被高频调用用户最常手动覆盖哪些参数覆盖 默认值不好的信号失败分析哪些工具失败最多OOM / 导入错误 / 超时各占多少收敛分析评审循环平均几轮达标分数曲线是快速上升、平台期还是震荡人工干预分析用户在哪里中途打断手动纠正这些是技能缺口模型差量分析harness 瘦身如果会话模型升级了旧模型时代的手把手脚手架就成了纯开销——此时删除步骤 N–M 是一个一等公民的优化提案与新增改动走同一套排名与审批逻辑分析完成后技能会把当前最卡的环节用一句话命名如验证质量、规划追加进只增不改的账本.aris/meta/bottleneck_log.jsonl——瓶颈会随时间迁移账本记录的是它的接力史。3. 关键设计只提案不落地/meta-optimize被刻意设计成只读生产者READ-ONLY PRODUCER它没有Write/Edit工具无法直接改任何 SKILL.md它唯一的写操作是把批准的补丁暂存到.aris/meta/pending/草稿区永不触碰技能库它还会用tools/meta_opt/trigger_eval.py测量技能触发率——事件日志只能看到技能被用了看不到想被用却漏触发的失败这个工具用改写意图的探测查询直接测量混淆矩阵。为什么这么抠细节因为它堵死了一个经典失败模式——自我豁免self-acquittal如果提出补丁的循环能自己批准并应用补丁那么一句被漏掉的指令就可能让系统给自己打免罪牌。把提案和落地拆到两个工具权限不同的技能里这条防线就是结构性的而不是靠一句请勿自行应用的口头约定。详见 skills/shared-references/acceptance-gate.md。4. 就绪提醒数据够了才叫醒你你不需要盯着日志。钩子配置里的SessionEnd还会触发 tools/meta_opt/check_ready.sh每次会话结束时做两件事上次优化以来累计≥5 次技能调用 → 打印 ARIS has logged N skill runs... Run /meta-optimize会话模型发生变化→ 打印 Model changed... a model bump makes existing scaffolding a deletion candidate两者都只是建议绝不自动运行。数据不足 5 条时/meta-optimize自己也会检查并劝退继续正常使用稍后再来。三、闭环第二步/meta-apply唯一的落地闸门读完/meta-optimize的报告后你说一句应用第 1、3 条然后手动运行/meta-apply。这一次敲键盘本身就是落地授权——skills/meta-apply/SKILL.md 规定它只能由人类显式触发永远不能作为别的技能或钩子的副作用运行。1. 落地时才开陪审团绝不信任生产者写的结论一个早期设计的教训被写进了源码注释如果信任生产者 manifest 里的jury_verdict: pass字段那是可伪造的——写这个字段的正是生产者自己一个有 bug 或跑偏的生产者可以把被拒的补丁标成 pass。所以/meta-apply的做法是在落地那一刻、对真实的暂存 diff开一个全新的跨模型陪审团全新线程的 Codex 评审路径级只读不携带生产者的推理过程只问一个问题这个改动是否在不引入回归的前提下改进了 harnessPASS 或 KILL 一句话理由。结果只在本地产出、当场消费没有可伪造的中间产物。被 KILL 的补丁人类无法强行放行——你只能在通过陪审团的幸存者里挑选。2. 作者与评审必须跨家族补丁由 Claude 侧执行者撰写由 Codex 模型评审。tools/provenance.py 中的assert_cross_family会在作者与评审同属一个模型家族或家族无法识别时直接抛错拒绝——这是结构性兜底防止同一个模型既写又批。3. 备份 → 应用 → 盖章 → 记日志全程可回滚每条幸存补丁的落地都是四步备份目标文件到.aris/meta/backups/date/可构造性可回滚仅用 Write/Edit 应用diff可审查、可归因不走 Bash盖溯源章tools/provenance.py 的stamp()写入{author_model, reviewer_model, verdict_id, content_hash}四元组且盖章时再次断言跨家族记账追加一行到.aris/meta/optimizations.jsonl特别值得新手注意的一点溯源章是流程收据process receipt不是正确性背书——它记录这个改动通过了跨模型陪审团 人类落地但不担保改动本身是对的。后续任何手改都会使content_hash失配章自动作废。四、如何开启自进化闭环四步上手启用埋点把 templates/claude-hooks/meta_logging.json 复制/合并进项目的.claude/settings.json正常使用跑至少 5 次完整工作流让.aris/meta/events.jsonl攒够数据运行优化分析看到提醒或随时手动输入/meta-optimize可加参数指定目标技能如/meta-optimize auto-review-loop阅读报告后告诉它要暂存哪几条人工落地运行/meta-apply 1,3或all陪审团逐条裁决通过者备份后写入被拒者留痕报告五、总结为什么这个闭环值得参考ARIS 的自进化闭环给所有想做AI 自我改进的人演示了一套克制而完整的工程范式提案权与落地权分离生产者只读落地者特权两者工具权限不同——防线是结构不是约定裁决在使用处生成跨模型陪审团在落地瞬间、对真实 diff 运行杜绝结论可伪造默认拒绝不指定补丁就不应用KILL 不可人工翻案全程留痕事件日志、瓶颈账本、备份、溯源章、优化流水每一环都可审计、可回滚对新手而言最值得借鉴的不是具体的脚本而是这套用真实使用数据驱动改进、用权限边界约束改进、用人类保持最终闸门的方法论——工具用得越久就会越懂你而每一步变强都经得起事后审查。【免费下载链接】Auto-claude-code-research-in-sleepARIS ⚔️ (Auto-Research-In-Sleep) — Lightweight Markdown-only skills for autonomous ML research: cross-model review loops, idea discovery, and experiment automation. No framework, no lock-in — works with Claude Code, Codex, OpenClaw, or any LLM agent.项目地址: https://gitcode.com/gh_mirrors/au/Auto-claude-code-research-in-sleep创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考