AI-Scientist 完整指南:让自动科研系统替你跑实验、写论文
发布时间:2026/9/12 7:25:30 作者:尧图编辑部 阅读量:1,286

AI-Scientist 完整指南让自动科研系统替你跑实验、写论文【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist如果你想验证一个新想法从提出假设、写代码、跑实验到成文往往要折腾好几周。AI-Scientist 是一套自动科研系统给它一份实验代码模板它会自动生成研究想法、执行实验、撰写 LaTeX 论文再让另一个模型当审稿人打分。本文带你从零跑到第一篇 AI 生成的论文。它是什么AI-Scientist 一句话心智模型这一节让你记住三件事它做什么、和AI 写代码工具有什么区别、入口在哪里。The AI Scientist 的定位是全自动开放式科学发现系统。它和常见的代码助手有三点关键差异闭环从想法到论文流程是生成想法 → 文献查新 → 写实验代码并执行 → LaTeX 成文 → LLM 审稿五步全部自动。审稿输出 Overall 分数1-10 分、Accept/Reject 决定和 Weaknesses 列表结果存在review.txt里。入口是模板而不是空白页templates/目录内置了 NanoGPT语言模型、2d_diffusion低维扩散生成、Grokking泛化与学习速度等模板每个模板都是experiment.pyplot.pyprompt.jsonseed_ideas.jsonlatex/template.tex的固定结构。人只出环境和预算你负责装依赖、配 API Key、付调用费中间的科研劳动全部交给 LLM。完整流程可以对照下面这张项目自带的工作流动画最快上手5 步部署 AI-Scientist 并跑通首次实验这一节给你一条最小可运行路径按顺序复制命令即可前提是 Linux NVIDIA GPUCPU 机器跑不完模板实验。第 1 步拿到代码git clone https://gitcode.com/GitHub_Trending/ai/AI-Scientist cd AI-Scientist第 2 步建环境并装 LaTeX。编译论文依赖pdflatex所以要先装 texlive-full这一步耗时较长中途可能需要按住 Enter 继续conda create -n ai_scientist python3.11 conda activate ai_scientist sudo apt-get install texlive-full pip install -r requirements.txt第 3 步准备数据并跑基线。以 NanoGPT 模板为例先下载三个数据集python data/enwik8/prepare.py python data/shakespeare_char/prepare.py python data/text8/prepare.py然后在模板目录里跑run_0基线。注意这一步必须在你自己的机器上做因为论文里的对比依赖你这台机器的运行时间cd templates/nanoGPT python experiment.py --out_dir run_0 python plot.py cd ../..其他模板的额外依赖2d_diffusion 需要安装 NPEET 仓库的pip install .以及scikit-learngrokking 只需pip install einops。第 4 步配置 API 密钥见下一节。第 5 步启动。建议先用轻量的nanoGPT_lite模板加 2 个想法验证整条链路python launch_scientist.py --model gpt-4o-2024-05-13 --experiment nanoGPT_lite --num-ideas 2如果你熟悉 Dockerexperimental/Dockerfile 已经打包好 texlive-full、全部 Python 依赖和预跑好的基线构建后可以直接用docker build -t ai-scientist -f experimental/Dockerfile .它能替代哪些工作把科研全流程拆成 3 个任务这一节按任务类型说明每个环节的输入和产出方便你判断哪一段最值得让 AI-Scientist 自动科研系统接管。想法生成与查新idea generation novelty check输入templates/名字/experiment.py的源码和seed_ideas.json里的种子想法。过程模型读取代码后批量产出想法--num-ideas默认 50 个每个想法带 Title、Experiment 描述以及 Interestingness/Feasibility/Novelty 三项 1-10 的自评分并经过 3 轮自我反思迭代NUM_REFLECTIONS 3见 launch_scientist.py。产出ideas.json。随后系统通过 Semantic Scholar或 OpenAlex做文献检索给每个想法标记novel字段只有查新的想法才进入实验。适合谁想快速看到模型能从我的代码里想出哪些研究方向的人。已有的想法不想重新生成时加--skip-idea-generation查新接口不通时加--skip-novelty-check。实验执行与数据产出输入一条 idea run_0/final_info.json基线结果。过程系统用 Aider由你选定的 LLM 驱动直接改写experiment.py和plot.py然后实际执行实验并记录到run_1、run_2… 各目录全过程对话与输出写入log.txt。产出每轮实验的final_info.json指标数据和训练曲线图。适合谁需要大量改一版代码、跑一遍、看指标循环的人。多卡环境用--parallel 4 --gpus 0,1,2,3并行处理不同想法进程数会自动对齐 GPU 数量。论文写作与自动审稿输入实验数据 latex/template.tex模板。产出一篇可编译的 LaTeX PDF接着用 OpenAI GPT-4o 做审稿——5 轮反思、5 个审稿人集成、temperature 0.1得到总体分、录用决定和具体弱点审稿相关调用见 ai_scientist/perform_review.py。进阶加--improvement参数系统会根据审稿意见自动修改论文生成_improved.pdf并二次审稿。适合谁需要快速拿到论文初稿、或者想让另一个模型给自己的工作挑毛病的人。调优与配置API 密钥、模型选择与关键参数这一节给你三块可直接复制的配置密钥、模型、参数。API 密钥配置密钥全部走环境变量按你选的模型厂商配置对应项# 任选其一对应你的模型 export OPENAI_API_KEY你的Key # GPT-4o / o1 系列 export ANTHROPIC_API_KEY你的Key # Claude 系列 export DEEPSEEK_API_KEY你的Key # deepseek-chat / deepseek-coder / deepseek-reasoner export GEMINI_API_KEY你的Key # gemini-1.5-flash / gemini-1.5-pro export OPENROUTER_API_KEY你的Key # llama3.1-405b经 OpenRouter # 文献检索可选 export S2_API_KEY你的Key # Semantic Scholar无 Key 也能用但吞吐低没有 Semantic Scholar Key 的替代方案pip install pyalex设置OPENALEX_MAIL_ADDRESS你的邮箱运行时加--engine openalex。支持的完整模型清单见 ai_scientist/llm.py 里的AVAILABLE_LLMS。模型选择建议Claude Sonnet 3.5claude-3-5-sonnet-20241022官方论文中实验成功率最高的主力模型单篇论文成本通常在 15 美元以内。deepseek-coder成本敏感时的选择官方 FAQ 里明确推荐它做低成本运行。GPT-4o写实验用没问题审稿环节代码里固定使用gpt-4o-2024-05-13官方建议审稿就用它。底线建议不要用明显弱于 GPT-4 水平的模型跑主流程想法生成和代码修改质量会明显下滑。关键命令参数说明python launch_scientist.py \ --model claude-3-5-sonnet-20241022 \ --experiment nanoGPT \ --num-ideas 2 \ --parallel 0 \ --engine semanticscholar参数作用--num-ideas生成的想法数量默认 50调试时设 2 最省钱--parallel并行进程数0 为顺序执行超过 GPU 数会被自动下调--gpus指定 GPU如0,1不指定则用全部--improvement审稿后自动按意见改稿并重新审稿--skip-idea-generation/--skip-novelty-check复用已有ideas.json/ 跳过查新--engine文献检索引擎semanticscholar或openalex成果长什么样example_papers 目录里的真实产出这一节带你直接看系统实际跑出来的东西建立对产出质量的预期。example_papers/下收录了 10 篇完整产出每篇都包含论文 PDF、想法 JSON、实验代码、run_1到run_5的原始数据和review.txt审稿记录。以 grokking 模板产出的数据增强论文为例验证准确率的对比图如下2D diffusion 模板的产出则侧重生成质量这是双专家去噪模型dual_expert_denoiser生成的样本对应的训练损失曲线用来观察模型收敛过程想快速校准预期建议先读几篇 Claude 生成的论文官方在 README 里也强烈建议这么做感受一下系统的强项和短板再去跑自己的实验。踩坑与排查高频问题及对应解法这一节列了跑 AI-Scientist 最常遇到的 8 个坑按现象对号入座。运行中提示文件缺失没完成模板初始化。先补齐该模板的数据准备/第三方依赖enwik8 数据、NPEET、einops再跑run_0基线最后才启动主流程。某个想法没产出 PDF 或 review单篇成功率受模板、模型和想法复杂度影响Claude Sonnet 3.5 最高个别想法失败是正常的看log.txt定位。审稿结果明显偏乐观官方指出其他模型审稿存在正向偏差或不按格式输出的问题审稿固定用 GPT-4o。texlive-full 安装卡住属于正常现象font 预生成很慢按住 Enter 让它继续。Semantic Scholar 访问不通换--engine openalex需先pip install pyalex并设置OPENALEX_MAIL_ADDRESS或--skip-novelty-check跳过查新。为什么非要自己跑 run_0运行时间对比必须基于本机硬件换机器就要重新跑基线。成本超预算调小--num-ideas或把主模型换成 deepseek-coder官方推荐的低成本方案。安全问题系统会执行 LLM 写的代码README 明确建议容器化运行并限制网络访问Dockerfile 就是为这个准备的。收尾你现在就可以做的 3 件事这一节给你明确的下一步动作清单。今天按最快上手一节装好环境用--num-ideas 2跑一遍 nanoGPT_lite然后打开产物目录里的ideas.json和review.txt看模型想了什么、审稿人怎么打分。本周挑 2-3 篇 example_papers/ 里的 PDF 通读一遍重点看实验设计和图表是否站得住脚。下一步确定你想探索的方向后照着 templates/nanoGPT_lite/ 的五件套结构experiment.py、plot.py、prompt.json、seed_ideas.json、latex/template.tex做自己的模板让 AI-Scientist 自动科研流程跑在你自己的问题上。【免费下载链接】AI-ScientistThe AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery 项目地址: https://gitcode.com/GitHub_Trending/ai/AI-Scientist创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考