GitHub 趋势 · 第 46 期
让编程 Agent 自己做研究:991 star 的 OpenResearch,把每条证据钉在 git 里
#研究Agent#实验可复现#本地优先
它和市面上大多数 AI 编程工具不是一类东西:它不提升你写代码的速度,它想解决的是脚本跑完之后的事——实验能不能被复现、被追溯。README 第一句定位是 the local-first workspace for research agents and autoresearch,本地优先,以及让 agent 自己走完「提想法 → 改代码 → 起实验 → 看证据 → 决定下一步」这一整圈。Rust 写的,MIT,991 颗星,今天涨了 210。
用 Claude Code 或 Codex 跑过实验的人都见过同一个场面:换了三组参数、跑了两轮,回头想确认「刚才那个更好的结果,到底是哪次提交跑出来的」,只能去翻终端历史。变体散在不同的 worktree 里,日志散在滚动的输出里,结论散在聊天窗口里,过一个星期连自己都说不清当时为什么改了那一行。
缺的其实不是算力,是证据的存放方式:让每一次运行的输入、代码快照、日志和产物,从一开始就长在同一棵树上。
它到底是什么
README 的原文是这么定义的:Turn Claude Code, Codex, or OpenCode into research agents that can review literature, develop hypotheses, run experiments, and produce research artifacts.——把你已经装好的三种编程 agent,变成能查文献、提假设、跑实验、产出研究工件的 agent。它自己不是 agent,是一层本地工作台:Rust 写成,装完跑一句 orx up,在 http://127.0.0.1:4791 起一个本地面板。
和「把结果交给云端」的路线不同,它的默认值压得很死:进程跑在 127.0.0.1,数据存在本地 SQLite 里。README 专门写了一节叫 Local by default,原话是 Creating a project or launching a run does not publish your code.——建项目和起实验都不会把代码发出去。openresearch.sh 的账号只用于组织与托管算力这类「服务侧才有的能力」,本地用法不需要它。
最核心的设计是 autoresearch:agent 可以自己跑完整圈——propose an idea, change the code, launch an experiment, inspect the evidence, and decide what to try next(提想法、改代码、起实验、看证据、再决定下一步);多个 agent 可以各占一个方向并行推进,而实验树保留它们的血缘关系。这一句里的每个动词,都能在面板上找到一个对应的落点,而不是一句宣传语。
核心能力:官方那张表,我逐条翻了一下
| 官方口径 | 实际含义 |
|---|---|
| Parallel exploration | 每个研究方向给一个独立的 agent 会话 + 独立的 git worktree,互不干扰 |
| Reproducible experiments | 变体记在一棵 git-native 实验树上;每次 run 自动留存它那次提交的不可变归档 |
| Evidence in context | 日志、diff、文件、结果、工件,都和产生它的那次工作绑在一起 |
| Your choice of agent | Claude Code / Codex / OpenCode 三选一,harness 与模型按会话指定 |
| Your choice of compute | 本地跑、跑在自建基础设施上,或用官方的托管算力 |
| Local ownership | 项目、会话、实验、run、日志、代码、工件都留在你自己机器上 |
第二行和第三行是本期我最在意的地方。every run receives an immutable archive of its recorded commit——每次运行都会给它记录的那次提交存一份不可变归档。这意味着「复现」不是靠你手抄配置,而是运行那一刻就被钉住了;之后改动代码不会污染上一次的证据。跟大多数「AI 帮你写代码」的工具比,这是完全不同的关注点:那些工具优化的是生成速度,它优化的是事后能不能讲清楚。
执行侧也留了余地。同一个提交快照可以跑在本地、走 SSH 跑在远端,也可以落到 Slurm、Kubernetes、Ray、Hugging Face Jobs、Modal、Tinker 上,README 强调 Publishing the repository is not required——不需要把仓库推出去才能跑。典型用法是把工作台跑在远端 GPU 旁边、浏览器留在笔记本上:
orx up --remote user@host
SSH 配置里的别名和自定义端口都支持。但这一行也是本期第一个要提醒的地方,后面「三条默认值」那节会展开。
上手:命令全部取自 README 原文
macOS 或 Linux 上装 CLI,两行:
curl -LsSf https://openresearch.sh/install.sh | sh orx up
第二行会把本地面板起在 http://127.0.0.1:4791。官方也提供桌面应用(openresearch.sh/download),Windows 目前要从 Releases 下载 zip 解压运行,README 明确写了先读 docs/windows.md——因为 Windows 支持还是 beta,而且 必须有 Git for Windows:它不只是个 git,orx 跑实验要用的 bash 和 coreutils 都来自它,System32 里那个 bash.exe 是 WSL 的启动器,看不到你的文件,orx 会直接拒绝。
另一条路是完全本地推理。README 单独给了一份文档讲怎么把本地模型接给 OpenCode,支持的三家与默认地址都在下面(这些地址必须是回环地址,相对运行 OpenResearch 的那台机器而言):
| 本地模型服务 | 默认地址 | 备注 |
|---|---|---|
| LM Studio | http://127.0.0.1:1234/v1 | 需开 Developer Mode,手动选加载参数,上下文设 32768 |
| oMLX(Apple Silicon) | http://127.0.0.1:8000/v1 | 放一个支持工具调用的 MLX 模型,首次请求时加载 |
| Ollama | http://127.0.0.1:11434/v1 | 走同一套 OpenAI 兼容连接流程 |
| 自定义端点(如 vLLM) | 填以 /v1 结尾的 base URL | 必须暴露 GET /v1/models,且支持工具调用 |
常用命令量不大,读一遍就知道它管什么:
orx projects # 列出项目 orx runs # 列出某项目的 run orx logs # 看某次 run 的日志 orx exp run # 运行一个实验 orx discover keyword # 按关键词检索 orx paper # 按 arxiv id 或 doi 取论文 orx install-skills # 把 OpenResearch skill 装进你的编程 agent orx --help # 完整接口
上面几行按 README 的命令清单抄下来,每条的完整参数在 orx 子命令 --help 里(例如 orx project view、orx exp run 后面跟的是 id)。其中 orx install-skills 值得单独说一句:它会把 OpenResearch 自己的 skill 写进你正在用的编程 agent 的目录里。仓库根目录里也确实躺着 SYSTEM_PROMPT.md、SKILL.md、agent-skills/(12 个 skill 目录:orx-evidence、orx-experiment-tree、orx-lit-review、orx-paper、orx-figures、orx-reports、orx-compute、orx-git、orx-create、orx-customize、orx-instances、orx-agent-delegation)。也就是说,agent 该怎么干活,是被这个仓库的提示词定义的——装之前值得先读一遍它们,而不是装完再猜为什么 agent 突然换了工作方式。
三条默认值,README 自己写清楚了
这条我单独拎出来,因为它是这一期里最该在动手前知道的事。
① 远程模式没有应用层鉴权。README 在 orx up --remote 那一节的原文是:The remote service binds to loopback and has no application-level authentication, so other users on that host can reach it.——远端服务绑在回环地址上,并且没有应用层鉴权,所以那台机器上的其他用户是可以访问到它的。多用户服务器上开远程模式,这一点必须先想清楚。
② 遥测默认开启,且是 opt-out。官方编译版本会发送粗粒度的使用事件,绑一个随机安装 ID。README 同时列明了不采集的东西:代码、提示词、文件内容与路径、仓库名、token、邮箱、项目与实验标识符都不在内;源码与开发构建不发遥测。要关掉就是三条命令:
orx telemetry off orx telemetry status orx runs --no-telemetry # 任意子命令都可临时关闭
③ 本地推理不等于离线。这句是 README 自己写的:Local inference does not mean the research workflow is offline.——模型可以在你机器上跑,但下载、论文检索、GitHub 操作、agent 执行的命令仍然会走网络。文档还补了一句容易被忽略的:遥测开关和模型路由是两件独立的事,关了遥测不代表模型请求不走网络。
我的判断:适合谁,不适合谁
适合这几类人:
- ▪手上真有实验要跑的研究/算法团队:需要同时试多个方向,又不能让各方向的改动互相打架
- ▪已经在用 Claude Code 或 Codex,但结果散在终端历史里、事后说不清哪次提交对应哪份结果
- ▪对证据链有要求的人:写论文、做内部复现、需要留档的工程决策
- ▪有自建算力(Slurm、K8s、Ray、Modal 之类)的团队——同一份提交快照可以直接丢过去跑
- ▪想完全用本地模型的人:LM Studio、Ollama、oMLX、vLLM 都有明确接法,模型服务地址只认回环
不适合:
- ▪只想让 AI 帮忙写代码、没有实验要跑的:这套东西管的是实验流程,不是补全速度
- ▪Windows 用户:支持仍是 beta,已知缺口官方列了五条——远程模式被拒(控制通道是 Unix domain socket)、orx update 不可用、SSH 连接无法复用导致状态轮询每次都新开连接、PATH 守卫不生效、数据目录仍写在 %USERPROFILE%\.local\share\openresearch
- ▪期待稳定版的人:当前版本 v0.1.122,Rust 项目连发 122 个补丁还在 0.1 线上,Windows 的 orx.exe 至今未签名,首次运行会被 SmartScreen 拦下
- ▪想要完全离线的人:本地推理只解决模型这一环,论文与代码的获取仍然联网
动手前值得先知道的几个坑:
① 安装脚本是管道执行:curl ... | sh 这种形式,装之前建议先把脚本拉下来看一眼,或者直接用 Releases 里的 tar.xz / dmg。
② Windows 三条硬限制:必须装 Git for Windows(orx 用它提供的 bash);路径超过 260 字符会顶到天花板,orx 只给 git 传了 core.longpaths,非 git 的脚本还得你自己去系统里开长路径;升级只能重跑安装器,orx update 在 Windows 上不工作。
③ 远端模式的默认暴露面:回环绑定 + 无应用层鉴权,意味着同一台主机上的其他用户可达。多租户机器上要先加一层访问控制再开。
④ 小模型 + 短上下文跑不动工具:官方文档写明上下文要和模型服务里加载的窗口对齐,32K 是起步建议值,并且「一个能力偏弱的模型配小上下文,可能撑不住编程类工具」。
⑤ 社区很新,别当成熟产品用:仓库 2026 年 6 月创建,991 star 对 5 个 watcher、11 个未关闭 issue,tags 一页 30 个全在 v0.1.93 到 v0.1.122 之间——迭代速度说明项目还在快速变形期,不适合押在关键生产链路上。
项目:alphaXiv/OpenResearch · https://github.com/alphaXiv/OpenResearch · 官网 https://openresearch.sh/
Star:991(GitHub REST API 实测)· Trending 页面同期快照列 1,048、今日 +210;fork 77、open issue 11、watcher 5
语言 Rust · 许可 MIT(LICENSE 为标准 MIT 全文,Copyright (c) 2026 alphaXiv,无追加条款,可商用)
版本:v0.1.122(2026-09-10,非预发布)· tags 一页 30 个(v0.1.93 → v0.1.122)· 仓库创建 2026-06-07、最近推送 2026-09-11 · 仓库体积约 65MB
发布物:openresearch-cli-aarch64-apple-darwin.tar.xz、x86_64-apple-darwin、aarch64/x86_64-unknown-linux-musl、OpenResearch.dmg、openresearch-cli-installer.sh
未归档、未禁用、无禁止宣传声明;topics 为空、homepage 指向 openresearch.sh
数据来源:GitHub Trending 官方页面(daily / weekly / monthly)+ GitHub REST API + raw README / LICENSE / docs/local-models.md / docs/windows.md 原文 · 抓取时间:2026-09-11 21:05
你现在跑实验是怎么记的——还在靠命令行历史和手工记参数,还是已经有一套自己的留痕方式了?留言说说,我会挑有意思的下期展开。
下期写 Lakr233/vphone-cli(11,571 star,本月 +3,892,Swift)——在 Mac 上把 iPhone 跑成虚拟机的命令行工具,连续几期都排在月榜高动量区。备选是 cordiverse/cordis(8,355 star,本月 +8,270,TypeScript)与 NVIDIA-NeMo/Switchyard(2,863 star,本月 +2,628,跨模型路由但保持 OpenAI / Anthropic 原生 API 兼容)。如果核实下来撑不起一期,就换月榜下一个高动量项目,绝不硬写。
#研究Agent#实验可复现#本地优先