GitHub 趋势 · 第 62 期

一个 2,752 star 的研究 harness:榜单第一名加粗,验证待定写进小字

#GitHub趋势#AIAgent#深度研究

先说判断。jordan-gibbs/hyperresearch 是把深度研究做成流水线的 Claude Code harness,16 步、16 个 subagent、9 条结构性约束。但它最值得读的地方不是流水线,而是三处口径的分层:README 顶部写 The Most Powerful Deep Research Harness;正文加粗写它目前领先 DeepResearch-Bench 的 RACE 榜;而同一张榜单图下面的小字写着那是一个前瞻性预测,第三方验证尚未完成。

这不是造假,是三句话分别写在三个位置上。只读加粗那句,就会把预测当成成绩。

AI 帮你做调研,卡住的从来不是模型

常见的三个死结:读过的来源,下一轮还要重读一遍;报告里的引用,没有人回头核;跑到一半崩了,只能从头再来。这三个问题的共同点是流程没有状态——每次研究都是一次性的,产出是一份文件,不是一个能继续生长的东西。

hyperresearch 押的正是这一点:把来源沉淀成库,让第二轮从第一轮的终点开始。

它是什么

装进 Claude Code 之后,你用 /hyperresearch <anything> 起一次研究。它把读过的每个来源落进一个持久化的 vault,正文本体是 Markdown 加 YAML frontmatter,SQLite 只是缓存与索引(这个概念在仓库的 2.0 路线图里被写成 markdown-is-truth / SQLite-is-cache)。所以它的核心承诺是复利:来源进过一次库,就不再走。

一个免费的差异化细节:同一个项目有三套自我介绍。GitHub 的 description 字段写的是 Agent-driven research knowledge base;pyproject.toml 里写的是 Claude Code harness for disciplined, adversarially-audited deep research with full provenance;README 的大标题写的是 The Most Powerful Deep Research Harness。知识库、harness、最强,三个词的分量差得很远。

一次研究要花多久:它自己标了价

这是 README 里的档位表,时间数字是原话:

档位跑什么典型耗时
light有边界的事实查询、综述、对比,只跑 5 步约 30–40 分钟
full(默认)带对抗评审的深度论证,全部 16 步加引用核对约 1.5–2.5 小时
dissertation分章的超大任务:4–10 章、300–450 个来源约 4–8 小时

同页还有一张 subagent 名册表,把每个角色默认用哪个模型也写了:16 个 agent,9 个默认 Opus、7 个 Sonnet。负责对抗评估的四个 critic、负责写终稿的 synthesizer、只准打补丁的 patcher,都在 Opus 那一档。把它和上面的时间表放在一起读,一次深度研究的真实价格就摆在同一页上了——README 自己补了一句:usage scales with tier, gear, and corpus size。

而且模型不是配置项。限制段写着 It runs on Anthropic models via the subagent roster,后面紧跟一句 If anyone wants to port this to Codex, put up a PR!。想换模型,官方给的路径不是改配置,是提 PR。

16 步里,有几步只准打补丁

流水线是 16 步(含 1.5 与 14.5 两个半步),light 档只跑其中的 1 → 2 → 10 → 15 → 16。真正少见的是这条约束:patcher 与 polish-auditor 两个 subagent 被工具锁死为 [Read, Edit],也就是只准做外科手术式的修改,不许整篇重写。官方把它总结成一条不变式:patch-never-regenerate

README 的 What's structurally enforced 小节列了 9 条,摘 5 条:

第四条不是口号,是代码。v0.9.1 的 release notes 写得很具体:从网页抓回来的正文会被包进 <untrusted-source url=...> 分隔符;正文里伪造的开闭围栏标签,无论大小写和内部空格,一律中和成 untrusted-source-inner 并保留可见以便取证;url 属性做 HTML 转义并剔除控制字符,让正文和伪造的 URL 都没法把文本种到围栏外面。

换句话说,这个项目在防的正是「你让 agent 去读网页,而网页里写着让 agent 干别的」。同一份 release notes 里还列了另外四处静默失败的修补:标签大小写在存储与查询两侧对齐、FTS 查询里的孤立引号不再抛错被当成零结果、批量 PDF 抓取失败改为回落浏览器通道并上报失败 URL、以及 vault 的 CLAUDE.md 里不再插当天日期(那个日期每天击穿一次 Claude Code 的 prompt cache)。

仓库里最该读的是那份 2.0 路线图

docs/roadmap-2.0/ 下有一份 5,768 字节的总纲,另加 6 份阶段文档(11,795 / 11,340 / 12,110 / 13,206 / 12,802 / 11,486 字节,合计 72,739 字节)。总纲开头就把 2.0 的目标写成一次升级:从「约 80 个来源、约 10K 字的单篇报告」,推到「论文级的研究系统」。然后是两份 2026-07-19 审计的结论,官方自己点出 1.x 的两个结构性问题:

6 个阶段里,5 个的状态在 2026-07-19 已勾选完成,Phase 0(清债)部分提前、仍未关闭。文档里还有一句方法论备注值得单独摘出来:Line numbers drift; when executing a phase, re-verify anchors with grep before editing——行号会漂,执行前先 grep 复核锚点;锚点的职责是让目标可被找到,不是永远精确。

上手

README 给的主路径,原文是两条命令(Python 3.11–3.13,README 明说 3.14 暂不支持):

cd your-project
pip install hyperresearch && hyperresearch install

装完在 Claude Code 里起一次研究,参数就是你随便问的一句话:

/hyperresearch <anything>

常用命令节选(README 原文,注释也是原话):

hyperresearch profile list           # all profiles + descriptions + current gear
hyperresearch profile use premier    # 100–130 sources, doubled depth budget (~3–5 h)
hyperresearch run status -j          # Step-by-step status, spend, escalation queue depth
hyperresearch search "ion-trap gate fidelity" -j           # Full-text search
hyperresearch lint -j                                      # Health check (broken links, missing tags)
hyperresearch export json -o out.json # every note as structured JSON

注意第二行的注释:premier 档写的是 100–130 个来源、深度预算翻倍、约 3–5 小时。它和上面的三档表不是同一把尺子——一个量的是单次研究的规模(tier),一个量的是 gears 与 profile 的组合,官方没有给两者的换算表。看到 README 里出现两个时间数字,先分清问的是哪个。

我的判断

适合谁:已经在用 Claude Code、要长期盯住某个领域、且能接受一次研究跑 1.5–2.5 小时的人。它的价值来自 vault 的复利,研究越连续越划算;也可以先跑 light 档试水,30–40 分钟出结果。

不适合谁:想五分钟拿到结论的人;只跑非 Anthropic 模型的人(官方给的换模型路径是提 PR);Python 3.14 环境(requires-python 写死了 >=3.11,<3.14);以及想拿它当通用搜索工具的人——它替你做的是流程,不是替你判断哪些来源重要。

上手前有五个坑,全部写在 README 与 pyproject 里,只是位置很分散:

最后补两个体量数字。整个仓库 1,755 KB,只带了一份样例报告(example-reports/rl-exploration-trajectory-planning.md,87,047 字节)——真产出都在用户本地的 vault 里,仓库装的是代码与提示词。所以它的分量不能按仓库大小估,得按它替你省下的重读与复核次数估。

仓库:github.com/jordan-gibbs/hyperresearch(jordan-gibbs/hyperresearch,个人账号)

star:API 实测 2,752 · Trending Python 日榜同期快照 2,806(单日 +153)· fork 267 · 未关闭 issue 14 · subscribers 12

许可:MIT(LICENSE 1,069 字节标准全文,可商用);本轮未发现 deprecated 声明、非商用条款或禁止宣传的要求。

版本:default_branch main · pyproject.toml 版本 0.11.1 · classifier 为 Development Status :: 3 - Alpha · requires-python >=3.11,<3.14 · 建仓 2026-04-09 · 最近推送 2026-09-11 · 仓库 size 1,755 KB

发版:/releases 列表共 14 个,全部 assets 为空——分发只走 PyPI,没有可下载的二进制包。最新是 v0.11.1(2026-09-11 21:15),与 v0.10.1(16:03)、v0.11.0(18:17)在同一天连发;上一次发版是 2026-07-25 的 v0.9.1,中间静默 48 天。顺带一个工具层提醒:同时刻实测 /releases/latest 端点返回的是 v0.9.1,而 /releases 列表与 /tags 都已经到 v0.11.1——查版本别只打一个端点。

选题依据:全语言日 / 周 / 月三榜逐个剔除历史已写项目后无新面孔,改用 Python、Rust、Go、TypeScript 四个分语言日榜;本项目不在历史已写清单与往期线索池中,是四个分语言日榜里未写候选动量最高的一个。

数据来源:GitHub Trending 官方页面 + GitHub REST API + 仓库内 README.md / LICENSE / pyproject.toml / docs/roadmap-2.0 / releases。抓取时间 2026-09-12 15:5x(GMT+8)。正文中的字节数、条目数、阶段数均为接口实测后逐项相加核对。

本文只陈述抓取到的公开事实,不构成对项目质量的保证,也不构成法律意见。

你会为一次 1.5–2.5 小时的研究买单吗?如果只跑 light 档,你觉得它值不值?评论区说一声,我下期挑一个更省时间的 harness 做对照。

下期预告:上一期答应的那个主题族(把模型塞到小设备与边缘上),到今天三榜上仍然凑不够成员,继续欠着。下期如果出现高动量新面孔,就回单项目精读;仍然零候选,就换个主题族做横向合集。

#GitHub趋势#AIAgent#深度研究