GitHub 趋势 · 第 62 期
一个 2,752 star 的研究 harness:榜单第一名加粗,验证待定写进小字
#GitHub趋势#AIAgent#深度研究
先说判断。jordan-gibbs/hyperresearch 是把深度研究做成流水线的 Claude Code harness,16 步、16 个 subagent、9 条结构性约束。但它最值得读的地方不是流水线,而是三处口径的分层:README 顶部写 The Most Powerful Deep Research Harness;正文加粗写它目前领先 DeepResearch-Bench 的 RACE 榜;而同一张榜单图下面的小字写着那是一个前瞻性预测,第三方验证尚未完成。
这不是造假,是三句话分别写在三个位置上。只读加粗那句,就会把预测当成成绩。
AI 帮你做调研,卡住的从来不是模型
常见的三个死结:读过的来源,下一轮还要重读一遍;报告里的引用,没有人回头核;跑到一半崩了,只能从头再来。这三个问题的共同点是流程没有状态——每次研究都是一次性的,产出是一份文件,不是一个能继续生长的东西。
hyperresearch 押的正是这一点:把来源沉淀成库,让第二轮从第一轮的终点开始。
它是什么
装进 Claude Code 之后,你用 /hyperresearch <anything> 起一次研究。它把读过的每个来源落进一个持久化的 vault,正文本体是 Markdown 加 YAML frontmatter,SQLite 只是缓存与索引(这个概念在仓库的 2.0 路线图里被写成 markdown-is-truth / SQLite-is-cache)。所以它的核心承诺是复利:来源进过一次库,就不再走。
一个免费的差异化细节:同一个项目有三套自我介绍。GitHub 的 description 字段写的是 Agent-driven research knowledge base;pyproject.toml 里写的是 Claude Code harness for disciplined, adversarially-audited deep research with full provenance;README 的大标题写的是 The Most Powerful Deep Research Harness。知识库、harness、最强,三个词的分量差得很远。
一次研究要花多久:它自己标了价
这是 README 里的档位表,时间数字是原话:
| 档位 | 跑什么 | 典型耗时 |
|---|---|---|
| light | 有边界的事实查询、综述、对比,只跑 5 步 | 约 30–40 分钟 |
| full(默认) | 带对抗评审的深度论证,全部 16 步加引用核对 | 约 1.5–2.5 小时 |
| dissertation | 分章的超大任务:4–10 章、300–450 个来源 | 约 4–8 小时 |
同页还有一张 subagent 名册表,把每个角色默认用哪个模型也写了:16 个 agent,9 个默认 Opus、7 个 Sonnet。负责对抗评估的四个 critic、负责写终稿的 synthesizer、只准打补丁的 patcher,都在 Opus 那一档。把它和上面的时间表放在一起读,一次深度研究的真实价格就摆在同一页上了——README 自己补了一句:usage scales with tier, gear, and corpus size。
而且模型不是配置项。限制段写着 It runs on Anthropic models via the subagent roster,后面紧跟一句 If anyone wants to port this to Codex, put up a PR!。想换模型,官方给的路径不是改配置,是提 PR。
16 步里,有几步只准打补丁
流水线是 16 步(含 1.5 与 14.5 两个半步),light 档只跑其中的 1 → 2 → 10 → 15 → 16。真正少见的是这条约束:patcher 与 polish-auditor 两个 subagent 被工具锁死为 [Read, Edit],也就是只准做外科手术式的修改,不许整篇重写。官方把它总结成一条不变式:patch-never-regenerate。
README 的 What's structurally enforced 小节列了 9 条,摘 5 条:
- ▪scaffold-prompt lint:逐字提示词视为不可改。
- ▪quote-integrity lint:引用原文必须真实存在。
- ▪Retractions block the ship:被撤稿的论文直接拦住,报告发不出去。
- ▪<untrusted-source> 围栏:抓回来的网页文字只能当数据,不能当指令。
- ▪patch-surgery lint:发现的问题不许被静默跳过。
第四条不是口号,是代码。v0.9.1 的 release notes 写得很具体:从网页抓回来的正文会被包进 <untrusted-source url=...> 分隔符;正文里伪造的开闭围栏标签,无论大小写和内部空格,一律中和成 untrusted-source-inner 并保留可见以便取证;url 属性做 HTML 转义并剔除控制字符,让正文和伪造的 URL 都没法把文本种到围栏外面。
换句话说,这个项目在防的正是「你让 agent 去读网页,而网页里写着让 agent 干别的」。同一份 release notes 里还列了另外四处静默失败的修补:标签大小写在存储与查询两侧对齐、FTS 查询里的孤立引号不再抛错被当成零结果、批量 PDF 抓取失败改为回落浏览器通道并上报失败 URL、以及 vault 的 CLAUDE.md 里不再插当天日期(那个日期每天击穿一次 Claude Code 的 prompt cache)。
仓库里最该读的是那份 2.0 路线图
docs/roadmap-2.0/ 下有一份 5,768 字节的总纲,另加 6 份阶段文档(11,795 / 11,340 / 12,110 / 13,206 / 12,802 / 11,486 字节,合计 72,739 字节)。总纲开头就把 2.0 的目标写成一次升级:从「约 80 个来源、约 10K 字的单篇报告」,推到「论文级的研究系统」。然后是两份 2026-07-19 审计的结论,官方自己点出 1.x 的两个结构性问题:
- ▪质量判断是易失的。6 维效用评分只被用一次——挑抓取目标,然后就丢掉;citations 按首次出现编号;Python 层没有任何东西能回答哪些来源最承重。原话是 sources 表只是一个去重台账,没有 score、tier 或 rank 列。
- ▪规模是硬编码在散文里的。来源下限 45 / 目标 55–80、loci 上限 6、depth 预算 40、草稿数 3、必读范围 20–50、字数上限 10K,全都是写在 skill 与 agent 提示词文本里的字面量。官方原话:Scaling up currently means rewriting 17 skills and 14 agent prompts。
6 个阶段里,5 个的状态在 2026-07-19 已勾选完成,Phase 0(清债)部分提前、仍未关闭。文档里还有一句方法论备注值得单独摘出来:Line numbers drift; when executing a phase, re-verify anchors with grep before editing——行号会漂,执行前先 grep 复核锚点;锚点的职责是让目标可被找到,不是永远精确。
上手
README 给的主路径,原文是两条命令(Python 3.11–3.13,README 明说 3.14 暂不支持):
cd your-project pip install hyperresearch && hyperresearch install
装完在 Claude Code 里起一次研究,参数就是你随便问的一句话:
/hyperresearch <anything>
常用命令节选(README 原文,注释也是原话):
hyperresearch profile list # all profiles + descriptions + current gear hyperresearch profile use premier # 100–130 sources, doubled depth budget (~3–5 h) hyperresearch run status -j # Step-by-step status, spend, escalation queue depth hyperresearch search "ion-trap gate fidelity" -j # Full-text search hyperresearch lint -j # Health check (broken links, missing tags) hyperresearch export json -o out.json # every note as structured JSON
注意第二行的注释:premier 档写的是 100–130 个来源、深度预算翻倍、约 3–5 小时。它和上面的三档表不是同一把尺子——一个量的是单次研究的规模(tier),一个量的是 gears 与 profile 的组合,官方没有给两者的换算表。看到 README 里出现两个时间数字,先分清问的是哪个。
我的判断
适合谁:已经在用 Claude Code、要长期盯住某个领域、且能接受一次研究跑 1.5–2.5 小时的人。它的价值来自 vault 的复利,研究越连续越划算;也可以先跑 light 档试水,30–40 分钟出结果。
不适合谁:想五分钟拿到结论的人;只跑非 Anthropic 模型的人(官方给的换模型路径是提 PR);Python 3.14 环境(requires-python 写死了 >=3.11,<3.14);以及想拿它当通用搜索工具的人——它替你做的是流程,不是替你判断哪些来源重要。
上手前有五个坑,全部写在 README 与 pyproject 里,只是位置很分散:
- ▪全局安装会污染每个 session。hyperresearch install --global 能让 /hyperresearch 在任何 Claude Code session 里可用,代价是每个 session 的 system reminder 里多约 15 行——README 的原话是 at the cost of ~15 lines in every session's system reminder。
- ▪装 MCP 必须锁上界。pyproject.toml 里那条依赖注释值得逐字读:mcp 2.0 移除了 mcp.server.fastmcp,而工具全建在它上面;不锁上界时 pip install hyperresearch[mcp] 会解析到 2.x,hyperresearch mcp 在 import 阶段就死,而且报错会说 extra 缺失——实际上它装好了。这种报错指向错误原因的坑,不写进注释就没人知道。
- ▪学术来源自带门槛。Unpaywall 要求真实联系邮箱,留空则整个 Unpaywall 被跳过;CORE 与 FRED 各要 API key;SEC EDGAR 要求设置 HYPERRESEARCH_CONTACT_EMAIL;RePEc 官方直说它的 API 没有搜索功能。
- ▪边界是硬的。README 原话:CAPTCHAs, 2FA, and logins are never solved automatically——验证码、两步验证与登录永不自动处理,会整理成一条消息交给你。
- ▪lint 只保证结构,不保证事实。README 自己写明它抓的是结构性失败(缺脚手架、溯源断了、有未解决的 CRITICAL),而 factual accuracy 仍然由你负责。这句话应该被每个用 AI 做研究的人读一遍。
最后补两个体量数字。整个仓库 1,755 KB,只带了一份样例报告(example-reports/rl-exploration-trajectory-planning.md,87,047 字节)——真产出都在用户本地的 vault 里,仓库装的是代码与提示词。所以它的分量不能按仓库大小估,得按它替你省下的重读与复核次数估。
仓库:github.com/jordan-gibbs/hyperresearch(jordan-gibbs/hyperresearch,个人账号)
star:API 实测 2,752 · Trending Python 日榜同期快照 2,806(单日 +153)· fork 267 · 未关闭 issue 14 · subscribers 12
许可:MIT(LICENSE 1,069 字节标准全文,可商用);本轮未发现 deprecated 声明、非商用条款或禁止宣传的要求。
版本:default_branch main · pyproject.toml 版本 0.11.1 · classifier 为 Development Status :: 3 - Alpha · requires-python >=3.11,<3.14 · 建仓 2026-04-09 · 最近推送 2026-09-11 · 仓库 size 1,755 KB
发版:/releases 列表共 14 个,全部 assets 为空——分发只走 PyPI,没有可下载的二进制包。最新是 v0.11.1(2026-09-11 21:15),与 v0.10.1(16:03)、v0.11.0(18:17)在同一天连发;上一次发版是 2026-07-25 的 v0.9.1,中间静默 48 天。顺带一个工具层提醒:同时刻实测 /releases/latest 端点返回的是 v0.9.1,而 /releases 列表与 /tags 都已经到 v0.11.1——查版本别只打一个端点。
选题依据:全语言日 / 周 / 月三榜逐个剔除历史已写项目后无新面孔,改用 Python、Rust、Go、TypeScript 四个分语言日榜;本项目不在历史已写清单与往期线索池中,是四个分语言日榜里未写候选动量最高的一个。
数据来源:GitHub Trending 官方页面 + GitHub REST API + 仓库内 README.md / LICENSE / pyproject.toml / docs/roadmap-2.0 / releases。抓取时间 2026-09-12 15:5x(GMT+8)。正文中的字节数、条目数、阶段数均为接口实测后逐项相加核对。
本文只陈述抓取到的公开事实,不构成对项目质量的保证,也不构成法律意见。
你会为一次 1.5–2.5 小时的研究买单吗?如果只跑 light 档,你觉得它值不值?评论区说一声,我下期挑一个更省时间的 harness 做对照。
下期预告:上一期答应的那个主题族(把模型塞到小设备与边缘上),到今天三榜上仍然凑不够成员,继续欠着。下期如果出现高动量新面孔,就回单项目精读;仍然零候选,就换个主题族做横向合集。
#GitHub趋势#AIAgent#深度研究