如何用 Academic Research Skills 的 7 级证据金字塔给文献来源做证据质量评级?
【免费下载链接】academic-research-skillsAcademic Research Skills for Claude Code: research → write → review → revise → finalize项目地址: https://gitcode.com/GitHub_Trending/ac/academic-research-skills
你手上有一批候选文献(APA 引用、DOI、报告或预印本),需要判断每一条到底属于什么等级的证据、能否作为主要证据引用。Academic Research Skills 是一个面向 Claude Code 的技能包,其中deep-research技能把这件事做成了可执行流程:source_verification_agent按照 7 级证据金字塔(Level I–VII)给每个来源定设计等级,再按 6 个维度的 A–F 评分表合成总体等级,最后产出一份带质量矩阵的 Source Verification Report。评级规则完整定义在 source_quality_hierarchy.md 中,运行它需要 Claude Code 环境已加载该技能包;你只需要准备好来源清单,按触发方式让对应 agent 执行。
先看懂 7 级金字塔:等级是怎么划分的
评级前的共同语言是这张等级表(来自 source_verification_agent.md 与 source_quality_hierarchy.md):
| Level | 证据类型 | 权重 | 示例 |
|---|---|---|---|
| I | Systematic Reviews / Meta-analyses | 最高 | Cochrane reviews、Campbell reviews |
| II | Randomized Controlled Trials (RCTs) | 很高 | 设计良好的 RCT |
| III | Controlled Studies(非随机) | 高 | 准实验、队列 |
| IV | Case-Control / Cohort Studies | 中高 | 纵向、回顾性研究 |
| V | Systematic Reviews of Descriptive Studies | 中 | 定性研究的综述 |
| VI | Single Descriptive / Qualitative Studies | 低中 | 案例研究、民族志 |
| VII | Expert Opinion / Committee Reports | 最低 | 立场论文、社论 |
每个等级在参考文档中都有特征与警示(Caveats),例如 Level I 的结论质量取决于其纳入的研究本身("garbage in, garbage out"),在快速变化的领域可能过时;Level II 在社会科学/教育学中常不可行。读评级结果时对照这些条目能理解某个等级为什么带保留意见。
文档同时强调评级分两个不可混用的轴:
- Study-design level:研究设计在实验—描述光谱上的位置,即上面这张表,绝对且与学科无关;
- Fitness for claim within a discipline:该来源相对于它自己学科对特定论断而言的证据适配度。
这就是为什么一个人文领域的一手档案(设计等级只有 Level VI)仍可能拿到总体 Grade A——因为 Level VI 在人文领域就是 gold standard。混用这两个轴会把优秀的解释性/定性研究压死在低分上。
执行评级:在 Claude Code 中触发 source verification
准备条件只有一项:候选来源清单。来源可以是你检索得到的文献列表(APA 7.0 格式引用 + DOI 更佳,有 DOI 的来源能走更完整的存在性验证),也可以是 Material Passport 里的literature_corpus[]语料。
触发方式按 SKILL.md 的模式选择指南,主路径有两条:
- lit-review 模式(有主题、需要文献梳理):
bibliography_agent先做系统检索并产出 Annotated Bibliography,随后source_verification_agent对来源做证据分级。模式选择依据是"Need literature review for a topic →lit-review"。 - fact-check 模式(已有一批论断/来源需要查核):该模式只激活 Source Verification agent,输出 Verification report(300–800 词)。触发示例可参考 fact_check_mode.md:用户直接给出待查核的论断列表,agent 逐条对照证据核验并给出判定。
触发关键词包括 research、literature review、fact-check 及对应中文(研究、文献回顾、事实查核等)。执行流程中 source verification 属于 Phase 2(Investigation),其产物——Verified & Graded Sources、Source quality matrix——是 Phase 3 综合阶段的前置输入,即评级完成前流水线不会跳到综合。
6 维度 A–F 评分表与总体等级合成
设计等级定完后,每个来源按 6 个标准各打一个 A–F 分(完整表格见 source_quality_hierarchy.md 的 Grading Rubric 一节):
| 维度 | Grade A(示例) | Grade F(示例) |
|---|---|---|
| Evidence Level | 达到/超过本领域该论断的 gold standard | 无法归类或根本不适配该论断 |
| Peer Review | 严格同行评审 | 自出版 |
| Methodology | 典范、可复现 | 缺失/有缺陷 |
| Sample/Data | 大且具代表性 | 未说明 |
| Currency | 3 年内 | 对该主题已过时 |
| Conflicts | 无声明或检测出的利益冲突 | 明确的未披露冲突 |
合成总体等级走三步(顺序不可跳过):
- Integrity floor:Conflicts 为 F(明确未披露冲突),或 Peer Review 为 F 且该领域把正式评审视为常态,则总体直接封顶 D——诚信问题不能被其他维度的强度抵消;
- Base grade:取 6 个维度分数的中位数(A=4 … F=0 标度,相邻等级平分取低);
- Fitness adjustment:Evidence Level(适配度)为 A 时上调一级——达到本领域 gold standard 的来源可以到总体 A,即使 Currency 或 Sample/Data 分数偏低;但若 Methodology 为 F 则不适用此步,且任何情况不超过 A。
总体等级对应的使用决策是明确的:
- A:作为主要证据使用;B:作为支撑证据;C:附带明确保留意见使用;
- D:仅在无更好来源时用于兜底,并承认其弱点;F:不要使用,只在批评性引用时提及。
Field-Specific Adjustments表按学科调整 gold standard 预期:医学/健康以 Level I–II 为 gold standard;教育学常见 Level IV–VI;社科 Level III–V;政策研究接受 Level IV–V + VII(专家报告);人文的 gold standard 就是 Level VI 一手材料;技术领域是 Level III + 产业报告(同行评审滞后于现实)。给来源打分前先查这张表确定"本领域的 gold standard 在第几级",Evidence Level 维度才打得出 A。
参考存在性验证:防止金字塔打在虚构文献上
证据等级再高,前提也是来源真实存在。验证走三层(覆盖度要求见 cross_agent_quality_definitions.md:100% DOI 检查 + 50% WebSearch 抽查):
- Tier 0(Semantic Scholar API,100% 覆盖):有 DOI 的走 DOI 查询,无 DOI 的走标题检索;标题 Levenshtein 相似度 ≥ 0.70 且年份匹配(±1 年内)记为匹配。DOI 能解析但标题相似度 < 0.70 时标记
DOI_MISMATCH——这是已知的幻觉引用模式之一; - Tier 1(DOI 解析,100% 覆盖):DOI 必须解析到真实页面,标题与作者匹配;DOI 返回 404 或标题差异 > 3 个词自动标记;
- Tier 2(WebSearch 抽查,50% 覆盖):随机抽 50% 来源,用精确标题 + 第一作者 + 年份检索,确认来源存在于所声称的刊物、年份一致;优先把 tier_3、tier_4(学术非同行评审、灰色文献)全部先查,再从 tier_1/tier_2 中抽样。
最终存在性判定是五选一:S2_VERIFIED(Semantic Scholar 匹配)、VERIFIED(DOI 解析且元数据匹配)、PLAUSIBLE(无 DOI 但 WebSearch 确认存在)、UNVERIFIABLE(所有方法都无法确认,标记转人工)、FABRICATED(所有层级都失败,CRITICAL,必须移除)。技能文档把这条定为 IRON RULE:"difficult to verify" 不算通过,灰色地带即 FAIL——无法确认存在的文献不进入报告。
核对输出:报告、评估卡与完成条件
评级完成后你会得到两类产物,可以逐项核对:
Source Verification Report(格式定义见 source_verification_agent.md 的 Output Format 一节),核心是 Source Quality Matrix:
| Source | Level | Venue | Author | Method | Currency | COI | Overall |
|---|---|---|---|---|---|---|---|
| 简写引用 | I–VII | pass/warn/fail | pass/warn/fail | pass/warn/fail | pass/warn/fail | pass/warn | Grade |
报告同时包含被标记来源的明细(Issue / Severity / Recommendation: Include with caveat、Downgrade 或 Exclude / Evidence)、Predatory Journal Alerts、COI 披露和 Verification Limitations(哪些没验证到、为什么)。
Evidence Assessment Card:按 evidence_assessment_template.md 逐来源一张卡,覆盖 Source Identification、Evidence Level 及 Justification、Publication Venue、Author Credibility、Methodological Quality、Currency、COI 六段,最后落到 Overall 的 A–F 与使用建议勾选框。模板的使用说明给出了批量作业的完成条件,可作为验收清单:
- 每个来源都必须拿到 I–VII 的设计等级;
- 所有 Grade D/F 来源必须有书面理由;
- 任何 predatory journal 标记要求完整验证;
- 最低抽查:20% 的来源做全卡评估。
质量门槛方面,agent 定义还要求所有 predatory 期刊检查有据可查、所有来源完成 COI 评估、至少 30% 的事实性论断经过独立来源交叉核验。fact-check 示例(fact_check_mode.md)展示了完整输出形态:每条论断给出 Verdict、Verification Basis、Source 与 Correction Suggestion,末尾附判定统计表。注意该文件中的具体数据(如高校数量、师生比)只是示例结果,不要当作固定预期。
边界与已知限制
- Domain Evidence Profile 只影响准入,不改分数:domain_evidence_profiles.md 定义的上位学科档案(如
cs_ml、humanities_interpretive、general_social_science)只改变文献筛选接收哪些证据类型,从不改变 A–F 总体等级、从不阻塞流程,且需要学者确认后才生效,默认值是unknown_user_defined(中性单金字塔)。clinical、education等仍是预留档案,选择它们会回落到默认。 - Currency 是相对论断的:奠基性或历史来源在论断就是关于该来源本身或其时代时不因年代扣分;只有在"时效与论断相关"(如论断领域现状)时才套用 3/5/10 年分档。
- 快速变化领域的取舍:agent 核心原则指出,快速领域中 2015 年的 meta-analysis 可能不如 2024 年的原始研究有相关性——等级高不代表自动可用。
- Predatory 期刊红旗:激进邮件征稿、72 小时内录用、无法识别的编辑委员会、未被 Scopus/WoS/PubMed 收录、非 COPE/DOAJ 成员、影响因子异常、范围过宽等,命中即列入 Predatory Journal Alerts;核验资源(DOAJ 白名单、COPE 成员名录、Scopus Source List 等)在参考文档中列名,按名检索即可。
- 红旗不是审查:flag 一个来源只表示上报疑虑,不静默剔除——剔除必须走报告里的 Recommendation 并注明依据。
核对完 Source Quality Matrix 后,评级任务即告完成:Grade A/B 的来源进入主要/支撑证据,C 级附带保留意见使用,D 级仅兜底,F 级(含FABRICATED与 predatory 全验证后确认的期刊来源)移除。后续如需基于这份已验证的文献清单写论文,deep-research的 Handoff Protocol 会把 Annotated Bibliography 交给academic-paper的 intake 阶段复用,不必重新检索。
【免费下载链接】academic-research-skillsAcademic Research Skills for Claude Code: research → write → review → revise → finalize项目地址: https://gitcode.com/GitHub_Trending/ac/academic-research-skills
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考