news 2026/9/10 18:40:54

如何用 Academic Research Skills 的 7 级证据金字塔给文献来源做证据质量评级?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何用 Academic Research Skills 的 7 级证据金字塔给文献来源做证据质量评级?

如何用 Academic Research Skills 的 7 级证据金字塔给文献来源做证据质量评级?

【免费下载链接】academic-research-skillsAcademic Research Skills for Claude Code: research → write → review → revise → finalize项目地址: https://gitcode.com/GitHub_Trending/ac/academic-research-skills

你手上有一批候选文献(APA 引用、DOI、报告或预印本),需要判断每一条到底属于什么等级的证据、能否作为主要证据引用。Academic Research Skills 是一个面向 Claude Code 的技能包,其中deep-research技能把这件事做成了可执行流程:source_verification_agent按照 7 级证据金字塔(Level I–VII)给每个来源定设计等级,再按 6 个维度的 A–F 评分表合成总体等级,最后产出一份带质量矩阵的 Source Verification Report。评级规则完整定义在 source_quality_hierarchy.md 中,运行它需要 Claude Code 环境已加载该技能包;你只需要准备好来源清单,按触发方式让对应 agent 执行。

先看懂 7 级金字塔:等级是怎么划分的

评级前的共同语言是这张等级表(来自 source_verification_agent.md 与 source_quality_hierarchy.md):

Level证据类型权重示例
ISystematic Reviews / Meta-analyses最高Cochrane reviews、Campbell reviews
IIRandomized Controlled Trials (RCTs)很高设计良好的 RCT
IIIControlled Studies(非随机)准实验、队列
IVCase-Control / Cohort Studies中高纵向、回顾性研究
VSystematic Reviews of Descriptive Studies定性研究的综述
VISingle Descriptive / Qualitative Studies低中案例研究、民族志
VIIExpert Opinion / Committee Reports最低立场论文、社论

每个等级在参考文档中都有特征与警示(Caveats),例如 Level I 的结论质量取决于其纳入的研究本身("garbage in, garbage out"),在快速变化的领域可能过时;Level II 在社会科学/教育学中常不可行。读评级结果时对照这些条目能理解某个等级为什么带保留意见。

文档同时强调评级分两个不可混用的轴:

  • Study-design level:研究设计在实验—描述光谱上的位置,即上面这张表,绝对且与学科无关;
  • Fitness for claim within a discipline:该来源相对于它自己学科对特定论断而言的证据适配度。

这就是为什么一个人文领域的一手档案(设计等级只有 Level VI)仍可能拿到总体 Grade A——因为 Level VI 在人文领域就是 gold standard。混用这两个轴会把优秀的解释性/定性研究压死在低分上。

执行评级:在 Claude Code 中触发 source verification

准备条件只有一项:候选来源清单。来源可以是你检索得到的文献列表(APA 7.0 格式引用 + DOI 更佳,有 DOI 的来源能走更完整的存在性验证),也可以是 Material Passport 里的literature_corpus[]语料。

触发方式按 SKILL.md 的模式选择指南,主路径有两条:

  1. lit-review 模式(有主题、需要文献梳理):bibliography_agent先做系统检索并产出 Annotated Bibliography,随后source_verification_agent对来源做证据分级。模式选择依据是"Need literature review for a topic →lit-review"。
  2. fact-check 模式(已有一批论断/来源需要查核):该模式只激活 Source Verification agent,输出 Verification report(300–800 词)。触发示例可参考 fact_check_mode.md:用户直接给出待查核的论断列表,agent 逐条对照证据核验并给出判定。

触发关键词包括 research、literature review、fact-check 及对应中文(研究、文献回顾、事实查核等)。执行流程中 source verification 属于 Phase 2(Investigation),其产物——Verified & Graded Sources、Source quality matrix——是 Phase 3 综合阶段的前置输入,即评级完成前流水线不会跳到综合。

6 维度 A–F 评分表与总体等级合成

设计等级定完后,每个来源按 6 个标准各打一个 A–F 分(完整表格见 source_quality_hierarchy.md 的 Grading Rubric 一节):

维度Grade A(示例)Grade F(示例)
Evidence Level达到/超过本领域该论断的 gold standard无法归类或根本不适配该论断
Peer Review严格同行评审自出版
Methodology典范、可复现缺失/有缺陷
Sample/Data大且具代表性未说明
Currency3 年内对该主题已过时
Conflicts无声明或检测出的利益冲突明确的未披露冲突

合成总体等级走三步(顺序不可跳过):

  1. Integrity floor:Conflicts 为 F(明确未披露冲突),或 Peer Review 为 F 且该领域把正式评审视为常态,则总体直接封顶 D——诚信问题不能被其他维度的强度抵消;
  2. Base grade:取 6 个维度分数的中位数(A=4 … F=0 标度,相邻等级平分取低);
  3. Fitness adjustment:Evidence Level(适配度)为 A 时上调一级——达到本领域 gold standard 的来源可以到总体 A,即使 Currency 或 Sample/Data 分数偏低;但若 Methodology 为 F 则不适用此步,且任何情况不超过 A。

总体等级对应的使用决策是明确的:

  • A:作为主要证据使用;B:作为支撑证据;C:附带明确保留意见使用;
  • D:仅在无更好来源时用于兜底,并承认其弱点;F:不要使用,只在批评性引用时提及。

Field-Specific Adjustments表按学科调整 gold standard 预期:医学/健康以 Level I–II 为 gold standard;教育学常见 Level IV–VI;社科 Level III–V;政策研究接受 Level IV–V + VII(专家报告);人文的 gold standard 就是 Level VI 一手材料;技术领域是 Level III + 产业报告(同行评审滞后于现实)。给来源打分前先查这张表确定"本领域的 gold standard 在第几级",Evidence Level 维度才打得出 A。

参考存在性验证:防止金字塔打在虚构文献上

证据等级再高,前提也是来源真实存在。验证走三层(覆盖度要求见 cross_agent_quality_definitions.md:100% DOI 检查 + 50% WebSearch 抽查):

  • Tier 0(Semantic Scholar API,100% 覆盖):有 DOI 的走 DOI 查询,无 DOI 的走标题检索;标题 Levenshtein 相似度 ≥ 0.70 且年份匹配(±1 年内)记为匹配。DOI 能解析但标题相似度 < 0.70 时标记DOI_MISMATCH——这是已知的幻觉引用模式之一;
  • Tier 1(DOI 解析,100% 覆盖):DOI 必须解析到真实页面,标题与作者匹配;DOI 返回 404 或标题差异 > 3 个词自动标记;
  • Tier 2(WebSearch 抽查,50% 覆盖):随机抽 50% 来源,用精确标题 + 第一作者 + 年份检索,确认来源存在于所声称的刊物、年份一致;优先把 tier_3、tier_4(学术非同行评审、灰色文献)全部先查,再从 tier_1/tier_2 中抽样。

最终存在性判定是五选一:S2_VERIFIED(Semantic Scholar 匹配)、VERIFIED(DOI 解析且元数据匹配)、PLAUSIBLE(无 DOI 但 WebSearch 确认存在)、UNVERIFIABLE(所有方法都无法确认,标记转人工)、FABRICATED(所有层级都失败,CRITICAL,必须移除)。技能文档把这条定为 IRON RULE:"difficult to verify" 不算通过,灰色地带即 FAIL——无法确认存在的文献不进入报告

核对输出:报告、评估卡与完成条件

评级完成后你会得到两类产物,可以逐项核对:

Source Verification Report(格式定义见 source_verification_agent.md 的 Output Format 一节),核心是 Source Quality Matrix:

SourceLevelVenueAuthorMethodCurrencyCOIOverall
简写引用I–VIIpass/warn/failpass/warn/failpass/warn/failpass/warn/failpass/warnGrade

报告同时包含被标记来源的明细(Issue / Severity / Recommendation: Include with caveat、Downgrade 或 Exclude / Evidence)、Predatory Journal Alerts、COI 披露和 Verification Limitations(哪些没验证到、为什么)。

Evidence Assessment Card:按 evidence_assessment_template.md 逐来源一张卡,覆盖 Source Identification、Evidence Level 及 Justification、Publication Venue、Author Credibility、Methodological Quality、Currency、COI 六段,最后落到 Overall 的 A–F 与使用建议勾选框。模板的使用说明给出了批量作业的完成条件,可作为验收清单:

  • 每个来源都必须拿到 I–VII 的设计等级;
  • 所有 Grade D/F 来源必须有书面理由;
  • 任何 predatory journal 标记要求完整验证;
  • 最低抽查:20% 的来源做全卡评估。

质量门槛方面,agent 定义还要求所有 predatory 期刊检查有据可查、所有来源完成 COI 评估、至少 30% 的事实性论断经过独立来源交叉核验。fact-check 示例(fact_check_mode.md)展示了完整输出形态:每条论断给出 Verdict、Verification Basis、Source 与 Correction Suggestion,末尾附判定统计表。注意该文件中的具体数据(如高校数量、师生比)只是示例结果,不要当作固定预期。

边界与已知限制

  • Domain Evidence Profile 只影响准入,不改分数:domain_evidence_profiles.md 定义的上位学科档案(如cs_mlhumanities_interpretivegeneral_social_science)只改变文献筛选接收哪些证据类型,从不改变 A–F 总体等级、从不阻塞流程,且需要学者确认后才生效,默认值是unknown_user_defined(中性单金字塔)。clinicaleducation等仍是预留档案,选择它们会回落到默认。
  • Currency 是相对论断的:奠基性或历史来源在论断就是关于该来源本身或其时代时不因年代扣分;只有在"时效与论断相关"(如论断领域现状)时才套用 3/5/10 年分档。
  • 快速变化领域的取舍:agent 核心原则指出,快速领域中 2015 年的 meta-analysis 可能不如 2024 年的原始研究有相关性——等级高不代表自动可用。
  • Predatory 期刊红旗:激进邮件征稿、72 小时内录用、无法识别的编辑委员会、未被 Scopus/WoS/PubMed 收录、非 COPE/DOAJ 成员、影响因子异常、范围过宽等,命中即列入 Predatory Journal Alerts;核验资源(DOAJ 白名单、COPE 成员名录、Scopus Source List 等)在参考文档中列名,按名检索即可。
  • 红旗不是审查:flag 一个来源只表示上报疑虑,不静默剔除——剔除必须走报告里的 Recommendation 并注明依据。

核对完 Source Quality Matrix 后,评级任务即告完成:Grade A/B 的来源进入主要/支撑证据,C 级附带保留意见使用,D 级仅兜底,F 级(含FABRICATED与 predatory 全验证后确认的期刊来源)移除。后续如需基于这份已验证的文献清单写论文,deep-research的 Handoff Protocol 会把 Annotated Bibliography 交给academic-paper的 intake 阶段复用,不必重新检索。

【免费下载链接】academic-research-skillsAcademic Research Skills for Claude Code: research → write → review → revise → finalize项目地址: https://gitcode.com/GitHub_Trending/ac/academic-research-skills

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 18:39:26

掌握Tkinter事件处理:从bind到bind_all构建交互式绘图应用

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/10 18:36:29

STM32+HC_SR501人体红外检测实战:从GPIO配置到状态机设计

简介&#xff1a;这是一份基于STM32F103C8T6的HC-SR501人体红外检测工程源码&#xff0c;面向物联网、嵌入式入门开发者与高校单片机实验课学员&#xff0c;可直接体验“人体感应触发-指示灯亮灭”的完整闭环。压缩包共163个文件&#xff0c;以C源码、头文件、启动文件及Keil工…

作者头像 李华
网站建设 2026/9/10 18:36:06

含氢气氨气综合能源系统优化调度:Matlab建模与求解实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/10 18:35:52

Python岗位数据分析实战:51job爬虫+清洗+交互可视化

简介&#xff1a;本资源是一个基于Python的51job招聘数据交互式分析与可视化项目&#xff0c;面向数据分析初学者、高校课程设计学生及求职者&#xff0c;解决岗位地域分布、薪资水平、学历要求、经验门槛与福利特征等核心求职决策问题。压缩包共1568个文件&#xff0c;主体为7…

作者头像 李华
网站建设 2026/9/10 18:35:34

极化敏感阵列原理与工程实现:从十字偶极子到POL-MUSIC

简介&#xff1a;本资源聚焦天线极化与阵列信号处理核心问题&#xff0c;面向通信工程、雷达系统及无线信号处理方向的高年级本科生、研究生与工程师&#xff0c;助力理解极化匹配、波束合成与极化敏感接收等关键技术。压缩包为RAR格式&#xff0c;共1个MATLAB源文件&#xff0…

作者头像 李华
网站建设 2026/9/10 18:34:07

Innovus中不规则Floorplan的Route Blockage自动化解决方案

1. 不规则Floorplan中的Route Blockage挑战 在数字后端设计流程中&#xff0c;Innovus作为业界主流的物理实现工具&#xff0c;其floorplan阶段对最终芯片性能有着决定性影响。当遇到不规则形状的die边界时&#xff08;如L型、U型或多边形结构&#xff09;&#xff0c;传统的矩…

作者头像 李华