如何构建一个6500万条微博舆情数据集?Weibo-COV论文(EMNLP2020)方法论全解读
【免费下载链接】weibo-covWeibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo项目地址: https://gitcode.com/gh_mirrors/we/weibo-cov
Weibo-COV 是由华中科技大学团队构建的大规模 COVID-19 微博舆情数据集,论文发表于EMNLP 2020 NLP4COVID 工作坊,收录6500 万条疫情相关微博。它演示了从"关键词体系设计 → 十亿级原始数据筛选 → 用户隐私脱敏"的完整数据集构建方法论,是学习舆情数据挖掘和社交媒体 NLP 研究的绝佳范本。本文带你逐步拆解这套方法论 📊。
一、Weibo-COV 是什么?两个版本的核心指标
Weibo-COV 经历了两次迭代,规模差异一目了然:
| 版本 | 时间跨度 | 关键词数 | 原始微博量 | 最终收录量 |
|---|---|---|---|---|
| 1.0 | 2019-12 ~ 2020-04 | 179 个 | 6.93 亿条 | 4089 万条 |
| 2.0 | 2019-12 ~ 2020-12 | 通用 + 月度动态 | 26.15 亿条 | 6517 万条 |
💡 2.0 版还额外发布了2000 万微博活跃用户池(脱敏后),方便做用户画像与传播研究。
二、方法论第一步:设计舆情关键词体系
整个数据集的地基,是关键词过滤(Keyword Filtering)。团队没有简单堆砌"疫情""新冠"这类大词,而是分层设计:
1. 基础版:179 个静态关键词
1.0 版使用 keywords/Weibo-COV.txt 中固定的179 个关键词,覆盖多个维度:
- 病原与命名:冠状、Cov-19、#2019nCoV、#nCoV、Coronavirus
- 机构与地标:武汉病毒所、CDC、中国疾病预防控制中心、武汉卫健委
- 防控动作:PHEIC、隔离14天、居家隔离、潜伏期、复工
- 社会热点:双黄连 抢购、武汉 封城
2. 进阶版:通用 + 月度动态关键词
2.0 版的关键词文件 keywords/Weibo-COV-V2.txt 达到491 行,采用"common 通用词 + 当月专属词"的组合策略:每月用通用词与该月专属词共同过滤当月微博。
以文件末尾的月度词为例,可以看到热点随时间自然漂移:顺义 一级防控、冷链食品 核酸检测、聚集性场所 测温验码、新冠疫苗 医保名录……这种动态更新让数据集在一年跨度内始终贴合真实舆情走向 🎯。
三、方法论第二步:从 26 亿条原始微博中精准筛选
关键词匹配看似简单,工程难点在于十亿级数据的规模:
- 2.0 版扫描了2,615,185,101 条带 GEO 标签的原始微博;
- 最终命中65,175,112 条,命中率约2.5%——说明关键词体系"收得紧",噪声可控;
- 作为对照,1.0 版从 6.93 亿条中筛出 4089 万条,方法一致,只是时间窗口更短。
筛选后的每条微博以 CSV 形式存储,包含10 个字段:
| 字段 | 含义 |
|---|---|
_id | 微博唯一标识 |
user_id | 用户标识(哈希脱敏后的值) |
crawl_time | 爬取时间戳 |
created_at | 微博发布时间 |
like_num/repost_num/comment_num | 点赞、转发、评论数(传播力指标) |
content | 微博正文(含转发理由) |
origin_weibo | 原微博 ID(可用于传播链重建) |
geo_info | 地理位置信息 |
四、方法论第三步:隐私保护与数据脱敏
大规模社交数据最敏感的问题是个人信息安全。Weibo-COV 的做法非常克制:
user_id全部替换为原始 ID 的哈希结果,无法逆向还原真实账号;- 2000 万用户池同样经过脱敏(见 readme.md 中的字段样例),仅保留性别、省市、粉丝量、VIP 等级等研究所需维度。
这套"哈希化 + 字段最小化"原则,如今仍是公共数据发布的通行标准 🔒。
五、如何获取并使用 Weibo-COV 数据集
获取方式很简单,一条命令拉取仓库:
git clone https://gitcode.com/gh_mirrors/we/weibo-cov- 仓库内 keywords/Weibo-COV.txt 与 keywords/Weibo-COV-V2.txt 即论文所用的全部过滤关键词,可复现筛选逻辑;
- 完整数据(6500 万条微博 + 用户池)的下载入口与更新日志(News)均维护在 readme.md 中;
- 数据集采用MIT License(见 LICENSE),学术研究自由使用。
典型研究方向:疫情舆情演化分析、情绪与立场分类、谣言/虚假信息检测、用户传播行为建模、热点话题发现等。据项目更新记录,该数据集已支持200+ 个研究项目。
六、论文引用信息
如果你在自己的研究中使用了该数据集,可引用其 EMNLP 2020 论文:
Hu, Y., Huang, H., Chen, A., & Mao, X.-L. (2020).Weibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo. Proceedings of the 1st Workshop on NLP for COVID-19 (Part 2) at EMNLP 2020.
完整 BibTeX 引文格式可在 readme.md 的 Citation 一节直接复制。
总结:可复用的数据集构建方法论
回顾 Weibo-COV 的完整流程,可以沉淀为四步通用范式:
- 📝分层关键词设计——静态基础词 + 动态月度词,兼顾召回与时效;
- 🔍大规模过滤——从 26 亿条中命中 6500 万条,~2.5% 的命中率验证了体系的有效性;
- 🛡️脱敏最小化——哈希 ID + 字段最小化,平衡隐私与研究价值;
- 📂元数据公开——关键词表、字段说明全部随仓库开源,方法可复现。
无论你要构建疫情、财经还是体育领域的舆情数据集,这套"关键词工程 + 规模过滤 + 隐私合规"的方法论都直接可迁移。
【免费下载链接】weibo-covWeibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo项目地址: https://gitcode.com/gh_mirrors/we/weibo-cov
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考