news 2026/9/11 22:27:02

如何构建一个6500万条微博舆情数据集?Weibo-COV论文(EMNLP2020)方法论全解读

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
如何构建一个6500万条微博舆情数据集?Weibo-COV论文(EMNLP2020)方法论全解读

如何构建一个6500万条微博舆情数据集?Weibo-COV论文(EMNLP2020)方法论全解读

【免费下载链接】weibo-covWeibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo项目地址: https://gitcode.com/gh_mirrors/we/weibo-cov

Weibo-COV 是由华中科技大学团队构建的大规模 COVID-19 微博舆情数据集,论文发表于EMNLP 2020 NLP4COVID 工作坊,收录6500 万条疫情相关微博。它演示了从"关键词体系设计 → 十亿级原始数据筛选 → 用户隐私脱敏"的完整数据集构建方法论,是学习舆情数据挖掘和社交媒体 NLP 研究的绝佳范本。本文带你逐步拆解这套方法论 📊。

一、Weibo-COV 是什么?两个版本的核心指标

Weibo-COV 经历了两次迭代,规模差异一目了然:

版本时间跨度关键词数原始微博量最终收录量
1.02019-12 ~ 2020-04179 个6.93 亿条4089 万条
2.02019-12 ~ 2020-12通用 + 月度动态26.15 亿条6517 万条

💡 2.0 版还额外发布了2000 万微博活跃用户池(脱敏后),方便做用户画像与传播研究。

二、方法论第一步:设计舆情关键词体系

整个数据集的地基,是关键词过滤(Keyword Filtering)。团队没有简单堆砌"疫情""新冠"这类大词,而是分层设计:

1. 基础版:179 个静态关键词

1.0 版使用 keywords/Weibo-COV.txt 中固定的179 个关键词,覆盖多个维度:

  • 病原与命名:冠状、Cov-19、#2019nCoV、#nCoV、Coronavirus
  • 机构与地标:武汉病毒所、CDC、中国疾病预防控制中心、武汉卫健委
  • 防控动作:PHEIC、隔离14天、居家隔离、潜伏期、复工
  • 社会热点:双黄连 抢购、武汉 封城

2. 进阶版:通用 + 月度动态关键词

2.0 版的关键词文件 keywords/Weibo-COV-V2.txt 达到491 行,采用"common 通用词 + 当月专属词"的组合策略:每月用通用词与该月专属词共同过滤当月微博。

以文件末尾的月度词为例,可以看到热点随时间自然漂移:顺义 一级防控冷链食品 核酸检测聚集性场所 测温验码新冠疫苗 医保名录……这种动态更新让数据集在一年跨度内始终贴合真实舆情走向 🎯。

三、方法论第二步:从 26 亿条原始微博中精准筛选

关键词匹配看似简单,工程难点在于十亿级数据的规模

  • 2.0 版扫描了2,615,185,101 条带 GEO 标签的原始微博;
  • 最终命中65,175,112 条,命中率约2.5%——说明关键词体系"收得紧",噪声可控;
  • 作为对照,1.0 版从 6.93 亿条中筛出 4089 万条,方法一致,只是时间窗口更短。

筛选后的每条微博以 CSV 形式存储,包含10 个字段

字段含义
_id微博唯一标识
user_id用户标识(哈希脱敏后的值)
crawl_time爬取时间戳
created_at微博发布时间
like_num/repost_num/comment_num点赞、转发、评论数(传播力指标)
content微博正文(含转发理由)
origin_weibo原微博 ID(可用于传播链重建)
geo_info地理位置信息

四、方法论第三步:隐私保护与数据脱敏

大规模社交数据最敏感的问题是个人信息安全。Weibo-COV 的做法非常克制:

  • user_id全部替换为原始 ID 的哈希结果,无法逆向还原真实账号;
  • 2000 万用户池同样经过脱敏(见 readme.md 中的字段样例),仅保留性别、省市、粉丝量、VIP 等级等研究所需维度。

这套"哈希化 + 字段最小化"原则,如今仍是公共数据发布的通行标准 🔒。

五、如何获取并使用 Weibo-COV 数据集

获取方式很简单,一条命令拉取仓库:

git clone https://gitcode.com/gh_mirrors/we/weibo-cov
  • 仓库内 keywords/Weibo-COV.txt 与 keywords/Weibo-COV-V2.txt 即论文所用的全部过滤关键词,可复现筛选逻辑;
  • 完整数据(6500 万条微博 + 用户池)的下载入口与更新日志(News)均维护在 readme.md 中;
  • 数据集采用MIT License(见 LICENSE),学术研究自由使用。

典型研究方向:疫情舆情演化分析、情绪与立场分类、谣言/虚假信息检测、用户传播行为建模、热点话题发现等。据项目更新记录,该数据集已支持200+ 个研究项目

六、论文引用信息

如果你在自己的研究中使用了该数据集,可引用其 EMNLP 2020 论文:

Hu, Y., Huang, H., Chen, A., & Mao, X.-L. (2020).Weibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo. Proceedings of the 1st Workshop on NLP for COVID-19 (Part 2) at EMNLP 2020.

完整 BibTeX 引文格式可在 readme.md 的 Citation 一节直接复制。

总结:可复用的数据集构建方法论

回顾 Weibo-COV 的完整流程,可以沉淀为四步通用范式:

  1. 📝分层关键词设计——静态基础词 + 动态月度词,兼顾召回与时效;
  2. 🔍大规模过滤——从 26 亿条中命中 6500 万条,~2.5% 的命中率验证了体系的有效性;
  3. 🛡️脱敏最小化——哈希 ID + 字段最小化,平衡隐私与研究价值;
  4. 📂元数据公开——关键词表、字段说明全部随仓库开源,方法可复现。

无论你要构建疫情、财经还是体育领域的舆情数据集,这套"关键词工程 + 规模过滤 + 隐私合规"的方法论都直接可迁移。

【免费下载链接】weibo-covWeibo-COV: A Large-Scale COVID-19 Social Media Dataset from Weibo项目地址: https://gitcode.com/gh_mirrors/we/weibo-cov

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/2 2:20:40

用RKNPU2部署YOLOv5目标检测:从模型转换到NMS后处理的完整教程

用RKNPU2部署YOLOv5目标检测:从模型转换到NMS后处理的完整教程 【免费下载链接】rknpu2 项目地址: https://gitcode.com/gh_mirrors/rk/rknpu2 本文带你用 RKNPU2(Rockchip NPU 工具链)在 RK3562/RK3566/RK3588 开发板上部署 YOLOv5 …

作者头像 李华
网站建设 2026/8/31 0:45:18

12:1宽压输入Quarter-Brick DC-DC转换器:轨道交通电源设计的硬核选择

第一次看到“12:1 Input Quarter-Brick DC-DC Converters Target Railway Systems”这个标题时,我的第一反应是:这玩意儿肯定是给列车辅助供电系统准备的。轨道交通的电源设计在工业领域里是最不讲情面的场景之一——输入电压波动大、环境温度跨度广、EM…

作者头像 李华
网站建设 2026/8/30 6:22:50

基于SpringBoot+Vue的体育运动中心场地管理系统毕业设计项目源码

温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台官方提供的学长联系方式的名片! 温馨提示:本人主页置顶文章(点我)开头有 CSDN 平台…

作者头像 李华