news 2026/9/12 5:20:13

MediaCrawler媒体爬虫工具:十分钟跑通首次采集完整指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
MediaCrawler媒体爬虫工具:十分钟跑通首次采集完整指南

MediaCrawler媒体爬虫工具:十分钟跑通首次采集完整指南

【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler

MediaCrawler是一款开源的多平台媒体爬虫工具,可采集小红书笔记、抖音视频、快手、B站、微博、百度贴吧、知乎的公开内容与评论。它用真实浏览器保持登录态,不用你碰JS逆向,适合做内容分析、竞品监测和舆情跟踪的新手直接使用。

是什么:MediaCrawler 的适用场景

采集范围覆盖 7 个平台的公开信息:

  • 关键词搜索:按指定关键词采集相关帖子
  • 指定帖子 ID:采集特定帖子及其评论
  • 创作者主页:采集某创作者的发布内容
  • 支持二级评论,还能生成评论词云图

技术原理是:基于 Playwright 启动真实浏览器,登录并缓存登录态,再在浏览器上下文里取接口签名参数。好处是不用逆向复杂加密算法,技术门槛低。

适合内容运营、市场调研、数据分析新手。项目声明仅供学习研究使用,请勿对平台大规模爬取,避免触发风控。

🚀 三步安装:从克隆代码到依赖就绪

环境要求三样:

  1. Python:由 uv 工具自动管理版本,先确认uv --version能正常输出版号
  2. Node.js 16 及以上:抖音、知乎的签名脚本需要
  3. Chrome 浏览器(144 及以上版本):默认 CDP 模式复用你已有的浏览器登录,降低风控概率

克隆代码后,依次执行:

git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && uv sync uv run main.py --platform xhs --lt qrcode --type search

uv sync会自动创建 Python 环境并装好依赖;默认 CDP 模式无需另装浏览器驱动。第三条命令就是运行小红书关键词搜索,装完依赖可以直接跑。

首次运行:小红书关键词搜索演示

运行前,把config/base_config.py里的KEYWORDS变量改成你要采集的关键词,多个用英文逗号分隔,默认是"编程副业,编程兼职"。

上面那条运行命令的含义:

  • --platform xhs:采集小红书,可换成 dy、ks、bili、wb、tieba、zhihu
  • --lt qrcode:扫码方式登录
  • --type search:关键词搜索模式,可换 detail(指定帖子)或 creator(创作者主页)

首次运行会弹出浏览器中的小红书二维码,用小红书 App 扫码登录。CDP 模式下 Chrome 还会弹确认对话框,60 秒内点"接受"即可。登录态默认缓存,下次运行不用重新扫码。

关键配置:config/base_config.py 里要改的变量

真正影响结果的变量都在这个文件里,带中文注释:

  • SAVE_DATA_OPTION:数据存储格式,默认 jsonl(每行一个 JSON,方便用 pandas 读取),可换 csv、excel、sqlite 等
  • CRAWLER_MAX_NOTES_COUNT:采集帖子条数,默认 15,初次试跑保持默认
  • ENABLE_GET_COMMENTS:评论采集开关,默认开启;单帖一级评论条数由CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES控制,默认 10 条
  • CRAWLER_MAX_SLEEP_SEC:请求间隔秒数,默认 2 秒,建议不低于 2 秒

代理开关ENABLE_IP_PROXY默认 False。网络环境差时再开启,需填供应商名称和账号信息。已购快代理独享代理的用户,用户名和密码在订单页的基本信息里:

各平台的专属配置在config/目录的 xhs_config.py 等文件中,按注释对照填写即可。

效果验证:如何检查采集到的数据

采集结束后,数据默认写入项目根目录data/目录,按平台分子文件夹存放。

检查分三步:

  1. 打开对应 jsonl 文件,确认每行是一个完整 JSON 对象
  2. 核对字段完整性:帖子 ID、标题、正文、点赞数、时间戳、评论内容不应为空
  3. 存储切换到 sqlite 或 MySQL 时自带去重,重复采集不会产生重复记录

想看评论词云,把ENABLE_GET_WORDCLOUD设为 True,中文字体用仓库自带的docs/STZHONGS.TTF。存储方式全量说明见官方文档 docs/data_storage_guide.md。

常见坑与进阶方向

新手高频三个问题

  1. 小红书登录一直弹滑块:原因是平台风控严格。处理:用默认 CDP 模式连接自己的 Chrome,复用真实 Cookie 和浏览历史,别用无痕模式;仍失败就关闭浏览器,清掉项目下生成的浏览器数据缓存目录后重新登录。
  2. 抖音或知乎报 ProgramError、缺少分号:原因是缺 Node.js 环境。处理:安装 16 及以上版本即可,代码不用改。
  3. 报 Cannot connect to existing browser on port 9222:原因是 Chrome 没开远程调试。处理:地址栏输入chrome://inspect/#remote-debugging勾选允许远程调试,页面显示Server running at: 127.0.0.1:9222才算就绪。

进阶方向

不想敲命令行可以启动内置 WebUI:一个终端启动api/main.py的 API 服务,另一个终端在webui目录装依赖并启动前端开发服务器,浏览器访问 localhost:5173,就能可视化配置参数、实时看采集日志和数据预览:

代理、手机号登录、CDP 模式等进阶内容,看 docs/ 目录下的专题文档。使用时保持小批量、控制频率,数据和你自己的账号都会更稳。

【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/5 18:44:58

三个月刷完阿里Java八股文1000道,我总结的实战刷题法

不用再解释八股文是什么了,国内做Java的,没人不知道这词的分量。尤其阿里这样的大厂,面试第一关就把基础功底筛得很死。我去年集中冲刺中高级岗,把市面上流传的那套“2023版阿里巴巴Java八股文1000道”整个刷了一遍,前…

作者头像 李华
网站建设 2026/9/12 5:20:08

十分钟跑通 NocoDB:你的团队不需要再为一张表建系统

十分钟跑通 NocoDB:你的团队不需要再为一张表建系统 【免费下载链接】nocodb 🔥 🔥 🔥 A Free & Self-hostable Airtable Alternative 项目地址: https://gitcode.com/GitHub_Trending/no/nocodb 市场部的活动报名又开…

作者头像 李华
网站建设 2026/9/4 16:33:42

AI利润轮动时代:开发者必看的商业化路径与ROI成本分析

微软、亚马逊三天涨超20%,这样的走势放在前两年很容易被解读成“AI概念又火了”。但这一次,市场交易的逻辑已经变了——不是押注谁有更科幻的Demo,而是在押注谁能把AI能力真正变成利润。用一句不严谨但更容易理解的话说:AI行情正在…

作者头像 李华
网站建设 2026/9/4 12:27:58

海康威视摄像头RTSP推流接入QT桌面应用:从原理到工程实践

简介:本资源是一套面向Qt开发者与安防系统集成工程师的实战型技术方案,聚焦海康威视网络摄像头在Qt环境下的RTSP推流全流程实现,解决视频实时预览、抓图、录像及流媒体对外推送等核心工程问题。压缩包共101个文件,含42个运行依赖D…

作者头像 李华
网站建设 2026/9/4 8:46:46

自研操作系统拆解:内核、引擎与架构的实战学习路线

先把结论放在前面:真正从零开始写一个可用于生产环境的操作系统,是国家级工程。但把“自研内核、自研引擎、自研架构”拆开看,每一条都有可以落地的学习路径和实验空间。最近经常刷到“自研操作系统”相关的讨论,有人晒内核代码量…

作者头像 李华
网站建设 2026/9/4 15:22:22

PDI-CE 9.4.0.0 深度解析:ETL工具核心架构、部署与性能调优实战

简介:本资源为 Pentaho Data Integration(Kettle)社区版 9.4.0.0 正式发行包,面向ETL开发工程师、数据集成初学者及BI项目实施人员,用于构建可视化数据抽取、转换与加载流程,解决跨数据库同步、日志清洗、报…

作者头像 李华