MediaCrawler媒体爬虫工具:十分钟跑通首次采集完整指南
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
MediaCrawler是一款开源的多平台媒体爬虫工具,可采集小红书笔记、抖音视频、快手、B站、微博、百度贴吧、知乎的公开内容与评论。它用真实浏览器保持登录态,不用你碰JS逆向,适合做内容分析、竞品监测和舆情跟踪的新手直接使用。
是什么:MediaCrawler 的适用场景
采集范围覆盖 7 个平台的公开信息:
- 关键词搜索:按指定关键词采集相关帖子
- 指定帖子 ID:采集特定帖子及其评论
- 创作者主页:采集某创作者的发布内容
- 支持二级评论,还能生成评论词云图
技术原理是:基于 Playwright 启动真实浏览器,登录并缓存登录态,再在浏览器上下文里取接口签名参数。好处是不用逆向复杂加密算法,技术门槛低。
适合内容运营、市场调研、数据分析新手。项目声明仅供学习研究使用,请勿对平台大规模爬取,避免触发风控。
🚀 三步安装:从克隆代码到依赖就绪
环境要求三样:
- Python:由 uv 工具自动管理版本,先确认
uv --version能正常输出版号 - Node.js 16 及以上:抖音、知乎的签名脚本需要
- Chrome 浏览器(144 及以上版本):默认 CDP 模式复用你已有的浏览器登录,降低风控概率
克隆代码后,依次执行:
git clone https://gitcode.com/GitHub_Trending/me/MediaCrawler cd MediaCrawler && uv sync uv run main.py --platform xhs --lt qrcode --type searchuv sync会自动创建 Python 环境并装好依赖;默认 CDP 模式无需另装浏览器驱动。第三条命令就是运行小红书关键词搜索,装完依赖可以直接跑。
首次运行:小红书关键词搜索演示
运行前,把config/base_config.py里的KEYWORDS变量改成你要采集的关键词,多个用英文逗号分隔,默认是"编程副业,编程兼职"。
上面那条运行命令的含义:
--platform xhs:采集小红书,可换成 dy、ks、bili、wb、tieba、zhihu--lt qrcode:扫码方式登录--type search:关键词搜索模式,可换 detail(指定帖子)或 creator(创作者主页)
首次运行会弹出浏览器中的小红书二维码,用小红书 App 扫码登录。CDP 模式下 Chrome 还会弹确认对话框,60 秒内点"接受"即可。登录态默认缓存,下次运行不用重新扫码。
关键配置:config/base_config.py 里要改的变量
真正影响结果的变量都在这个文件里,带中文注释:
SAVE_DATA_OPTION:数据存储格式,默认 jsonl(每行一个 JSON,方便用 pandas 读取),可换 csv、excel、sqlite 等CRAWLER_MAX_NOTES_COUNT:采集帖子条数,默认 15,初次试跑保持默认ENABLE_GET_COMMENTS:评论采集开关,默认开启;单帖一级评论条数由CRAWLER_MAX_COMMENTS_COUNT_SINGLENOTES控制,默认 10 条CRAWLER_MAX_SLEEP_SEC:请求间隔秒数,默认 2 秒,建议不低于 2 秒
代理开关ENABLE_IP_PROXY默认 False。网络环境差时再开启,需填供应商名称和账号信息。已购快代理独享代理的用户,用户名和密码在订单页的基本信息里:
各平台的专属配置在config/目录的 xhs_config.py 等文件中,按注释对照填写即可。
效果验证:如何检查采集到的数据
采集结束后,数据默认写入项目根目录data/目录,按平台分子文件夹存放。
检查分三步:
- 打开对应 jsonl 文件,确认每行是一个完整 JSON 对象
- 核对字段完整性:帖子 ID、标题、正文、点赞数、时间戳、评论内容不应为空
- 存储切换到 sqlite 或 MySQL 时自带去重,重复采集不会产生重复记录
想看评论词云,把ENABLE_GET_WORDCLOUD设为 True,中文字体用仓库自带的docs/STZHONGS.TTF。存储方式全量说明见官方文档 docs/data_storage_guide.md。
常见坑与进阶方向
新手高频三个问题
- 小红书登录一直弹滑块:原因是平台风控严格。处理:用默认 CDP 模式连接自己的 Chrome,复用真实 Cookie 和浏览历史,别用无痕模式;仍失败就关闭浏览器,清掉项目下生成的浏览器数据缓存目录后重新登录。
- 抖音或知乎报 ProgramError、缺少分号:原因是缺 Node.js 环境。处理:安装 16 及以上版本即可,代码不用改。
- 报 Cannot connect to existing browser on port 9222:原因是 Chrome 没开远程调试。处理:地址栏输入
chrome://inspect/#remote-debugging勾选允许远程调试,页面显示Server running at: 127.0.0.1:9222才算就绪。
进阶方向
不想敲命令行可以启动内置 WebUI:一个终端启动api/main.py的 API 服务,另一个终端在webui目录装依赖并启动前端开发服务器,浏览器访问 localhost:5173,就能可视化配置参数、实时看采集日志和数据预览:
代理、手机号登录、CDP 模式等进阶内容,看 docs/ 目录下的专题文档。使用时保持小批量、控制频率,数据和你自己的账号都会更稳。
【免费下载链接】MediaCrawler小红书笔记 | 评论爬虫、抖音视频 | 评论爬虫、快手视频 | 评论爬虫、B 站视频 | 评论爬虫、微博帖子 | 评论爬虫、百度贴吧帖子 | 百度贴吧评论回复爬虫 | 知乎问答文章|评论爬虫项目地址: https://gitcode.com/GitHub_Trending/me/MediaCrawler
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考