MidScene 快速上手:3 步用自然语言驱动 AI 浏览器自动化
【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene
做网页自动化时,最磨人的往往是写选择器、盯元素加载。MidScene 是一个零代码的 AI 浏览器自动化工具:用自然语言描述任务,AI 就能自动操作浏览器或移动设备,全程不写代码。这篇教程讲清它怎么装、装好之后哪些场景马上能用。
MidScene 是什么:它如何"看懂"屏幕
一句话定位:MidScene 是用自然语言驱动浏览器与移动端的开源自动化工具。
它的"眼睛"和传统脚本不一样——底层是视觉语言模型(VLM),直接读截图:屏幕上有什么控件、文字写着什么,看完再决定下一步动作。不用按 id 或 class 去 DOM 里找元素,页面结构怎么调整,任务大概率照跑不误。
3 步启动:一条命令跑起 MidScene
本地装好 Node.js 18+ 和 Git 之后,总共就三条命令:
git clone https://gitcode.com/GitHub_Trending/mid/midscene cd midscene && npm install npm run start拉取代码、装依赖、起服务,一气呵成。浏览器里打开的就是 MidScene 的 Playground 界面:左边输入一句指令,右边实时看到执行过程。
不想起服务、想在浏览器里直接用?仓库自带 Chrome 扩展:在扩展管理页开启开发者模式,加载 Chrome 扩展源码 对应目录,装完工具栏就能看到 MidScene 图标。
三类场景,装好就能跑
🧪AI 自动化测试:测试用例直接写成一句话,比如"打开首页,搜索 headphones,验证至少一条结果带价格"。它逐步执行并输出带截图和耗时的报告,全程不用写测试代码。
📊网页数据提取:说明要什么就行,例如"把列表页里每件商品的名字和价格抓出来,整理成表格"。页面结构由它自己识别,单次抓取、批量处理都适用。
📱移动端跨平台:同一套自然语言写法在 Web、Android、iOS 上通用,一套表述复用多类设备,省掉分别维护脚本的功夫。
为什么比手写脚本稳:免选择器、不碰 DOM
传统自动化脚本最大的痛点是维护:网站一改样式,选择器失效,整个流程跟着崩。MidScene 从根上绕开这层——它靠截图理解界面,不依赖 DOM 结构,页面怎么重构,只要屏幕长得差不多,任务照样执行。
还有一层好处:数据在本地处理,支持自托管 AI 模型,敏感页面和业务数据不必经过第三方服务,团队里落地阻力小很多。
MidScene 常见问题
Q:除了网页,能驱动真手机吗?A:能。Web、Android、iOS 都在支持范围内,移动端同样用自然语言下指令。
Q:换了说法,需要重新录制吗?A:不需要。它每次基于当前截图重新理解,不依赖预先录好的坐标,措辞或界面变了都能接着跑。
Q:可以接自己的大模型吗?A:可以。支持自托管 AI 模型,配合本地数据处理,整条链路能留在自己的环境里。
跑完上面三条命令,打开 Playground 输入第一个任务,你就能看到 AI 浏览器自动化第一次真实落地。
【免费下载链接】midsceneGUI Agent for E2E Testing项目地址: https://gitcode.com/GitHub_Trending/mid/midscene
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考