news 2026/9/11 22:21:16

基于LangChain+LLM大模型+机器学习的恶意域名(流量)智能检测系统

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
基于LangChain+LLM大模型+机器学习的恶意域名(流量)智能检测系统

无需借由LLM就能生成基础检测报告, 参照实际字符特征以及训练数据的统计来解释风险线索, AI复核给出进度与阶段有文字展现出的提示, 训练输出日志和任务的状态, 这些反映的是执行进程, 并非是在展示大模型内部的思维链。

3.6 六维可视化安全工作台

用于工作台的使用, 其作用是展示检测趋势, 以及风险分布, 还有概率分布, 包括模型使用量, 以及AI复核状态, 以及后台任务状态。每一张图表都要注明统计口径, 并且提供能够展开的数据表, 要兼顾直观浏览以及具体数值查看。

四、应用场景

场景

使用方式

应用价值

课题研究与项目答辩

演示训练、评测、发布、检测和 AI 复核流程

展示完整的软件工程与机器学习应用能力

网络安全教学

比较随机森林、线性 SVM 与逻辑回归,查看误判样本

理解特征、阈值、指标与误报之间的关系

域名清单初步筛查

将已有域名清单整理为 TXT/CSV 后批量上传

从大量域名中寻找需要进一步检查的风险线索

算法实验与模型比较

在固定数据划分上训练不同模型并查看评测记录

为参数选择和算法分析提供可追溯依据

安全分析辅助报告

对选中记录进行 AI 复核,导出结果

整理检测依据、分歧与后续核查建议

系统用于辅助筛查工具较为适宜, 真实业务当中进行处置时却需要与访问行为一同, 再者还要结合业务背景以及其他证据加以考量, 而以当前情况来看系统不会主动去采集这样一些外部信息, 这是明确的。

五、系统核心功能5.1 账户与权限管理

系统具备注册功能, 还有账户密码登录方式、手机短信验证码登录方式、退出功能以及修改密码功能。用户首先要借助当前密码与短信验证码来绑定手机号, 之后能够在登录页面凭借短信验证去重置密码;重置完成后旧的登录会话便会失效。注册的账户被固定设定为普通用户, 管理员拥有管理用户状态的权限、重置密码的权限以及调整角色的权限。

针对普通用户而言, 其仅能够去访问归属于自身的检测记录, 以及复核记录, 还有任务记录以及导出记录;而管理员方面, 则是能够去访问整个系统的记录, 并且能够运用数据集管理功能, 以及训练功能, 还有评测功能, 以及模型管理功能和LLM配置等一系列管理功能。权限是在服务端进行执行的, 页面隐藏仅仅只是交互层面的一种辅助手段而已啊。

5.2 安全工作台

工作台呈现有效域名预测的数量, 呈现预测恶意的数量, 呈现已完成AI复核的数量, 呈现已发布模型的数量, 呈现状态以及最近检测任务, 并且给出快速域名检测的入口。

图表

展示内容与口径

近 14 天检测趋势

按上海时区统计每日正常、恶意预测数量,缺失日期补零

检测风险分布

全部可见预测中正常与恶意的数量和占比

恶意类别概率分布

按五个概率区间统计数量,最后一个区间包含 100%

模型使用量 TOP 8

按模型处理的预测记录数排序,包含历史模型

AI 复核状态

按复核记录统计各状态,重复复核分别计数

后台任务状态

汇总用户有权查看的任务状态

对预测数量于批次之内进行去重操作, 跨批次之际要分别计数数量。普通用户旨在得以查看本人开展的业务统计情况, 管理员则是要去查看全系统的统计状况;已经发布的模型数量能够反映可用来进行公共检测适用的模型。其具备支持手动刷新数据功能, 有空数据实时提示作用以及呈现窄屏单列布局的特点。

5.3 数据集管理

数据集的管理, 是独立于训练中心的, 它能够支持对本地数据进行检查, 还能查看版本与质量报告, 能够让使用者选择版本来用于训练, 并且可以按照引用约束去删除版本。

如今存在着原始数据, 其中包含了.txt以及.txt, 原始数据的行数分别是801,667与1,000,000。此数据中的标签0被映射为正常状态, 而标签1至8则被映射为恶意状态 ;要保留原始的标签以便用于统计, 并不是将数字解释为具体的恶意家族。

对数据进行处理, 要统一大小写, 处理尾随点以及实施 IDNA 表示, 记录无效输入情况与重复项, 隔离正常标签与恶意标签之间的冲突。原始文件要保持只读状态, 将清洗报告以及划分文件写入指定位置。最终可用数量以对应版本质量报告作为依据。

管理当前数据集时, 会对本地训练文件进行检查, 在域名检测里, 用于预测的上传文件, 不会被自动添加向训练集。

5.4 模型训练

系统提供三种可选择的算法:

算法

实现方式

使用特点

随机森林

er,基于域名统计特征

作为默认训练算法,支持树批次进展反馈

线性 SVM

+ ,独立概率校准

适合进行线性分类模型比较,避免全量核 SVM 的高训练开销

逻辑回归

+

作为结构清晰的对照模型

这并非是关于特征的全部内容, 特征还涵盖了域名长度, 主体长度在其中也占有着一定比例, 层级数和字符熵同样属于特征的范畴, 数字和元音比例也包含其间, 连字符比例也是特征内里的一部分, 不同字符数量以及连续字符长度等都被包含在特征之中。系统会把特征模式、预处理器、分类器、校准器、阈值以及版本信息一同进行保存。

并非随机抽取, 而是按类别比例, 从固定训练集中, 以默认快速模式, 抽取得以最多达到 20 万条的样本, 当然管理员还能够选择全量训练。训练的时候或者评测那一刻, 在后台得以顺利进行, 页面之上设置给予了呈现状态、给出进度、记录日志还有取消入口。

5.5 模型评测与生命周期管理

评测页会给出, F1、ROC - AUC、PR - AUC、误报率、漏报率以及推理耗时, 通过这些数据并利用混淆矩阵、ROC曲线以及PR曲线用以展示模型表现, 误判样本情形下每页会展示六条, 历史评测记录具备支持查看以及按照约束条件删除的功能。

在模型完成了有效评测之后, 是由管理员进行人工发布的。系统是允许多个模型同时进行发布的, 并且会设置一个默认模型, 用户能够选择其他已经发布的模型。管理操作涵盖发布、取消发布、设为默认以及删除;已经发布或者被运行任务使用的模型是不能够直接删除的。

现行评测报告才可视作切实指标、既定标准。当下系统既未应允恒定准确率, 亦未将某次测试集成绩视为一切业务场景之表现, 绝无此等论断、判定标准及相关承诺。

5.6 单域名与批量文件检测

输入一个域名进行单域名检测后, 在当前页面直接展示结果卡, 同时展示完整的报告说明, 并且不显示批量域名选择列表。

进行批量检测时, 其支持 TXT、CSV 格式, 默认的限制是 20 MB、10 万行。对于 TXT 格式而言, 它支持每行放置一个域名, 同时也能够兼容“域名 标签”这种格式;并且附带的标签是不参与预测的。而 CSV 格式呢, 它支持进行预览操作以及选择域名列, 还会提供 UTF-8、UTF-8 BOM 以及编码处理。

对有效行持续进行检测, 针对无效行逐个详细说明缘由;若是重复域名仅作一次推理, 留存来源行以及重复关系。批量给出的结果以域名列表和报告区域相组合, 用户能够随意切换去查看任一记录。开启新检测或者切换检测方式之际清空旧的页面结果, 不过历史记录依旧予以保留。

5.7 检测报告、历史查询与导出

预测类别, 恶意类别概率, 阈值, 模型版本, 包括这些内容才是基础报告, 实际域名特征, 统计参照, 可能误判因素, 证据限制跟核查建议同属基础报告也。统计特征说明其实就是在风险线索相关事项的说明范畴内, 但是请务必注意千万别把它当作冒充模型的因果解释来对待哦。

独立检测结果页通过全部可见记录进行分页展示, 提供域名筛选, 提供判断筛选, 提供AI状态筛选;表头全选框可选择当前页, 支持勾选后删除, 支持CSV格式导出, 支持JSON格式导出。记录归属由后端校验, 删除限制由后端校验。

5.8 LLM 配置与 AI 复核

借助接入兼容接口, 使管理员能够添加、编辑、删除配置。其中, 可设置包含Base URL , 也有模型标识、API Key、会有超时情况、存在输出长度以及启用状态等内容。然后依据往上调动或往下调动来达成顺序的调整。

用户于检测结果里主动去点击 AI 复核, 能够进行单条复核, 还在结果页可选择最多 20 条记录进行复核。页面给出执行进度以及阶段说明, 完成之后展示结论、依据、跟机器学习判断的分歧、局限性以及建议。所有接口失败之时保留原始机器学习结果并且展示失败原因。

人工智能仅仅进行已给出的证据的分析,不会去查询域名系统、域名注册信息、网站的内容或者外部的威胁情报。密钥加密存放在里, 加密密钥各自放置于//。

5.9 任务、日志与运行管理

采用Flask API, 使其独立, 将任务状态持久化, 实现训练、评测共享重任务执行资源, 检测与AI请求使用有界资源。前端进行有关进度以及和增量日志的查询, 可计数阶段展现实际比例, 难以精确计数的阶段借助于状态与耗时予以反馈。

能够支持任务取消, 以及对失败进行重试, 并具备中断识别功能, 防止进程在退出之后一直呈现出运行中的状态。后端请求日志能够在控制台当中予以查看, 日志以及模型产物会统一写入到 /这里。运行项目代码这个//run.py即可达成启动后端API与。

六、技术栈与系统架构

层次

当前技术

用途

前端应用

Vue 3、、Vite

页面开发、类型检查与构建

路由与状态

Vue 、Pinia

页面导航、登录与应用状态

界面组件

Plus、自定义 HTML/CSS 组件

表单、交互与蓝黑控制台界面

可视化

工作台和模型评测图表

后端

3.13、Flask、

REST API 与单机服务托管

数据访问

、Flask-、

数据模型、事务及迁移

数据库

, 日志模式

用户、模型元数据、任务、检测与复核记录

机器学习

-learn、NumPy、、

数据处理、训练、评测和模型保存

域名处理

idna、、本地公共后缀规则

规范化、后缀解析与分组

LLM 接入

、-、

兼容 API 调用、故障转移与报告校验

安全与测试

、、、

密钥保护、密码哈希、接口与浏览器测试

当在浏览器中对Vue应用进行访问时, 该应用就会朝着Flask API去提交请求。要是普通的查询, 便会直接返回结果。将训练、检测、评测以及AI复核等耗时的工作提交当作后台任务, 交由其来执行。数据库用于保存结构化记录, 文件系统则用来保存模型、数据划分以及大报告。然后前端去查询任务状态, 并且更新页面。

构建后方才形成的前端借由Flask在同源实施托管, 本地运作的机器学习流程对GPU、Redis以及云端训练服务不存在依赖关系, AI进行复核之时需要配置能够实现访问的具备兼容性性质的接口, 其可以正常使用的状况取决于相对应的供应商或者本地所拥有的模型服务。

七、目录与部署方式

项目根目录/ ├── 系统介绍文档.md ├── 视频介绍脚本.md ├── 系统文档.md ├── 系统开发步骤.md ├── 运行说明.md ├── dataset/ # 原始训练数据 ├── 测试数据/ # 检测演示文件 ├── 项目代码/ │ ├── backend/ # Flask、机器学习、Worker 与测试 │ │ └── run.py # 后端启动入口 │ └── frontend/ # Vue 应用与原型 └── runtime/ # 数据库、日志、模型、上传、导出与密钥

其默认的访问地址, 有着这样一项: 是那 :5050 , 当己做好这般的那种配置环境之后, 运行 run.py 这个程序, 就能够实现启动的这项操作;而关于安装、停止、备份以及恢复这样的一些操作, 去参照《运行说明.md》便可以知晓。当前处于主要状态的那种验证环境, 是 macOS , 启动管理脚本面向的是 macOS/Linux。

八、应用价值与后续扩展方向

对于教学演示以及域名风险筛查而言, 系统把数据质量管理、模型实验、业务检测、AI辅助分析还有运行反馈, 放置进同一个应用里, 从而提供完整流程。它的价值体现为: 能够使得分类结果可读, 可以保证执行过程可见, 并且让历史依据可查。

往后能够思索增添除时间之外的与未知家族数据开展评测, 以及更多的特征和算法, 另有外部情报查询, 审批处置流程, 又或者更大规模的任务调度。这些都归属于后续的方向, 当前版本可是尚未实行的。系统现有的能力跟边界应当以实际的页面、接口以及评测报告作为依据。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 22:21:12

会议室门牌屏幕尺寸选型与空间适配落地指南

在很多办公园区的改造项目中,我们常遇到这样的尴尬场景:走廊尽头的小型洽谈室门口挂着一块巨大的屏幕,不仅显得突兀压抑,还让原本宽敞的通道变得拥挤;而另一边,大型报告厅的入口处却只装了一块小小的显示屏…

作者头像 李华
网站建设 2026/9/11 22:17:21

YOLOv10安全锥检测与SpringBoot工程化实战

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/11 22:16:10

【JAVA毕业设计】基于 SpringBoot 的会议室智能预订平台的设计与实现(源码+文档+远程调试,全bao定制等)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于Java、小程序技术领域和毕业项目实战 ✌️技术范围:&am…

作者头像 李华
网站建设 2026/9/11 22:15:37

基于Python与Flask的高校学生违纪信息管理系统设计与实现

简介:一套基于Python的高校学生违纪信息管理系统源码包,面向高校教务人员、辅导员及有Python Web开发经验的学习者,用于解决学生违纪信息的录入、分类统计、警告处罚记录、报表导出与权限管理等实际管理问题。资源共391个文件,包括…

作者头像 李华
网站建设 2026/9/11 22:15:09

计算机单片机毕设实战-基于 STM32 的自动节能型多功能智能台灯设计与实现 基于 STM32 的声光感知双模控制 LED 照明系统设计(023607)

博主介绍:✌️码农一枚 ,专注于大学生项目实战开发、讲解和毕业🚢文撰写修改等。全栈领域优质创作者,博客之星、掘金/华为云/阿里云/InfoQ等平台优质作者、专注于嵌入式单片机,Java、小程序技术领域和毕业项目实战 ✌️…

作者头像 李华
网站建设 2026/9/11 22:14:43

从零到一搭建可视化AI工作流编排平台:deer-flow实战解析

deer-flow:从零到一搭建自己的可视化AI工作流编排平台最近在做LLM(大语言模型)应用落地时,被工作流编排这件事折腾得不轻。对接过Dify、Coze这类SaaS平台,虽然上手快,但一旦涉及私有化部署、深度定制和复杂…

作者头像 李华