importtorchimporttime# 1. 设置设备iftorch.cuda.is_available(): device=torch.device("cuda")print(f"检测到设备: {torch.cuda.get_device_name(0)}")else: device=torch.device("cpu")print("使用 CPU")# 2. 增加矩阵尺寸,让 GPU 有事可做 (比如 4000x4000 或 8000x8000)# 1000x1000 对高端卡来说太小了size=4000print(f"正在初始化矩阵 (Size: {size}x{size})...")A=torch.randn(size, size,device=device)B=torch.randn(size, size,device=device)# --- 关键步骤:GPU 预热 (Warm-up) ---print("正在进行 GPU 预热 (第一次运行通常很慢)...")# 跑几次空运算,触发库加载和初始化for_inrange(5): _=torch.mm(A, B)torch.cuda.synchronize()print("预热完成,开始正式计时!")# ------------------------------------# 3. 正式计时 GPUtorch.cuda.synchronize()start_time=time.time()# 循环多次取平均值更准确loop_times=10for_inrange(loop_times): C=torch.mm(A, B)torch.cuda.synchronize()# 等待所有计算完成end_time=time.time()avg_gpu_time=(end_time - start_time)/ loop_times print(f"GPU 平均运行时间: {avg_gpu_time:.5f} 秒")# 4. 对比 CPU (如果尺寸太大,CPU可能会非常慢,建议 CPU 测试时如果太慢就减少 loop)iftorch.cuda.is_available(): print("正在准备 CPU 数据 (这可能需要一点时间)...")A_cpu=A.cpu()B_cpu=B.cpu()start_time_cpu=time.time()# CPU 一般不需要像 GPU 那样严格预热,但跑一次也没坏处# 注意:如果 size 是 4000,CPU 跑这 10 次可能会很慢cpu_loops=2# 减少 CPU 循环次数以免等太久for_inrange(cpu_loops): C_cpu=torch.mm(A_cpu, B_cpu)end_time_cpu=time.time()avg_cpu_time=(end_time_cpu - start_time_cpu)/ cpu_loops print(f"CPU 平均运行时间: {avg_cpu_time:.5f} 秒")# 修正加速比公式:CPU时间 / GPU时间speedup=avg_cpu_time / avg_gpu_time print(f"---")print(f"真实性能对比: GPU 比 CPU 快 {speedup:.2f} 倍")如何快速测试GPU的推理速度
张小明
前端开发工程师
Google Cloud零售API实战:构建下一代智能电商推荐引擎
Google Cloud零售API实战:构建下一代智能电商推荐引擎 【免费下载链接】python-docs-samples Code samples used on cloud.google.com 项目地址: https://gitcode.com/GitHub_Trending/py/python-docs-samples 在数字化转型浪潮中,零售企业面临着…
UniVRM完整指南:从零开始掌握虚拟角色导入导出
UniVRM完整指南:从零开始掌握虚拟角色导入导出 【免费下载链接】UniVRM UniVRM is a gltf-based VRM format implementation for Unity. English is here https://vrm.dev/en/ . 日本語 はこちら https://vrm.dev/ 项目地址: https://gitcode.com/gh_mirrors/un/U…
学生成绩分析和弱项辅助系统(11452)
项目演示视频 有需要的同学,源代码和配套文档领取,加文章最下方的名片哦 一、项目演示 二、资料介绍 完整源代码(前后端源代码SQL脚本)配套文档(LWPPT开题报告)远程调试控屏包运行 三、技术介绍 Java语…
【郑州大学主办,IEEE Fellow支持,可靠有保障 | IEEE出版 ,EI稳定检索,该出版社快至会后3个月检索】第二届图像处理、多媒体技术与机器学习国际学术会议(IPMML 2025)
往年已稳定EI检索!录用率高!支持latex和word双通道投稿 郑州大学主办,IEEE Fellow支持,可靠有保障! 第二届图像处理、多媒体技术与机器学习国际学术会议(IPMML 2025) 2025 2nd Internationa…
4张GPU搞定70B大模型训练!DeepSpeed SuperOffload实战全解析
4张GPU搞定70B大模型训练!DeepSpeed SuperOffload实战全解析 【免费下载链接】DeepSpeedExamples Example models using DeepSpeed 项目地址: https://gitcode.com/gh_mirrors/de/DeepSpeedExamples 还在为训练70B参数大模型的显存需求而发愁吗?D…
大模型知道自己在瞎说,却停不下来背后的原理是什么?
前言:作为长期和大语言模型打交道的技术从业者,你一定经历过这样的场景:让模型解答一个复杂问题,它开头逻辑清晰、步骤明确,但越往后越像在自言自语——反复重述观点、兜圈子解释、堆砌看似合理却毫无信息增量的句子。…