news 2026/9/13 4:41:36

Milvus 2.6.1 CAGRA:GPU建索引+CPU查,成本腰斩性能不减

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Milvus 2.6.1 CAGRA:GPU建索引+CPU查,成本腰斩性能不减

Milvus上的CAGRA有什么不同?

尽管GPU在图索引构建阶段优势显著,但在实际生产环境中,GPU资源通常比CPU更昂贵且稀缺。若索引构建与查询均依赖GPU,会导致一系列问题:

资源利用率低(查询请求零散,GPU大量时间空闲)

 

部署成本高(需为每个查询服务配置GPU,增加不必要的硬件成本)

扩展性受限(GPU数量限制服务实例数)

灵活性不足(无法按需切换 GPU 和 CPU )

针对这些痛点,开源向量数据库Milvus在2.6.1版本中,通过adapt_for_cpu参数,为GPU索引CAGRA推出灵活部署选项,实现GPU构建高质量图索引+CPU查询(一般用 HNSW )的混合模式,在保证索引质量的同时大幅降低部署成本。对于数据更新频率低(无需频繁重新构建索引)、查询规模大(需大量查询服务实例)、成本敏感(希望降低GPU资源投入)的场景,这是一种非常实用的解决方案。

(1)adapt_for_cpu解读

Milvus通过adapt_for_cpu

 

参数控制CAGRA索引的序列化与反序列化行为,实现构建与查询设备的灵活切换。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/11 0:54:41

Nano-vLLM 源码分析(一) - 课程大纲

Nano-vLLM 源码分析课程大纲 🚀 一个轻量级 vLLM 实现的深度源码解析 课程简介 Nano-vLLM 是一个仅用约 1200 行 Python 代码实现的轻量级 LLM 推理引擎,却能达到与 vLLM 相当的推理性能。本课程将带你深入分析每一行代码,理解现代 LLM 推理…

作者头像 李华
网站建设 2026/9/11 4:11:36

免费下载Seed-Coder-8B-Base镜像,开启本地代码生成新时代

免费下载Seed-Coder-8B-Base镜像,开启本地代码生成新时代 在今天这个AI重构软件开发流程的时代,你是否曾因使用云端编程助手而犹豫?一段正在调试的核心算法、一个尚未发布的业务逻辑——这些代码一旦上传到远程服务器,就可能面临…

作者头像 李华
网站建设 2026/9/13 11:33:36

百度搜索关键词优化:如何快速找到Qwen3-32B资源

百度搜索关键词优化:如何快速找到Qwen3-32B资源 在AI研发一线的工程师们可能都有过类似经历:项目急需部署一个高性能大模型,团队评估后锁定了通义千问系列中的旗舰开源版本——Qwen3-32B。参数规模达320亿,支持128K超长上下文&…

作者头像 李华
网站建设 2026/9/12 16:22:02

紫薯矮砧密植:水肥一体化系统的铺设要点

紫薯地里,老王的紫薯个头均匀,颜色鲜亮。“这套水肥系统让我的紫薯品质提升不少,”他指着地里的滴灌带说,“不仅产量稳定,薯块还特别甜糯。”认识紫薯矮砧密植紫薯矮砧密植,简单来说就是选用矮蔓品种&#…

作者头像 李华
网站建设 2026/9/13 1:39:02

芋头矮砧密植:水肥一体化系统的铺设要点

芋头田里,老张的芋头长势整齐,个头匀称。“这套水肥系统帮了我的大忙,”他指着地里的管道说,“不仅省水省肥,产量还提高了四成。”认识芋头矮砧密植芋头矮砧密植,说白了就是选用矮生品种(Dwarf …

作者头像 李华
网站建设 2026/9/12 13:34:33

2025 AtomGit 最受欢迎 G-Star 项目 组织评选活动火热进行中!

2025 AtomGit 最受欢迎 G-Star 项目 & 组织评选活动火热进行中!本次活动面向全体 G-Star 认证个人项目、G-Star 认证开源组织。分个人和组织两个赛道,以项目/组织在 AtomGit 平台的 star 数、贡献者数、仓库数进行综合排名。最终评选出的前 40 名个人…

作者头像 李华