SEED: Domain-Specific Data Curation With Large Language Models
使用大型语言模型的 领域特定 数据管理
最近,数据科学和人工智能应用中迫切需要管理高维向量数据。 非结构化数据和机器学习 (ML) 的激增推动了这一趋势,其中 ML 模型通常将非结构化数据转换为特征向量以进行数据分析,例如产品推荐。 现有的向量数据管理系统和算法有两个局限性:(1)在处理大规模动态向量数据时会出现严重的性能问题; (2)它们提供的功能有限,不能满足多功能应用的要求。 本文介绍了 Milvus,这是一个专门构建的数据管理系统,用于有效管理大规模向量数据。 Milvus 支持易于使用的应用程序接口(包括 SDK 和 RESTful API); 针对具有现代 CPU 和 GPU 的异构计算平台进行优化; 实现超越简单向量相似性搜索的高级查询处理; 处理动态数据以实现快速更新,同时确保高效的查询处理; 并将数据分布到多个节点以实现可扩展性和可用性。 我们首先描述 Milvus 的设计和实现。 然后我们演示 Milvus 支持的实际用例。 特别是,我们在 Milvus 之上构建了一系列 10 个应用程序(例如图像/视频搜索、化学结构分析、COVID-19 数据集搜索、个性化推荐、生物多因素认证、智能问答)。 最后,我们使用广泛的系统对 Milvus 进行实验评估,包括两个开源系统(Veach 和 Microsoft SPTAG)和三个商业系统。 实验表明,Milvus 比竞争对手快两个数量级,同时提供更多功能。 现在 Milvus 已被全球数百家组织部署,也被认定为 LF AI & Data Foundation 的孵化阶段项目。 Milvus 开源于 https://github.com/milvus-io/milvus。