Home avatar

Stay Hungry Stay Foolish

Paper Reading: AnalyticDB-V

AnalyticDB-V: A Hybrid Analytical Engine Towards Query Fusion for Structured and Unstructured Data

ABSTRACT

随着非结构化数据的爆炸性增长(例如图像,视频和音频),非结构化数据分析在真实世界应用的丰富脉络中广泛存在。许多数据库系统开始合并非结构化数据分析以满足此类需求。但是,在大多数系统中,对非结构化和结构化数据的查询通常被视为 disjoint tasks,在大多数系统中,混合查询(即涉及两种数据类型)尚未得到充分支持。

Paper Reading: Milvus a Purpose-Built Vector Data Management System

Milvus:A Purpose-Built Vector Data Management System

ABSTRACT

最近,数据科学和人工智能应用中迫切需要管理高维向量数据。 非结构化数据和机器学习 (ML) 的激增推动了这一趋势,其中 ML 模型通常将非结构化数据转换为特征向量以进行数据分析,例如产品推荐。 现有的向量数据管理系统和算法有两个局限性:(1)在处理大规模动态向量数据时会出现严重的性能问题; (2)它们提供的功能有限,不能满足多功能应用的要求。 本文介绍了 Milvus,这是一个专门构建的数据管理系统,用于有效管理大规模向量数据。 Milvus 支持易于使用的应用程序接口(包括 SDK 和 RESTful API); 针对具有现代 CPU 和 GPU 的异构计算平台进行优化; 实现超越简单向量相似性搜索的高级查询处理; 处理动态数据以实现快速更新,同时确保高效的查询处理; 并将数据分布到多个节点以实现可扩展性和可用性。 我们首先描述 Milvus 的设计和实现。 然后我们演示 Milvus 支持的实际用例。 特别是,我们在 Milvus 之上构建了一系列 10 个应用程序(例如图像/视频搜索、化学结构分析、COVID-19 数据集搜索、个性化推荐、生物多因素认证、智能问答)。 最后,我们使用广泛的系统对 Milvus 进行实验评估,包括两个开源系统(Veach 和 Microsoft SPTAG)和三个商业系统。 实验表明,Milvus 比竞争对手快两个数量级,同时提供更多功能。 现在 Milvus 已被全球数百家组织部署,也被认定为 LF AI & Data Foundation 的孵化阶段项目。 Milvus 开源于 https://github.com/milvus-io/milvus。

阅读:DDIA 第二章

第二章:数据模型与查询语言

数据模型可能是软件开发中最重要的部分了,因为它们的影响如此深远:不仅仅影响着软件的编写方式,而且影响着我们的 解题思路。