• 超越想象!高效快速的大规模相似性搜索引擎与卓越GPU加速分析,助力您的数据发现新纪元


    超越想象!高效快速的大规模相似性搜索引擎与卓越GPU加速分析,助力您的数据发现新纪元

    1.什么是相似性搜索

    相似性搜索就是根据某些特征,在大量的样本集中搜寻出与目标样本最相似的一个或多个样本。

    相似性搜索问题无论是在学术界还是工业界,都是一个研究得比较多的问题。相似性搜索有两类方法:存在最近邻检索(Nearest Neighbor Search, NNS)和近似最近邻检索(Approximate Nearest Neighbor Search, ANNS)。NNS 最初是用目标向量和数据库向量逐条计算距离,结果最为精确。后来又产生了相关算法(比如 KD-tree),使得搜索效率大为提高,但在应对海量高维度数据时显得力不从心。ANNS 则是在可接受的精度条件下通过把向量分簇建立索引,大幅提高搜索效率,是大规模相似性搜索场景下所使用的主要方法。

    因此,相似性搜索问题往往会转化成向量检索问题。

    这里先给出向量检索的定义:向量检索是指通过某种数学量化模型,对向量构建一种时间和空间都比较高效的数据索引结构,使得我们能够实时地获取跟查询向量尽可能最相近的 K 个向量。从定义可以看到,要设计一种高效的向量检索引擎,应该满足 3 个基本条件,即:

    • 实时查询,支持海量(百亿、千亿级别)规模库量级的实时查询;
    • 存储高效,要求构建的向量索引模型数据压缩比高,达到大幅缩减内存使占用的目的;
    • 召回精度好,跟暴力搜索(Brute Force Search)的结果相比,top-K 有比较好的召回率&
  • 相关阅读:
    使用Psycopg2连接openGauss 3.0(python2)
    征战MINI学习路线
    SCT71403F50,SCT71403F33,TPS7B82,TPS7B81
    文献解读:有监督的机器学习在心理学上的应用
    npm报错
    C语言中文网 - Shell脚本 - 8
    在Windows 10中开启FTP服务
    一文带你了解人工智能:现状、应用、变革及未来展望
    Python序列操作指南:列表、字符串和元组的基本用法和操作
    重定向:基于神经网络优化的方法
  • 原文地址:https://blog.csdn.net/sinat_39620217/article/details/133764833