跳到正文
APPLICATIONS · RETRIEVAL SYSTEMS

向量只给候选一把尺搜索系统才决定谁能被看见

Embedding 只定义了一种任务相关的几何;真正的搜索还要决定语料怎么切、谁有资格被检索、近似索引漏了多少、稀疏与稠密怎样融合、何时精排,以及新旧索引怎样可回滚地切换。把这些层分开,才能定位质量、延迟、权限和新鲜度故障。

金色查询信号从左侧进入蓝紫色语义点阵和文档候选群,经过收束后在右侧留下少量高亮文档
总览:Query 先进入“可见且有资格”的候选空间,再经过近似召回、混合和重排逐步收束;图只表达直觉,精确数据流见后文 SVG。
01 · DEFINE THE RETRIEVAL CONTRACT

先定义“谁、从哪一版语料、按什么相关性找什么”,再挑模型和向量库

“语义相似”不是完整需求。企业搜索要尊重对象权限和生效时间;RAG 要找能支持回答的证据;推荐要找用户可能消费且可售的候选;图文搜索要比较不同模态。四个系统都能用向量,正样本、过滤条件和最终成功却完全不同。

01 · ELIGIBILITY

谁有资格被看见

tenant、ACL、地域、时间、库存、内容状态与合规策略先决定候选集合。相关但无权,不是“低分”,而是不合格。

02 · RELEVANCE

什么叫相关

答案证据、同款商品、视觉近似、用户兴趣不是同一个标签。训练对和标注指南必须写明任务。

03 · BUDGET

允许花多少状态和计算

语料规模、更新率、内存、磁盘、P95/P99、并发与 reranker 成本共同决定索引和级联。

04 · EVIDENCE

怎样证明可上线

冻结语料、exact 基线、真实查询、分群标注、权限回归、延迟分位数、shadow diff 与回滚演练缺一不可。

白话类比 · 一把尺和一套图书馆制度

Embedding 像给书和问题画坐标;搜索系统像整座图书馆

坐标帮助把“意思相近”的书放近,但馆藏版本、借阅权限、目录、快速找书路线、复核台和撤下旧版才决定读者最终拿到什么。类比的边界是:真实向量没有人类可读的固定“主题轴”,距离也不是相关概率;它只在指定模型、输入格式与任务上有意义。

范围边界

本页负责“从表示到候选、排序、索引和发布”的检索系统。生成模型如何消费证据进入 RAG;token 输入表与上下文表示进入 Token 与 Embedding;搜索结果的对象级授权不能被向量相似度、RRF 或 reranker 取代。

02 · GEOMETRY IS AN INTERFACE

向量不是“完整句意的压缩包”,而是一份带前处理和距离函数的接口

同一串浮点数换了 pooling、query prefix、归一化或 metric,排序就可能改变。生产合同至少要固定 encoder、tokenizer、输入角色、截断、pooling、维度、dtype、normalization 与 distance;只记录“用了某某 embedding 模型”不足以复现。

DOT PRODUCT · 点积s(q,d)=qᵀd

方向和向量长度都会影响分数。若训练目标保留 norm 信息,擅自归一化会改任务。

COSINE · 余弦cos(q,d)=qᵀd/(‖q‖‖d‖)

只比较方向;零向量没有定义。分数仍不是概率,也不能跨模型直接比较。

SQUARED L2 · 平方欧氏距离‖q−d‖²

越小越近。若两侧都 L2-normalized,则 ‖q−d‖²=2−2qᵀd,与 cosine / dot 得到相同名次。E11

手算 · SAME DIRECTION

长度不同,也可以余弦完全相同

q=(1,1)、文档 A 为 (2,2)、文档 B 为 (1,−1)。则 cos(q,A)=1cos(q,B)=0;A 与 q 同方向。点积却是 q·A=4q·B=0,会同时使用方向和长度。这个二维例子只演示 metric;真实语义轴不是人工指定的“价格”“天气”。

ROLE

Query 与 Document 可能不对称

查询通常短、含意图;文档通常长、含证据。有些模型要求不同 instruction / prefix,漏掉或互换会产生静默分布偏移。

DIMENSION

维度不是独立质量旋钮

只有像 Matryoshka Representation Learning(套娃表示学习)这样专门训练嵌套前缀的模型,才支持按声明维度截断。普通向量直接砍尾部没有质量保证。E25

SCORE

阈值要在目标数据上校准

0.82 不等于 82% 相关;query 难度和语料密度会改变分数分布。阈值、拒答和 zero-result 策略都要用真实标注拟合并监控。

03 · WHERE DOES INTERACTION HAPPEN?

三类相关性模型的核心区别,是文档侧能预计算到哪一步

Bi-encoder(双编码器)把 Query 和文档分别压成向量;Cross-encoder(交叉编码器)让二者从 Transformer 输入起联合交互;Late Interaction(晚交互)先分别保留多个 token 向量,检索时才做 MaxSim。交互越早越细,离线复用越少。

三类相关性模型:双编码器分别产生单向量并用 ANN 召回;交叉编码器把查询和候选联合送入模型逐对打分;晚交互分别产生多个 token 向量并用 MaxSim 聚合
图里“召回 / 精排”是常见角色,不是固定产品配置。候选窗口、batch、截断和多向量索引实现必须按工作负载实测。 查看原图 ↗
BI-ENCODER

速度优势来自语料状态可复用

SBERT 与 DPR 展示了独立编码的经典路线:文档向量离线生成,在线只编码 Query 并做相似度搜索。两塔可共享参数,也可不共享;“双塔”描述计算边界,不等于权重必然相同。E01E02

CROSS-ENCODER

细粒度匹配换来逐对计算

每个候选都与 Query 组成一条新输入,不能为所有未来 Query 预存一个通用相关分。它适合有限候选重排,但候选数、文本长度、batch 与硬件决定真实成本,不能把“Top-100”写成通则。

LATE INTERACTION

单向量和全交互之间的另一种状态预算

ColBERT 为每个 Query token 找最相似的文档 token,再求和。ColBERTv2 报告其残差压缩与监督方案相对晚交互基线缩小 6–10× 空间;这是论文实验结果,不是任意语料的固定压缩率。E03E04

历史证据 · DPR 2020

论文在其开放域 QA 设置中,相比强 Lucene-BM25 报告 Top-20 passage retrieval accuracy 提升 9–19 个百分点

这个数字绑定 Natural Questions 等论文数据、其负样本和“包含答案”标注,不证明 dense 在所有企业搜索、语言、实体查询或时间切分上都优于 BM25。真实系统仍要保留 lexical 基线和私有 query 集。E02

04 · NEGATIVES DEFINE THE RULER

正样本说明“应该靠近”,负样本决定模型究竟学会区分什么

常见对比损失让每个 Query 在一批候选中认领正文档:提高正对相似度,同时压低其他候选。temperature 改变 softmax 的锐度;batch 构成改变比较对象。它优化相对排序,不会让分数自动校准,也不会把未标注的相关文档变成真负例。

REPRESENTATIVE INFO-NCEL(q)=−log[exp(s(q,d⁺)/τ) / Σⱼ exp(s(q,dⱼ)/τ)]

τ 是 temperature(温度);dⱼ 包含正样本与候选负样本。公式只是代表性写法,实际系统还可能用多正例、跨设备 batch、蒸馏分数或 listwise loss。E07

RANDOM / IN-BATCH

便宜,但可能没有信息量

同 batch 其他文档可复用一次矩阵乘法。若负例主题完全不同,梯度很快变小;若它其实也能回答问题,就成为 false negative。

LEXICAL HARD

同词但答非所问

BM25 高排却不满足标签的文档,迫使模型超越词面。必须先检查别名、重复答案和标注缺失,否则“难”只是“误标”。

DENSE HARD

当前模型最像但错

ANCE 从全语料 ANN 索引取负例;RocketQA 增加 cross-batch、去噪 hard negative 和 cross-encoder 信号。索引与 teacher 的版本也成为训练数据的一部分。E05E06

DISTILLATION

把贵模型的相对判断教给快模型

Cross-encoder 可提供软分数或排序。学生单向量容量有限,目标是改善候选几何,不是“无损复制”教师的全部 token 交互。

切分规则也是训练规则

按随机行切 train/test,可能让同一模板、作者、时间段或近重复文档同时出现。至少按时间、站点、租户、语言或来源做一组外推切分;公开 BEIR/MTEB 只补充覆盖,不替代私有语料、权限分布和线上尾部查询。SimCSE 的 STS 表现也不能直接等同于检索质量。E07E19

05 · ROUTING ERROR ≠ CODE ERROR

HNSW、IVF 和 PQ 不是一条升级路线,而是两类近似与一份容量账

Flat exhaustive search(穷举检索)逐条比较,是 exact 基线。HNSW 和 IVF 主要减少“看哪些候选”;SQ(Scalar Quantization,标量量化)与 PQ(Product Quantization,乘积量化)主要减少“用多少位表示并怎样估距离”。两者可以组合,误差也会叠加。E12

向量索引地图:Exact Flat 产生参照 Top-k;HNSW 通过分层图路由,IVF 通过 coarse centroids 与 nprobe 选桶;SQ 和 PQ 用低位宽或子空间短码估计距离,再可用原向量重排
先在同一语料、过滤与 metric 上冻结 exact Top-k。ANN Recall 测路由与压缩是否保住这个集合;端到端 nDCG 不能替代这层诊断。 查看原图 ↗
HNSW

图搜索的三笔预算

M 控制连接预算;efConstruction 控制建图候选;efSearch 控制查询候选。更大值通常提高 Recall,也增加内存、建库或查询成本。删除和过滤行为取决于实现;例如 Faiss HNSW 不支持直接删除,不能外推成所有产品都一样。E08E10

IVF

先选桶,再在桶内扫描

nlist 是 coarse cells 数,nprobe 是查询桶数。少 probe 会漏掉跨边界近邻;桶大小不均,因此 nprobe/nlist 只是粗略扫描比例。IVF 还需要代表性训练数据和重训策略。

PQ / ADC

短码估距离,不等于保留原向量

PQ 把 d 维向量拆为 m 个子空间,每段存 codebook id;ADC(Asymmetric Distance Computation,非对称距离计算)用未压缩 Query 对压缩文档估距。可多取候选,再用原向量 rescore。E09

FILTERED ANN

过滤会改变图或桶的可达候选

pgvector 当前实现的文档示例中,post-filter 下若条件只匹配 10% 行,默认 ef_search=40 平均只剩约 4 行;iterative scan、partial index 或 partition 是不同修复。这个例子只说明机制,不是所有数据库的固定行为。E15

容量手算

1 亿条 × 768 维 × FP32 = 307.2 GB(十进制)≈ 286.1 GiB

FP16 原始数组下界约 153.6 GB;每维 8 bit 的裸码下界约 76.8 GB。它们都没算 id、HNSW 边、倒排表、码本、metadata、allocator、副本和原向量。

历史系统证据 · DiskANN 2019

论文在 SIFT1B、16 核机器、64 GB RAM + SSD 上报告超过 5,000 QPS、平均延迟低于 3 ms、1-recall@1 超过 95%

这是说明“图可以把大部分状态放到 SSD”的特定历史证据,不是 2026 任意文本 embedding、过滤条件、并发模型或硬件的 SLA。维度、内在维度、metric、更新和过滤都会改变结果。E13

06 · DATA PLANE + CONTROL PLANE

生产搜索的关键不是“写入向量库”,而是让资格、版本和每阶段候选都可追溯

离线链把语料与权限变成可发布索引;在线链先鉴权和编译过滤条件,再做 dense / lexical 候选、融合与重排;控制面负责 backfill、shadow、切换、更新、删除与回滚。任何一步换版本,都可能换一把尺。

生产检索合同:manifest 绑定语料、解析、权限、模型、归一化、距离和索引;离线构建 dense 与 sparse 制品;在线从身份和过滤计划进入两路召回、融合、重排与结果装配;发布通过 backfill、shadow、切换、监控与回滚闭环
权限标签必须与内容一起版本化,且在召回计划中生效。结果出来后再遮掉无权内容,既可能不足 k 条,也可能已经泄漏 metadata、计数或延迟侧信号。 查看原图 ↗
AUTH BEFORE RELEVANCE

“有权看”不是 reranker 特征

对象级授权先产生 eligible corpus,再在其中排序。pre-filter、partition、iterative filter 或 filter-aware graph 的实现不同,但不能把无权候选送进下游 LLM、日志、缓存或摘要后才删除。

OBSERVE EVERY ARM

混合检索要看每条支路是否还活着

记录 dense-only、lexical-only、overlap、各支原名次、融合后名次和被过滤原因。一条支路静默返回空集时,端到端指标可能过很久才显著下降。

FRESHNESS IS A SYSTEM

Upsert 不等于新索引已经可信

静态图、动态 overlay、tombstone、compaction、局部重平衡和整库 rebuild 的一致性不同。FreshDiskANN 与 SPFresh 都把流式更新作为独立研究问题,说明新鲜度不是 ANN 的免费属性。E14E28

RRF · RECIPROCAL RANK FUSION score(d)=Σᵣ 1 / (c + rankᵣ(d))

RRF 用名次而不是原始分数融合,避免直接把 BM25 的 0~若干与 cosine 的另一尺度相加;c 是 rank constant。它仍依赖每支候选窗口和去重规则,也不会把输出变成概率。E17E18

01CORPUS

原文 hash、有效时间、删除状态、父文档与权限来源

02PARSE

解析器、OCR、表格/图片处理、chunk 边界、重叠与 parent id

03MODEL

encoder、tokenizer、query/document prefix、pooling、维度、dtype 与 normalization

04INDEX

distance metric、HNSW / IVF / PQ 参数、训练样本、build hash 与 shard 拓扑

05ONLINE

query 规范化、过滤计划、各支 Top-k、fusion、reranker、截断与装配策略

06RELEASE

别名、backfill、shadow diff、切换时间、回滚目标与 tombstone / compaction 规则

事故演练 · 新政策上线后仍搜到旧版本

先问六个版本问题,而不是先调 cosine 阈值

  1. 主数据是否真的 tombstone 旧文档?
  2. chunk 表与 sparse / dense 两支是否都消费删除事件?
  3. 查询读的是哪一个 release alias?
  4. 缓存键是否包含 corpus / ACL / model manifest?
  5. 父文档扩展是否又取回旧正文?
  6. 回滚目标是否是一整份已验证 manifest,而不是只换 encoder?
07 · LONG DOCUMENTS & MULTI-MODALITY

长文档真正难的是证据局部而语境全局,不只是“窗口装不下”

整篇压成一个向量会稀释局部事实;先切得太碎又丢标题、指代和时间范围。Early chunk、contextual prefix、late chunking 与 multi-vector 改的是不同成本:编码范围、索引项数、更新粒度和在线聚合都要重新入账。

EARLY CHUNK

先切,再各自编码

最容易增量更新;标题、路径和适度重叠可补上下文。跨边界事实仍可能被拆开,短块也可能只剩“该公司增长 3%”而没有公司与季度。

CONTEXTUAL PREFIX

先为块补一段出处语境

把文档、章节、时间或实体摘要前置给 embedding 和 lexical index。额外生成过程也要版本化,不能把模型写出的错误背景当原文。Anthropic 2024 给出一个产品实现。E29

LATE CHUNKING

整篇编码 token,再按块池化

chunk 向量能带入周边上下文,但要求长上下文 encoder;整篇变化可能重算更多 token。它不是让一条向量无损保存整篇,也不消除边界选择。E23

MULTI-VECTOR

一篇文档保留多个检索单元

按段落、token、视图或潜在主题建多向量,再聚合到 parent。细节更丰富,索引项、过滤、去重、更新和聚合成本也更大;BGE-M3 是 dense / sparse / multi-vector 同模输出实例。E22

定位小,阅读大

Child-to-parent retrieval

用小 chunk 找到证据位置,再回取其父段落或章节给用户 / RAG。父块必须继承同一权限与版本,按 token 预算去重;否则五个相邻 child 可能扩成五份重复父文档,把其他证据挤出上下文。

RAG

正样本是能支持回答的证据

主题相关不够;要测证据覆盖、引用支持与拒答。多跳问题可能有多个必需文档,Top-1 合理仍可能不完整。

RECOMMENDATION

正样本带展示偏差和业务约束

候选生成—排序的两阶段结构与搜索相似,但点击不是纯语义标签;曝光、库存、探索、多样性和长期价值另有目标。E27

MULTIMODAL

共享空间也要规定方向与单位

CLIP 类图文双编码器支持文搜图、图搜文;视频还要决定帧、镜头或整段表示。文本与图片的 encoder、预处理和正负对必须同版。E26

长窗口不是检索免疫

LongEmbed 把既有 embedding 模型扩展到最长 32,768 token,并构造两类合成、四类真实长文档任务;论文也显示现有模型仍有明显改进空间。窗口能接收更长输入,不代表局部目标在池化后必然保真。E24

08 · LAYERED EVALUATION

不要只问“搜索好不好”,要问正确文档在哪一层消失

先验证文档存在且有资格,再以 Flat exact 检查 encoder 与 chunk;然后测 ANN / filter 相对 exact 漏了多少;最后看融合、reranker 和产品装配。上游没召回,下游没有魔法;端到端下降,也不能自动归因给 embedding。

六层检索评测:语料与标注、Exact encoder、ANN 与过滤、Dense Lexical 融合、Reranker、产品任务;每层分别列出冻结基线、指标和典型失败
每层只与自己的基线比较:ANN 对 exact eligible Top-k,reranker 对固定候选集,产品对完整证据与任务结果。这样才能把修复动作指向正确 owner。 查看原图 ↗
RECALL@k

相关文档有多少被前 k 条覆盖

适合多正例与候选覆盖;分母依赖 qrels(相关性标注)是否完整。RAG 多跳可另测“全部必需证据都命中”的 query-level coverage。

MRR · MEAN RECIPROCAL RANK

第一个相关结果有多靠前

每条 Query 取首个相关结果名次的倒数再平均。它强调第一个命中,不表达后续多个证据是否齐全。

nDCG · NORMALIZED DISCOUNTED CUMULATIVE GAIN

有等级相关性时同时看顺序和增益

高相关结果越靠前贡献越大,再除以理想排序的 DCG。不同 gain / discount 定义要固定,不能只写一个缩写。

ANN RECALL@k

近似 Top-k 与 exact Top-k 的集合重叠

它诊断索引,而不是人工相关性。并列距离、过滤资格、分片合并和 k 值必须同口径,否则同一索引也会得到不同数字。

至少分这些桶

语言 · query 长度 · 拼写 / 编号 · 头部 / 尾部实体 · 时间新鲜度 · tenant / ACL 选择率 · 文档长度 · dense-only / lexical-only · zero-result · 多正例 / 多跳 · 新索引 / 增量 overlay

公开 benchmark 怎样用

BEIR / MTEB 用来发现外推风险,不用来代替产品验收

原始 MTEB 论文覆盖 8 类任务、58 个数据集、112 种语言,并报告没有一种 embedding 方法在所有任务上占优;当前 MTEB 已继续扩展任务、语言和模态,所以页面不固化“截至今天第一名”。选择模型时先锁目标任务与许可证,再在私有时间切分、权限分布和成本预算上复跑。E19E20E21

SHIP ONLY IF

同一 manifest 下,质量、资格、延迟、新鲜度和回滚同时过门

最低证据包:query id、corpus snapshot、eligible positives、chunk / model / index / reranker manifest、每阶段 Top-k 与过滤原因、P50/P95/P99、内存与成本、最终标注、shadow diff、切换和回滚记录。任何一个版本字段缺失,都可能让“同模型复跑”得到另一套结果。

RESEARCH LEDGER

一手来源与证据边界

优先使用论文、官方文档、官方模型卡和代码仓库。页面中的数字只代表来源所述设置,不自动外推到其他模型与数据。

E01
Sentence-BERT: Sentence Embeddings using Siamese BERT-NetworksReimers & Gurevych · EMNLP-IJCNLP 2019

双编码器独立编码句子并以余弦比较的经典方案,以及与逐对 BERT 推理的成本差异。

E02
Dense Passage Retrieval for Open-Domain Question AnsweringKarpukhin et al. · EMNLP 2020

问题—段落双编码器、in-batch negatives,以及论文设置中的 Top-20 passage accuracy 历史结果。

E03
ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERTKhattab & Zaharia · SIGIR 2020

token 级多向量与 MaxSim 晚交互的原始架构。

E04
ColBERTv2: Effective and Efficient Retrieval via Lightweight Late InteractionSanthanam et al. · NAACL 2022

残差压缩与去噪监督;6–10× 空间缩减只复述其论文相对原晚交互系统的实验口径。

E05
RocketQA: An Optimized Training Approach to Dense Passage RetrievalQu et al. · NAACL 2021

cross-batch negatives、去噪 hard negatives 与 cross-encoder 标注的数据增强。

E06
Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text RetrievalXiong et al. · ICLR 2021

从全语料 ANN 索引挖掘更有信息量的困难负样本,以及训练索引随模型更新的边界。

E07
SimCSE: Simple Contrastive Learning of Sentence EmbeddingsGao, Yao & Chen · EMNLP 2021

对比学习对 alignment、uniformity 和句向量空间的影响;不把 STS 结果外推为检索通用结论。

E08
Efficient and Robust Approximate Nearest Neighbor Search Using HNSW GraphsMalkov & Yashunin · TPAMI 2020 / arXiv 2016

分层可导航小世界图、随机层级与搜索候选集合的原始算法。

E09
Product Quantization for Nearest Neighbor SearchJégou, Douze & Schmid · TPAMI 2011

把向量拆成低维子空间、存短码,并以 Asymmetric Distance Computation 估计距离。

E10
Faiss IndexesMeta Research · 核查于 2026-07-17

Flat、HNSW、IVF、SQ、PQ 的当前实现组合、每向量字节公式、操作限制与参数语义。

E11
Faiss MetricType and DistancesMeta Research · 核查于 2026-07-17

L2、inner product、cosine 与 L2 normalization 的当前官方关系。

E12
Guidelines to Choose a Faiss IndexMeta Research · 核查于 2026-07-17

先以 Flat 建基线,再按内存与质量—速度约束选图、IVF 与压缩组合;实现建议不是算法定律。

E13
DiskANN: Fast Accurate Billion-point Nearest Neighbor Search on a Single NodeSubramanya et al. · NeurIPS 2019

SSD 驻留图索引的历史系统证据;页面数字严格绑定 SIFT1B、当时 16 核机器与论文指标。

E14
FreshDiskANN: A Fast and Accurate Graph-Based ANN Index for Streaming Similarity SearchSingh et al. · arXiv 2021

实时插入、删除与查询需要专门的更新规则,不能假定静态图索引自动保持新鲜度和 Recall。

E15
pgvector — Vector Similarity Search for Postgrespgvector · 核查于 2026-07-17

exact / HNSW / IVFFlat、距离操作符、过滤、iterative scans、多租户分区与当前实现默认值。

E16
Dense Vector Field TypeElasticsearch Reference · 核查于 2026-07-17

当前 HNSW、Flat、标量/二值量化、原向量保留与 oversampling/rescore 的产品实现示例;默认值会随版本变化。

E17
Reciprocal Rank Fusion Outperforms Condorcet and Individual Rank Learning MethodsCormack, Clarke & Buettcher · SIGIR 2009

按倒数名次融合多个排序器的原始方法。

E18
Reciprocal Rank FusionElasticsearch Reference · 核查于 2026-07-17

当前检索器独立取候选、rank window 与 rank constant 的工程实现说明。

E19
BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval ModelsThakur et al. · NeurIPS Datasets and Benchmarks 2021

跨领域零样本检索评测,说明单一同分布数据集不足以证明泛化。

E20
MTEB: Massive Text Embedding BenchmarkMuennighoff et al. · EACL 2023

原始 MTEB 的 8 类任务、58 个数据集、112 种语言,以及没有一种方法支配全部任务的论文结论。

E21
MTEB Documentation — OverviewMTEB · 核查于 2026-07-17

当前 benchmark / task / modality 分类入口;排行榜与任务集合会继续变化,页面不固化“最新第一名”。

E22
M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge DistillationChen et al. · arXiv 2024 · v5 revised 2025

同一模型产生 dense、sparse 与 multi-vector 表示的实例,不代表三路分数天然可直接相加。

E23
Late Chunking: Contextual Chunk Embeddings Using Long-Context Embedding ModelsGünther et al. · 2024

先编码整篇长文本的 token,再按 chunk 池化,使局部向量带入文档上下文。

E24
LongEmbed: Extending Embedding Models for Long Context RetrievalZhu et al. · EMNLP 2024

长上下文 embedding 的 32,768 token 扩展实验与 LongEmbed 任务;窗口更长不等于局部证据必然更易检索。

E25
Matryoshka Representation LearningKusupati et al. · NeurIPS 2022

经专门训练的嵌套表示可以按维度预算截断;不支持任意裁剪普通 embedding。

E26
Learning Transferable Visual Models From Natural Language SupervisionRadford et al. · ICML 2021

CLIP 图文双编码器与跨模态共享空间的原始证据。

E27
Deep Neural Networks for YouTube RecommendationsCovington, Adams & Sargin · RecSys 2016

候选生成与排序两阶段推荐系统的公开实例;正样本和业务目标不同于文本检索。

E28
SPFresh: Incremental In-Place Update for Billion-Scale Vector SearchXu et al. · SOSP 2023

十亿级磁盘向量索引的增量就地更新研究,说明 freshness、重平衡与资源峰值是独立系统问题。

E29
Introducing Contextual RetrievalAnthropic Engineering · 2024-09-19

为 chunk 加文档上下文并同时建立 contextual embedding / BM25 的产品方法;页面不把其内部实验外推为通用增益。