难题1主链路达标

面向 AI 的 SSD 存算融合与高效索引技术:低算术强度算子下沉与低内存映射验证方案

面向 AI 检索、RAG 和大规模向量数据库的存算融合方案,通过 SQDelta 2.0 编码、低复杂度算子、低内存映射和设备侧 FTL 原型,降低算力与内存成本,同时保持吞吐和尾延迟稳定。

What it does

它解决什么问题?

AI 检索系统同时面临近存算力不足、向量计算成本高、FTL/索引映射内存开销大等问题。该方案把低复杂度计算路径和低内存映射结合起来,让 SSD 数据路径更适合承载高吞吐向量检索与 RAG 负载。

SSD 存算融合路径

面向 AI 检索和 RAG 场景,把低算术强度算子下沉到更靠近数据的位置,降低主机侧计算与数据搬运压力。

SQDelta 2.0 编码器

通过面向 SSD 的向量编码表示,把高成本浮点相似性计算转化为更适合近数据执行的低复杂度计算路径。

低内存映射索引

围绕 ANN 索引和 FTL 映射表开销做低内存设计,在降低 DRAM 常驻开销的同时保持吞吐和尾延迟。

RAG/LLM 场景验证

覆盖 BEIR 检索、RAG end-to-end、真实 GGUF 模型推理服务和长稳态查询,验证 AI 应用链路可用性。

设备侧 FTL 原型

通过 FEMU SSD 仿真器验证低内存映射 FTL 原型,支撑从主机索引到设备映射的双层证据链。

可信复测证据链

覆盖公开数据集、重复统计、1000 query 长稳态、复杂业务约束和测试程序可信性审查。

Performance

主链路性能指标

算子加速下界

13.91x

目标:算力需求下降 10x

workload 加速

16.52x

真实 workload 口径

DRAM 降幅

72.04%

ANN_GIST1M A/B

吞吐保持率

100.86%

核心结论:吞吐未损失

P99 比例

0.9165

满足 P99≤+10%

FTL 映射降幅

97.24%

1GiB mixed workload

Role

它起什么作用?

降低 AI 检索系统的存算成本

把高成本向量计算与索引映射开销拆解到更低复杂度的数据路径中,适合 RAG、推荐、向量数据库和 LLM 检索增强。

减少高性能索引的内存压力

通过低内存映射与 SSD 友好索引组织,降低常驻 DRAM 开销,缓解大规模向量索引扩容成本。

连接主机侧与设备侧优化

同时验证主机侧 ANN 索引和设备侧 FTL 原型,让方案不止停留在算法层,也能映射到存储系统设计。

Pipeline

从向量检索到 SSD 友好执行

1

向量或 RAG 检索请求进入低复杂度编码表示层。

2

SQDelta 2.0 将相似性估计转为 SSD 友好的低成本计算路径。

3

低内存映射索引减少 DRAM 常驻表和索引管理开销。

4

RAG/LLM 链路评估召回、端到端命中率和长稳态稳定性。

5

FEMU FTL 原型补充设备侧映射降内存可行性证据。

Use Cases

适合哪些场景?

向量数据库、RAG 检索和 LLM 推理前置召回

SSD 近数据计算、存储卸载和高效索引原型验证

海量向量索引的 DRAM 成本压缩

BEIR、SIFT、GIST 等公开数据集复测与工程对标

复杂业务约束下的检索召回和空结果率优化

需要算子、索引、设备侧和 AI 应用侧证据链的研发项目

SSD AI Index Console

SSD 存算融合验收工作台

verified chain

Acceptance Snapshot

Operator13.91x speedup min
Workload16.52x compute speedup
DRAM72.04% saving
FTL97.24% mapping saving

POC

想评估 SSD AI 索引方案?

可通过邮件沟通数据规模、向量维度、SSD 形态、DRAM 预算、RAG 链路和验收指标。

发送邮件