检索增强生成(RAG)并不只是「把文档丢进向量库再拼 prompt」。要落地到生产,需要处理好切分策略、元数据过滤、重排与缓存。
在 Spring Boot 中,spring-ai 已经封装了 VectorStore 与 ChatClient,但真正决定效果的往往是文档切分的粒度与向量模型的选型。
ChatClient client = builder
.defaultAdvisors(new QuestionAnswerAdvisor(vectorStore,
SearchRequest.builder().topK(5).build()))
.build();
下一步我会单独写一篇关于重排(rerank)如何把召回准确率从 62% 提升到 89% 的实测。