索引设置
索引设置
索引设置用于控制 Standard 部署如何编码文档并为基于 OpenSearch 的检索准备数据。只有 Admin 应修改这些部署级设置,并且每次变更都应使用有代表性的索引内容进行测试。
Embedding 模型
OpenCore 使用所选 embedding 模型编码文档 chunk 与查询。该页面提供已配置的云 Provider、支持的自托管模型和自定义 embedding 模型定义。
索引设置要求 Standard 模式。Lite 不启动 OpenSearch,因此不能运行连接器索引或 embedding 模型切换。在托管 Cloud 部署中,embedding 选择器及相关控制为只读,由服务统一管理。
选择云 embedding Provider 的模型前,先配置该 Provider 的凭据。定义自定义模型时确认 dimension、normalization 和 prefix;这些值会成为索引 contract 的一部分。
模型切换
修改 embedding 模型或 Contextual Retrieval 设置需要完整重新索引。OpenCore 会从当前 OpenSearch 索引读取已有 chunk,使用新设置重新生成 embedding,并将结果写入目标索引。
第一种策略是默认值,也是最安全的选择。对于大型语料库,重新生成 embedding 可能需要数小时或数天。在普通切换或 active-only 切换期间,旧模型会持续可用,直到提升新索引。
当前实现会把 OpenSearch 中已存储的 chunk port 到新索引并重新计算 embedding;它不会通过连接器重新获取每一份源文档。复制 backlog 时,forward indexing 会继续保护更新的写入。
取消进行中的切换会停止 port,并放弃此次重建目标及其进度,同时保持旧 embedding 模型为当前模型。取消流程不保证删除物理 OpenSearch index。立即切换的 backfill 仍未完成时,不要开始另一轮切换。
Reranking
Reranking 与 embedding 和 OpenSearch 索引构建相互独立。当前索引设置页面不显示 reranker 选择器,其 Apply & Re-index 请求也不发送 reranker 字段。
应把 embedding 模型切换视为 retrieval candidate 的变化,而不是 reranker 变化。新索引提升后需要验证回答质量,但不要预期该页面会修改部署中独立的 retrieval-time reranking 行为。
Contextual Retrieval
Contextual Retrieval 会在 embedding 前为每个已索引 chunk 添加文档级 context,以改善 hybrid search 相关性。启用它可能显著增加 LLM 与 embedding 成本。
只有部署至少配置了一个语言模型时才能使用该控制。启用后必须选择 Contextual Retrieval LLM;如果开关已打开但未选模型,OpenCore 会阻止 Apply & Re-index。托管 Cloud 部署会禁用该设置。
修改 Contextual Retrieval 设置或模型会使用完整重新索引流程。当 contextual enrichment 发生变化时,OpenCore 会在目标 OpenSearch 索引中重建 chunk context 与 embedding,而不是复制旧向量。
高级设置
Captioning model 与图像处理更新只影响后续建立索引的文档。已有 caption 已经进入先前的 embedding,因此只修改 captioning model 不会重写它们。