docs: 模型切换至 mimo-v2.5 + 文档全面更新

- config.py: INTENT_MODEL 从 deepseek-v4-flash 切换至 mimo-v2.5
- config.py: get_intent_client() 从百炼 API 切换至 mimo API
- RAG系统完整指南.md: v4.0→v4.1,新增图片检索子系统、P0安全网、
  救援管线、五层缓存架构文档;替换所有旧模型名和API地址
- RAG数据流程.md: 完全重写,匹配实际代码逻辑
- curl测试手册.md: 更新模型名和Reranker配置
- MinerU模型部署指南.md: VLM_MODEL 更新为 mimo-v2.5
- 开发与系统模块说明.md: API地址和模型名更新
- 测试指南.md: API地址和模型名更新
This commit is contained in:
lacerate551
2026-06-21 23:11:46 +08:00
parent 4753a53487
commit 8268071fdc
7 changed files with 466 additions and 297 deletions

View File

@@ -4,7 +4,7 @@
>
> 测试日期2026-06-10最近更新| 生产服务器:`47.116.16.222` | 服务地址:`http://127.0.0.1:5001`
>
> 当前部署模型:`qwen-turbo`DashScope| 嵌入模型:`bge-base-zh-v1.5`(本地 CPU| Rerank`qwen3-rerank`DashScope 云端 API
> 当前部署模型:`mimo-v2.5`xiaomimimo.com API| 嵌入模型:`bge-base-zh-v1.5`(本地 CPU| Rerank`xop3qwen8breranker`(讯飞云 API
## 目录
@@ -2106,7 +2106,7 @@ curl -s -X POST "http://localhost:5001/collections/public_kb/reindex"
| 优化项 | 配置 | 效果 |
|--------|------|------|
| Reranker 云端化 | `RERANK_BACKEND=cloud`qwen3-rerank | 搜索阶段从 33-48s 降至 ~0.3s |
| Reranker 云端化 | `RERANK_BACKEND=cloud`xop3qwen8breranker/讯飞云 | 搜索阶段从 33-48s 降至 ~0.3s |
| MMR 文本相似度 | `MMR_USE_EMBEDDING=false` | MMR 阶段从 ~36s 降至 ~0s |
### 耗时拆解(优化后 /rag 问答)
@@ -2126,7 +2126,7 @@ curl -s -X POST "http://localhost:5001/collections/public_kb/reindex"
└── 流式 token 生成 ~11s
```
> **注**LLM 生成阶段耗时取决于 qwen-turbo API 响应速度,非本地可优化。当前已使用 qwen-turbo最快模型如需进一步压缩可考虑减少检索切片数量或缩短 prompt。
> **注**LLM 生成阶段耗时取决于 mimo-v2.5 API 响应速度,非本地可优化。如需进一步压缩可考虑减少检索切片数量或缩短 prompt。
---
@@ -2174,14 +2174,14 @@ curl -s -X POST http://127.0.0.1:5001/collections/<kb_name>/reindex
### Reranker 配置
生产环境使用 DashScope 云端 Reranker 替代本地 CPU 推理,显著提升检索速度:
生产环境使用讯飞云 Reranker 替代本地 CPU 推理,显著提升检索速度:
| 配置项 | 值 | 说明 |
|--------|-----|------|
| `RERANK_BACKEND` | `cloud` | 使用云端 API可选 `local` / `cloud` / `fallback` |
| `RERANK_CLOUD_MODEL` | `qwen3-rerank` | DashScope 云端排序模型 |
| `RERANK_CLOUD_API_KEY` | `sk-*` | DashScope 标准 API Key |
| `RERANK_CLOUD_BASE_URL` | `https://dashscope.aliyuncs.com/compatible-api/v1/reranks` | OpenAI 兼容端点 |
| `RERANK_CLOUD_MODEL` | `xop3qwen8breranker` | 讯飞云排序模型 |
| `RERANK_CLOUD_API_KEY` | `sk-*` | API Key |
| `RERANK_CLOUD_BASE_URL` | `https://maas-api.cn-huabei-1.xf-yun.com/v1/rerank` | 讯飞云 Rerank 端点 |
| `MMR_USE_EMBEDDING` | `false` | MMR 使用文本相似度(零额外计算) |
> **fallback 模式**`RERANK_BACKEND=fallback` 优先使用云端 API如果云端不可用则自动回退到本地模型适合生产环境高可用场景。