lacerate551
|
e40989eeab
|
docs: 全面重写出题批题后端对接指南 v2.0
- 新增 generate-smart 接口文档(含 ai_analysis 字段)
- 判断题返回 bool(true/false)格式说明
- 填空题二维数组答案格式详细说明
- 统一响应格式、状态码、错误码
- 5种题型批阅结果真实示例
- curl 调用示例、性能参考
- 基于生产服务器实测数据
|
2026-06-30 10:33:55 +08:00 |
|
lacerate551
|
a3aa6cbcf3
|
docs: 完善出题批卷系统设计文档,补充服务器实测验证备注
- generate-smart 的 requested_types 可能包含值为0的题型(AI分析结果)
- actual_types 仅包含实际生成数量大于0的题型
- 文档已通过生产服务器三端点实测验证
|
2026-06-22 19:23:52 +08:00 |
|
lacerate551
|
a31ee4bba0
|
feat(exam_pkg): 优化出题系统稳定性与推理模型适配
- core/llm_utils: MiMo模型自动注入thinking=disabled参数,全局生效
- config: 新增LLM_DISABLE_THINKING配置项(默认true)
- generator: 推理模型自适应max_tokens(1.5x)、429限流重试+指数退避、v2管线补题机制
- generator: analyze_document_for_exam新增max_total参数控制AI出题上限
- generator: validate_questions_schema兼容type和question_type字段
- grader: 主观题max_tokens从1000提升至2000、fuzzy_match增加编辑距离容错
- manager: results变量初始化防NameError、透传max_total参数
- api: /exam/generate-smart支持max_total请求参数
|
2026-06-22 18:51:11 +08:00 |
|
lacerate551
|
b966be5417
|
fix: 修正 RAG性能分析报告中的错误和遗漏
- INTENT_MAX_TOKENS 2048 不再标注为'浪费',推理模型思考链需 ~1000 token
- 删除 P2 建议'INTENT_MAX_TOKENS 降低 2048→512'(推理模型不可降)
- P0 优化建议标注 deepseek-v4-flash 额度已尽,需寻找替代轻量模型
- Rerank 配置补充云端 xop3qwen8breranker(讯飞云)信息
- §6.4 休眠模块:AgenticRAG 类已在 v4.0 删除,更新描述
- 阶段 7 补充两管线断裂问题:chart_contexts 降门槛、P0 安全网、答案后过滤鸡生蛋问题
- 阶段 9 补充推理模型 content 为空问题和 reasoning_content 回退机制
- 阶段 10 图片后过滤补充 _filter_images_by_answer 函数名
|
2026-06-22 13:08:14 +08:00 |
|
lacerate551
|
8268071fdc
|
docs: 模型切换至 mimo-v2.5 + 文档全面更新
- config.py: INTENT_MODEL 从 deepseek-v4-flash 切换至 mimo-v2.5
- config.py: get_intent_client() 从百炼 API 切换至 mimo API
- RAG系统完整指南.md: v4.0→v4.1,新增图片检索子系统、P0安全网、
救援管线、五层缓存架构文档;替换所有旧模型名和API地址
- RAG数据流程.md: 完全重写,匹配实际代码逻辑
- curl测试手册.md: 更新模型名和Reranker配置
- MinerU模型部署指南.md: VLM_MODEL 更新为 mimo-v2.5
- 开发与系统模块说明.md: API地址和模型名更新
- 测试指南.md: API地址和模型名更新
|
2026-06-21 23:11:46 +08:00 |
|
lacerate551
|
ee5295cc97
|
fix(parser): PDF/DOCX 切片层级结构修复与 MinerU V2 解析增强
核心修复:
- _post_process_chunks: 用 _buffer_has_body 标志替代 buffer.text_level=0,
标题+正文合并后保留 text_level 不置零,修复层级信息丢失
- heading_rules numeric_level2: 正则从 ^\d+\.\d+[\.、\s] 改为
^\d+\.\d+(?!\.\d),修复无空格标题如"2.1运行调度"无法匹配
- V2 title handler: heading_rules 优先(模式匹配可靠),VLM 仅兜底
(VLM 常给所有标题 level=1)
MinerU V2 解析增强:
- 两轮 TOC 过滤:多行目录块检测 + 孤立标题/单字符残留清理
- 封面 logo 过滤、重复标题去重
- chart VLM 描述和 Markdown 数据表提取
- ChromaDB metadata 新增 text_level/bbox/table_type/sub_type 字段
配置调整:
- CLUSTER_SECTION_PREFIX_LEVELS 1→2(两级 section 聚类更精确)
- MINERU_LOCAL_BACKEND 默认改为 pipeline
文档:
- RAG检索流程逻辑.md 更新 MinerUChunk 字段、ChromaDB metadata、
MinerU 解析策略等章节
- 新增 RAG引用跳转-优化计划.md、云端MinerU输出分析与优化方案.md
|
2026-06-19 23:56:13 +08:00 |
|
lacerate551
|
858ee40e5b
|
chore: 同步项目状态
- main.py: 去掉 emoji 避免 GBK 编码崩溃
- docs/curl测试手册.md: 更新模型名和测试日期
- docs/代码审查报告_2026-06-05.md: 删除过期报告
- docs/main分支独有功能说明.md: 新增
- docs/出题系统逻辑.md: 新增
|
2026-06-19 15:25:57 +08:00 |
|
lacerate551
|
4afa30a946
|
docs(rag): 编写完整的 RAG 检索流程逻辑文档
覆盖从 MinerU 解析入库到 LLM 回答的全链路数据流:
- 文档解析与入库流程(MinerU → Chunk → ChromaDB + BM25)
- ChromaDB 存储字段详解(每个 metadata 字段的作用)
- BM25 索引两种实现的差异分析
- distances/scores 语义在各管线阶段的变化
- 检索管线完整数据流图
- 三重救援机制详解(BM25 分歧/词法匹配/章节聚类)
- 配置项完整列表(含死代码标注)
- 单/多知识库路径说明
|
2026-06-17 19:58:31 +08:00 |
|
lacerate551
|
183a57e7f1
|
refactor(api): 统一响应格式迁移 + 异步任务系统 + 状态码体系完善
- 将全部路由文件(12个)的 jsonify 响应迁移至 success_response/error_response 统一格式
- 修复 sync_routes.py error_response 参数错误(P0)
- 新增异步任务系统:task_registry + task_routes
- 新增状态码:TASK_NOT_FOUND(4014)、TASK_CONFLICT(4015)、REINDEX_ERROR(5040)
- 修正 task_routes/exam_pkg 中语义不匹配的状态码
- 更新 curl 测试手册、后端对接规范文档
- 添加缓存性能报告和 Redis 迁移计划
|
2026-06-05 22:56:00 +08:00 |
|
lacerate551
|
54a6815ad4
|
docs: 重写 RAG 系统指南并重命名(移除 AgenticRAG 内容)
- 全面重写文档,反映统一编排路径和四层缓存架构
- 添加 Query Cache 修复说明和语义缓存集成文档
- 重命名 Agentic_RAG完整指南.md → RAG系统完整指南.md
- 同步更新开发与系统模块说明.md 中的引用链接
|
2026-06-05 21:34:56 +08:00 |
|
lacerate551
|
6deba8fae2
|
docs: 添加代码审查报告 2026-06-05
|
2026-06-05 15:26:38 +08:00 |
|
lacerate551
|
6f863ddfd7
|
docs(exam): 出题批卷接口变更说明及文档同步
- 新增《出题批阅接口变更说明(2026-06-05)》面向后端的迁移指南
- 同步更新 curl测试手册 和 后端对接规范 中的出题批卷章节
|
2026-06-05 14:06:17 +08:00 |
|
lacerate551
|
d67a8ff50b
|
docs(fix): 修正引用跳转文档错误及修复 fix_image_paths 脚本
- 修正 preview 接口路径(去掉多余的 /api 前缀)
- 修正响应示例中 chunk id 格式(文件名_序号,非 UUID)
- 补充 preview 响应中 status、version 字段
- 明确前端引用匹配方式为 chunk_id 查找而非数组下标
- fix_image_paths.py 改为遍历知识库子目录,避免生成空 chroma.sqlite3
|
2026-06-05 11:24:44 +08:00 |
|
lacerate551
|
cb75b9b274
|
fix(boundary): 修复多库边界问题、版本管理及删除清理
多库检索与存储修复:
- RRF 融合去重改用 (collection, chunk_id) 复合键,修复同名文件结果被吞
- DocStore 存储路径加 collection 前缀,修复跨库同名切片数据覆盖
- search_multiple 去重改用复合键
- chunk_id 解析改用 rsplit 兼容下划线文件名
上传与版本管理修复:
- 同名文件上传改为覆盖模式,自动清理旧切片
- 修复首次上传不创建版本记录
- 修复覆盖上传版本号回退到 v1
- sync ADDED 分支改用动态版本号生成
- _generate_version_id 改为基于全部版本递增
- 废止/恢复操作同步 SQLite 版本记录
- mark_document_as_superseded 改为仅更新 SQLite
删除清理修复:
- 删除文档时同步清理 SQLite 版本记录和变更日志
- 删除向量库时同步清理该库所有版本记录
- cleanup 改为清理 SQLite 记录而非 ChromaDB
测试:
- test_version_management.py: 27 条版本管理单元测试
- test_edge_cases.py: 28 条边界用例测试
- test_upload_dedup.py: 5 条上传去重测试
- e2e_risk_test.py: 27 条端到端风险测试
文档:
- 新增风险边界问题修复注意事项.md(面向后端的对接文档)
- 新增向量库边界风险分析.md
- 更新多篇现有文档
|
2026-06-04 23:58:44 +08:00 |
|
lacerate551
|
100d1a06eb
|
init: RAG 知识库服务初始提交
- 后端 API(Flask + Gunicorn)
- RAG 引擎(混合检索 + 云端 Reranker + 引用溯源)
- 文档解析(MinerU + 多格式支持)
- Docker 生产部署配置
- 排除前端项目、敏感配置、模型文件
|
2026-06-04 17:35:27 +08:00 |
|