Agentic AI 学术研究与工程应用平台 - 任务执行清单

[!IMPORTANT]

基于Implementation Plan v1.1
对齐PRD & Architecture v1.1


#目录

  1. 项目概览
  2. Phase 1: 基础巩固
  3. Phase 2: 智能增强
  4. Phase 3: 认知增强
  5. Phase 4: 生态完善
  6. 跨阶段验证任务
  7. 进度追踪

#1. 项目概览

#1.1 总体路线图

#1.2 里程碑

里程碑目标日期交付物验收标准
M12026-01单内容处理流程上传 → 解析 → 翻译 → 分析完整可用
M22026-02Web UI MVPUI 上线,基础 RAG 可用
M32026-04知识图谱图谱构建完成,混合检索实现
M42026-06认知增强多跳推理可用,RAGAS 达标
M52026-08完整平台用户系统 + API 平台上线

#1.3 优先级说明

  • 🔴 P0:核心功能,必须完成
  • 🟡 P1:增强功能,重要
  • 🟢 P2:扩展功能,可延期
  • 可选:锦上添花,视时间安排

#2. Phase 1: 基础巩固

时间:2025-12 ~ 2026-02
目标:构建核心处理流程,实现单内容完整处理链路

#2.1 任务依赖关系


#T1.1 后端服务层 🔴

目标:基于 FastAPI 构建异步高性能后端服务

子任务描述产出物验收标准状态
T1.1.1项目初始化与目录结构cognizes/ 目录符合设计规范
T1.1.2FastAPI 应用入口api/main.py服务正常启动
T1.1.3配置管理模块core/config.py环境变量加载正确
T1.1.4异常处理机制core/exceptions.py统一错误响应格式
T1.1.5Pydantic 模型定义core/models/数据验证正确
T1.1.6Sources API 实现routes/sources.pyCRUD 接口可用
T1.1.7Tasks API 实现routes/tasks.py任务管理接口可用
T1.1.8Search API 实现routes/search.py搜索接口可用
T1.1.9Health Check APIroutes/health.py/health 返回正常
T1.1.10WebSocket 任务事件websocket/task_events.py实时推送正常
T1.1.11单元测试编写tests/unit/api/覆盖率 > 70%

验收标准

验收项标准验证方式
API 响应时间< 500ms (P95)性能测试
并发处理能力100+ 并发上传压力测试
WebSocket 连接1000+ 同时连接连接测试
API 文档Swagger 自动生成访问 /docs

#T1.2 Agent 层(Google ADK)🔴

目标:基于 Google ADK 实现核心 Agent,完成内容处理流程

子任务描述产出物验收标准状态
T1.2.1ADK 环境配置依赖安装、认证配置API 调用成功
T1.2.2Agent 目录结构agents/adk/符合设计规范
T1.2.3Coordinator Agentcoordinator.py流程编排正确
T1.2.4Reader Agentreader_agent.pyPDF 解析准确率 > 95%
T1.2.5Translation Agenttranslation_agent.py术语保留 100%,BLEU > 0.7
T1.2.6Heartfelt Agentheartfelt_agent.py生成结构化报告
T1.2.7PDF 解析工具tools/pdf_parser.pyPyMuPDF 集成
T1.2.8Web 抓取工具tools/web_scraper.pyURL 解析正确
T1.2.9内容处理工作流workflows/content_pipeline.py端到端可用
T1.2.10Agent 单元测试tests/unit/agents/覆盖率 > 70%
T1.2.11Markdown 解析工具tools/md_parser.pymarkdown-it-py 集成
T1.2.12arXiv API 工具tools/arxiv_fetcher.pyarXiv API 调用成功
T1.2.13DOCX 解析工具tools/docx_parser.pypython-docx 集成

验收标准

验收项标准验证方式
PDF 解析准确率> 95% 文本提取正确样本测试
翻译质量术语保留 100%,BLEU > 0.7人工评估
流程完整性端到端流程无中断E2E 测试
元数据提取准确率 > 90%样本验证

#T1.3 OceanBase 集成 🔴

目标:集成 OceanBase 向量数据库,实现内容存储与向量检索

子任务描述产出物验收标准状态
T1.3.1OceanBase 部署Docker 容器运行服务启动正常
T1.3.2数据库连接配置core/database.py连接池正常工作
T1.3.3sources 表创建Schema SQL表结构正确
T1.3.4source_embeddings 表创建向量表 + HNSW 索引索引创建成功
T1.3.5tasks 表创建任务状态表表结构正确
T1.3.6全文索引创建FULLTEXT 索引关键词检索可用
T1.3.7ORM 模型实现SQLAlchemy 模型CRUD 操作正常
T1.3.8向量存储服务向量写入/检索相似度搜索正确
T1.3.9数据库测试集成测试全部通过

验收标准

验收项标准验证方式
数据库连接连接池正常工作连接测试
CRUD 操作增删改查正常单元测试
向量索引HNSW 索引正确创建EXPLAIN 验证
检索延迟< 100ms (P95)性能测试

#T1.4 Web UI MVP 🔴

目标:构建基础 Web 界面,支持内容上传、列表查看、任务监控

子任务描述产出物验收标准状态
T1.4.1Next.js 项目初始化ui/ 目录开发服务器启动
T1.4.2全局布局实现app/layout.tsx导航、主题正常
T1.4.3仪表板页面app/page.tsx统计概览展示
T1.4.4内容列表页面app/sources/page.tsx列表展示正常
T1.4.5内容详情页面app/sources/[id]/page.tsxTab 切换正常
T1.4.6上传页面app/sources/upload/page.tsx拖拽上传可用
T1.4.7任务监控页面app/tasks/page.tsx实时状态更新
T1.4.8搜索页面app/search/page.tsx搜索功能可用
T1.4.9API 调用 Hookhooks/useApi.ts数据请求正常
T1.4.10WebSocket Hookhooks/useWebSocket.ts实时连接正常
T1.4.11状态管理store/*.ts (Zustand)状态同步正确
T1.4.12前端测试Vitest + Playwright覆盖率 > 60%

验收标准

验收项标准验证方式
页面加载< 2s (首屏)Lighthouse
文件上传50MB 文件 < 30s功能测试
任务实时更新WebSocket 延迟 < 1s连接测试
响应式设计适配移动端视觉测试

#T1.5 基础 RAG 检索 🔴

目标:实现基于向量的语义检索功能

子任务描述产出物验收标准状态
T1.5.1Embedding 服务向量生成模块OpenAI API 调用成功
T1.5.2向量相似度搜索搜索服务Top-K 结果正确
T1.5.3检索 API 实现/api/v1/search接口响应正常
T1.5.4LLM 回答生成生成模块回答质量达标
T1.5.5OceanBase 搜索工具tools/oceanbase_search.pyAgent 可调用
T1.5.6检索测试集成测试准确率 > 80%

验收标准

验收项标准验证方式
检索响应时间< 500ms性能测试
检索准确率相关结果占 Top-10 的 80%+人工评估
回答质量Faithfulness > 85%RAGAS 评估

#Phase 1 验收清单

检查项状态验收日期验收人
FastAPI 服务启动正常
API 文档可访问 (/docs)
WebSocket 连接正常
Reader Agent 解析 PDF
Translation Agent 翻译
Heartfelt Agent 分析
完整流程端到端可用
OceanBase 连接正常
向量索引创建成功
向量检索功能可用
Web UI 首页可访问
文件上传功能正常
任务监控实时更新
语义搜索功能可用
测试覆盖率 > 80%

#3. Phase 2: 智能增强

时间:2026-02 ~ 2026-04
目标:集成 Neo4j 与 Cognee,构建知识图谱与混合检索能力

#3.1 任务依赖关系


#T2.1 Neo4j 部署配置 🔴

目标:部署 Neo4j 图数据库,创建知识图谱 Schema

子任务描述产出物验收标准状态
T2.1.1Docker Compose 配置docker-compose.yml服务启动正常
T2.1.2Neo4j 健康检查端口测试7474/7687 可访问
T2.1.3唯一性约束创建Cypher 脚本6 个约束创建
T2.1.4向量索引创建向量索引cosine 相似度索引
T2.1.5全文索引创建全文索引source_fulltext 可用
T2.1.6Python 驱动连接neo4j-driver连接测试通过
T2.1.7Neo4j 工具封装tools/neo4j_query.pyCRUD 操作正常

验收标准

验收项标准验证方式
Neo4j 服务启动健康检查通过端口测试
约束创建成功6 个唯一性约束SHOW CONSTRAINTS
向量索引创建cosine 相似度索引可用SHOW INDEXES
Python 连接neo4j-driver 正常连接连接测试

#T2.2 Cognee 集成 🔴

目标:集成 Cognee 框架,配置三存储架构

子任务描述产出物验收标准状态
T2.2.1Cognee 依赖安装pyproject.toml版本 >= 0.1.17
T2.2.2LLM 配置Anthropic 配置API 调用成功
T2.2.3Embedding 配置OpenAI 配置向量生成成功
T2.2.4图存储配置Neo4j 连接cognee → Neo4j 成功
T2.2.5Cognee 初始化core/cognee_config.py无报错启动
T2.2.6CogneeMemory 封装core/memory.pyAPI 封装完成
T2.2.7cognee.add 测试添加文档测试成功添加
T2.2.8cognee.cognify 测试构建图谱测试成功构建
T2.2.9cognee.search 测试混合检索测试返回相关结果
T2.2.10OceanBase 适配器core/cognee_oceanbase.py向量存储透明
T2.2.11适配器 BaseVectorStore继承实现add/search/delete
T2.2.12适配器单元测试tests/unit/cognee/pytest 全部通过
T2.2.13Cognee 透明集成验证集成测试cognee.search 正常

验收标准

验收项标准验证方式
Cognee 初始化无报错启动日志检查
cognee.add成功添加文档API 测试
cognee.cognify成功构建图谱图谱查询
cognee.search返回相关结果检索测试

#T2.3 知识图谱构建 🟡

目标:实现内容到知识图谱的自动转换

子任务描述产出物验收标准状态
T2.3.1实体类型定义节点类型规范10 类实体定义(PRD 对齐)
T2.3.2关系类型定义边类型规范10 类关系定义(PRD 对齐)
T2.3.3实体抽取器entity_extractor.pyLLM 抽取实现
T2.3.4关系识别器关系抽取准确率 > 75%
T2.3.5图谱写入服务Neo4j 写入批量写入正常
T2.3.6向量嵌入服务节点向量化嵌入存储成功
T2.3.7图谱查询 APICypher 查询封装查询接口可用
T2.3.8图谱数据导出get_graph_data可视化数据格式
T2.3.9Source 基类定义节点模型Paper/Article/Doc/Repo
T2.3.10知识实体类定义节点模型Author/Concept/Method/etc

验收标准

验收项标准验证方式
实体抽取准确率> 80%人工评估
关系识别准确率> 75%人工评估
图谱完整性核心实体全部入图图遍历验证

#T2.4 混合检索实现 🔴

目标:实现关键词 + 向量 + 图谱的三路混合检索

子任务描述产出物验收标准状态
T2.4.1查询解析器查询类型分类三类查询识别
T2.4.2关键词检索OceanBase FULLTEXT返回结果正确
T2.4.3向量检索OceanBase HNSWTop-K 正确
T2.4.4图谱检索Neo4j Cypher关系查询正确
T2.4.5RRF 融合算法hybrid_search.py排序正确
T2.4.6智能路由器search_router.py路由策略正确
T2.4.7三路并发执行asyncio.gather并发检索正常
T2.4.8LLM 重排序可选增强质量提升
T2.4.9混合检索 API/api/v1/search/hybrid接口可用
T2.4.10检索质量评估Precision@10> 70%

验收标准

验收项标准验证方式
三路检索可用全部正常返回结果功能测试
RRF 融合正确排序符合预期单元测试
混合检索质量Precision@10 > 70%评估测试
响应时间< 1s性能测试

#Phase 2 验收清单

检查项状态验收日期验收人
Neo4j 服务正常
Neo4j Schema 创建完成
Cognee 初始化成功
cognee.add 功能正常
cognee.cognify 功能正常
实体抽取功能可用
知识图谱数据可查询
关键词检索可用
向量检索可用
图谱检索可用
RRF 混合检索可用
测试覆盖率 > 85%

#4. Phase 3: 认知增强

时间:2026-04 ~ 2026-06
目标:实现多跳推理问答、RAGAS 评估体系、Agent 记忆持久化

#4.1 任务依赖关系


#T3.1 多跳推理问答 🔴

目标:实现基于 Agentic RAG 的复杂问题推理

子任务描述产出物验收标准状态
T3.1.1智能路由器查询分类三类路由正确
T3.1.2问题分解模块子问题生成分解合理
T3.1.3多步检索执行逐步检索信息累积正确
T3.1.4推理分析模块子答案生成推理过程清晰
T3.1.5答案综合模块最终答案生成结构完整
T3.1.6自我反思机制质量评估修正能力有效
T3.1.7相关性评估器Grader 实现低质量可检测
T3.1.8Web 搜索补救外部检索补充信息正确
T3.1.9MultiHop API/api/v1/multihop接口可用

验收标准

验收项标准验证方式
问题分解准确子问题覆盖完整人工评估
多跳检索有效能发现间接关联案例测试
回答质量Answer Relevancy > 90%RAGAS 评估
推理可解释包含推理过程输出检查

#T3.2 RAGAS 评估体系 🔴

目标:建立基于 RAGAS 的检索与生成质量评估体系

子任务描述产出物验收标准状态
T3.2.1RAGAS 依赖安装ragas版本 >= 0.1.0
T3.2.2评估数据集框架JSON Schema 定义符合 RAGAS 要求
T3.2.3自建问答对论文库抽取100+ 条
T3.2.4领域专属数据人工标注50+ 条
T3.2.5标准测试集引入MS MARCO/NQ 子集500+ 条
T3.2.6评估器实现evaluation.py四项指标计算
T3.2.7Faithfulness 达标忠实度评估> 85%
T3.2.8Answer Relevancy 达标相关性评估> 90%
T3.2.9Context Precision 达标精确度评估> 80%
T3.2.10Context Recall 达标召回率评估> 85%
T3.2.11评估报告生成自动化报告格式清晰
T3.2.12CI 集成GitHub Actions自动化评估

验收标准

验收项标准验证方式
评估管道运行无报错完成评估功能测试
评估数据集至少 100 条测试用例数据检查
指标达标四项指标全部达标评估运行

#T3.3 Agent 记忆持久化 🟡

目标:实现 Agent 跨会话记忆持久化

子任务描述产出物验收标准状态
T3.3.1短期记忆实现内存存储会话内保持
T3.3.2长期记忆实现OceanBase 存储重启后保留
T3.3.3情景记忆实现Neo4j 存储历史轨迹记录
T3.3.4语义记忆实现Cognee 存储知识关联保持
T3.3.5记忆管理器memory_manager.pyAPI 完整
T3.3.6记忆检索功能相关记忆召回准确率达标
T3.3.7记忆固化机制短期 → 长期转移自动执行
T3.3.8记忆测试跨会话测试功能正常

验收标准

验收项标准验证方式
短期记忆有效会话内上下文保持会话测试
长期记忆持久重启后记忆保留持久化测试
记忆检索准确相关记忆正确召回检索测试

#T3.4 图谱可视化 🟡

目标:实现知识图谱的交互式可视化

子任务描述产出物验收标准状态
T3.4.1vis-network 集成前端组件渲染正常
T3.4.2图谱数据 API/api/v1/graph返回格式正确
T3.4.3节点渲染样式配置类型区分清晰
T3.4.4边渲染关系展示方向正确
T3.4.5交互功能缩放/拖拽/点击响应流畅
T3.4.6节点详情展示点击展开信息完整
T3.4.7中心展开查询指定节点展开功能正常
T3.4.8性能优化1000+ 节点渲染 < 3s
T3.4.9图谱页面app/graph/page.tsx页面完整

验收标准

验收项标准验证方式
图谱渲染正确节点和边正确显示视觉测试
交互功能支持缩放、拖拽、点击功能测试
性能表现1000 节点渲染 < 3s性能测试

#T3.5 Solutions Architect Agent 🟡

目标:实现场景化方案定制 Agent

子任务描述产出物验收标准状态
T3.5.1Agent 定义solutions_architect.py结构完整
T3.5.2需求分析能力Prompt 设计场景理解准确
T3.5.3方案检索能力工具集成检索相关内容
T3.5.4架构设计能力输出模板结构化输出
T3.5.5Coordinator 注册流程集成Agent 可调度
T3.5.6API 端点/api/v1/architect接口可用
T3.5.7方案质量评估人工评估匹配度 > 80%
T3.5.8最佳实践整合BettaFish/Cognee 模式工程模式验证
T3.5.9定制化输出PRD/代码骨架多格式输出

验收标准

验收项标准验证方式
Agent 响应生成结构化方案文档功能测试
方案相关性方案与场景匹配度 > 80%人工评估
响应时间< 30s(含检索)性能测试

#T3.6 BettaFish ForumEngine ⚪ 可选

目标:实现 Agent 论坛协作机制

子任务描述产出物验收标准状态
T3.6.1ForumEngine 架构forum_engine.py结构完整
T3.6.2主持人 AgentHost LLM引导讨论
T3.6.3参与者 Agents三种视角多元观点
T3.6.4讨论轮次控制最多 3 轮可收敛
T3.6.5共识判断机制共识检测判断正确
T3.6.6结论综合综合器输出质量高
T3.6.7Forum API/api/v1/forum/discuss接口可用

验收标准

验收项标准验证方式
多轮讨论支持 3 轮以上辩论功能测试
共识达成论坛能收敛到结论逻辑测试
输出质量论坛输出 > 单 Agent 输出质量A/B 测试

#Phase 3 验收清单

检查项状态验收日期验收人
多跳推理问答可用
问题分解功能正常
自我反思机制有效
RAGAS 评估管道运行
Faithfulness > 85%
Answer Relevancy > 90%
Context Precision > 80%
Context Recall > 85%
短期记忆功能正常
长期记忆持久化
记忆检索准确
图谱可视化页面可用
Solutions Architect 可用
ForumEngine 可用(可选)
测试覆盖率 > 90%

#5. Phase 4: 生态完善

时间:2026-06 ~ 2026-08
目标:完善用户系统、个性化推荐、API 开放平台

#5.1 任务依赖关系


#T4.1 用户认证系统 🟢

目标:实现用户注册、登录、权限管理

子任务描述产出物验收标准状态
T4.1.1users 表创建用户数据模型表结构正确
T4.1.2user_favorites 表收藏数据模型关联正确
T4.1.3reading_history 表历史数据模型记录完整
T4.1.4注册功能邮箱验证密码强度检查
T4.1.5登录功能JWT 签发Token 正确
T4.1.6Token 刷新Refresh Token过期自动刷新
T4.1.7权限控制中间件未授权返回 401
T4.1.8收藏功能收藏 APICRUD 正常
T4.1.9第三方登录OAuth2GitHub/Google 可选

验收标准

验收项标准验证方式
注册功能邮箱验证、密码强度检查功能测试
登录功能JWT 签发正确功能测试
Token 刷新过期自动刷新边界测试
权限控制未授权访问返回 401安全测试

#T4.2 个性化推荐 🟢

目标:基于用户行为的个性化内容推荐

子任务描述产出物验收标准状态
T4.2.1用户行为数据收集埋点实现数据完整
T4.2.2协同过滤算法相似用户推荐推荐合理
T4.2.3内容推荐算法向量+图谱推荐推荐相关
T4.2.4热门推荐全局统计数据准确
T4.2.5趋势推荐时间衰减新鲜度保证
T4.2.6推荐 API/api/v1/recommend接口可用
T4.2.7冷启动处理新用户推荐有效推荐

验收标准

验收项标准验证方式
推荐生成新用户也能获得推荐冷启动测试
推荐相关性用户满意度 > 70%用户调研
响应时间< 500ms性能测试

#T4.3 API 开放平台 🟢

目标:提供开放 API 供第三方调用

子任务描述产出物验收标准状态
T4.3.1API Key 生成密钥管理安全生成
T4.3.2API Key 验证中间件验证正确
T4.3.3速率限制限流中间件超限返回 429
T4.3.4使用统计调用量统计数据准确
T4.3.5API 文档完善Swagger完整可用
T4.3.6开发者控制台管理界面功能完整
T4.3.7套餐管理计费逻辑可配置

验收标准

验收项标准验证方式
API 文档Swagger 完整可用文档检查
API Key 管理创建、撤销功能正常功能测试
速率限制超限返回 429压力测试
使用统计调用量统计准确数据验证

#T4.4 移动端适配 🟢

目标:Web 端完全适配移动设备

子任务描述产出物验收标准状态
T4.4.1响应式布局TailwindCSS 断点适配正确
T4.4.2触摸优化点击区域调整易于操作
T4.4.3图片懒加载性能优化加载顺畅
T4.4.4Service WorkerPWA 支持离线可用
T4.4.5安装提示PWA Manifest可安装
T4.4.6移动端测试多设备测试兼容性好
T4.4.7Lighthouse 优化性能评分Mobile > 80

验收标准

验收项标准验证方式
移动端可用核心功能正常设备测试
Lighthouse 评分Mobile > 80性能测试
离线支持缓存页面可访问功能测试

#Phase 4 验收清单

检查项状态验收日期验收人
用户注册登录正常
JWT 认证正确
用户收藏功能可用
个性化推荐有效
API 文档完整
API Key 管理功能正常
速率限制生效
移动端完全适配
PWA 离线支持
全平台测试通过

#6. 跨阶段验证任务

#6.1 测试体系

测试类型工具目标覆盖率执行频率
单元测试Pytest / Vitest> 85%每次提交
集成测试Pytest> 70%每次 PR
E2E 测试Playwright> 60%每日构建
性能测试k6P95 < 500ms每周
RAGAS 评估ragas四项达标每周

#6.2 E2E 测试场景

编号场景所属阶段优先级
E2E-001论文上传完整流程Phase 1P0
E2E-002语义搜索验证Phase 1P0
E2E-003翻译流程验证Phase 1P0
E2E-004深度分析验证Phase 1P0
E2E-005知识图谱展示Phase 2P1
E2E-101多跳问答验证Phase 3P0
E2E-102跨会话记忆Phase 3P1
E2E-103方案生成验证Phase 3P1

#6.3 性能基准

接口/功能指标目标值
/api/v1/sources POST响应时间< 200ms
/api/v1/search POSTP95 延迟< 500ms
向量检索单次查询< 100ms
图谱遍历 (2 跳)单次查询< 200ms
混合检索 (三路)端到端< 1s
页面首屏LCP< 2s

#6.4 RAGAS 评估数据集

编号任务产出物验收标准
V-001评估数据集格式定义JSON Schema符合 RAGAS 要求
V-002自建问答对收集从已分析论文抽取100+ 条
V-003领域专属标注人工 Ground Truth50+ 条
V-004评估脚本实现evaluation/ragas_eval.py四项指标计算

#6.5 翻译质量评估

编号任务产出物验收标准
V-101BLEU 评估脚本evaluation/bleu_eval.pysacrebleu 集成
V-102参考翻译数据集30+ 篇高质量翻译人工翻译样本
V-103翻译质量验证评估报告BLEU > 0.7

#7. 进度追踪

#7.1 总体进度

#7.2 阶段进度汇总

阶段任务总数子任务数已完成进度
Phase 155400%
Phase 244300%
Phase 365800%
Phase 443000%
跨阶段-1100%
总计1919600%

#7.3 风险提示

风险影响概率缓解措施
OceanBase 向量功能备选 Milvus/Qdrant
Cognee 兼容性自研 GraphRAG 组件
LLM API 限流多 Provider 切换
开发周期延误迭代交付、优先核心

#附录

#A. 术语表

术语定义
Agentic RAGAgent 驱动的检索增强生成
GraphRAG结合知识图谱的 RAG 技术
CogneeAI 认知记忆层框架
HNSW分层可导航小世界图算法
RRF倒数排名融合算法
RAGASRAG 评估框架

#B. 参考文档

文档路径
PRD & Architecturedocs/000-prd-architecture.md
Implementation Plandocs/001-implementation-plan.md
认知增强调研docs/research/000-cognitive-enhancement.md
Context Engineeringdocs/research/001-context-engineering.md
Agent Frameworksdocs/research/002-agent-frameworks.md
Cognee 调研docs/research/003-cognee.md
OceanBase 调研docs/research/004-oceanbase.md
Neo4j 调研docs/research/005-neo4j.md
BettaFish 调研docs/research/006-bettafish.md

#C. 变更记录

版本日期变更内容
v1.02025-12-22初始版本
v1.12025-12-22精细化优化版:新增 31 个子任务项,与 PRD 完全对齐