多智能体文档智能AI已上线
AgentFlow
把复杂业务文件变成带引用、可核查的高管简报的多智能体平台。

结果
文档审阅时间减少 85%
问题
管理者要花上数小时,手工把复杂的 CSV、Excel、PDF 和 DOCX 归纳成可执行的摘要。
我构建了什么
用 LangGraph 构建了由五个专职 LLM 智能体(Orchestrator、Ingest、Retrieval、Verifier、Summarizer)组成的编排式 DAG,并结合混合语义检索与 RAG。
成效
每份简报都自动锚定在源文档上,引用严格,风险被标注出来。
工作原理
- 01
文件进入 Ingest,把 CSV、Excel、PDF 和 DOCX 归一化为一份切分并向量化的统一表示。
- 02
Orchestrator 决定这次请求要跑哪些智能体,而不是每次都把整张图跑一遍。
- 03
Retrieval 在切片上做混合检索:稠密向量负责语义,关键词匹配负责具体数字或条款。
- 04
Verifier 把草稿里的每一条论断与召回的段落逐一比对,凡是无法锚定的就丢弃或标记。
- 05
Summarizer 写出带引用的简报,无法核实的风险会被摆出来,而不是被抹平。
AI 层
五个职责分明的智能体放在 LangGraph 的 DAG 里,因为让一条提示同时完成摄取、检索、核验和总结,四件事都会做不好。承重的那个是 Verifier:它存在的意义就是让没有依据的句子不进入简报。
工程层
外围是一个 FastAPI 服务,按格式做文档解析,对慢到会让请求超时的部分用后台任务处理,并有一个供检索步骤读取的向量库。引用以指回源文件的区间形式保存,而不是模型复述的一段文字。
关键技术决策
用一个核验智能体,而不是一条严厉的提示。
让模型只陈述能支撑的内容,在长文档上撑不住。用一个独立环节把每条论断与召回段落比对就撑得住,因为那是另一个有可核查答案的问题。
混合检索,而不是只靠向量。
稠密检索擅长语义,在精确 token 上并不可靠。财务简报恰恰依赖精确 token:一个数字、一个日期、一个条款号。
用 DAG,而不是让智能体互相聊天。
自由形态的智能体对话难以调试,成本也没有上限。显式的图让每次运行可复现、每一步可检查。