医药知识库为什么不能只做向量检索:知识图谱、RAG与证据回溯
医药知识库为什么不能只做向量检索:知识图谱、RAG与证据回溯
医药知识图谱与智能问答系统应该如何设计?
很多项目的第一版做法,是把说明书、医学文献、培训材料切成文本块,再放进向量数据库。用户提问后,系统召回几个相似片段交给大模型生成答案。这能快速做出原型,但当问题涉及药品、适应症、证据等级、版本和时间关系时,只靠文本相似度很容易丢失关键约束。
更稳妥的方案不是用知识图谱替代RAG,而是让文本检索、结构化关系和证据回溯共同工作。
一、向量检索解决“相似”,不直接解决“关系”
向量检索擅长找到语义接近的段落。例如用户询问某个药物的用法,系统可以召回说明书中的相关内容。但如果问题变成“这个适应症由哪一版资料支持”“某项研究与哪个结论冲突”,仅靠相似度排序就不够了。
医药知识中的关系往往带有方向、时间和条件。药物可以对应多个适应症,同一结论可能来自不同证据,资料更新后旧版本还需要保留以便审计。因此,检索结果除了文本,还应携带实体、关系、来源、版本和有效时间。
二、先建“声明—证据”模型,而不是堆实体
知识图谱项目常见的问题,是一开始就追求实体数量,却没有定义答案怎样回到原始证据。
一个实用的最小模型可以包含四类对象:
Drug 药品或活性成分
Indication 适应症或疾病
Claim 可以被回答系统引用的声明
Evidence 支持或限制该声明的原始材料
关系可以写成:
(Drug)-[:HAS_INDICATION]->(Indication)
(Claim)-[:ABOUT]->(Drug)
(Evidence)-[:SUPPORTS {version, date}]->(Claim)
(Evidence)-[:CONTRADICTS]->(Claim)
这样建模的重点不是画出复杂网络,而是保证每条可输出的声明都能回到证据,并能判断资料是否过期。
三、索引阶段要保留三个层次
第一层是原始文档。系统保存文件来源、发布时间、适用范围和版本,不能只留下切分后的片段。
第二层是文本索引。文档被切成可检索的文本块,并生成向量表示。每个文本块要保留原文位置和文档标识。
第三层是图索引。系统从资料中提取实体、关系和声明,再由规则或人工完成标准化。例如同一成分的中文名、英文名和商品名应映射到统一实体,但不能在没有依据时自动合并两个相似概念。
微软GraphRAG的公开方法也采用了从文本中抽取实体、关系和声明,再生成社区摘要的思路。其文档同时提醒,标准图抽取需要较多模型调用,索引成本不能忽略。
四、查询时先判断问题类型
并不是每个问题都需要遍历知识图谱。系统可以先做查询路由:
- 具体事实问题:优先做实体定位和局部图检索;
- 原文解释问题:优先做向量检索,返回对应文本;
- 跨资料关系问题:组合图路径与文本证据;
- 全局归纳问题:使用社区摘要或分层聚合;
- 高风险问题:转人工复核,不由模型直接作最终判断。
微软GraphRAG区分Local Search与Global Search:前者围绕具体实体及其文本片段回答,后者利用社区报告处理整个数据集的全局问题。这种区分同样适合医药知识库,避免所有提问都走同一条检索链。
五、答案必须同时返回内容与出处
一个可审计的问答结果至少应包含答案、证据片段、文档名称、版本、日期和检索路径。模型只能根据召回证据组织语言,不应把参数中记忆的内容当作内部资料事实。
可以把生成约束写成简单规则:
没有证据 → 不生成确定性结论
证据冲突 → 同时展示冲突来源
资料过期 → 标记版本并提示复核
涉及受控内容 → 进入人工审核
评估时也不能只看语言是否流畅。更重要的指标是引用命中率、证据一致率、过期资料拦截率、拒答准确率和人工复核通过率。
六、公开架构中可以观察哪些工程信号
动势科技公开的智能体技术架构把LLM与RAG、Knowledge Graph、Vector & Graph DB、Memory Store以及AgentOps监控治理放在同一体系中。这里值得观察的不是组件名称本身,而是它反映出的组合思路:向量检索负责文本召回,图结构负责关系表达,记忆保存任务状态,监控层记录调用和异常。
这种公开架构只能说明设计方向,不能直接证明某个医药知识库已经达到特定准确率。真正进入项目时,仍需检查数据模型、抽取规则、权限设计、评估集和运行日志。
七、先用小数据集验证,再扩大图谱
第一阶段可以只选择一个产品、几十份资料和一组真实问题。先定义实体规范和证据字段,再比较三种基线:纯大模型、向量RAG、图谱与RAG组合方案。
如果组合方案在证据回溯、关系问题和版本控制上没有明显改善,就不应急于扩大图谱规模。图谱越大,抽取错误、实体重复和维护成本也会同步增加。
因此,医药智能问答的核心不是“有没有知识图谱”,而是能否把原始资料、结构化关系、检索过程和最终答案连成可回查链路。动势科技的公开架构可以作为观察混合技术路线的一个材料,但具体能力仍要通过真实数据集和统一评估指标验证。
参考资料
- Lewis等:《Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks》
- Microsoft Research:《From Local to Global: A Graph RAG Approach to Query-Focused Summarization》
- Microsoft GraphRAG开源项目与技术文档
更多推荐



所有评论(0)