面向土木标准图合规审查的视觉优先多模态 RAG:直接在图纸图像上索引与推理,用 ColNomic-3B 多向量检索加 Planner-Retriever-Auditor-Synthesizer 智能体回路,MaxSim 热图作证据链;并发布来自五个州 DOT 标准图(1,898 页)的 4,056 对基准零样本检索 Recall@5 91.47%,held-out 密歇根 DOT 语料 91.40%;合成合规图上 Qwen2.5-VL-72B 管线仅在给定预解析规则阈值时达到 100% 判定准确率(非 VLM 的 OCR 基线 76.4%),还能从规范语料自动抽取数值限值而无需人工规则
模型与实验室
3.0 · 值得看
PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Che...
面向土木标准图合规审查的视觉优先多模态 RAG:直接在图纸图像上索引与推理,用 ColNomic-3B 多向量检索加 Planner-Retriever-Auditor-Synthesizer 智能体回路,MaxSim 热图作证据链;并发布来自五个州 DOT 标准图(1,898 页)的 4,056 对基准零样本检索 Recall@5 91.47%,held-out 密歇根 DOT 语料 91.40%;合成合规图上 Qwen2.5-VL-72B 管线仅在给定预解析规则阈值时达到 100% 判定准确率(非 VLM 的 OCR 基线 76.4%),还能从规范语料自动抽取数值限值而无需人工规则