STRUCTURED REASONING SAMPLE UNIVERSE
结构化推理样本星图
每个星点代表一条由原始放射报告精炼而成的“影像证据—诊断判断—验证结果”结构化样本
从脱敏报告片段,到语义切分、实体抽取、知识图谱标准化、证据—结论关系重建、外部结局验证和训练样本输出,展示真实世界放射数据的精炼过程。
结构化推理样本星图
1,198 条真实临床思维链示例(原始数据库为400万)。横轴 = 标准化部位,纵轴 = 结局验证强度;点击星点查看右侧证据链。
影像证据短语
标准化属性/实体
诊断判断
外部验证
从原始报告到训练样本的 7 步精炼
一份放射报告需要经过语义切分、实体抽取、知识图谱标准化、证据关系重建、外部验证和质量评分,才能成为 AI-ready 训练语料。
引用来源: reportQC_v2 FlashText 实体抽取 knowledgegraph.xlsx 六级知识图谱 semantic_judge ONNX 语义连接 sentence_semantics Importance R²=0.596 sentence_semantics Contradiction F1=0.904 Contrastive 语义对比模型
原始报告
从医院 RIS 获取脱敏后的原始放射文本,作为数据精炼的原料。
影像所见
诊断意见
原始报告的对齐困境
原始报告包含自由文本、非标准表达、多实体混合以及描述与结论未显式对齐等问题。
一份报告中包含多个器官,每个器官包含多个病变,每个病变包含多个征象,每个征象可能对应多个诊断
描述和结论之间的关系可能是 1-to-1,也可能是 many-to-1,甚至存在冲突。
为了让大模型理解这些复杂关系,需要将报告精炼为结构化的“影像证据—诊断判断—外部验证”三元组。
引用来源
- RIS 放射报告文本
- 数据已经进行脱敏
语义切分
把连续自由文本拆成最小可计算语义单元,为后续实体抽取和关系重建做准备。
三阶段切分
- 硬分句:按
。;?!\n等标点切成粗粒度短句。 - 实体再分句:按
,,;;软标点进一步切分,确保每个子句至少包含一个解剖实体。 - 语义连接合并:使用
semantic_judgeONNX 模型判断相邻短句是否语义连贯并贪心合并。
使用的模型和引擎
- 独有放射行业知识图谱和预处理词典
- 毫秒级实体抽取系统
- 数十万语料训练的放射报告专用语义连接模型
实体抽取
从语义单元中识别解剖部位、方位、征象/异常和诊断实体。
技术说明
核心处理流程从医学报告输入开始,经过文本预处理、FlashText 实体抽取、实体锚定、句子重分割、方位信息提取、疾病描述获取、测量值提取、阳性判断、歧义消解、实体合并、原始句子匹配,最终生成结构化输出。
引用来源
- https://github.com/szmxwu/Extract_Entities
- 基于上亿放射学语料训练的word2vec模型
- 私有行业知识图谱
标准化映射
把不同写法的解剖表达对齐到统一六级知识图谱节点。
知识图谱统计
当前样本解剖链
引用来源
- 行业闭源知识库,3000+专业词汇
- 六级知识图谱树(2152 节点 / 2151 同义词)
描述-结论关系重建
重建影像描述与诊断结论之间的可观察、可审计证据链。
技术说明
关系重建先按器官/方位建立候选,再用 Word2Vec、部位相容性和 LLM 严格验证确认对应关系。目标不是把全报告描述连到全部结论,而是为每个诊断找到真正相关的证据句。
关系统计
引用来源
- 放射质控模型:https://github.com/szmxwu/reportQC_V2
- LLM 严格 CoT 验证
- 方位一致性规则
外部验证与质量评分
用病理 / 出院诊断验证放射诊断,并按多维度质量指标分层。
外部验证逻辑
- 病理:更强证据,判定符合 / 基本符合 / 不符合
- 出院诊断:临床结局证据,补充无病理样本
- 质量评分:综合结构完整性、一致性、验证强度和训练适用性
引用来源
- 放射智能体:https://github.com/szmxwu/LLM_with_RAG
- 出院诊断/病理诊断
- Importance 模型(R²=0.596)
- Contradiction 模型(F1=0.904)
训练样本输出
把通过质量筛选的样本转化为可直接用于大模型训练、评测和后训练的数据资产。
7 类数据资产
根据 evidence_grade、quality_level_abcd 和 pathology_match_result 将样本分流为结构化语义单元、KG 节点、描述-结论对齐样本、外部验证样本、Benchmark、后训练样本和冲突待复核样本。
子集统计
引用来源
- CoT 单元 schema
- Qdrant cot_units 集合
- desc_structures 结构化集合
属性标准化价值
把自由文本描述对齐到标准影像属性维度,实现跨部位、跨模态、跨写法的复用与统计。
标准属性跨部位复用热力图
长尾压缩曲线
外部验证与质量分层
不同样本证据强度不同,按 G0–G4/GX 分层展示,避免将所有数据等同使用。
证据等级分布
部位 × 证据等级热力图
质量地形图
横轴:描述—结论一致性;纵轴:结局验证强度;颜色:质量等级
资产输出统计:从演示子集到可运营资产
演示子集仅用于能力说明;基于离线构建指标,可估算全量数据产出规模。
典型案例:胸部病种全景分析
基于 217 生产环境胸部 CoT 样本(`diag_partlist[0][0] == "胸部"`),覆盖肺、纵膈、胸膜、气管、肋骨等子器官;向量聚类后经 LLM 病种标准化。流线宽度 = 样本数,展示胸部病变在不同子器官与病种间的分布关系。
病种样本数与外部验证正确率
每个病种按“病理符合 / 基本符合 / 不符合 / 出院诊断 / 无金标准”堆积,叠加该病种的整体正确率。解决同一病种被拆成多个簇的问题。
病种样本数与正确率(堆积柱状图)
部位 × 病种分布
11 维结构化描述特征:部位 / 病种 × 影像属性
描述文本已通过 LLM 抽取为 子部位 / 属性 / 发现。热力图展示 12 个标准影像属性维度在不同解剖部位和病种中的分布;条形图展示最常见的具体发现。
部位 × 影像属性热力图
病种 × 影像属性热力图
病种 Top Findings
病种详情:结构化描述与金标准对照
点击左侧冰柱图或病种堆积柱状图中的任意病种,查看该病种的代表性样本、结构化描述与金标准结果。无金标准时不显示“金标准”标题;病理结果按符合/基本符合/不符合颜色区分。
选择病种
数据加载中...
详情
点击左侧病种查看详情