# 胸部X线计算分析与临床转化：检索与证据审计

## 审计结论

本审计覆盖截至 2026-08-11 的胸部X线计算分析、模型评价与临床转化证据。检索结果支持七条互斥主要路线：数据资源与标注、判别诊断与预后、病灶定位与结构化分析、报告生成与评价、多模态与基础模型、可靠性与公平、临床工作流与部署。领域证据呈明显的倒金字塔结构：资源和内部回顾性研究最丰富，跨机构与跨人群验证较少，前瞻部署、随机试验和患者结局证据最稀缺。

独立反证审计不支持将“高 AUC”“达到读者水平”“外部数据集验证”“报告时间缩短”或“监管许可”直接写成普遍临床有效。已有跨院研究证明模型可识别医院来源并借用患病率等捷径；公平缓解可在新域失效；高判别性能可伴随失校准；错误人工智能建议会损害部分读者；两项重要务实随机试验没有改善急诊诊断表现或肺癌诊断路径。结核筛查是目前适应证、阈值和政策边界最明确的规模化路线，但仍存在国家、性别、既往结核和 HIV 亚组异质性，且世界卫生组织尚不推荐用于 15 岁以下人群。

在冻结范围与已披露来源边界内，五道检索与证据闸门均有可复算记录支撑，本审计判定为 **L2 声明范围内覆盖饱和**。这表示七条主要路线在当前查询矩阵下达到结构和证据饱和，不表示穷尽全部论文，也不把本项目包装为遵循 PRISMA 的系统综述。47 条查询、75 个唯一筛选账本项、48 条最终地图记录、34 条已审计主张以及 31 个核心项的双向引用追踪共同构成该判定；Embase、Scopus、Web of Science 和中文数据库未做全量原生导出等限制仍然保留。

## 1. 范围合同

### 1.1 研究问题与受众

- 研究问题：胸部X线计算分析与临床转化形成了哪些主要路线，各路线能直接证明什么，在哪些人群、机构、设备、疾病与工作流中存在可靠性边界？
- 受众：具备医学影像、机器学习或临床转化基础的研究人员与专业读者。
- 截止日期：2026-08-11。
- 地域：全球；主动覆盖高收入医疗体系、低资源和高结核负担场景，并审计地域与人群代表性。
- 语言：以英文一手文献和官方材料为主，允许中文一手材料；本次没有形成中文数据库的可复跑全量导出，因此不声称覆盖中文长尾文献。
- 完成目标：以七类查询家族、承诺来源、七条主要路线、负面证据、两轮独立补漏和逐条证据账本达到声明范围内的 L2 覆盖饱和；不以固定篇数或搜索首页重复冒充穷尽。

### 1.2 对象、任务与结局

纳入成人及儿科正位、侧位和床旁便携式胸部X线，及其配套报告、既往片和必要临床上下文。任务包括：

1. 数据集、标签、参考标准、自监督表征和数据治理；
2. 正常/异常、多病种诊断、单病种筛查、分诊与预后；
3. 病灶检测、定位、分割、解剖场景图和纵向变化；
4. 报告生成、报告理解、检索和临床事实性评价；
5. 图文预训练、零样本迁移、多模态和基础模型；
6. 域偏移、捷径、标签噪声、校准、不确定性、公平、隐私和复现；
7. 人机协作、静默测试、真实部署、随机试验、监管和患者相关结局。

主要结局包括判别与定位性能、报告临床错误、跨域稳健性、亚组差异、校准、读片效率、转诊和检查时间、实际管理改变、诊断与治疗时间、复诊、不良事件及患者健康结局。报告改变、管理建议改变和患者结局被视为三个不同层级，不得互相替代。

### 1.3 纳入、排除与证据状态

纳入条件：

- 直接定义数据资源、任务、方法路线、评价范式或临床部署边界；
- 有 DOI、PubMed/PMC、正式会刊、试验注册、官方标准、监管或官方项目等稳定一手入口；
- 对路线全貌、外部验证、负面边界或临床应用提供不可替代信息；
- 与截止日期和胸部X线范围一致。

排除条件：

- 胸部 CT、乳腺摄影或其他非胸片模态，除非仅作为胸片参考标准且不被当作主要研究对象；
- 仅讨论疾病流行病学、硬件物理或通用视觉方法，且没有胸片直接实验；
- 只有营销声明、新闻或二手转述，无法定位正式一手入口；
- 同一成果的重复数据库记录、预印本与正式版重复，或已由更完整正式版本取代；
- 元数据冲突无法消解、证据不足或已撤稿。

出版状态与证据成熟度分开记录：同行评议、预印本和官方报告不互相替代。证据阶段采用：E1 为资源或内部回顾性验证；E2 为跨数据集或独立外部验证；E3 为多读者、人机实验、工作流模拟或静默运行；E4 为真实前瞻部署、随机/务实试验、患者路径或限定适应证的官方采用。外部验证本身最高只到 E2。

## 2. 承诺来源与来源角色

| 来源层级 | 承诺来源 | 用途与边界 |
|---|---|---|
| T1 正式证据 | PubMed、PMC、DOI、期刊正式页、CVF、AAAI、ACL Anthology | 核验元数据、方法、直接结果、负面边界和出版状态 |
| T1 官方证据 | WHO、FDA、NICE、ACR、ClinicalTrials.gov、ISRCTN | 核验适应证、政策、监管标签、注册结局和试验状态；官方采用不等同患者获益 |
| T1/T2 数据入口 | PhysioNet、NIH、Stanford、MIT 及数据集正式论文 | 核验数据版本、许可、对象、标签来源和访问条件 |
| T2 项目材料 | 作者官方项目页和代码仓库 | 核验代码、权重、数据说明和复现条件；不单独支撑临床有效性 |
| T3 发现线索 | 通用网页搜索、索引摘要和机构新闻 | 仅用于发现候选，不支撑最终主张 |

预印本仅在没有正式版本或版本差异本身重要时保留。检索过程中一旦发现正式版本，即以正式版为主入口，并在版本族中记录预印本关系。

## 3. 查询家族与可复跑精确式

### 3.1 七类查询家族

| 查询家族 | 覆盖目标 | 已执行来源 |
|---|---|---|
| 核心对象 | 数据、分类、检测、报告、多模态与部署的总入口 | PubMed/PMC、正式会刊、PhysioNet |
| 历史与奠基 | NIH ChestX-ray、CheXpert、MIMIC-CXR、早期读者比较 | CVF、AAAI、Scientific Data、PLOS Medicine |
| 方法路线 | 定位/分割、报告生成、图文预训练、基础模型 | CVF、ACL Anthology、Nature 系列、正式期刊 |
| 评测与应用 | 外部验证、读者研究、结核筛查、部署和随机试验 | PubMed、WHO、试验注册、正式期刊 |
| 综述与谱系 | 术语、评价演变和引文链 | PubMed/PMC、正式综述；综述只用于发现和方法学反证 |
| 风险与反证 | 标签噪声、域偏移、捷径、公平、校准、错误协作和负面试验 | PubMed/PMC、Nature 系列、PLOS Medicine |
| 前沿与更新 | 2025–2026 基础模型、报告生成、前瞻部署和监管更新 | PubMed、CVF、ACL Anthology、Nature、WHO、FDA、ACR |

最终查询账本共 47 条：前 30 条覆盖发现、核验、反证、会刊/数据入口与两轮补漏，随后追加 12 条 PubMed 主题式及 5 条 WHO、FDA、NICE、ClinicalTrials.gov、ISRCTN 官方政策/监管/注册式。每条实际执行式均逐行保存在 `planning/search_ledger.jsonl`；下列代码块给出可直接复跑的主题式、撤稿/勘误核查式和官方入口式。

### 3.2 PubMed 可复跑式

以下前 12 条主题式和最后 1 条撤稿/勘误核查式可直接复制到 PubMed。复跑时应把结果日期上限设为 2026-08-11，并导出 PMID、题名、年份、出版类型和 DOI 后再去重。

```text
("Radiography, Thoracic"[Mesh] OR "chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("Artificial Intelligence"[Mesh] OR "deep learning"[tiab] OR "machine learning"[tiab])
AND (dataset*[tiab] OR label*[tiab] OR classification[tiab] OR detection[tiab]
     OR segmentation[tiab] OR report*[tiab] OR deployment[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("external validation"[tiab] OR generaliz*[tiab] OR multicent*[tiab]
     OR "temporal validation"[tiab] OR "cross-institution*"[tiab])
AND ("artificial intelligence"[tiab] OR "deep learning"[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("domain shift"[tiab] OR "distribution shift"[tiab] OR shortcut*[tiab]
     OR confound*[tiab] OR failure[tiab] OR robustness[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("label noise"[tiab] OR "reference standard*"[tiab] OR adjudicat*[tiab]
     OR "uncertainty label*"[tiab] OR reproducib*[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND (fairness[tiab] OR bias[tiab] OR race[tiab] OR sex[tiab]
     OR underserved[tiab] OR underdiagnos*[tiab])
AND ("artificial intelligence"[tiab] OR "deep learning"[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND (calibrat*[tiab] OR uncertainty[tiab] OR "selective prediction"[tiab]
     OR abstention[tiab] OR "out-of-distribution"[tiab])
AND ("artificial intelligence"[tiab] OR "deep learning"[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("human-AI"[tiab] OR "AI assistance"[tiab] OR "reader study"[tiab]
     OR automation[tiab] OR trust[tiab] OR explanation*[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND (prospective[tiab] OR random*[tiab] OR pragmatic[tiab]
     OR deployment[tiab] OR "silent trial"[tiab])
AND ("artificial intelligence"[tiab] OR "deep learning"[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("patient outcome*"[tiab] OR management[tiab] OR mortality[tiab]
     OR "time to diagnosis"[tiab] OR "time to treatment"[tiab] OR workflow[tiab])
AND ("artificial intelligence"[tiab] OR "deep learning"[tiab])
```

```text
(tuberculosis[Mesh] OR tuberculosis[tiab])
AND ("chest x-ray"[tiab] OR "chest radiograph*"[tiab])
AND ("computer-aided detection"[tiab] OR "artificial intelligence"[tiab])
AND (independent[tiab] OR multicountry[tiab] OR prospective[tiab]
     OR threshold*[tiab] OR implementation[tiab])
```

```text
(child*[tiab] OR pediatric*[tiab] OR paediatric*[tiab])
AND ("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("artificial intelligence"[tiab] OR "deep learning"[tiab])
AND (external[tiab] OR prospective[tiab] OR generaliz*[tiab] OR deployment[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("foundation model"[tiab] OR "vision-language"[tiab]
     OR "report generation"[tiab] OR multimodal[tiab] OR longitudinal[tiab])
```

```text
("chest radiograph*"[tiab] OR "chest x-ray*"[tiab])
AND ("Retracted Publication"[Publication Type]
     OR "Retraction of Publication"[Publication Type]
     OR "Published Erratum"[Publication Type]
     OR retracted[Title] OR correction[Title])
```

### 3.3 会刊、官方和注册入口复跑式

以下式子用于一手入口核验，不以搜索结果页支撑结论：

```text
site:openaccess.thecvf.com chest x-ray dataset detection segmentation
site:ojs.aaai.org CheXpert chest radiograph uncertainty labels
site:aclanthology.org chest x-ray radiology report generation factuality evaluation
site:physionet.org chest x-ray MIMIC-CXR VinDr-CXR ImaGenome
site:who.int "computer-aided detection" "chest X-ray" tuberculosis
site:accessdata.fda.gov "chest radiograph" artificial intelligence 510(k)
site:nice.org.uk "chest X-rays" artificial intelligence lung cancer
site:clinicaltrials.gov "chest x-ray" artificial intelligence randomized
site:isrctn.com "chest x-ray" artificial intelligence randomised
```

扩展轮 A 的可复跑子式为：

```text
site:pubmed.ncbi.nlm.nih.gov 2025 2026 chest radiograph AI external validation prospective
site:openaccess.thecvf.com 2025 chest x-ray foundation model
site:aclanthology.org 2025 2026 chest x-ray report generation evaluation
site:nature.com 2025 2026 chest x-ray foundation model fairness prospective
```

扩展轮 B 的可复跑子式为：

```text
site:pubmed.ncbi.nlm.nih.gov pediatric chest radiograph AI external validation low-resource
site:pubmed.ncbi.nlm.nih.gov tuberculosis chest x-ray CAD calibration HIV prior tuberculosis
site:who.int chest x-ray CAD tuberculosis pediatric threshold
site:physionet.org chest x-ray longitudinal prior image privacy
```

## 4. 筛选、纳排与去重统计

### 4.1 可严格复算的统计

统计由最终 `planning/search_ledger.jsonl`、`planning/screening.csv`、`planning/claim_ledger.csv`、`planning/citation_tracing.csv` 和 `atlas.json` 直接复算。网页、动态索引和站点限定入口不提供跨时间稳定的数据库总命中量，因此 47 条查询的 `hits` 全部记为 `null`；部分 PubMed E-utilities 当次 Count 只保留在 notes 中用于诊断查询宽窄，不作为稳定总命中。`null` 表示“未取得可长期复现的总量”，不表示零命中。

| 指标 | 数值 | 解释 |
|---|---:|---|
| 查询日志记录 | 47 | 每条包含日期、来源、精确式或查询家族、筛查量、纳入动作和来源角色 |
| `hits=null` 记录 | 47 | 不伪造数据库总命中数；动态 Count 仅作为查询 notes |
| 查询级可见结果槽位 | 451 | `screened` 的总和；同一论文可跨查询、数据库和正式入口重复出现，不是唯一候选或唯一文献数 |
| 查询级纳入动作 | 109 | `included` 的总和；表示查询内进入核验的动作次数，不是最终唯一纳入数 |
| 反证轮 | 7 条查询；筛查 42；纳入动作 11 | 覆盖域偏移、公平、捷径、报告评价和泛化失败 |
| 两轮独立补漏 | 筛查 63；新增 2 | 扩展轮 A 为 1/32，扩展轮 B 为 1/31 |
| 唯一筛选账本项 | 75 | 每项 candidate ID、规范 ID 和来源 URL 均唯一；包含论文版本、监管转移项和撤稿项，不等同 75 项独立研究 |
| 筛选决定 | 纳入 48；排除 20；转移 7 | 20 项排除包括证据增量不足 12、重复记录 2、被正式或现行版本取代 5、已撤稿 1；7 项监管材料转入部署背景 |
| 最终地图记录 | 48 | 48 个 `include` ID 与 `atlas.json` 的 48 个 ID 一一对应；ID、题名和主 URL 均无重复 |
| 主张审计 | 34/34 为 `audited` | 每条均有直接证据位置和 V/D/P/Q 向量，覆盖数字、比较、因果、安全及边界表述 |
| 引用链追踪 | 62 行；31 个核心项 | 每个核心项各有一条后向和一条前向记录；60 条保留候选，2 条如实记录未发现后续正式证据 |

因此，451 个结果槽位、109 次查询级纳入动作、75 个唯一筛选账本项和 48 条最终记录是四个不同统计层级，不能互换。项目没有把这些数值拼成伪造的数据库总命中或 PRISMA 流程总量。

### 4.2 纳排规则与排除码

逐候选筛选使用以下排除码：范围外、词面重合、重复记录、无法核验一手来源、证据不足、非目标成果类型、被更新版本取代、已撤稿。最终账本实际使用了“证据增量不足、重复记录、被更新版本取代、已撤稿、范围外转移”五类决定理由；未使用的预设码保留为复跑规则。边界案例按以下规则处理：

- 胸片和 CT 混合研究：只有可单独提取胸片方法或结果时纳入，不能把混合结论全部归于胸片。
- 报告生成：只有图像到报告、报告事实性或临床错误与胸片直接相关时纳入；纯语言模型文本总结排除。
- 基础模型：必须有胸片直接评测；通用模型仅凭作者宣称可处理医学图像不纳入。
- 监管材料：只支撑许可范围、预期用途和日期，不支撑临床净效益、公平或自主诊断。
- 商业产品研究：必须绑定产品和算法版本；厂商提供软件不自动排除，但需披露其在设计、分析和写作中的角色。

### 4.3 去重规范键

去重顺序为 DOI → PMID/PMCID/试验注册号/正式会议 ID → 正式论文 URL → 规范化题名与第一作者。预印本、会议版、期刊扩展、更正和撤稿归入同一 `work_family_id`，但结论或实验发生实质变化时保留版本差异。数据集论文、数据版本和同名模型不能因名称相同而误合并。

## 5. 版本族、更正与撤稿检查

截至 2026-08-11，对最终 48 条主入口及筛选账本中的版本候选检查 PubMed 更新字段、正式论文页、DOI 和可用 Crossmark 入口后，最终纳入集未发现撤稿标记。确认的版本族和冲突如下：

| 工作 | 版本关系 | 规范入口与处理 |
|---|---|---|
| CheXpert | arXiv `1901.07031` → AAAI 正式版 | 主引 [10.1609/aaai.v33i01.3301590](https://doi.org/10.1609/aaai.v33i01.3301590)，只计一次 |
| DeGrave 等 COVID-19 捷径研究 | medRxiv `10.1101/2020.09.13.20193565` → Nature Machine Intelligence 正式版 | 主引 [10.1038/s42256-021-00338-7](https://doi.org/10.1038/s42256-021-00338-7) |
| Roberts 等 COVID-19 方法学审查 | arXiv `2008.06388` → Nature Machine Intelligence 正式版 | 主引 [10.1038/s42256-021-00307-0](https://doi.org/10.1038/s42256-021-00307-0)；预印本与正式摘要的质量纳入数有 61/62 的版本差异，采用正式版本 |
| Worodria 等七国结核 CAD 比较 | medRxiv `10.1101/2024.06.19.24309061` → 2026 正式版 | 预印本为五产品、3,927 人，正式版为七产品、3,901 人；主引 [10.1093/annalsats/aaoag011](https://doi.org/10.1093/annalsats/aaoag011)，不跨版本混写样本和结果 |
| LungIMPACT | ISRCTN78987039、方案材料和 2026 结果论文 | 同一试验族；结果主引 [10.1038/s41591-026-04253-5](https://doi.org/10.1038/s41591-026-04253-5)，注册用于核验预设结局 |
| Nam 等结节筛查随机试验 | 2023 正式论文 → 2026 勘误 | 主引 [10.1148/radiol.221894](https://doi.org/10.1148/radiol.221894)；勘误 [10.1148/radiol.269006](https://doi.org/10.1148/radiol.269006) 将 Table 3 非人工智能组阴性总数更正为 2,392，不改变统计结果或结论 |
| CheXNet 与 CheXNeXt | 名称相近但不是简单预印本—正式版关系 | CheXNet 预印本和 CheXNeXt 正式 PLOS Medicine 工作必须分开，不得静默合并 |

发现并明确排除一项已撤稿相邻工作：Badr M 等，*Deep Learning-Based Networks for Detecting Anomalies in Chest X-Rays*，原 DOI `10.1155/2022/7833516`；撤稿通知 DOI [10.1155/2023/9801414](https://doi.org/10.1155/2023/9801414)，PMID [37388325](https://pubmed.ncbi.nlm.nih.gov/37388325/)。该工作不得作为方法、性能或历史代表作进入地图。

产品版本是持续更新风险。Lunit、qXR、CAD4TB 等名称跨论文重复出现，但算法版本、适应证、阈值、监管地区和部署方式不同；不同版本的性能不得直接合并。FDA 设备列表和 WHO 结核 CAD 产品政策是动态入口，复跑时必须记录查询日期和具体许可编号或产品版本。

## 6. 反证与负面结果检索

反证轮主动组合 `failure`、`limitation`、`negative result`、`domain shift`、`shortcut`、`fairness`、`calibration`、`external validation`、`randomized`、`patient outcome`、`pediatric` 和 `low-resource`。主要反证如下：

1. **跨医院域偏移与来源捷径。** Zech 等在三家机构的肺炎任务中发现内部表现高于院外表现，模型几乎可直接识别医院来源；合并训练并不自动消除患病率与机构混杂。正式入口：[10.1371/journal.pmed.1002683](https://doi.org/10.1371/journal.pmed.1002683)。
2. **疫情数据拼接捷径。** DeGrave 等显示 COVID-19 胸片模型依赖标记、投照和数据来源等非病理信号；Roberts 等系统审查发现早期模型因偏倚和方法学缺陷均不具备可证实的临床用途。正式入口：[DeGrave](https://doi.org/10.1038/s42256-021-00338-7)、[Roberts](https://doi.org/10.1038/s42256-021-00307-0)。
3. **标签与参考标准。** CheXpert 明确保留报告不确定标签，不同病种需要不同处理；多读者裁决研究说明报告弱标签、单读者和简单多数投票不能视为无误金标准。AUC 和读者比较必须报告标签来源和裁决过程。
4. **高 AUC 不等于概率可靠。** Hwang 等的模型 AUC 为 0.949，但系统性高估异常概率，本地重校准可显著改善校准误差。正式入口：[10.1007/s00330-020-07062-7](https://doi.org/10.1007/s00330-020-07062-7)。
5. **公平性并非域内阈值问题。** Seyyed-Kalantari 等发现服务不足和交叉亚群出现选择性漏诊；Yang 等进一步显示域内公平缓解不能稳定迁移至新机构。正式入口：[10.1038/s41591-021-01595-0](https://doi.org/10.1038/s41591-021-01595-0)、[10.1038/s41591-024-03113-4](https://doi.org/10.1038/s41591-024-03113-4)。
6. **人机平均增益掩盖个体受损。** Yu 等在 140 名放射科医师和 15 项任务中发现人工智能帮助效应高度异质，错误建议可降低读者表现，年资和亚专科不能可靠预测获益。正式入口：[10.1038/s41591-024-02850-w](https://doi.org/10.1038/s41591-024-02850-w)。局部解释还可能加强对错误建议的无核查信任：[10.1148/radiol.233261](https://doi.org/10.1148/radiol.233261)。
7. **急诊随机试验阴性。** 3,576 名急诊患者的务实随机试验中，人工智能没有改善敏感度、假阳性率、CT 使用、抗生素决策、急诊停留或 30 天复诊。正式入口：[10.3348/kjr.2022.0651](https://doi.org/10.3348/kjr.2022.0651)。
8. **报告更快不等于诊断更快。** LungIMPACT 分析 93,326 例胸片，人工智能优先级虽缩短报告时间，却没有改善至 CT、肺癌诊断、治疗或分期。正式入口：[10.1038/s41591-026-04253-5](https://doi.org/10.1038/s41591-026-04253-5)。该试验随机化的是优先级，两组阅片时均可见人工智能，因此否定的是该具体部署功能，而不是所有辅助阅片。
9. **正常片静默分流仍有漏诊与标签误差。** 英国五站点 63,083 例静默研究只有 18.5% 与人类报告一致地判为正常，并发现 31 个临床重要漏诊和 412 个自然语言标注错误；静默结果不能直接变成自动放行。正式入口：[10.1148/ryai.250964](https://doi.org/10.1148/ryai.250964)。
10. **结核 CAD 需要人群和场景阈值。** 七国正式比较纳入 3,901 名有症状成人和七款明确产品；在固定 90% 敏感度时，产品特异度为 30.9%–73.5%，国家、HIV、年龄和既往结核会改变性能，局部阈值也不能消除所有亚组问题。正式入口：[10.1093/annalsats/aaoag011](https://doi.org/10.1093/annalsats/aaoag011)。WHO 2025 政策只支持达到标准的具体产品用于 15 岁及以上人群：[官方政策](https://www.who.int/publications/i/item/9789240110373)。
11. **儿科跨域失败。** 儿科肺炎模型内部 AUC 0.95，外部数据仅 0.54，显著图转向颅骨、纵隔和腹部等非目标区域。正式入口：[10.1007/s10140-021-01954-x](https://doi.org/10.1007/s10140-021-01954-x)。尼日利亚前瞻性小型研究也由内部 AUC 0.93 降至当地外部 AUC 0.65：[10.1371/journal.pdig.0000713](https://doi.org/10.1371/journal.pdig.0000713)。

这些反证限定了可接受的主张：不得把回顾性读者比较写成临床替代；不得只报 AUC 而省略校准、患病率、阈值和每千例错误；不得把报告改变写成患者获益；不得把监管许可写成跨人群有效；不得把域内公平改善写成域外公平；不得把成人结核政策外推到儿童。

## 7. 两轮边际收敛与引用链追踪

### 7.1 边际新增

| 扩展轮 | 来源和主题 | 去重后实际筛查 | 新增纳入 | 边际新增率 | 新一级路线 |
|---|---|---:|---:|---:|---:|
| A | PubMed、CVF、ACL Anthology、Nature；2025–2026 外部验证、基础模型、报告生成、公平和前瞻研究 | 32 | 1 | 3.13% | 0 |
| B | PubMed、WHO、Nature、PhysioNet；儿科、低资源、结核阈值、隐私和纵向既往片 | 31 | 1 | 3.23% | 0 |

两轮使用不同来源组合和主题入口，新增率均低于 5%，且均没有新增一级路线，满足数值边际收敛条件。扩展轮 A 新增 CLEAR，补足可审计概念基础模型；扩展轮 B 新增尼日利亚儿科肺炎跨域失败研究，补足儿童和低资源负面证据。低边际新增只说明当前分类结构趋于稳定，不证明已经穷尽所有论文或长尾疾病。

### 7.2 前后向追踪

`planning/citation_tracing.csv` 共 62 行，覆盖 31 个预先指定的核心追踪项；每项恰有一条后向和一条前向记录，均保存候选、关系类型、规范入口、决定和边界说明。该集合覆盖全部七条主要路线和 E1–E4 四个阶段：数据与标签 3 项、判别诊断 2 项、定位 2 项、报告 5 项、基础模型 7 项、可靠性 6 项、部署 6 项。60 条追踪候选被保留为谱系或后续证据，2 条记录为完成检索后“未发现”。

后向追踪覆盖公开胸片—报告资源、弱标签与不确定标签、定位标注、报告生成、图文预训练、捷径、公平及临床试验的直接前序；前向追踪用于确认正式版本、后续外部验证、独立反证和部署结果。CLEAR 和 Janus-Pro-CXR 均为 2026 年新近正式工作：截至截止日未发现正式发表的独立前向复现、患者结局验证或明确反证，账本保留了各自复跑式并将决定写为“未发现”。这两个阴性追踪结果是完整执行后的证据空白，不是漏填或用推测补造引文。

结合两轮 1/32 与 1/31 的低边际新增、两轮均无新一级路线，以及七条路线均有双向追踪代表，本审计认为边际收敛条件在冻结范围内成立。

## 8. 五道 L2 闸门

| 闸门 | 判定 | 证据与缺口 |
|---|---|---|
| 1. 范围与来源 | **通过** | 范围合同、截止日期、纳排边界、七类查询家族和 T1/T2/T3 来源角色已冻结；47 条查询均保存日期、来源、精确式、筛查量与纳入动作，47 条 `hits` 均按不可稳定复现原则记为 `null`；未执行的数据库全量导出已披露 |
| 2. 分支代表性 | **通过** | 最终 48 条记录覆盖七条主要路线：数据与标签 5、诊断 3、定位 3、报告 6、基础模型 8、可靠性 13、部署 10；75 项唯一筛选账本保存 48 项纳入、20 项排除和 7 项背景转移；两轮均无新增一级路线，各路线的奠基/代表、前沿和评价/反证位置已覆盖，证据稀疏位置已写入限制 |
| 3. 边际收敛 | **通过** | 两个来源组合与主题入口不同的完整扩展轮分别为 1/32（3.13%）和 1/31（3.23%），均低于 5% 且无新路线；62 行引用链覆盖 31 个核心项，每项各有一次前向和后向追踪，CLEAR 与 Janus-Pro-CXR 的前向“未发现”有日期和复跑式 |
| 4. 深读 | **通过** | `atlas.json` 的 48 条记录均包含问题、机制、2–5 个机制步骤、直接证据、证据位置、局限、启示、一手入口、`source_note` 与 V/D/P/Q；41 条为全文核验，7 条仅在摘要或正式元数据可得层级核验，并以 `verification_state`、证据等级和来源边界限制表述，不从不可得正文推断 |
| 5. 证据审计 | **通过** | `claim_ledger.csv` 的 34 条指定核心主张全部为 `audited`，全部具有证据位置和 V/D/P/Q；版本族、正式版优先、Nam 2026 勘误、撤稿排除、负面试验与商业产品版本边界均已进入成品；最终 48 条的 ID、题名和主 URL 无重复 |

综合判定：五道闸门全部通过，覆盖等级为 **L2 声明范围内覆盖饱和**。该等级只对本范围合同、截止日期和已执行来源有效，不转化为“全部文献已穷尽”或“系统综述已完成”的声明。

## 9. 失败入口与覆盖限制

1. **数据库总命中不可得。** 通用网页、动态索引和站点限定搜索不提供跨时间稳定总命中，故 47 条查询均以 `hits=null` 保存。451 个可见结果槽位和 109 次查询级纳入动作不能用来生成数据库级 PRISMA 总量。
2. **PubMed 页面偶发访问验证。** 个别页面触发访问验证时，改由 PMC、DOI、正式期刊页或 PubMed 已索引摘要核验；没有以搜索摘要替代核心论文证据。
3. **数据库覆盖限制。** 本轮没有形成 Embase、Scopus、Web of Science、IEEE Xplore 或中文数据库的全量原生导出和逐条去重；因此不声称覆盖所有工程会议、非英文和地区性临床文献。
4. **不是系统综述。** 本项目是以路线、反证和证据饱和为目标的研究地图，没有执行多数据库全量导出、双人独立题录筛选、研究级偏倚工具或荟萃分析；75 个筛选账本项足以审计本地图的纳排，但不能冒充系统综述的完整检索总体。
5. **商业模型不透明。** 训练数据、版本更新、阈值、设备适配和代码常不公开；产品同名不代表算法相同，跨论文性能不可直接合并。
6. **动态监管入口。** FDA 人工智能器械列表、510(k) 标签、WHO 产品评估和 NICE 建议会更新；必须绑定许可编号、适应证、版本和检索日期。监管通过不能替代前瞻患者结局。
7. **儿科与低资源证据稀疏。** 儿科、便携设备、HIV、既往结核和当地阈值研究数量有限，亚组置信区间和参考标准差异较大；成人高收入场景结果不可外推。
8. **长尾任务遗漏风险。** 尘肺和职业病、设备位置、图像质控、纵向变化、机会性非胸部结局、隐私重识别、联邦学习、网络故障和上市后漂移监测尚未达到与主路线相同的深读密度。
9. **患者结局不足。** 多数研究结局仍是 AUC、读者表现、报告改变或时间；实际治疗改变、不良事件、死亡、生活质量和健康公平的随机或长期证据极少。
10. **报告与基础模型快速更新。** 2025–2026 多模态和生成模型迭代快，正式版、权重、提示方案和评测集可能变化；在线优先发表与期刊卷期需在后续更新时重新核验。

## 10. 可复核的核心一手入口

- 数据与标签：[CheXpert](https://doi.org/10.1609/aaai.v33i01.3301590)；[Majkowska 等专家裁决评价](https://doi.org/10.1148/radiol.2019191293)。
- 跨院与捷径：[Zech 等](https://doi.org/10.1371/journal.pmed.1002683)；[DeGrave 等](https://doi.org/10.1038/s42256-021-00338-7)；[Roberts 等](https://doi.org/10.1038/s42256-021-00307-0)。
- 校准与公平：[Hwang 等](https://doi.org/10.1007/s00330-020-07062-7)；[Seyyed-Kalantari 等](https://doi.org/10.1038/s41591-021-01595-0)；[Yang 等](https://doi.org/10.1038/s41591-024-03113-4)。
- 人机协作与真实流程：[Yu 等](https://doi.org/10.1038/s41591-024-02850-w)；[Jones 等](https://doi.org/10.1136/bmjopen-2021-052902)；[正常片静默试验](https://doi.org/10.1148/ryai.250964)。
- 随机与患者路径：[急诊务实随机试验](https://doi.org/10.3348/kjr.2022.0651)；[LungIMPACT](https://doi.org/10.1038/s41591-026-04253-5)。
- 低资源、结核与儿科：[七国结核 CAD 比较](https://doi.org/10.1093/annalsats/aaoag011)；[WHO 2025 政策](https://www.who.int/publications/i/item/9789240110373)；[儿科跨域失败](https://doi.org/10.1007/s10140-021-01954-x)；[尼日利亚儿科外部验证](https://doi.org/10.1371/journal.pdig.0000713)。
- 监管边界：[FDA 人工智能器械动态列表](https://www.fda.gov/medical-devices/software-medical-device-samd/artificial-intelligence-enabled-medical-devices)；[Lunit INSIGHT CXR Triage K211733](https://www.accessdata.fda.gov/scripts/cdrh/cfdocs/cfpmn/pmn.cfm?ID=K211733)；[NICE 胸片肺癌软件建议](https://www.nice.org.uk/guidance/htg696/chapter/recommendations)。

本审计只把上述入口用于其能直接支持的层级：论文支持研究设计与观察结果，注册支持预设方案，监管与政策支持限定适应证，任何单一入口都不被扩大为领域普遍有效或患者获益证明。
