用途与边界
明确一项任务、目标用户、允许的操作,以及必须停止或转交人工的情形。
科学与方法 · 2026年8月19日复核
我们区分产品假设与已证实的医疗获益。每个智能体都应明确用途、用户、数据边界、错误类型、停止标准和专业人员监督。
科学原则
技术准确率本身不能证明临床获益。评估对象包括数据、模型、界面、工作流以及人机协作团队。
明确一项任务、目标用户、允许的操作,以及必须停止或转交人工的情形。
测试前设定完整性、误报、遗漏、耗时、来源质量和必须终止验证的严重错误。
不仅评估模型回答,也评估专业人员如何理解、核查、纠正并使用结果。
记录模型、提示词、知识库和数据集版本,不把一个人群或机构的结果自动推广到其他场景。
证据阶梯
进入每个下一阶段都需要新的方案、批准以及责任专业人员的明确决定。
描述用户、问题、预期操作和不可接受的伤害。
使用虚构案例验证来源、拒绝、转人工和界面稳定性。
在获准数据上评估预先设定指标、亚组、偏倚和外部适用性。
按方案在小规模真实流程中研究安全性、人因和运行表现。
与选定对照比较流程或结局影响,并记录意外后果。
研究计划
检索完整性、标准匹配错误、未知信息比例、协调员复核时间以及向医生转交的质量。
官方来源时效性、下一步清晰度、材料完整性,以及是否避免暗中选择治疗或机构。
有来源的陈述比例、无依据结论、关键遗漏、复核耗时和专业核查质量。
遗漏操作、角色间转交质量、人工纠正、周期耗时和新增风险点。
主要与官方来源
涵盖用途、透明度、验证、数据和生命周期监管等主题。
↗DECIDE-AI · Early-stage clinical evaluation用于报告真实临床环境中 AI 决策支持早期评估的清单。
↗TRIPOD+AI · Reporting clinical prediction models临床预测模型(包括机器学习)的透明报告指南。
↗FDA · Good Machine Learning Practice面向 AI/ML 医疗器械全生命周期的质量与安全原则。
↗NCI · TrialGPT clinical-trial matching临床试验检索与匹配研究系统的官方说明。
↗ClinicalTrials.gov · Data API官方注册数据接口;状态和标准必须按查询日期再次核查。
↗Evidence boundary
方法和来源清单不等于项目已完成临床研究、已注册为医疗器械或可处理真实健康数据。这些结论需要单独的证据和批准。