先写清 AI 输出会被拿去做什么
“用于医药研发”不是一个可以直接验证的场景。系统可能帮助研究人员筛文献、提取实验条件,也可能预测结果、支持申报材料。前者通常是资料整理,后者可能影响安全性、有效性或质量判断。任务不同,允许的错误和验证深度也不同。
FDA 2025 年发布的草案把使用场景称为 context of use,要求说明模型怎样被用来回答一个具体问题。2026 年 FDA 与 EMA 发布的良好 AI 实践原则再次提出清楚定义用途、采用风险方法和全生命周期管理。项目立项时就应把这些内容写进验收,而不是等模型完成后再补说明。
一份可执行的使用场景要包含四项信息
第一是输入,包括数据来源、时间范围、样本和预处理。第二是输出,明确字段、分数或建议的含义。第三是使用者,说明谁能看到并怎样复核。第四是影响,写清结果是否进入实验、研究记录或监管材料。
例如“从药化论文提取化合物活性数据供研究人员初筛”比“智能解析论文”更容易验证。团队可以检查化合物编号、实验方法、单位和原文位置,也能规定未经复核的数据不得进入正式项目记录。
数据适用性比数据量更值得先检查
训练或评测数据要覆盖预定用途中的文献类型、实验条件和表达方式。若数据大多来自格式整齐的公开论文,系统面对扫描补充材料或内部记录时,表现可能明显下降。数据缺失、选择偏差和标签口径都应记录。
个人信息、受试者数据和未公开研发资料还有额外权限与保密要求。项目要说明哪些数据可以进入外部模型服务,哪些必须留在专属环境,并保留访问与处理记录。部署位置不能替代数据治理。
验证指标要对应真实后果
文献筛选可以看漏检与误选,字段抽取可以逐项核对准确情况,预测模型则需要结合具体研究问题设计性能与不确定性评估。一个综合分数很难说明哪些错误会影响后续判断。
评测数据应与开发数据分开,并代表实际使用分布。风险较高的用途还需要更严格的独立验证和统计设计。模型在公开基准上表现好,不等于适合某个企业的特定资料和流程。
版本、修改和人工监督要贯穿使用过程
模型、提示规则、数据预处理和知识库都会改变。每个正式结果应能关联到当时使用的版本。高影响场景在验证后需要冻结配置;确需更新时,重新评估受影响的样本和结论。
专业人员的监督不是在页面上加一个“确认”按钮。复核者需要看到输入、原始证据、模型输出和不确定项,并有权驳回或修改。系统也要记录复核意见,帮助下一次评测找到真实失败模式。
从低风险资料任务建立可信链条
很多团队适合先做文献定位、字段抽取和知识检索。这些任务能保留原文,研究人员容易判断系统是否有帮助,也便于积累高质量的复核记录。未经证实的生成内容不进入正式研究结论。
当数据、评测和版本管理已经稳定,再讨论更高影响的用途。医药研发 AI 的进展不应只按模型能力衡量,还要看团队能否解释每项输出从哪里来、适用于什么、由谁负责。
试点记录可以直接沿用未来正式项目需要的字段,包括研究问题、输入版本、模型配置、复核人、驳回原因和最终去向。即使首轮只做辅助检索,这些记录也会成为后续扩大用途时判断风险与验证工作量的真实依据。
