哈哈小说
第 8 卷 · 把电搬下来 · 第 278 章 · 54 段 · 0 字

北辰健康

温立铭周四发来文件。

不是样本,是数据室权限和一份基础说明,两段话:「北辰健康,化药为主,五个在售品种,三个在审。在售品种里两个是原研,三个是仿制。再融资前做内部合规梳理,他们希望年底前把文件都理清楚。」第二段是数据室账号和密码。

陆衍把说明发给卫越,然后自己也登进去看。

北辰健康的数据室比晨康大。晨康是并购项目,文件清单走的是标准尽调格式——药品注册证、GMP许可证、供应商协议,分类清晰,每类文件数量有限。北辰健康这边是自己梳理,什么都在里面:批准文号证、GMP许可证、受理通知书、质量管理体系文件、原料药来源说明,还有陆衍以前没见过的一类文件名——「临床试验批件」,英文缩写IND,文件夹里放了三份。

他把这个截图发给卫越。

「这个你认识吗?」

卫越回得很快:「IND批件,Investigational New Drug,原研化药做临床试验要先拿这个批件,相当于国家批准你可以开始做临床。和最终的批准文号是两种东西——批准文号是批准你可以卖,IND批件是批准你可以试。」

「格式?」

「没做过,」卫越说,「但光看文件夹里的名字,格式肯定不一样。批准文号证我们已经有识别逻辑了,IND批件的字段分布估计完全是另一套。」

陆衍把IND批件那个文件夹展开,看了第一份的文件名:「CDE受理号CXHS2201003,临床试验批准通知书.pdf」。和批准文号证的命名规律不同,前缀是CDE,不是国药准字。

「先不管格式,」他说,「这类文件的逻辑应该和受理通知书一样——它代表的是一个品种处于临床阶段,还没有上市资质。」

插图

「对,」卫越说,「而且IND批件批准的是临床方案,不是产品本身。有IND批件不代表这个品种最后能拿到批准文号,临床失败了就到头了。」

「那文件里的字段比对意义就不大,」陆衍说,「关键是这类文件存在本身说明了什么。」

他想了一会儿。这不像涉外认证那种情况——涉外认证是工具看不懂外文字段,本质上是识别能力的问题,可以通过扩展别名表慢慢覆盖。IND批件是另一种情况:它的逻辑框架完全不同,一个IND批件对应的是某个品种的临床研究方案,批件编号、临床阶段(I/II/III期)、研究机构、适应症,这些字段拿出来和什么比对?和批准文号证的字段之间没有直接的对应关系。

他给卫越发过去这段分析,最后加了一句:「我觉得不能用现有框架硬套,要么不覆盖,要么单独设计识别逻辑。」

「先不覆盖更安全,」卫越说,「设计识别逻辑得先搞清楚IND批件里哪些字段在尽调场景下有意义,这个得找懂临床报批流程的人帮确认。」

「那这批先跑批准文号证、GMP许可证、受理通知书,」陆衍说,「IND批件那三份单独列出来,在报告里说明:存在该文件类型,本次扫描未覆盖,建议咨询具备药物研发背景的专业人员核实。」

「措辞要准确一点,」卫越说,「不是「未覆盖」,是「需专项处理,当前识别框架不适用于该类文件」,说清楚是框架问题,不是漏掉了。」

陆衍把这句话写进本子,原话。

「好,」他说,「你先把清单过一遍,把文件按类型分开,IND批件单独列,其余的按我们现有框架跑预处理,有问题再说。」


卫越下午发来预处理结果。

文件清单一共八十一份,IND批件三份单独列出、标注未覆盖,剩余七十八份按类型分:批准文号证十一份(五个在售品种各一份,另外六份是原料药批文)、GMP许可证三份、受理通知书三份(对应三个在审品种)、原料药来源说明十二份,其余是质量体系和内部管理文件,工具不处理这类。

插图

真正进入扫描的是十一份批准文号证、三份GMP和三份受理通知书,共十七份。

卫越跑出的初步结果显示,受理通知书三份格式都能识别,CDE受理号前缀正确,日期字段完整;GMP许可证三份没有问题;麻烦出在批准文号证上。

不是字段矛盾。是格式问题。

卫越发了一个截图过来,两份证书并排:「你看这两个,都是化药批准文号证,字段明明应该是一样的。」

陆衍在手机上放大看。

右边那份是仿制药,版式他已经很熟悉了——左上角国药准字H开头的编号,正文是药品名称、剂型、规格、申请人全称、生产地址,最下面是有效日期和审批机构。字段位置固定,工具识别起来没有问题。

左边那份也是化药,批准文号同样是国药准字H开头,但版式完全不同。名称下面多了一个字段:「药品来源:自主研发(国家1类新药)」,再往下是「上市注册证明文件编号」,对应的编号格式是NDA开头,不是药品注册号格式。正文里还有两段备注,其中一段引用了临床数据所在的登记号,另一段写的是「本产品为原研药品,同品种仿制药上市申请需参照本品开展一致性评价」。

「不是同一套模板,」陆衍说,「原研药的批准文号证比仿制药多了一层信息——来源说明、NDA编号、一致性评价参照声明。」

「但批准文号本身的格式是一样的,」卫越说,「国药准字H,八位数字,原研和仿制都是这个格式。」

「字段层面不一样,」陆衍说,「我们现在用的识别逻辑是按仿制药那套版式写的,这个版式里没有NDA编号字段,也没有备注说明部分。原研药那份,如果工具按仿制药模板识别,备注里的字段会怎么处理?」

「会当成正文结尾的非结构化文本,」卫越停了一下,「不会报错,但字段提取不完整,那两段备注不会被识别成字段,只会被扫成文本块。」

插图

「那就是识别结果可能不完整,」陆衍说,「备注里如果有实质内容——比如一致性评价要求,或者关联品种的限制说明——工具有可能发现不了。」

「对,」卫越说,「这次北辰健康的两个原研药批准文号证,备注那段需要我手动看一遍,不能完全相信工具的输出。」

陆衍在本子上写了一行:原研药批准文号证——版式与仿制药不同,识别逻辑需要分支处理。

「这期先人工补看,」他说,「下一版框架里要把两种版式分开处理。」

「我知道,」卫越说,「等我今晚看完那两份,有什么发现告诉你。」


晚上九点,卫越发消息过来。

「两份原研药批准文号证手动看完了。一份没有问题,字段都是正常的,备注里的一致性评价说明是标准格式,没有特殊限制。另一份——」卫越顿了一下,「另一份备注里有一条我不确定该怎么标注。」

陆衍看完截图。

第二份原研药批准文号证的备注部分,第二行写了一句话:「本品原料药采购须来自持有原料药登记号的供应商,具体登记号见原料药登记备案系统,本批准文号不作具体列明。」

「这句话的意思是,」陆衍说,「原料药来源有限制,但限制的具体信息不在这份证书上,在另一个数据库里。」

「对,」卫越说,「原料药登记备案系统是独立的,不在我们拿到的数据室文件里。这份批准文号证说的是原料药必须来自登记号持有者,但没有说是哪些登记号。」

插图

「这是外部数据库引用,」陆衍说,「工具发现了吗?」

「没有,」卫越说,「因为工具把这段当文本块跳过了,没有识别成字段。所以外部数据库引用这条没触发。」

陆衍把这件事写进本子。

两个问题叠在一起:第一,原研药批准文号证版式不同导致识别不完整;第二,识别不完整导致外部数据库引用这条漏报。漏报的那条本来是工具应该发现的——如果版式识别是对的,备注里的「原料药登记备案系统」会触发类别12,现在因为版式问题先漏了,类别12也跟着漏了。

「这个要在报告里写清楚,」他说,「原研药批准文号证版式差异导致备注识别不完整;手动核查发现备注中包含原料药来源限制条款,引用原料药登记备案系统;建议委托方单独核实该品种在当前供应链下的原料药登记号合规情况。」

「这样写的话,」卫越说,「工具的局限和手动发现的结果要分开说。」

「分开说,」陆衍说,「工具的局限是工具的局限,发现是发现,不能混在一起。」

本子最后一行他写了三个字,没有标点:

原研≠仿制。

两种格式,两套逻辑,这件事下一版工具得解决。今晚的发现说明的是,同一个类型的文件里,有的时候格式差异本身就是问题所在——不只是字段填了什么,而是字段在哪里、有没有被识别。