哈哈小说
第 8 卷 · 把电搬下来 · 第 180 章 · 66 段 · 2721 字

清单

第一百八十章 清单

周一下午,霍建新助理发来了文件清单。

不是霍建新本人,是一个叫林小慧的助理,邮件格式很规整,正文三行,附件是一个表格,第一行是表头,往下五十八行,每行一份文件,文件名、文件类型、大致内容,三列。

陆衍把表格打开,从头扫了一遍。

和霍建新说的差不多——五十八份文件,比制造公司那批多出来七八份,但分布不一样。制造公司那批集中在认证和采购,格式相对规律。这批生物技术的文件,认证只占了一小部分,剩下的是临床前研究报告、工艺验证记录、体外测试数据汇总,还有好几份是原始试验记录——他看到「实验室原始记录扫描件」这几个字的时候,在那行上停了一下。

扫描件。


他把这个问题在脑子里先放了一下,没有立刻发给卫越,而是把清单从头到尾又过了一遍,把文件类型做了个粗分:标准Word或PDF文档的,大概三十五份;表格类的,十二份;剩下十一份,备注里写着「扫描件」或「照片件」。

十一份扫描件。

他想了一下,给卫越发了个消息:「你有空吗,我有个东西想先过一遍。」

卫越回得快:「在,说。」

陆衍把清单截了图发过去,把那一列扫描件的备注用红框标出来:「第三个项目的文件清单,里面有十一份是扫描件,实验室原始记录。」

「我看到了,」卫越说,「你的问题是扫描件怎么处理?」

「对。」


等了大约二十分钟,卫越发来一条语音。

「我刚才测了一下,用现成的OCR跑了几个典型场景,识别率大概在六成到七成之间,主要问题是手写字段名——实验室记录里有很多字段是手写填的,打印的字段名旁边是手写数值,识别引擎拆开来处理,有时候把手写数字和打印字段搞混,有时候直接漏掉整行。」

插图

陆衍把语音听完,在椅子上坐了一会儿。

六成识别率,意味着从清单里进来的十一份扫描件,平均每份有四成的字段会出问题。四成出问题,矛盾扫描的结果就不可靠——你不知道它报出来的是真实矛盾还是识别错误带来的假象。

「那这十一份,你觉得怎么办?」他问。

「三种选项,」卫越说,「第一,我们做人工提前处理,把这十一份的字段手工整理一遍,导入工具再跑;第二,我们把这十一份排除掉,只跑剩下四十七份,但告知客户扫描件暂不支持;第三,我们把OCR集成进预处理步骤,降低期望值,告诉用户识别率有限,发现结果仅供参考。」

「你倾向哪个?」陆衍问。

「第二个,」卫越说,「不确定的不要进报告。」


陆衍没有立刻回应,把卫越说的三个选项在脑子里排了一遍。

第一个,手工处理,时间成本太高,而且每个项目都有不同的扫描件,这条路走下去相当于我们自己变成了半手工的处理机构,不是在做产品。第三个,把OCR集成进去但降低期望值,看起来是在扩展能力,但六成识别率的结果进入报告,等于让客户面对一堆可信度不明的发现,这和工具的精度原则是反的——宁可漏报,不可误报。

第二个,排除扫描件,这是守住边界的选项。

他给卫越发了一条:「你说得对,选第二个。但有一点要想清楚——不是「暂不支持」,是「不支持」。如果我们说「暂」,客户会等,会问什么时候支持,然后我们要一直解释。如果我们从一开始就把范围说清楚,「工具处理电子文档,扫描件不在范围内」,这不是限制,是定义。」

卫越回了一句:「那就这样写进说明里。」

「对,」陆衍回,「边界说明的第二条。」


他把这件事记在本子上,在那行字旁边写了个数字:47。

插图

工具处理的是这四十七份,不是五十八份。这件事没什么好回避的——他们在做的不是一个处理任意文档格式的工具,是一个处理结构化电子文档的工具,扫描件的识别不是他们的核心能力,也不打算做成核心能力。

他想了一下,给霍建新助理回了邮件:

「感谢发来清单。我们已经过了一遍。工具处理电子文档,包括Word、PDF原生格式、Excel。扫描件(图片化PDF、照片件)需要先经过OCR处理,识别率有限,为保证发现结果可靠,本次扫描件部分(11份)暂不纳入扫描范围,将在报告说明中注明。可扫描文档共47份,预计下周内完成,是否可以按此进行?」

发出去,等了二十分钟,助理回:「好的,按此进行,谢谢。」


他把这封回信截图发给卫越,没有加说明。

卫越看了一下,回了一个字:「稳。」

陆衍把手机放下,重新打开那张文件清单。四十七份可以处理的文件,他挨个看了一遍类型。认证文件他们处理过,相对熟悉;工艺验证记录这类文件他没见过,字段体系和制造业不一样;临床前研究报告的结构更复杂,有些字段名非常专业,他认识字,但不确定这些字段之间的关系在生物技术行业有没有特定的惯例。

这就是卫越建字段别名表的意义所在——不只是把字段名变成标准名,是把这个行业里约定俗成的对应关系记下来,让工具在不同标的之间可以复用。

「生物技术的字段别名表,」他给卫越发消息,「进度怎么样?」

「还在查,」卫越回,「这个行业我不熟,在找资料。认证类的字段和制造业有一些重叠,但工艺验证和临床数据那块完全是新的,我估计要三到四天。」

「行,你先做,做完我们再确认一遍。文件我这边收到了,可以先把电子格式的文件理一下,看看字段分布情况。」

「好。」


他们这样分工了两天。

插图

卫越在整理字段别名表,陆衍把四十七份文件的格式做了个初步摸排——有十三份是标准格式,字段名规整,一看就知道怎么映射;有二十一份字段名有变体,需要别名表支撑;剩下十三份,字段密度高、格式不统一,很可能要在预处理步骤里多走几轮确认。

周三晚上,卫越把初版别名表发来了。

「我做了一百一十六条,认证和工艺验证为主,临床数据那块还不全,大概有二十条左右不确定的,我标了颜色。」

陆衍打开表格,先看了一眼标色的部分——二十一条,集中在两个字段族:一个是和「批次」相关的字段群,生物技术里有「批号」「批次编号」「生产批号」「产品批次代码」至少四种叫法,卫越标的是不确定它们是否全部等价,还是只在特定文件类型里等价;另一个是测试数据的描述字段,什么情况下叫「测试结果」,什么情况下叫「检验数据」,什么情况下叫「分析结果」,卫越没有把握。

陆衍把这二十一条看了一遍,在边上批注了几条,然后给卫越发消息:「「批次」那组,我查了一下,常见的有四种叫法,在认证和工艺验证文件里大部分可以等价,但在临床数据报告里「生产批号」有时候指的是不同阶段的子批次,不一定等价。我的建议是分开处理,不要合并映射,让预处理步骤在这四条上都标出来,让客户自己确认。」

「好,我照这个改,」卫越回,「测试数据那组呢?」

「测试数据那组先保留,等我们拿到霍建新这批文件以后,看实际出现的是哪几种叫法,然后再决定要不要合并。」

「行。」


周五,卫越把修订后的别名表发来了,上面有一张便条:「改完了,批次那组拆开,测试数据那组留白。你看一下。」

陆衍把表格拉了一遍,标色的条目只剩下测试数据那组的七条,其他的都已经按行业标准做了说明。

他把表格存好,发给卫越:「这版可以用。等霍建新的文件过来,我们先跑一遍字段映射,看预处理那一步出什么。」

「好,」卫越回,然后停了一下,又发了一条,「你觉得这个东西,最后会是什么样子?」

陆衍想了一下,「你是说产品层面?」

插图

「对,就是说,我们处理了制造业,现在处理生物技术,下一个来了可能是别的行业,别名表每次都要重新建,预处理每次都要调,这件事会一直这样下去吗?」

陆衍看着这条消息,想了好一会儿。

「会,」他回,「但不一样。第一次建生物技术的别名表,我们花了三四天,下一个生物技术项目来的时候,大部分的表已经在了,只用补新出现的。建表的成本是递减的,但判断的工作不会消失——每一个新的字段族,用不用等价,都需要人去想清楚。这件工具不会变成全自动的,它会变成越来越顺手的。」

「所以是工具,不是平台,」卫越说。

「是工具,」陆衍回,「我们做的事情,是让每一次拿到新行业文件的人,不需要从头开始想字段的问题,可以直接把精力放在发现上。」


他发出这条消息,然后把手机放下,看了一眼窗外。

外面天色快暗了,楼下街道上有人在叫外卖,隔着窗玻璃听起来很远。

工具,不是平台。

这件事他没有仔细想过,卫越问的是对的。平台意味着扩展,意味着接更多行业,覆盖更多场景,最终变成一个可以自己跑的东西。工具意味着有人用它,用的时候它是顺手的,用完它就是一份报告。两件事的方向不是相反的,但走的路不一样。

他在本子上写了一行:

「工具 = 让人的判断更有效率,不替代判断。」

然后他的手机屏幕亮了,是霍建新的助理发来的消息:

「文件已发送到您的邮箱,请查收。」