哈哈小说
第 6 卷 · AI 的前夜 · 第 110 章 · 67 段 · 2447 字

POC

第一百一十章 POC

凌矩科技的总部在深圳南山,一栋写字楼的第十三层,陆衍和程一帆是下午两点半进的门。

接待他们的是凌矩的商务总监,名叫韦庆,三十出头,讲话很快,把整个演示流程说了一遍,基本是标准的企业销售节奏:先介绍公司,再讲产品,再演示 benchmark,最后约 POC。

陆衍听他说完,开口说了一句话:「韦总,我们不看 benchmark,我带了我们自己的测试集,能不能直接跑?」

韦庆停了一下,「当然可以,我去给你们安排测试机器。」


凌矩的测试机房在同楼层的最里头,一排蓝光指示灯的服务器柜,一个工程师坐在操作台前,看着他们进来,没有说话。

程一帆把测试集拷进去,跑环境配置,大约二十分钟之后,第一个测试用例开始跑。

陆衍站在操作台旁边,盯着监控屏幕。

他看的不是延迟数字,看的是内存使用曲线。


第一轮跑的是小批量推理场景,批次大小八,都是青舟最常见的企业文档分析请求,时延要求低于两秒。凌矩的机器跑出来的数字很干净:平均时延一点四秒,P99 延迟两点一秒,吞吐量比青舟目前在公有云上跑的同配置高了大约百分之三十二。

程一帆看了一眼陆衍,没有说话,但表情是「比我预期好」的那种。

「把批次大小调到六十四,」陆衍说。

凌矩工程师没有问原因,改了参数,重新跑。

这次的数字变化很明显:平均时延升到了五点七秒,P99 延迟爬到了九点三秒,吞吐量有所提升,但提升的幅度远低于理论值。

「内存带宽,」程一帆说,「批次放大之后,模型权重加载和 KV-cache 的内存吞吐撑不住了。」

插图

陆衍点了点头,「继续往上,」他说,「批次大小一二八。」

工程师看了他一眼,改了参数。

这次的结果出来,陆衍盯着屏幕上那个数字看了几秒:P99 延迟十七点四秒。

韦庆在旁边说了一句:「这个批次大小在我们已有的客户里不是主流场景……」

陆衍没有接话,「我们这边有的时候会有这类请求,」他说,「没有别的问题了,我们先把数据收集一下,回去分析。」


回程的高铁上,程一帆把测试数据整理了一遍,发了一份简版报告给陆衍。

结论很直接:凌矩的方案在小批量推理场景下有竞争力,但在大批量并发场景下,内存带宽成为瓶颈,性能曲线的弯折点出现在批次大小四十八附近。

「这是凌矩的问题吗?」陆衍问。

程一帆想了一下,「他们用的是标准的 HBM2e,带宽在那里,他们没有做优化的空间——这不是工程问题,是硬件规格问题。换一家,如果用的是同样的内存方案,结论大概率是一样的。」

「那就是行业问题,」陆衍说,「不是某家公司的问题。」

「对,」程一帆说,「现阶段大家都在用同一代的内存堆栈,差异在封装和散热,不在底层能力。」

陆衍靠在座位上,把窗外快速后退的风景看了一会儿。

这件事他知道。

插图

不是从今天才知道的——是在很久以前某个读文档的深夜,豆包给他整理过一份技术演进路径,其中有一段专门讲了推理场景下的内存墙问题,讲了那个问题会在什么时间节点开始成为行业性约束,又在什么时间节点会出现真正能解决它的硬件方案。

那个时间节点还没有到。

但它会到。

问题是,等它到来的时候,青舟要在哪里。


「程一帆,」他说,「我问你一个技术上的问题,你大概从工程角度怎么看:如果有人要做一款专门针对大批量推理场景、把内存带宽优化作为核心设计目标的推理加速硬件,从架构上,那个设计的关键取舍在哪里?」

程一帆转过头看了他一眼,「你是认真的?」

「算是技术学习,」陆衍说,「你说。」

程一帆想了一下,「那你要在内存带宽和计算密度之间做取舍,」他说,「通用 GPU 是往计算密度方向优化的,因为训练场景需要大量浮点运算;但推理场景更多是内存密集型的,模型大了之后每次推理的瓶颈不是算力不够,是权重装不快、KV-cache 刷不及时。如果专门做推理,你可以把一部分计算面积让给更大的内存带宽,用 3D 堆叠内存或者定制的互联结构,把读写速度拉上来。」

「这类架构,现在有人在做吗?」

程一帆想了想,「有几家,但都是早期,产品还没有大规模量产的。更多的人觉得这个方向太窄,不如做通用的。」

「但如果 AI 推理的需求规模继续增长,」陆衍说,「这个方向会越来越有价值。」

「理论上是这样,」程一帆说,「问题是那种芯片研发周期长、风险高,不是一般公司做得了的。」

陆衍没有继续往下说,把这个话题收了,「好,」他说,「你说的这些我记了,我们先把凌矩的测试结论整理好,下周内给我一个完整版本,我拿着这份数据再看一下其他几家。」

程一帆:「好,这周能出来。」

插图

回上海之后,陆衍把凌矩的测试结论发给了豆包,加了一句:「其他几家大概率也是同样的问题,行业内存带宽普遍不够用。」

豆包看了数据,说:「你的判断是对的,但这个问题的解决方案在时间线上大约要等两到三年,那段时间行业会有新一代高带宽内存的产品进入量产。」

「两到三年,」陆衍重复了一遍,「那就是 2022 年前后。」

「差不多,」豆包说,「但等到那时候,采购那类硬件的竞争会很激烈,不是价格问题,是排队问题。有意愿的公司越早拿到分配资格,在新一代硬件上线时拿到产能的可能性越大。」

陆衍把这段话在脑子里过了一遍,「那在等待的两到三年里,」他说,「青舟的算力问题要怎么处理?」

「过渡方案,」豆包说,「先优化软件层,争取把现有的公有云成本压低一成到两成;同时小规模试点自建推理节点,把运维能力积累起来;到新硬件上线时,青舟已经有了自建算力的经验,更容易完成切换。」

「这条路,」陆衍说,「软件层优化程一帆已经在做了,自建推理节点小规模试点——这件事需要谁来主导?」

豆包沉默了几秒,「需要一个真正懂基础设施的人,」它说,「这个能力青舟现在有吗?」

「没有,」陆衍说,「所以下一步要找。」

他在本子上写了一行字:「基础设施 / 算力方向的核心工程师,2020 年初。」


当天下午,他在公司的会议室里开了一个内部会,参加的是乔木、程一帆、还有负责商务的林翔廷。

「我把这个季度的情况跟你们说一下,」陆衍开门见山,「算力成本现在是我们最大的隐患。今年这个方向我们已经确认了两件事:第一,现在采购外部硬件,没有解决内存带宽这个根本问题;第二,唯一可行的中期方案,是在 2020 年前后自建一套推理基础设施,并且开始为下一代硬件上线做资格准备。」

乔木问:「准备什么样的资格?」

插图

「产能分配,」陆衍说,「新的高带宽内存硬件上线的时候,先进去试点的公司会拿到更好的交货排期和技术支持。我们现在的体量如果不提前建立合作关系,2022 年抢不到机器。」

林翔廷:「你说的这些,要具体落到什么动作上?」

「两件事,」陆衍说,「第一,程一帆那边的软件层优化本月完成,降低当前的公有云账单;第二,我接下来要开始接触做下一代推理硬件的团队,不是采购,是技术交流。知道他们在做什么,他们知道我们要什么。」

「你说的「做下一代推理硬件的团队」,」乔木问,「是国内的公司?」

「有国内的,也有国外的,」陆衍说,「先看国内的,如果方向对,这件事不用走很远。」

会议开到傍晚六点半结束。走出会议室的时候,程一帆在走廊上跟上陆衍,低声说了一句:「陆哥,你今天说的那些,感觉不只是在谈采购。」

陆衍转头看了他一眼,「你说什么意思?」

「你讲「为下一代硬件做产能资格准备」,还有「技术交流不是采购」,」程一帆说,「我们最后是不是不只打算买?」

陆衍没有立刻回答,「先把眼前的事做好,」他说,「其他的事情,等时候到了再说。」

程一帆点了点头,「好,」他说,「那我先去优化代码了。」

他往自己的工位走去,陆衍在原地站了几秒。

程一帆猜得大差不差,只是还少了一截——不是「不只打算买」,而是有一天可能「买也买不到、只能自己做」。但那一步,现在说还太早,太早说就是在吓人,而不是在带人走路。

他回到自己的办公室,把本子翻开,在「基础设施 / 算力方向的核心工程师」那行下面又写了一句:「让团队先走起来,结论放在后面。」