第一百五十章 数据
十月的上海开始有一点秋意,但机房里永远是空调的温度,和季节无关。
沈默发消息给方宇明,是一个周五的下午。
「数据出来了。」
他附带了一个截图——一张折线图,横轴是时间(过去三周),纵轴是每瓦特完成的推理任务数量(token/J)。图上有两条线,一条标着「A800」,一条标着「砺火一号」。
砺火一号的那条线从一开始就高于A800,两条线之间的差距维持在大约1.8倍左右。
「1.8倍,」沈默写,「不是同等性能,但功耗密度比你们预测的好。你们内部估的是多少?」
方宇明给陆衍看这条消息的时候,陆衍正好在B207。
「我们估的是1.6倍,」方宇明说,「原因是我们假设实际工作负载下的访存效率会比测试时低,因为真实请求的长度分布不均匀,换页会频繁发生——但沈默那边的调度器做了一些优化,让砺火一号的任务队列尽量聚合相似长度的请求,减少了换页开销。」
「所以是调度器帮了忙,」陆衍说。
「是,」方宇明说,「但砺火一号的基础数字也确实不错——1.8比1.6,在误差范围外,说明我们设计时对KV-cache命中率的估计偏保守了。」
那天晚上,方宇明坐在B207,打开了一个新文档。

文档名字:`lhfire2_design_objectives_v0.1.md`
他在空白页上打了第一行字:
`砺火二号设计目标(初稿)`
然后在下面打了第二行:
`基于砺火一号实际运行数据修正的设计输入。`
他停在这里,想了一会儿,没有继续写,把文档保存关掉了。
「你在写二号,」颜天磊第二天早上来B207,看到方宇明打开了那个文档,问。
「刚开始,」方宇明说,「还没有数字。」
「主要改哪几个方向?」
「三个,」方宇明说,「一是存储带宽——一号现在是LPDDR4,带宽25.6 GB/s,对KV-cache的访问是瓶颈,换HBM,目标768 GB/s;二是片上KV-cache容量扩大,一号是2MB,二号目标64MB,减少换页频率;三是工作频率,一号1GHz,二号目标1.5GHz——但目标频率要等工艺选型确定之后才能精确,可能还是28nm,也可能升到12nm。」

「HBM,」颜天磊说,「这不便宜。」
「不便宜,」方宇明说,「但沈默那边如果继续买,数量上去了,单价能下来。而且二号如果功耗密度能做到A800的三倍以上,那整个的性价比会非常好。」
颜天磊把这三个方向记在他随身的小本子上,「时间线?」
「不定,」方宇明说,「先把目标文档写好,工艺和架构选型定了才能说时间线。」
陆衍那段时间在上海,偶尔来B207坐一会儿,偶尔在外面接一些咨询的事。
他发给豆包:「方宇明在写砺火二号的设计目标了,但说还没有数字,刚打了一行标题。」
豆包:「第一行标题是最重要的一步。在芯片设计里,从一号到二号之间有一个很关键的过渡——一号的设计是基于假设和预测,二号的设计是基于实际数据的反馈。一号数据修正了什么,就决定了二号的方向。」
陆衍:「沈默发来的功耗密度数字是1.8倍,方宇明估的是1.6倍。」
豆包:「1.8比1.6,差了12.5%,在首款芯片上这是一个不错的差异方向——好于预期。更重要的是,差异的来源是可以解释的(调度器优化+KV命中率估计偏保守),这说明团队的建模能力在提升,二号的预测会更准。」
陆衍:「他们说换HBM。」

豆包:「HBM(High Bandwidth Memory)是目前AI芯片存储带宽的主要方案,NVIDIA A100用的是HBM2,H100用的是HBM3。砺火一号的LPDDR4带宽是25.6 GB/s,如果换成HBM2e,理论带宽可以到768 GB/s,差了约30倍。对于KV-cache密集的推理任务,带宽是最主要的瓶颈,30倍带宽理论上可以让延迟下降很多——当然实际效果取决于片上缓存设计和访存效率。」
陆衍想了一会儿,「一号从设计到流片是多少时间?」
豆包:「从颜天磊开始写RTL到GDS提交台积电,方宇明说是大约十四个月。加上流片等待时间(MPW大概六个月),第一块实物芯片在手里是二十个月。二号如果从现在开始启动设计,假设流程相似——最快二十个月后有芯片,大概是2023年中到下。」
「2023年,」陆衍说,「好。」
他没有再说什么。
那天是十月十五日,陆衍在B207窗边坐着,方宇明在另一端盯着屏幕,颜天磊在对面翻着接口规格书。B207的灯是日光灯,偏白,照着桌上的仪器和电线,很安静。
陆衍突然想起豆包上次说的话——「你做的所有事,方向都是对的,只是速度由你决定。」
他不确定速度是什么意思。
但他觉得,砺火二号开始写设计目标文档这件事,是某种速度的一部分。
傍晚,颜天磊先走了。方宇明又在那个设计目标文档里加了几行:

``` 1. 存储:LPDDR4 → HBM2e,目标带宽 768 GB/s 2. 片上KV-cache:2 MB → 64 MB 3. 工作频率:1 GHz → 1.5 GHz(工艺TBD) 4. 功耗目标:<120 W(含HBM) 5. 基于砺火一号实测数据:预期功耗密度达 A800 3× 以上 ```
五条。
他把文档关掉,拿了外套,走出去关灯。
陆衍在门口等他,「走?」
「走,」方宇明说。
走廊里,方宇明说:「一号的事,谢谢。」
陆衍:「我没做什么。」
「你找到沈默,」方宇明说,「我们做出来,得有人用。」
陆衍没有说话。他们一起往电梯走,走廊里只有脚步声和远处空调的声音。