两箱银灰色的铝合金机箱,每箱四台,一共八台。每台机箱里装着一块定制的信号处理板卡——双核DSP加FPGA的异构架构,这是天穹地面终端的内核计算平台。
张磊拆开第一台机箱的时候,手指都在微微发抖。
”城哥,这板子的做工也太精致了吧。”他捧着板卡翻来复去地看,”比我们实验室用的开发板高了好几个档次。”
”这是蓝湾通信和芯片厂联合定制的。”左城接过板卡看了一眼丝印,”DSP主频六百兆赫,FPGA是二十八纳米工艺,片上RAM两兆字节。和我们仿真用的参数模型一致。”
”一致”这个词他说得很有信心。但三天后他就知道自己错了。
问题出在第一次上板测试。
方泽把多星渠道调度器的代码移植到DSP上,编译通过,刻录成功,激活运行——然后系统在第十七秒崩溃了。
”内存溢出。”方泽盯着调试器的输出,眉头拧成了一团,”堆栈空间不够。”
左城走到他旁边看了一眼数据。仿真环境里调度器的峰值内存占用是一点六兆字节,而DSP的片上RAM是两兆字节,理论上应该够用。但实际运行时,编译器生成的代码比仿真环境的仿真代码体积大了百分之四十——因为真实的DSP指令集和仿真用的通用指令集不一样,某些运算需要更多的中间变量和临时缓冲区。
一点六兆乘以一点四,等于二点二四兆。超了。
”仿真和实物之间永远有gap。”左城的语气没有意外,只有冷静,”这是工程开发阶段必须面对的问题。仿真验证了算法的正确性,但代码的工程实现必须针对真实硬件重新优化。”
”怎么优化?两兆的RAM是硬限制,改不了。”方泽问。
”改代码,不改硬件。”左城坐到方泽旁边,打开了调度器的源码,”第一步,做内存剖析——找出哪些数据结构占了最多的空间。第二步,做数据压缩——能用短整型的不要用长整型,能复用缓冲区的不要另开新空间。第三步,做代码瘦身——把编译器生成的冗馀指令手动优化掉。”
这三步说起来简单,做起来是一刀一刀削肉的苦活。
左城和方泽花了整整一周,把调度器的代码从头到尾重写了一遍。不是改算法——算法不用动——而是改每一行代码的实现方式,让它在有限的内存空间里尽可能高效地运行。
七天后重新上板。峰值内存占用——一点七八兆。稳了。系统运行了十二个小时,没有崩溃,没有溢出,调度器的响应时间和仿真结果完全吻合。
方泽靠在椅背上长出了一口气。他的眼镜片上有两个明显的指印——这一周他推眼镜的频率比平时高了三倍。
”这种活儿比写算法累多了。”他难得抱怨了一句。
”算法是创造,工程优化是雕刻。”左城说,”两种累法。”
但这只是第一个模块。
接下来的三周里,同样的问题在其他三个模块上依次出现。自适应参数共享引擎的内存问题更严重——环形缓冲区在DSP上的对齐要求和仿真环境不同,导致实际占用比预期多了百分之三十。波束协同控制器的问题不在内存,在时序——FPGA的时钟频率和仿真的理想时钟有微小的偏差,导致分层精度切换的判断逻辑偶尔会错过一个时钟周期,造成波束指向的瞬间抖动。
频谱感知前端反而是最顺利的——因为这个模块的嵌入式优化在架构设计阶段就已经做到位了,定点化、DMA流水线、候选循环频率预筛选,每一步都是针对真实硬件设计的,上板后只做了几处寄存器配置的小修改就跑通了。
”之前砍的那三刀没白砍。”刘伟感慨了一句。
六月底,四个模块全部完成了上板移植和初步联调。
左城在白板上更新了进度,第一里程碑的八月节点,目前来看可以按时达成。但中间还有一个关键步骤没有完成:四个模块之间的联合测试。
单独跑每个模块都没问题,但四个模块同时运行在一块板卡上、共享同一块内存、争抢同一个总线带宽的时候,会不会出新的问题?
左城知道答案:一定会!联调的bug永远比单模块测试多,而且往往更隐蔽、更难复现。这是工程开发的铁律。
七月初他召开了一次内部会议,把联调计划从头到尾过了一遍。
”联调分三轮。”他在白板上画了一个时间轴,”第一轮:双模块联调,两两配对测试兼容性,预计一周。第二轮:三模块联调,重点测试资源竞争和时序冲突,预计一周半。第三轮:全链路联调,四个模块加之鼎新的终端协同接口一起跑,预计两周。三轮做完,八月交样机。”
唐旭看着时间轴:”三