第八十九章 波束之困
    第二天一早,左城去了天穹项目的开发实验室。实验室里灯火通明,唐旭显然又熬了一夜。

    唐旭的工位上摆满了打印出来的仿真日志,用荧光笔标注了异常的位置。他见左城来了,站起来有些不好意思。

    ”左总,波束切换延迟的问题我排查了快两周,还没找到根因。”唐旭说,”初步判断是多星并行处理时,波束管理模块和其他模块之间存在资源竞争,导致切换指令排队等待,延迟从50毫秒涨到了120毫秒。”

    左城坐下来,开始翻看仿真日志。日志很详细,每一毫秒的状态都有记录。红的是异常段,绿的是正常段,黄色是临界段。左城盯着数据看了半个小时,目光锁定在一段红色局域上,然后把唐旭叫了过来。

    ”你看这里。”左城指着日志中的一段,”波束切换指令发出后,在第37毫秒进入了等待队列,直到第107毫秒才被执行。中间70毫秒的等待时间,是什么模块占用了资源?”

    唐旭凑过来看:”是频谱感知模块。它在做实时频谱扫描,占用了大量的计算资源。”

    ”频谱感知和波束管理共用一个计算单元?”

    ”是的,在当前的架构下,两个模块共享GPU资源。”唐旭说,”之前第二阶段卫星数量少的时候没有问题,但第三阶段480颗卫星同时运行,频谱感知的计算量是之前的四倍,就把GPU资源吃满了。”

    左城立刻看到了问题的关键。资源竞争不是算法的问题,而是架构设计的问题。如果波束管理和频谱感知共用GPU,当频谱感知的计算量暴涨时,波束管理就会被挤占资源。

    ”两个模块必须做资源隔离。”左城说,”波束管理单独分配一组GPU,频谱感知单独分配一组。这样就不会互相干扰。”

    ”但我们的硬件平台只有两组GPU。”唐旭说,”一组跑信号处理,一组跑频谱感知和波束管理。如果要隔离,需要加一组GPU,硬件成本会增加百分之十五。”。这个数字不小,但如果波束切换延迟不解决,验收通不过,损失更大。

    ”先不管成本,解决问题是第一位的。”左城说,”硬件方面我去和蓝湾沟通,看能不能申请变更。你先把资源隔离的方案设计出来,把延迟降下去。”

    唐旭点头:”明白。我今天就改。”唐旭说完,立刻回到工位上开始重新设计架构。

    左城在实验室里待了一整个上午,和陈浩、唐旭一起讨论了资源隔离的方案。最终确定的方案是:信号处理独占GPU组A,频谱感知独占GPU组B,波束管理独占新增的GPU组C。三组GPU各自独立,互不干扰。

    ”新增的GPU组需要什么型号?”陈浩问。

    ”和现有的B组一样,型号统一,方便维护。”左城说,”硬件采购的事我去对接,你们专注把软件改好。”

    ”好。”陈浩和唐旭同时点头。

    左城回到办公室,关上门,打开系统面板。他仔细查看了航天通信枝干上波束管理叶片的详细描述。

    叶片上的技术能力确实包含了波束管理,但它提供的是最优的波束切换算法,不是硬件架构设计。架构出了问题,科技树帮不了。

    他关掉系统面板,给陆明远打了电话。

    ”陆总,天穹第三阶段有个技术问题需要和您沟通。波束管理模块在多星并行测试中出现了延迟超标,原因是GPU资源竞争。我们计划增加一组GPU做资源隔离,硬件成本增加约1800万。”

    陆明远沉默了几秒钟:”延迟超标多少?”

    ”从50毫秒涨到了120毫秒,是验收的一票否决项。”

    ”必须解决。”陆明远说,”成本增加的事我和周总沟通,应该没问题。技术方案尽快提交,我安排评审。”

    ”好的,谢谢陆总。”

    挂掉电话,左城松了一口气。蓝湾的态度很积极,说明他们对402的技术能力还是信任的。天穹第二阶段94分的好成绩摆在那里,一次架构调整不会动摇蓝湾的信心。只要方案合理,成本增加不是问题。

    但左城心里清楚,这次的波束切换问题暴露了一个更大的隐患:402的硬件架构设计还不够成熟。科技树给了他最先进的算法,但工程实现还是要靠团队。如果团队的架构设计能力跟不上算法的进化速度,类似的问题以后还会出现。

    他需要加强系统架构方面的能力。也许,下一次科技雷达扫描的时候,可以特别留意一下有没有系统架构方面的人才和技术。

    正当他思考的时候,韩露推门进来。

    ”左总,银杏资本的尽职调查团队明天到,需要你配合做技术访谈。”韩露说,”另外,蓝湾产业基金那边也回复了,他们对战略投资很感兴趣,但希望看到天穹第三阶段的最新进展再决定。不过我想最终应该没问题。”

 

本章未完,请点击下一页继续阅读>>