第一百七十七章 计算机深度学习
参数优化的论文……缺乏底层创新,拒稿。”

    查理斯一边嘟囔着,一边快速扫过几篇论文的摘要,将其归入“拒稿候选项”的文档夹。在目前的硬件算力瓶颈下,大家都在现有的框架里打转,很难看到让人眼前一亮的突破。

    他点击鼠标,打开了下一封未读邮件。

    发件人:Yang Zhao。

    查理斯对这个名字没有任何印象。在计算机科学和深度学习这个圈子里,这显然是一个完全陌生的新人。

    邮件正文极其简短,只有一句话:

    “解决异步随机梯度下降中梯度陈旧问题的一种新框架。”

    查理斯看到这句话,眉头微微挑起。

    眼神之中闪过一丝好奇。

    “解决异步SGD的梯度陈旧问题?这倒是有些稀奇了!”

    异步SGD的梯度陈旧问题,是目前整个分布式深度学习领域公认的最大痛点。

    异步算法虽然能解决节点间的通信等待时间,但由于各节点计算速度不同,慢节点传回的“陈旧梯度”会严重破坏全局模型的收敛方向。无数顶尖实验室都在尝试解决,但从来没有实验室拿出来过相对完美的底层架构。

    这个投稿人,口气未免太大了些。

    而且这个投稿人,并不是什么知名人物——至少在计算机深度学习领域是这样的。

    本想直接划走,但稍稍迟疑了一下,抱着万一的态度,查理斯点开了邮件下方的PDF附件。

    论文标题:《一种用于超大规模神经网络训练的新型异步分布式框架》

    查理斯喝了一口咖啡,态度随意的开始翻看论文的摘要和引言部分。

    一分钟后。

    他放下了手里的咖啡杯。

    十分钟后。

    查理斯的身体坐直了很多,表情严肃了很多,他的眼睛盯着论文中关于动态时间戳惩罚机制的推导公式,一动不动。

    “这种引入时间差作为衰减权重的数学模型……”

    查理斯滑动鼠标滚轮。