三位教授,五位学长学姐,八个人,十六道视线,全部钉在陆丰身上。
似乎都在等陆丰说结果,陆丰则是被盯得浑身起鸡皮疙瘩。
叶国栋最先打破了沉默,他扶了扶眼镜。
“理论上可行,但……你能用具体的模型把它表达出来吗?”
“比如公式或者说简易的模型。”
“当然。”陆丰回答得干脆。
开玩笑,我能说出来,还不能验证?
徐云教授下意识地从笔筒里抽出一支全新的白板笔,递了过去。
陆丰接过笔,拔掉笔帽,转身走向那面巨大的白色书写板。
五名大三的学生不自觉地挺直了腰杆,身体微微前倾。
陆丰没有立刻书写,他先是在白板的左上角画了一个简单的二维网格。
“首先,是状态空间S的定义。”他的声音在安静的机房里回荡,清淅而沉稳,仅是开口就让人神往,这感染词条的力量着实变态。
“我们将整个城市划分为N个局域,每个局域就是一个状态。“
”的士的状态s,就是它当前所在的网格编号i。”
笔尖在白板上划过,留下一行行简洁的数学符号。
“然后,是动作空间A。对于任意状态s,的士的动作a,就是选择驶向相邻的某个局域j。”
“最关键的,是奖励函数R。”陆丰的笔速加快,一行行公式开始在白板上蔓延。
“奖励R(s, a)由两部分构成。第一部分是执行动作a后,在新局域j接到乘客的概率P,乘以这单的预期收益E。”
“第二部分,是空载行驶的成本C,包括时间成本和燃油成本。”
计算机学院的孙毅教授看得连连点头,他已经完全被陆丰的思路吸引了。
这套建模方式,简洁、优雅,而且可计算性极强。
。”陆丰转身,看向那五位已经有些呆滞的学长学姐。
“传统的动态规划需要知道完整的
他没有给任何人提问的机会,直接在白板中央,写下了那个强化学习领域最内核的方程。
“我们不需要知道全局地图,也不需要预测未来。每辆车都是一个独立,它只需要根据自己当前的Q表,选择能带来最大Q值的动作。”
“每一次成功的载客,都是一次正向奖励。”
“每一次长时间的空载,都是一次负向惩罚,通过海量的真实运营数据进行迭代训练,这张Q表会不断收敛,最终趋近于最优解。”
陆丰一边讲,一边在方程旁边补充着每个参数的物理意义。
学习率α,折扣因子γ,状态s,动作a。
计算机学院的李浩和王哲对视一眼,都从对方的反应里看到了难以掩饰的震撼。
因为他们也没有想到陆丰在数学方面的造诣居然也这么高。
不一会儿,一整面巨大的白板,已经被写得满满当当。
从状态空间的离散化,到奖励函数的设计,再到Q表的迭代更新算法,形成了一个完整而自洽的逻辑闭环。
叶国栋脸上的笑容已经彻底压不住了,他转头看向身边的徐云和孙毅,那表情仿佛在说:看看,看看我发现了什么宝贝!
徐云教授也是不住地点头,而孙毅则直接掏出手机,对着那面写满公式的白板,从不同角度连拍了好几张照片。
那五名学生已经彻底放弃了思考,这不是一时半会就能搞定的。
陆丰写完最后一个字符,将笔帽盖上,随手放在讲台桌上。
他转过身,看到三位教授在那边挤眉弄眼,笑得跟中了五百万彩票似的。
不是,你们能不能先让我回去坐下?
三位大佬站在这里,五位学长学姐坐在那里,就我一个人杵在中间,这算怎么回事?公开处刑吗?
叶国栋似乎是察觉到了陆丰投来的视线,他立刻收敛了笑容,清了清嗓子,试图恢复自己作为教授的威严。
“咳咳……非常好。”他的声音里带着一丝还没完全压下去的兴奋。
“这个思路,非常新颖,而且逻辑严谨,可行性极高。”
他转向那五个还处在石化状态的学生。
“说实话,当初这道题在国赛赛场上,没有一个队伍想到用强化学习的思路来解,最好的成绩,也不过是用了一个带时间窗的遗传算法,模型复杂,而且求解精度很一般。”
这番话,无疑是给陆丰的方案盖上了官方认证的印章。
陆丰冲着几位老师点了点头,默默地走回自己的座位坐下。
他刚一坐下,旁边的陈静就凑