按照大会的规定,岑言团队必须在现场向评审专家进行设备调试与Demo预演,证明他们的开源代码具备实际演示价值,才能最终保留这间会议室的使用权限。
评审专家们在第一排落座,看不出喜恶地看着台上的岑言。
“岑教授,你们的思路确实很新颖。”
为首的评审主席开口说道。
“但今天我们要看到实际运行效果。”
“请开始你的表演。”
岑言站在讲台侧面向卢卡斯微微点头,卢卡斯如臂驱使,随声而动。
这是一套完整的英德机器翻译系统。
岑言看着台下空旷的会议厅。
“为保证预演的真实性,各位评审可以随意提供一段德语或英语的长文本。”
岑言说道。
一名评审专家立刻拿出一份专业的德语计算机学术期刊,随机挑选了其中包含了大量专业术语和复杂从句的一整页内容,将其输入到系统的文本框中。
“开始。”
岑言开口,卢卡斯执行。
屏幕上的进度条只闪烁一瞬。
几秒后,长达数千字的准确英文翻译结果直接呈现在输出框内。
同时,界面的右侧实时生成了多头注意力机制的权重热力图,清晰地展示了模型在翻译每一个单词时,是如何将注意力分配到整个句子的不同位置上的。
评审专家仔细核对翻译结果。
几分钟后,几名专家的脸上全都露出了难掩的惊叹。
翻译结果不仅语法精准,对专业术语的上下文连贯性处理更是达到了母语者水平。
更重要的是,处理这样长度的文本量,推理延迟竟然几乎可以忽略不计。
“难以置信的并行处理效率。”
评审主席看着屏幕上的注意力热力图,赞叹连连。
“岑教授,组委会非常期待你们明天的正式报告。”
顺利,高效,简单。
现在开始,没有什么能够阻拦岑言到NIPS的大会上好好地爽爽装上这个逼了。
翌日,NIPS 2016大会正式开幕。
巴塞罗那会展中心的主会场内,三千多名来自全球的AI学者和企业代表入席。
开幕式后的主旨演讲环节,是每年NIPS大会的重头戏,代表着未来一年人工智能领域的风向标。
组委会邀请了三名在深度学习领域享有泰斗级声望的资深学者上台发言。
扬・道芬登台,他的PPT上满是各种复杂的门控机制公式。
“在处理长距离序列依赖的问题上,长短期记忆网络(LSTM)依旧是我们目前最好的工具。”
他在台上侃侃而谈。
“此前LSTM/GRU仅用于RNN时序,GLU第一次把门控公式通用化到CNN、并行前馈网络,我想或许会和岑的Transformer能够迸发出一些火花来。”
很明显,他对于岑言团队所提出来的Transformer架构是很有好感的。
他看向岑言的时候,微笑颔首,岑言也点头回以谢意。
这就相当于有人在今天这场大会,真正地把Transformer作为未来的核心方向,进行了一种推广。
哪怕岑言相信Transformer必然成为未来,可目前的大佬站台也同样重要。
但学术圈是这样的。
有人支持,自然也就有人反对。
“对于前面道芬先生的思路,我有一点异议。”
第三位上台的泰斗看起来脸要冷得多。
“我们注意到最近有一些关于注意力机制的讨论。不可否认,注意力机制在特征对齐上是一个不错的辅助模块。但如果有人妄想用这种辅助模块去完全替代循环网络,那无疑是本末倒置。”
这位泰斗的目光扫向岑言,语气中带着几分告诫。
“放弃时间维度的循环记忆,去追求单纯的矩阵并行计算,这无疑是抛弃了序列建模的核心根基。而且,其实只要算力足够,RNN的深度堆叠可以解决绝大多数的上下文理解难题。”
大家顺着他的目光看去。
那里坐着岑言和他的团队。
这些目光里有人夹杂着探究与质疑,也有人满怀期待。
大家都想看看这位敢于公开底牌的年轻天才面对老派权威质疑,又会作何反应。
岑言却只是微笑点头。
周志云坐在他旁边,眉头紧锁。
“这老东西,真是不见棺材不落泪。代码都开源了,还在这里死鸭子嘴硬,一看就是没有自己亲手试一试的。”
周志云撇着嘴吐槽道。
台上的泰斗似乎因为岑言没有反驳而感觉到了自己精神上的胜利,或许也因为他名里带Q,昂首挺胸地下了台,像只斗胜了的大公鸡。
岑言却宠辱不惊地为他鼓掌。
“习惯就好,利益和惯性会蒙蔽人的双眼,不过没关系,今天下午的专题讨论会,我们会帮他们把眼睛睁开。”
下午,两点
NIPS大会安排的Symposia在各个分会场同步开启。
岑言团队所在的“自注意力机制与序列建模新方向”专题报告厅,原本只安排了五百个座位。
但在距离开场还有半个小时,报告厅就已经被挤得水泄不通。
没有任何一个空的座位,不仅有些位置的扶手都有人坐,就连过道、后排空地与会议室门外,都站满了慕名而来的参会者。
大家都很想亲眼看看这历史性的时刻。
岑言上台时,扫了一眼。
估摸着这厅里都挤了有小一千人,倒是得多可怜可怜那被男上加男的椅子。
他走到台前,一切顺利。
可就在岑言讲解架构机制的时候。
前排一名来自苏世黎理工学院的教授突然举手打断了岑言的节奏。
“岑教授,抱歉打断您。”
这名学者站起身,直视岑言。
“目前学界对于完全抛弃RNN机制还是存在着极大的争议。”
看样子是来质疑的。
只不过......
岑言看着这位教授的眼神,怎么总觉得他不像是来质疑的,还是说他特地抢前排?
“来这里之前,我们都已经了解这些,我们不需要您展示这些我们已经滚瓜烂熟的东西,现在还请您现场展示Transformer处理长序列和实际应用的真实状态,否则大家有理由怀疑,贵团队在预印本网站上公布的数据只是一场缺乏实据的学术炒作。”
啧,真尖锐的质疑啊。
一旦现场演示翻车,或效果不达预期,那后果会如何,不用多说了。
但他没有丝毫慌乱。
因为他现在懂了,这哥们不是来质疑,明明是来送助攻的。
看看他那越发明亮和狂热的眼神。
岑言点了点头。
“我非常赞同您的观点,理论的优劣,最终需要工程落地来检验。”
岑言朝卢卡斯打了个手势。
“既然大家对实际效果更感兴趣,那我们就跳过理论宣讲环节,直接看成果。”
岑言退到屏幕一侧,让出视野。
“公平起见,我们现在运行的是目前市面最普通的双路泰坦消费级显卡服务器。”
岑言向台下的学者介绍道。
“go。”
大屏幕左侧的终端窗口里,海量的英德翻译数据开始飞速滚动。
右侧的监控面板上实时指标变化。
“各位请看屏幕右侧的数据。”
“在完全抛弃循环和卷积结构、仅使用多头注意力机制的情况下,我们的模型正在并行处理所有的序列数据。”
台下不少人不由自主地坐直,想看得更清楚一些。
“大家都很熟悉正常RNN的处理速度,答案显而易见。”
Transformer的速度,足足是同类型RNN架构的四倍以上!
同步启动的BLUE测试分数也出来了。
和之前公布的分数相差无几。
这是在众目睽睽之下,用普通卡跑出来的数据?
众人面面相觑。
似乎......在适用性上,Transformer比他们想象中的还要强大。
岑言看着台下那些因震撼而呆滞的面孔。
“这就是自注意力机制的实际效果。”
岑言笑眯眯地扶了扶话筒。
“我觉得,它应该是完全超越了目前所有同类型产品的效率和准确率。”
岑言保持微笑。
“那么......”
“现在我们可以继续讨论理论了吗?”
讨论呗,谁还能讨论得过您啊。
岑爹。