强化学习吞噬全世界
强烈推荐《哈萨比斯传》,我之前看过纪录片《思维机器》,觉得不好看,那说白了就是google造神的宣传片。
deepmind影响了整个ai发展历史是毋庸置疑的,算是西方的ai产学研体系的代表了。
这本书独特之处在于,以deepmind视角,描述了: 1) 深度学习和强化学习两条路径在2011年到2022年之间是如何演变的; 2) ai公司发展过程中长期面临的商业和研究的平衡;
1、深度学习和强化学习
deepmind以强化学习起家,开始训练ai玩游戏,然后切到围棋,之后进入医药领域。
openai的成立跟deepmind有很大关系,马斯克愿意掏钱给openai是因为担心谷歌收购deepmind之后垄断ai。
有个有趣的点,幻方用强化学习做量化,也大概是因为deepmind2016年围棋项目赢了之后,迫切需要赚钱,启动了量化项目,但最后没做成。幻方把deepmind没做成的事情做成了。很难讲梁文锋从哈萨比斯那里得到了多少经验。
深度学习流派核心人物就是辛顿,强化学习核心人物就是理查德萨顿。
理查德萨顿的学生席尔瓦是deepmind联创,是阿尔法狗的推手。如果有研究萨顿的轨迹就会发现,萨顿很早就认为扩大算力规模能带来更好的智能,也是唯一路径。
但就算deepmind给理查德萨顿开了一间独立的办公室,哈萨比斯和席尔瓦也不认为扩大算力规模是一条必经路径,他们执著于创造的agi,一种优雅的通用智能。
在他们眼里,算力应该服务于agi架构。
另外一边,被谷歌收购后,辛顿开始壮志已筹,他的学生伊利亚反而日渐进入创造期。2014年seq to seq的论文横空出世。这篇论文就是在探讨语言序列自回归的路线,当时看有点超前了,伊利亚思考这个问题很久很久了,为四年后gpt的诞生铺平了道路。
这四年对伊利亚是冷板凳,对deepmind是最高光的时光。
2016年,阿尔法狗打败李世石,全球吃瓜群众第一次在新闻里感受到了ai时代的跳动。
deepmind的成功给了所有ai研究员巨大的压迫感,似乎强化学习才是ai的主场。
改变点很快来了,2017年,transformer出现了。
书里说:伊利亚兴奋的从椅子上跳了起来。
全世界似乎只有伊利亚意识到了transformer意味着什么,甚至连他们的作者都没意识到,还以为这个只是一个提高翻译水平的手段。
书里有可惜的语气,因为哈萨比斯和席尔瓦应该意识到。但他们忙着跟谷歌闹独立,长达两年的扯皮似乎让deepmind陷入了停滞。
接着故事就很熟悉了,gpt1出来了。
哈萨比斯不屑一顾。
gpt2出来了,deepmind开始成立项目进行追赶。
接着gpt3,3.5陆续推出。
deepmind计划推出叫麻雀的chat软件,但很不幸openai提前两个月发布chatgpt。
接着openai一飞冲天。
谷歌内部慌了,调整了两年,将deepmind和谷歌大脑合并,哈萨比斯这才逐步推出gemini等语言模型。
虽然伊利亚赢得了语言模型的先发比赛,但他有句话评价deepmind的话让人印象深刻,就是:阿尔法zero的学习,几乎不需要数据,这很优美。
我看到这句评价,放下书,思考了片刻。
2、neolab的资本做空性
哈萨比斯比较牛的一点就是一开始他就表明了尽量不做商业。这是所有研究者共同会思考的问题,如果需要做商业,day 1就必须去营销,否则就没有生存下去的可能性。
但neolab如果一开始就产生很大的销售收入,注定不会有任何推动社会进步的研究成果。
哈萨比斯很幸运,碰到了彼得蒂尔,彼得蒂尔是典型的资本代表,彼得蒂尔是懂ai是什么的,除此之外,彼得蒂尔索性把哈萨比斯介绍给了马斯克,接着哈萨比斯因为马斯克而认识了拉里佩奇。
对于马斯克这种建设火星的目标的企业者,他对人类灭绝忧心忡忡,马斯克同样是识货的。
对于谷歌这样的公司,他们是最早沿着高校路线发展科技的代表,谷歌是识货的。
哈萨比斯卖身谷歌,也找到了商业和研究的平衡。
但这样的天性,导致了openai和马斯克的爱恨纠结,同时也导致了google丧失了语言模型这个最大的转折点。
所以,当我们启动一个领域的研究的时候,我们前面会面临什么?这是每个研究员都需要去思考的问题。
3、技术审美
里面有一段我特别受益。
讲了一个点:模型记住了互联网上所有的内容,他只是不会表达,思维链就是锻炼模型的表达能力。
openai推出o1前,推出了一个Q-star项目,这是一个改变一切的项目,Qstar顾名思义,就是评价tokens的Q值,也就是最佳策略,促使模型在一批tokens里,输出那个针对人的最佳结果。
正因为这个项目的推进,整个大模型行业从params by params变成了token by token时代,这是打开agent的step by step的重要转折点。
当然之后step by step,必然的又回到了ppo,回到了那个非常不稳定,但非常天才的强化学习结构。
但这些重要的节点都被ai快速的发展,一带而过。
但同时openai在做Q-star项目的时候,书里讲Gemini也在做了强化学习来对齐模型表达了,说明共同的技术理念的人,几乎同时想到了同样的技术手法。
更秒的是,几乎在同一时间,大洋彼岸的deepseek也关注到了这一点。
技术品味在ai时代快速验证。
这也是我坚持用强化学习来构建量化模型的根本原因。