为什么要用agent+弹性算力网络做研究
2023年底,作为Alphago的爱好者,我看到openai即将发布GPT4o,并且听说有一个秘密的Q-star项目,即将产生颠覆产业的影响。
我感觉到坐不住了,于是开始尝试做第一个算法。
第一个算法是纯线性回归的算法,用于预测供应链产品的价格,我有深厚的金融背景,野心更大,除了价格,还想用算法来预测广告坑位的”利润表“。
但事实上,尝试快一年之后,我意识到这样的努力是白费的,因为当平台使用GPU进行超大集群大规模计算的时候,其实独立算法的空间就比较小了,如果还用传统的cpu串行计算逻辑,那几乎不可能存在算法有效的区间,也就是说,线性算法在并行算法面前,已经没有效益可言。
正如2026年8月底,萨姆.奥特曼在播客里回忆的那样:他们当时以为GPT4会颠覆一切,但是事实上,传统惯性是如此强大,导致了这一切发生的都特别慢,但这反而救了openai。
同时,其实也救了我们。
在一次失败的尝试之后,我们转向了更加具有公平性的“二级市场”,这次我们的目标是构建一个完全自主的强化学习的交易模型。
当我们基座转向神经网络来驱动算法的时候,第一个困难就是,需不需要去学校请一个教授,或者构建一个科学家的团队。
如果按照时下年薪来计算,请5个科学家,每个人年薪100万,大概是500万元/年的成本投入负担。
在这个问题上我们纠结了很久,幸运的是,我看到了卡帕西讲演那时还不出名的deepseek的视频。
一个清晰的决定涌上眼前:我们不需要构建一个科学家的团队,我们需要构建的是能自动做研究的agent。
正如十年前,那批下棋下得一般的人,构建的AlphaGo最终战胜了世界上最好的棋手。
在我们选定了用agent来做研究这条路之后,接着,便碰见了第二个问题:卡和算力从哪里来。
要构建自己的小型数据中心,至少也需要500万起步,如果使用消费级显卡又将极大的拖住研究的步伐,并且消费级显卡的价格在当时也不菲了。
我们在这个问题上,卡住了接近两个月,毫无进展。
在兜兜转转两个月之后,终于找到了答案,我们需要一个完美适配agent的弹性算力网络,这个算力网络需要足够大和宽,agent能同时启动100台机子来验证神经网络结构,同时在每一个有效验证树里,都能将记录保存下来,让agent能沿着收敛的路径持续验证。
我们大概花了6个月的时候来做这样的弹性算力网络,适配每一个数据中心规范,每一个卡种规范,搭建计算优化层......
绵绵的雪山延绵不绝。奇迹发生在,当我们接入的卡种超过15种的时候,我们的算力成本呈现直线下降的趋势。
很显然,卡种更多的时候,agent更加倾向于用一些20分钟的短碎步骤来验证他自己的想法,也就是环境变了,agent也会相应的调整研究策略。
我们已经全然不需要先在本子上,完成逻辑上的验证,然后充值几万的算力,战战兢兢的等待着开机,并且半夜爬起来睁着眼睛查看机子的反馈,生怕训崩了。
接着,agent+弹性算力网络让我们很快找到了最佳模型。
从最佳模型的结构回过头来看,原来那个优势信号是如此狭窄。
但如果按照传统路径,我们几乎百分之一百会确定失败。
并行研究和计算模式似乎挽救了我们。
这是我们推荐用agent和弹性算力网络来做研究的原因,除了负担直线下降,结果却翻倍的回馈。