如果你觉得最近 AI 生成内容似乎又是一个「风口」,那么你并不孤独。因为在 arXiv 上,关于机器学习 + AI 相关的论文发布趋势呈指数级上升 —— 你根本没有时间来啃下那么多的论文,然后新的应用就出来了。
据几位投资人朋友说,国内拿到投资的在做 AI 生成图片社区的、各种开源算法改造的团队有几十家之多;身边的朋友也开始逐渐找我讨论有没有什么新的机会。
在喧闹声中,作为 Open AI 的创始成员,现任特斯拉人工智能高级总监, Andrej Karpathy 的这篇文章中的思考反而能让我们冷静下来。
在本文中,他通过完成下面几件事,来通过历史预测未来的发展
- 复原最早关于端到端的神经网络训练论文,1989 年 Yann LeCun 等人撰写的,基于反向传播的手写邮政编码识别 应用。当时的数据集仅有 7291 个,以及 1000 个神经元,用最当时最先进的服务器训练了三天,错误率为 4.09% ;
- 用今日的方法改造模型,增大数据集,发现错误率降低到了 1.25%,并且训练时间仅仅花费了M1 Mac 的 30 秒时间。
- 通过尽可能忠实地还原当时推导的过程,并用今天的技术,公平地改进它(从数据集到模型),然后利用这个事实推演未来的情况。
通过对论文的还原,Karpathy 的一些思考总结如下:
- 33 年来,宏观层面没有变化,依旧在建立由神经元层组成的神经网络架构,并通过反向传播和随机梯度进行端到端优化,只不过当年的规模更小。
- 33 年前的数据集是一个婴儿,只有 7291 个 16× 16px 的灰度图像,而今天的视觉数据集往往包括几亿个高分辨率的彩色图像(还在增加中),从像素角度来看,比当年的训练集多了 100,000,000 倍。
- 33 年前的神经网络也是一个婴儿,当年只有 9760 个参数,而现在的视觉模型往往几十亿个参数。自然语言模型往往达到数万亿个参数。
- 当时这个模型在最先进的工作站上训练了三天,现在在无风扇 Mac Air 上训练了 90s,速度提升了 3000 倍。
- 事实上,仅仅通过利用现代创造出来的新思路,调整模型、增强、损失函数和优化,就能将错误率降低 60%。
- 仅通过扩大数据集就能获得可观的收益。
- 更大的模型能带来更好的收益,但是这需要更多的算力和研发成本来进行训练。但如果回到 33 年前,最终会因为算力限制达到上限。
假如根据这个趋势来看,可以预测 33 年后,即 2055 年回望当下的感受是:
- 2055 年的神经网络与 2022 年的基本相同,只是更大
- 我们今天的数据集和模型看起来就像是个笑话,因为两者都会比现在大约大 1000 万倍。
- 一个人可以在个人设备上很快的进行模型训练,仅需几分钟即可。
- 我们今天的模型并不是最优的,仅仅改变模型的一些细节、损失函数、增强或优化,就可以将误差减半。
- 我们的数据集太小,仅通过扩展数据集就可以获得适度的收益。
- 如果不投资计算基础设施及研发来有效地训练这种规模的模型,我们是无法继续前进的。
这和计算机的发展历史相比,有许多相似之处:
- 在宏观层面上没有什么变化,只是变得更大了,它们仍然是由晶体管组成的。
- 早期的程序要简单得多,代码行数要少得多。
- 而它们的运行速度则要慢得多
- 架构优化,使用更多的内核、专用内存、缓存,使性能得到很大的提高。
- 通过增加代码的复杂性,可以获得一些收益
- 计算机的大小仍然决定着性能(但我们需要研发来很好地利用它)。
但他认为更重要的趋势是:
- 基础模型的发展,将会替代绝大多数从头开始训练的任务。基础模型由少数拥有大量计算资源的机构进行训练,大多数应用都是通过对网络部分进行微调、改进、缩小、垂直化进行实现。
- 极端来看,你根本不想(也不需要)训练任何神经网络。在 2055 年,你将会对一个 1000 万倍大小的神经网络进行自然语言描述,然后来执行某些任务。
有了这些更加宏观的视角之后,反而可以应用政治经济学的一些框架来进行思考:
- 生产工具的进化中
- 开源(如 Android)和非开源(如 iOS)的竞争过程的关键变量是什么?利用开源产品进行二次开发的产品,核心壁垒又在哪里(如 MIUI)。
- 如何结合现有生产工具来提高效率,比如支持 Figma / Photoshop(Alpaca) 的插件?
- 如何颠覆现有人力密集型的工具?如微软新发布的 Designer 会对 Canvas(可画)造成什么影响?或者 RunwayML 对 Premier 的影响?
- 如何在现有工作的上下游提供更有效率的工具?如专门生成 3D 模型材质的 Poly ?
- 生产要素的交换的要素到底是什么(数据集?Prmopt?Transforms?)?谁在交换?在哪里交换?(或许这是不懂技术的 PM 可以思考的方向)
- HungigingFace 号称是 AI 时代的 Github,上面有许多的 Transforms 可以进行训练和查阅。
- PromptsBase 中交易的是各种 AI 生成图片的提示词。
- 谁来消费这些内容?作为生产消费以及作为生活的消费,会有哪些新的形态产生?
- Novel AI 可以帮助作者生成动漫角色
- Make a Video 可以直接生成小视频
但不要被以上这些应用纷扰,也不必立即梭哈 All in。如贝佐斯所说:所有人都爱关心那些新的变化,但重要的是,未来哪些东西是不变的。
以及,未来并不存在于评论家嘴里,Karpathy 为我们展示了一种更加理性的预测未来的方式:如果你想进行 T°+x年的预测,你可以评估 T°-3x ~ 2x 之间,相同原因带来的相同影响。
延伸阅读:
