产品沉思录 产品沉思录 产品沉思录 产品沉思录
AI 领域的「数据网络效应」

AI 领域的「数据网络效应」

liufei

AI领域的用户数据可以快速提升模型性能,形成正向循环,导致赢家通吃的现象。这种现象被称为数据网络效应,意味着获取更多用户数据后,产品体验变得更好。以Midjourney为例,该平台通过社区互动和用户行为数据的积累,强化了其数据网络效应。创业者在面对冷启动时,可以通过人工规则和数据标注来解决初期问题,从而迈向数据网络效应的成功路径。

最近在观察和思考AI领域的商业竞争时,逐渐意识到了一个很显著的现象:AI 领域的用户量以及背后的行为数据,是可以快速补充进模型,形成正向循环的。这样以来,就会存在先入壁垒了,而且会赢家通吃。这是个很有意思的逻辑推演。

我在翻阅了一些材料后,发现还真的有对这种效应的描述,「数据网络效应」,即 Data Network Effects。

这篇就分享下我整理的资料,以及我的看法。

▎网络效应和数据网络效应

网络效应是平台经济最重要的属性。从电商、社交,到外卖和网约车,再到如今的短视频,形成了网络效应的平台,就有很难撼动的体验加成,这能构成先入壁垒。

在滴滴工作的时候,对这方面深有感触。

我们假设某网约车平台 A 在一个城市有 100 个司机和 1000 个乘客,另一个平台 B 在这里有 10000 个司机和 100000 个乘客。那么他们的体验差是 10 倍或者 100 倍吗?可能不是,体验差可能是 10000 倍。

因为对于即时需求而言,运力达到一定阈值,才能给乘客带来基本的体验,也就是每次打车,等待时间小于 5 分钟。试想一个城市只有 100 个司机,那分散在各处的乘客,大概率是打不到附近的车的。

而反过来说,一个平台的运力多,乘客就更愿意使用,会带来更多乘客,司机在注册和使用的时候也会考虑有更多乘客、更容易接单的平台,进一步让平台具备了对司乘两侧的吸引力。

网络效应的定义就是,规模能带来体验,在双边市场里,就指的是规模能同时带来两侧的吸引力。这样的网络效应,同样发生在微信、淘宝、美团外卖和抖音。

那数据网络效应是什么?

指的是,当你获取更多用户数据后,产品体验也变得更好、更吸引力。这件事在近些年各位的体会肯定更深刻,毕竟大多数产品都有了自己的个性化推荐。

你使用这个平台的产品比较多,贡献的行为数据越多,产品给你的推荐就越精准。接下来你就越依赖这个平台。

在更大范围里,比如平台面对整体大规模的用户,也能通过共性的需求来判断普适的爱好,做出更好的推荐(比如内容平台,对男性直接推小姐姐,百试不爽)。

所以数据网络效应并非是 AI 领域独有的。或者可以说,广义上的 AI 就包括了推荐引擎,涉及大数据分析和推理的产品,都有潜力具备数据网络效应。

▎一个案例:Midjourney

近半年间,在数据网络效应方面最有创造力、叫人印象深刻的就是 Midjourney 了。它一跃成为全球最受欢迎的 AI 绘图产品,它的制图在小红书和抖音广泛流传,很多时候以假乱真。

产品沉思录之前应该聊过 Midjourney 以及创始人的故事,这里不多做项目的介绍了,还是说说它在数据网络效应方面的尝试。

Midjourney 广受好评的就是利用了 Discord 社区,让社区真正围绕绘图流转起来(这也是我最近的反思:社区/社群必须有个有价值的 core。大多数 DAO 没有这个,哪怕技术再高明、分钱再公平也没意义。)

一方面,新人可以低成本地模仿别人开启自己的绘图之旅,另一方面,社区 feed 里大量的精选、搜索、分类功能,可以让用户始终都有新事物可以参考、尝试。

这些过程,至少可以积累以下的行为数据:

这就是强化学习的精髓了。单纯提供了工具,用户会无从下手、无法贡献数据;用户在用产品,但并不知道用户是否满意。这些都无法让数据循环起来产生价值。

Midjourney 使用的还是开源的 Stable Diffusion 作为底层模型,但在绘制大多数场景时,效果已经远超 SD。且由于 SD 的硬件要求苛刻、配置搭建复杂,也没有针对性地优化,让 Midjourney 这个闭源的项目成为了主流。

而且考虑到数据网络效应,我深信,它会变得越来越主流。

▎迈向数据网络效应之路

作为观察者,数据网络效应往往是事后总结。而作为创业者,或者中小公司的负责人,发现具备数据网路效应的潜力,但要怎样迈向数据网络效应呢?

冷启动对于大多数产品来说可能确实是困难的。一个绘图模型,没有大量的用户标注,效果就不会好;各种推荐模型也是类似。

因此对于多数产品,前期不得不面对的问题就是:人工解决。

人工解决有两个层面。

第一个层面,就是通过规则,而不是神经网络等相关的算法去解决体验的问题。可以让工程师书写大量的规则,比如内容产品,对怎样的新用户推荐怎样的内容,有简单粗暴的判断,先保证基础的体验,让产品运转起来。

就像在滴滴早期,派单的逻辑十分简陋,就是距离优先。关键时刻,还有人工调度团队去指派司机;在缺少乘客的时候,公司动员大家跑到路上去打车。这是人工的方式填补冷启动的空缺。

后来滴滴的派单算法就复杂很多,而且是依据大的模型做全局最优的预测。这是在有了足量数据之后才能做的事情。

人工解决的第二个层面,就是大量的标注。

算法引擎还是先用上,不过可以安排员工,或者外包团队,模拟真实用户的使用,用这种比较 tricky 的方法完成基础数据的补充。

更 tricky 的方法,就是再用一个 AI 训练出来的假人去反复使用。像 ChatGPT 在很多方面已经能模拟真实的人的言行,那让它去做标注员也未尝不可(只是可能有点贵?)

以上这些能作为一个基本的了解,希望能对你有启发。

更多对于网络效应或者数据网络效应的参考: