产品沉思录 产品沉思录 产品沉思录 产品沉思录
用 Midjourney 生成了上百张图片后的一些思考

用 Midjourney 生成了上百张图片后的一些思考

通过使用 Midjourney 生成图像,探索了 AI 创作的潜力和影响。Midjourney 被视为一个实验室,强调算法效果和社区互动。创作过程涉及理解词汇和绘画技巧的结合,AI 可以通过简单的提示生成复杂的图像。观察到 AI 创作可能改变版权业务、辅助创作、启发设计,并推动创作革命。同时,社群在 Discord 上的互动促进了学习和创作的快速发展,展现了新媒介的独特特性。

趁着假期折腾了一番 AI 创作,表情如李安:我不懂,但我大受震撼。主要研究了 disco diffusion v5 和 Midjourney,尤其是后者实在是让人上瘾。本文不打算讨论各个算法之间的优劣和技术方案(毕竟也不懂),只是单纯的写下一些粗浅的思考,用来抛砖引玉。

在官网的描述上,Midjourney 把自己定位是一个实验室,并非是艺术工作室,而是专注于探索能赋予人们新能力的媒介和工具。这个实验室极其低调,对外的资料很少,官网也只有一个 Discord 的入口而已。目前已经知道的是 DiscoDiffusion 的创造者之一 Somnai 在其中工作。

Midjourney 有两部分比较有趣的,一部分是算法效果本身,另一部分是架设在 Discord 上的社区,接下来单独来讲:

01一张画的背后,是理解和技法,最终是数学

作为一个曾经学了很多年美术的人,可以说看到这些效果时被震撼的说不出话来。这种感觉就像习惯了在物理世界在暗房中冲洗和修改照片的人,突然看到了 Photoshop 的那种震撼 —— 因为之前的许多习惯和努力,或许都要重新再思考。

这并不是否认绘画的价值,而是一种思维方式的转变。曾经在 09 年做了一年的美术外包,客户是外国人,基本上拿到的需求是这样的:一个会魔法的精灵族的房屋,波斯风格,需要有长廊和二层楼,魔法师在这里学习魔法。下面就是我们根据这段简单的的描述和参考了对方给的资料,加上自己一些脑补绘制的效果图 。

如果再把这个过程拆解,其实这段文本背后依赖于大量的资料查找,比如「波斯」,比如「精灵」,比如「魔法」,每个文本背后都隐藏着数不清的概念,需要创作者从中选择自己想要的并且进行改进,然后依靠个人的绘画能力生成许多个版本,最终依靠「功能&审美」选择出来了一个方案不断改进。当时被打回来修改很多次,因为外国人的对「波斯」的理解和我们对「波斯」的理解大相径庭,只有良好的绘画技法是无济于事的。所以这里面核心是两个能力:词汇理解 & 绘画技巧

关于词汇的理解,目前还不知道 Midjourney 背后使用的 CLIP(即基于对比的图片 - 文本学习的跨模态训练模型)是哪个,但是常见的也有几亿对参数。比如在测试中 AI 能相对好的理解唐朝街道和神秘的吴哥窟。

关于绘画技巧,其实还能继续拆解为数学问题:

只不过有了 Midjourney 之后,这个过程就交给了计算机的 AI,我们能从其提示语(Prompt)中窥见一些结构:

当年几十个步骤的创作,可能现在变成了一句话加上 50s 的等待时间,而这背后就从感性变成了数学计算问题。

穆夏的风格,一个长发女子望向圆月,有花瓣飘舞。
穆夏的风格,一个长发女子望向圆月,有花瓣飘舞。
浮世绘风格,飞流直下三千尺的英文翻译。
浮世绘风格,飞流直下三千尺的英文翻译。

就像 Photoshop 最终并非只是用来处理照片,还衍生出来了许多别的用法,PS 本身就成为了一种创造的媒介。而当绘画技巧和理解不是问题之后, Midjourney 为代表的这种 AI 创作媒介,会带来什么样的变化?通过在我社群中的观察,发现了一些可能性:

在实践的过程中,我也对人机共生有了新的理解:人机共生并非总是脑后插管,或者植入某种芯片,更多的是思维上的融合。

这张画风格出自 Ivan Aivazovsky ,俄国著名画家,在 1900 年去世。所以他不可能看过香港的九龙城寨,以及理解什么是赛博朋克的风格。

而灵感则来自于押井守《攻壳机动队》的一个经典镜头,即在九龙城寨仰望飞机即将降落启德机场。后期由于飞机 AI 无法识别,所以是通过 PS 贴图,以及用 PS 贴合了一些电线和广告牌,调整了颜色的明暗。

在这个创作过程中,我和 AI 更多的是在探讨:这个画面应该怎么样,应该有什么不该有什么,应该增加什么减少什么,它是在搞不定的最终我会拿 PS 来修复,而它的许多创造有些是惨不忍睹,有些又超出我的预期。在我们不断地配合下,各司其职,最终生成了一个作品。

问题是,这张画,算是谁的?这种创作过程,又和传统的绘画过程有何不同呢?

02像社群的产品,像产品的社群

与 Disco Diffusion 需要一堆麻烦的配置不同,Midjourney 主要架设在 Discord 上。

只需要在群内@机器人,然后输入上述指令,就可以每次生成四张图片,你可以选择其中一张继续扩展细节,也可以选择基于某张继续生成。

U 代表选择某张继续,V 代表选择某张继续生成衍生内容。
U 代表选择某张继续,V 代表选择某张继续生成衍生内容。

想要创作的时候,需要将命令发在群里并 @Bot ,然后 Bot 将会开始为你创作。通过和 Bot 的简单互动,就能得到最终的作品。同时基于 Discord 的接口,你可以在 Midjourney 的官网上看到自己的作品、Feeds、内容精选,以及对应不同的权限。

这意味着,除了高级付费会员,其他任何人的任何创作都能被其他人看到,而在群里面的人更像是在学习魔法的麻瓜,不断捕捉别人的关键字和风格,试图创造出来不一样的东西。

Discord 的频道中,各种人在尝试各种风格
Discord 的频道中,各种人在尝试各种风格
通过接口将 Discord 的内容读取到网站上,可以进行浏览和收藏,以及跳转到对应的内容。
通过接口将 Discord 的内容读取到网站上,可以进行浏览和收藏,以及跳转到对应的内容。

群内的学习速度非常之快,像极了生物的进化。比如有人带来了一个前所未有的艺术家风格,或者用了一组特殊的词汇来描述镜头,又或者是开了个巨大的脑洞,其他人很快就会来学习。在社区中创作,在社区中学习,在社区中获得荣誉,这和传统 web2.0 时代做一个 App 然后让别人下载,再拉起一堆微信群和开个公众号,是完全不同的演化思路。而任何新人加入,都只能通过已经付费的用户邀请加入群才能使用,这样新人到了之后能很快地在其他人的影响下开始创作,形成正向循环。而当这些新人掌握技巧后,会自然分流到主题群进行专业的创造(比如我就一直待在环境群里面生成各种风景图。)

另一方面,由于 Discord 足够丰富的接口,可以将社群中的内容提炼并沉淀出来,把快速流动的信息变成相对静态的资料库,这样对于新加入社群的人来说也能看到历史上的精华(比如优秀的作品和一些关键词),每个人也能从川流中退出,回到自己的主页,对已有作品进行欣赏和再创作。从这个视角来看,微信群最终归于沉寂是必然,因为既无法通过机器人提供高频的交互,也无法通过接口将内容和第三方共享沉淀群的历史价值,真的是很让人遗憾的事情。

Discord 让社群天然成为了产品的一部分,而 AI 产品本身需要被训练的特性,也因为社群不断激发和迭代。实话实说,在这一刻,内心有些羡慕这样的基础设施和产品。

03小结

遇到一个新的媒介,最忌讳的其实是用老的思路来使用。更重要的是,理解这个媒介本身的特性,然后用这个特性来创造截然不同于之前东西,就像电影语言和游戏是不同的,印刷出版和电子出版也是不同的 —— 但可悲的是,任何媒介都会被老的媒介影响很久,直到新一代没有受到老媒介的新人诞生,才能为这个媒介找到最终的语言。

我兴奋于 AI 能绘制出来 1817 年风格的油画作品,被构图和颜色所震撼;但也观察到许多人并不用来做绘画,有用来生成房屋内的设计,有用来生成封面,有用来窥探某个历史事件的画面,有人用来做工业设计,有人用来模拟各种材质的效果,让已故的画家绘制未来的风格,也让梦境中的画面跃然纸上。

所以我唯一知道的是,不知道自己不知道的东西,还有太多,不要总是惯性思考。

PS:Midjourney 还在内测,所以可以先看推荐内容的教程手工安装一个 Disco Diffusion 来尝鲜;如果有想要注册体验 Midjourney的小伙伴可以来联系我,还有十多个名额(名额有限,送完即止)。

推荐阅读: