说实话,2023年那件事我还记得清清楚楚。美国科罗拉多州博览会的美术赛上,一张名为《太空歌剧院》(Théâtre D’opéra Spatial)的数字艺术作品,直接拿下了年度冠军,还顺带抱走了一个普利策艺术奖提名。创作者叫杰森·艾伦,他用的工具不是画笔,不是相机,也不是雕塑刀,而是Midjourney。
那一刻,全球创意圈炸锅了。画家们愤怒,设计师们恐慌,但也有一群人——比如我这样的技术派——兴奋得睡不着觉。因为大家突然意识到:绘画不再是“手”的艺术,而是“脑”的艺术。
今天,2024年的AI绘画技术已经彻底成熟了。你不需要懂透视,不需要会调色,甚至不需要有一台高性能电脑,就能生成比很多初级设计师做得还好的商业海报。但这背后,究竟藏着怎样的技术逻辑?版权的边界又在哪里?那些曾经靠画图吃饭的创意工作者,饭碗是不是真的被打碎了?
别急,咱们今天不聊虚的,把这套东西掰开了、揉碎了,讲得连你家十岁的小朋友都能听懂。
一、 谁在画?谁在看?——AI绘画到底是个啥?
很多人有个误区,觉得AI绘画就是“把照片拼在一起”或者“随机乱画”。其实,这完全是两码事。
1.1 核心原理:扩散模型与“降噪”
你可以把AI绘画想象成一个“在混乱中找回秩序”的过程。
想象你站在一间完全黑暗的房间里,地上散落着成千上万块五颜六色的乐高积木,乱成一团。现在,你告诉我:“我要一座城堡。”
传统的AI(早期的GAN,生成对抗网络)是让你慢慢把这些积木搭起来。但现在的技术(Diffusion Models,扩散模型),恰恰相反:它先给你看一堆完全随机的噪点(就像电视没信号时的雪花屏),然后一步步把那些“不像城堡”的噪点去掉,直到一座清晰的城堡浮现出来。
这个过程,叫“去噪”。
为什么这很重要? 因为Midjourney、Stable Diffusion、DALL-E 3这些工具,它们不是在“画”画,而是在“筛选”画面。它们在数百万张人类已有的画作、照片、设计稿中,学习到了“城堡长什么样”、“光影如何投射”、“色彩如何搭配”。当你输入提示词时,它是在这个巨大的“知识海洋”里,为你打捞出一张最符合你描述的图片。
1.2 三大巨头,各有所长
在2024年,市面上主流的AI绘画工具有三巨头,它们的性格完全不同:
| 工具名称 | 开发商 | 特点 | 适合人群 | 成本 |
|---|---|---|---|---|
| Midjourney | Midjourney Inc. | 美学天花板。生成的图片艺术感极强,光影、构图天生自带“高级感”。 | 想要快速出大片、追求艺术效果的设计师、艺术家 | 付费订阅(约$10/月起) |
| Stable Diffusion | Stability AI | 可控性之王。完全本地部署,可以精确控制每一根线条、每一个像素的位置。插件生态极其丰富。 | 技术宅、程序员、需要高精度控制的商业设计师 | 免费开源(需自备显卡) |
| DALL-E 3 | OpenAI | 听话的助手。与ChatGPT无缝连接,对复杂文字指令的理解能力最强,逻辑性最好。 | 普通用户、非技术背景、需要精准还原文字描述的人 | 包含在ChatGPT Plus订阅中 |
举个例子: 如果你想生成一张“穿红裙子的小女孩在雨中打伞”,DALL-E 3可能会给你一个非常准确但略显平庸的图片;Midjourney可能会给你一个光影绝美、氛围感拉满的图片,但小女孩的脸可能有点怪;而Stable Diffusion配合ControlNet插件,可以让你精准指定小女孩的站姿、雨伞的角度、甚至光线的来源,虽然学习曲线陡峭,但上限最高。
1.3 给小朋友的解释:AI画家是一个“超级看书”的机器人
如果你家里有小朋友,可以这样告诉他:
“宝贝,你看这个机器人,它读过世界上所有的图画书。它看过很多猫、很多狗、很多房子、很多城堡。虽然它自己不会拿笔画画,但它记得所有的样子。
当你告诉它‘画一只会飞的猫’,它就闭上眼睛,从脑海里所有的图画书里,找出‘猫’的样子,再加上‘翅膀’的样子,然后拼在一起,再擦掉不对的地方,最后给你变出一只会飞的猫!
所以,它不是‘创造’,它是‘超级整理’。”
这个比喻虽然简单,但抓住了本质:AI是基于已有知识的重组与再创造。
二、 零成本实战:普通人如何用Stable Diffusion生成商业海报
既然提到了“零成本”,那我就不得不提Stable Diffusion。虽然它需要一台配置不错的电脑(最好有NVIDIA显卡,显存8GB以上),但它一旦部署成功,永远免费,无限制生成,且图片完全属于你。
这不再是“玩具”,而是真正的“生产力工具”。
2.1 环境搭建:别再折腾代码了,用这个“一键包”
对于普通用户,自己写Python代码安装Diffusers库简直是噩梦。我强烈推荐“秋叶Stable Diffusion整合包”(Bilibili上搜“秋叶酱”)。
它是一个绿色免安装版本,解压即用,内置了WebUI界面,就像操作一个网页一样简单。
步骤:
- 下载整合包(约4-5GB,取决于你选择的核心)。
- 解压到一个没有中文路径的文件夹(比如
D:\SD\)。 - 双击
webui-user.bat,等待浏览器自动打开。 - 下载一个大模型(Checkpoint)。这是AI的“大脑”。推荐从Civitai网站下载ChilloutMix(写实人像)或RevAnimated(动漫风格)。把模型文件放入
models/Stable-diffusion文件夹。
2.2 实战演练:生成一张“夏日清爽饮料”商业海报
假设你是某饮料公司的兼职设计师,老板给你5分钟,要一张“冰镇汽水,夏日,清爽,高饱和,商业摄影风格”的海报。
第一步:写提示词(Prompt)
提示词是AI绘画的灵魂。一个好的提示词结构通常是:
[主体描述] + [环境/背景] + [艺术风格] + [光影/镜头] + [质量修饰词]
错误的提示词:
一瓶可乐,夏天,好看。
AI的反应: 随便画一个瓶子和太阳,画面杂乱,没有商业感。
正确的提示词(英文,因为大多数模型对英文理解更好):
(masterpiece, best quality, photorealistic:1.2), 1 bottle of ice-cold cola, condensation on the bottle, splashing water droplets, summer sunset, beach background, bright lighting, high saturation, commercial photography, 8k, sharp focus, depth of field, fresh feeling, vibrant colors, advertising poster layout.
中文解析:
(masterpiece, best quality, photorealistic:1.2):强调高质量、逼真,权重略高。1 bottle of ice-cold cola:主体,一瓶冰镇可乐。condensation on the bottle:瓶身上的水珠(这是体现“冷”的关键细节!)。splashing water droplets:飞溅的水珠(增加动感)。summer sunset, beach background:夏日夕阳,海滩背景。bright lighting, high saturation:明亮光照,高饱和度(符合饮料广告特征)。commercial photography, 8k, sharp focus:商业摄影,8k分辨率,焦点清晰。depth of field:景深(背景虚化,突出主体)。advertising poster layout:广告海报排版。
第二步:调整参数
在WebUI界面右侧,你会看到各种参数:
- Sampler(采样器): 推荐
Euler a或DPM++ 2M Karras。前者速度快,后者质量高。 - Steps(步数): 设为
20-30。太少画面模糊,太多浪费时间且边际效益递减。 - CFG Scale(提示词相关度): 设为
7-9。太高会导致画面过饱和、失真;太低则AI不听你话。 - Resolution(分辨率): 商业海报通常需要高分辨率。先设为
512x768或768x512(竖版或横版)。如果需要更大,可以开启“高清修复”。
第三步:生成与筛选
点击“Generate”,你会看到4张(默认)图片。AI不会一次就给你完美的,它给你的是一个“概率云”的结果。
技巧: 不要只选第一张。看哪张构图最好,哪怕细节错了,也可以用它作为底图,使用“图生图”功能修改。
第四步:高清修复(Hires. fix)—— 让海报商用
直接生成的图片分辨率很低,打印出来会模糊。我们需要使用“高清修复”。
- 勾选
Hires. fix。 - Upscaler(放大算法): 选择
4x-UltraSharp或R-ESRGAN 4x+。这些算法能在放大图片的同时,补充细节,而不是单纯拉伸像素。 - Hires steps: 10-15步。
- Denoising strength(重绘幅度): 设为
0.3-0.5。这个值很关键:- 太低(<0.3):细节变化少,可能保留原图瑕疵。
- 太高(>0.5):AI会大幅修改原图内容,可能完全改变你的构图。
- 0.4是黄金平衡点,既能增加细节,又不破坏原有构图。
点击“Generate”,等待几分钟,你就会得到一张4K甚至8K分辨率的商业级海报。
2.3 进阶技巧:ControlNet——精确控制构图
这是Stable Diffusion区别于Midjourney的最大杀手锏。
如果你有一个现成的排版草图,或者想让人物保持特定的姿势,你可以使用ControlNet插件。
场景: 你有一个模特摆pose的照片,你想把这个pose应用到另一个场景中,生成一张“该模特在太空穿宇航服”的海报。
- 在WebUI右侧找到
ControlNet单元。 - 上传你的参考图(模特的照片)。
- 选择预处理器(Preprocessor):
openpose(提取人物骨架)或depth(提取深度信息)。 - 选择模型(Model):对应刚才的预处理器。
- 设置
Control Weight为0.8(高权重,严格遵循姿势)。 - 输入新的提示词:
astronaut, space background, futuristic, high tech。 - 生成。
你会发现,新图片里的人物姿势、角度,与你提供的参考图完全一致,只是换了服装和背景。这对于商业设计来说,简直是神技——你不需要从头设计构图,只需要用AI填充内容。
三、 普利策争议背后的法律迷局:AI画的作品,归谁?
回到开头那个《太空歌剧院》的案例。杰森·艾伦用Midjourney生成的图片,真的算他的“作品”吗?他能不能因为这张图,告别人侵权?
3.1 美国版权局的立场:不算
2023年,美国版权局(USCO)做出了一个明确的裁定:纯粹由AI生成的作品,不受版权保护。
理由是:版权法保护的是“人类作者”(human authorship)的创作成果。AI只是一个工具,就像相机一样。但不同的是,相机只是记录光影,而AI是“生成”图像。既然杰森·艾伦没有亲手画每一笔,他也没有对最终图像进行足够程度的“创造性控制”,那么这张图就属于公共领域(Public Domain)。
这意味着什么? 意味着任何人,包括你的竞争对手,都可以免费使用《太空歌剧院》这张图,甚至把它印在T恤上卖,而杰森·艾伦无法起诉他们侵权。
3.2 那如果我在AI生成的基础上,进行了大量后期处理呢?
这就复杂了。版权局现在的态度是:“人类贡献的部分”可以受保护。
比如,你用Midjourney生成底图,然后在Photoshop中精心修饰了50%,加入了大量手绘元素、重新调色、调整构图。那么,这50%的修改部分可以申请版权保护。
实战建议:
- 如果你是想保护自己的设计,务必保留原始提示词、生成日志、以及你在PS中的分层文件。这些是你的“人类创作”证据。
- 不要指望整张AI图都有版权,但要确保你在其中投入的智力劳动得到保护。
3.3 中国的情况:更灵活
相比美国,中国法院对AI生成内容的版权认定更为积极。
在“李某诉刘某侵害作品信息网络传播权纠纷案”中,法院认为,用户使用AI绘画工具生成图片,如果体现了用户的个性化选择、判断和投入(如精心设计的提示词、多次迭代、参数调整),那么该图片可以构成作品,享有著作权。
关键点: 法院看重的是“人的智力投入”,而不是“人的亲手绘制”。
所以,在中国,一个精心调教、反复迭代的AI海报,很可能被认定为你的作品。但这依然处于法律灰色地带,不同法官可能有不同判例。
3.4 对创意工作者的影响:饭碗还在,但端法变了
恐慌者说: “AI会取代插画师!” 乐观者说: “AI只会取代不会用AI的插画师!”
事实介于两者之间。
被取代的是:
- 低端、重复性、低创意的商业绘图工作(如:简单的Logo草图、配图、电商白底图)。
- 缺乏审美积累、只会模仿的画手。
被强化的是:
- 创意总监/艺术指导:他们需要的是“好点子”,而不是“好手感”。AI让执行成本趋近于零,创意的价值被放大。
- 熟悉AI的工作流:能快速用Midjourney出概念图,再用SD做精细化控制,最后用PS修图的复合型人才,薪资反而更高。
- 版权运营者:谁能更好地保护和处理AI生成内容的版权,谁就能在新规则下获利。
给年轻朋友的忠告: 如果你是想学画画养家糊口,不要只练“手头功夫”,要练“眼高手低”——眼高(审美、创意、构图能力),手低(愿意用工具,包括AI)。未来的画家,更像是“视觉导演”,指挥AI这个“执行团队”去干活。
四、 避坑指南:AI绘画的那些“坑”与“雷”
虽然AI很强大,但它不是万能的。以下这些问题,你可能迟早会遇到:
4.1 版权问题:训练数据的原始来源
这是目前最大的雷区。Midjourney、Stable Diffusion的训练数据,是从互联网上爬取的数亿张图片,其中包含了大量未经授权的艺术家作品。
- 艺术家的愤怒: 很多知名插画师起诉Midjourney,指控其侵犯版权。目前案件仍在诉讼中,尚未有最终判决。
- 风险: 如果你生成的图片,与某位在世艺术家的风格高度相似,理论上存在侵权风险。虽然目前尚无大规模判例,但建议避免生成与特定在世艺术家风格极度雷同的商业作品。
4.2 商标与肖像权
- 名人肖像: 不要生成拜登、特朗普、泰勒·斯威夫特等名人的虚假形象用于商业宣传。这不仅涉及版权,还涉及肖像权和诽谤风险。
- 品牌Logo: AI有时会“魔改”知名品牌的Logo。如果你生成的海报上出现了类似Nike钩子、麦当劳M的标志,即使略有不同,也可能构成商标侵权。商用前务必人工检查。
4.3 伦理与偏见
AI会从训练数据中学习人类的偏见。
- 如果你输入“CEO”,AI可能默认生成白人男性。
- 如果你输入“护士”,AI可能默认生成女性。
- 对策: 在提示词中明确指定多样性,如
diverse group of leaders, male and female, different ethnicities。
4.4 “幻觉”问题
AI经常犯低级错误:
- 手指数量不对: 手永远是AI的噩梦。生成人手后,务必用PS修正手指。
- 文字乱码: 虽然DALL-E 3和Midjourney v6在文字生成上有了进步,但依然不可靠。商业海报上的文字,务必后加,不要指望AI直接生成可阅读的文字。
- 逻辑错误: 比如“一个男人手里拿着一个苹果,苹果里有另一个男人”。这种超现实主义的错误,需要人工筛选。
五、 2024年最新趋势:多模态与视频生成
绘画只是开始,2024年的AI创意浪潮已经蔓延到了视频和3D。
5.1 Sora与Runway Gen-3
当OpenAI发布Sora,Runway推出Gen-3时,AI绘画就升级成了AI视频生成。
- 文生视频: 输入一段描述,生成几秒钟的高质量视频。
- 图生视频: 上传一张Midjourney生成的图片,让它动起来。比如,让那张“夏日可乐海报”动起来,水珠滚动、气泡上升、海浪拍打沙滩。
这对广告行业是核弹级别的冲击。以前拍一个广告片需要剧组、摄像机、灯光师,现在只需要一个提示词。
5.2 实时生成与交互
Stable Diffusion的InstantID和IP-Adapter技术,让你可以在几秒钟内,将一个人的脸,换到任何AI生成的图片中,且保持风格一致。
这意味着,你可以用AI生成100张不同背景、不同姿势的“虚拟模特”照片,用于电商展示,而无需雇佣真人模特。
六、 结语:工具无罪,人心有衡
回到那个普利策奖争议。杰森
