【长文】时隔一年,stable diffusion有哪些变化呢?
bilibili吧
全部回复
仅看楼主
level 13
差不多一年前的这个时候,在了解了一些NAI的信息后我开始在自己的本地电脑上部署了当时的sd1.5的生态。
但玩了几个月感觉没意思了,就放下了。
这段时间刚好有点闲,回去看了下SD的最新版本,也就是SDXL。
感到乐子不少,就打算回坑玩玩[滑稽]
首先介绍一下SDXL是什么,SDXL是SD1.5这条技术路线上的终极产物,里面技术细节就没什么特别多好说的。
总而言之就是SD1.5的超级加倍版,参数量翻了几倍,摸到了人类对图像感知的临界点。
具体来说就是学啥像啥,不像SD1.5那样图像风格高度一致,看多了都是一眼AI。
虽然SDXL在绘图能力方面追上了midjourney v5,但受限于clip的性能,其并不如mid和niji那么方便易用。
但好在SDXL依然维持了stability ai的传统——真·开源,这使得该模型在用户社区中有着非常好的可拓展性以及无可比拟的可定制性。
你说是吧,close ai[滑稽]
下一代SD,也就是SD的V3版本在这几天也公布了一个预览版。
应该是受到了openai的dall e3的启发,他们用上了新的diffusion transformer架构,同时可以确定他们彻底抛弃掉了clip。
stability ai接下来应该必然是全力梭哈这条技术路线,他们放出来的几个大模型预览效果都完全可以和open ai的dall e3以及sora比肩了。
而stability ai的CEO也都明确了,他们依然会保持开源策略(具体是否会有商用限制还要到时候再看)。
你说是吧,close ai[滑稽]
扯远了,回到SDXL上。
SDXL是去年七月初发布的,起初社区里的人都不太待见这个新东西。
因为对硬件配置要求太高,部署难度高,易用性太差,训练难度过高等等问题生态发展很缓慢。
但随着webui支持了其fp8精度下的推理,社区大神对其技术的研究,到最近一段时间SDXL的社区生态已经被建设的很好了。
比起潜力已经被挖掘殆尽的SD1.5,XL明显更加优异的绘制性能显然是更吸引人的。
那么回到画制片人老婆这一点,我还是看到了novel ai v3版本后才对SDXL的性能到底有多强有一个明确的感知。
NAI3可以轻易的通过作品以及角色名称的提示词,来精确还原出这个角色,还可以风格词来定制一些绘制风格。
甚至可以通过一些抽象词汇来定制图像的情感传达方向。
但是十分可惜的是,NAI3不可能再像当年那样被泄露出来了,现阶段想体验这个最强的SDXL还是需要付费的。
但好在,民间大神也不甘示弱。
比如Animagine XL,他们在最新3.0版本里同样实现了和NAI3接近的效果。
实际上,这个模型使用了和NAI3类似的数据集来源和打标方式,但明显他们的数据集规模和打标强度要差不少。
它的性能距离NAI3还是存在不小的差距,但丝毫不影响其是目前为止开源社区里能被免费使用的,性能最好的二次元模型,没有之一。
例如输入【miyu/koharu/mika,blue archive】等提示词,便可以分别生成这些人设还原度较高,且十分精美的图像:
而从这几张例图可以看出,得益于XL模型在噪声随机分布方面的改进,已经很大程度上脱离了此前【一眼AI】的尴尬情况。
图片的明暗分布变得更加自由,更符合人眼的常识。
但这种程度的东西对我来说还不够,要解锁一些更加进阶的玩法那必然就要涉及到微调,定制自己更加中意和喜欢的模型。
我对这个模型目前的意见是:
1、色彩对比度偏灰,我对二次元艺术的喜好偏向于更高的对比度,更强烈的色彩风格。
2、角色的造型太普通了,我需要更加独特的,符合我的喜好的造型倾向。
于是我花了点时间,收集了二十几张我在网上浏览时发现的符合我喜好的作品。
【为避免争议,所有收集而来的作品均为原发布者声称为AI生成的图像】
在打标完成后,将Animagine XL 3.0作为基底大模型,调好学习画风的参数就丢进炼丹炉就开始训练了这个lora了。
我还配置了卷积层维度相关的参数,训练成了lora的变种模型,也就是lycoris。
经过一段时间的等待后训练完成,我根据每次保存时生成的样本图筛选了几个版本出来进行对比。
使用webui的xyz脚本功能生成如下表格:
综合对比下来,cute_v3_02这个版本我最满意。
画风学习的比较到位,且并未发现明显的过拟合现象,手指错误相对较少。
到这一版本应该是训练了21*25*3=1575步。
XL训练lora的效率比预想中的速度要快很多,在SD1.5版本中,应当是在2000-3000步左右才能获得相对效果较好的画风lora。
cute_v3_02版本的四张测试图片:
除了肉眼可见的偏向于萝莉、可爱风格外,还有着橙红色的线条、粗描边、扁平化的材质等特征。
色彩显著偏暖,亮度较高,明暗交接处有橘色的描边。
仅用21张图片作为素材,就可以微调到这么出色的效果,可见SDXL的性能和潜力。
感觉又可以玩上一段时间了[滑稽]
2024年02月25日 17点02分 1
level 8
社区模型一辈子都追不上公司模型
2024年02月25日 18点02分 2
@跳舞南瓜头🎃 错误的 现在nai3全网实时扒图
2024年02月27日 04点02分
论质量还是社区模型确实比不上,不过社区模型胜在更新度。比如跑同人图方面,nai3这些大模型都跑不了新出的角色,而sd1.5或者xl只要训练个lora就能跑了。
2024年02月26日 04点02分
level 13
SD1.5的迭代给我整得精疲力尽,加上SDXL我跑不起来,现在正在给NAI补票[呵呵]
我认为在二维图像数据和简单文字标注基础上的画图AI快到瓶颈了,现有的问题比如构图的精细控制、人体/物体结构细节,都需要更多对世界的“知识”(三维结构)和语言理解能力,需要架构上有所突破
2024年02月25日 18点02分 3
SDXL大概要什么配置啊?
2024年02月26日 01点02分
@sj5sj5 最低6g显存可以跑推理,最低8g显存可以跑lora,都是开启fp8精度的情况下。
2024年02月26日 02点02分
level 15
我是A卡[呵呵]
2024年02月25日 19点02分 4
秋叶启动器现在也有了zluda,理论上已经可以让a卡在Windows上跑出理论满速[太开心] 有人测试7900xtx可以跑到4070ti的速度,可以尝试一下[滑稽]
2024年02月25日 19点02分
@真·晕晕无双 哦是吗,赶紧试试
2024年02月26日 01点02分
巧了,我也是[睡觉]
2024年02月26日 04点02分
level 12
看来我真是好久没看ai了,好多模型已经看不懂了[滑稽]
2024年02月25日 23点02分 5
看不懂就对了[吐舌]
2024年02月25日 23点02分
level 15
之前用ai做了几个抱枕,细节部分用手绘+ai辅助,做出来的成品已经很满足了
2024年02月26日 01点02分 6
level 9
很多时候大家说一眼ai不仅是画风,还有细节上的模糊和错误,比如lz这几张还是很明显能看出是ai的
2024年02月26日 01点02分 7
这个就没办法了,哪怕是目前性能最优异的dall e3也没能解决生成的图像存在逻辑这种问题[滑稽]
2024年02月26日 01点02分
@真·晕晕无双 后面打字漏了,是【存在逻辑错误】
2024年02月26日 01点02分
level 2
技术方面的另一问题是人机交互,怎么告诉AI人想要什么。
2024年02月26日 01点02分 8
level 15
我满脑子只想画色图[阴险]
2024年02月26日 01点02分 9
level 12
这种有啥教程吗,我下了秋叶佬的整合包,然后图生图出来基本除了脸以外都是一坨扭曲的东西,这种精致的图是怎么搞出来的呀
2024年02月26日 02点02分 10
建议还是从文生图开始了解,图生图以及controlnet其实是相对更加进阶的东西。也可以看看Nenly同学这个up主的sd入门教程,虽然他教的比较浅,但综合观感是最好的。然后因为他的教程是去年的版本,你可以在秋叶启动器里也把sd版本切换到去年他教程发布时期的版本。
2024年02月26日 03点02分
@真·晕晕无双 主要文生图随机性太高了,很难整出想要的,我是想自己画个草图然后让AI上色细化的
2024年02月26日 03点02分
@igucrc- 关于你这种需求其实是属于进阶操作了,可以看这个教程【BV1Zj411h7od】。但我也还是建议你最好把整个软件的教程都过一遍,学到后期一些概念性质的东西没搞懂的话还是要回去补课的。
2024年02月26日 03点02分
@igucrc- 生成一坨,你是不是最基本的参数都没配好,vae什么不调整到合适范围内就是生出一坨的图
2024年02月26日 08点02分
level 11
这玩意进化太快了,没多久就出新东西[滑稽]
2024年02月26日 02点02分 11
level 11
我也赞同楼上所说的人机交互的重要性,这意味着十年后很有可能诞生一种专门的职业“咒语师”——其实就是ai训练师,依靠自己对ai的深刻理解准确地操纵和训练ai以产出商业级音画文作品。
还有可能出现一批专门为ai产物修缮细节的流水线工人,就像现在动画业的中割一职。
2024年02月26日 02点02分 12
level 10
结果到现在还是画不好手吗
2024年02月26日 04点02分 13
level 10
好高级的帖子,看不懂啊
2024年02月26日 04点02分 14
level 1
不明觉厉
2024年02月26日 05点02分 16
1 2 尾页