level 13
真·晕晕无双
楼主
差不多一年前的这个时候,在了解了一些NAI的信息后我开始在自己的本地电脑上部署了当时的sd1.5的生态。
但玩了几个月感觉没意思了,就放下了。
这段时间刚好有点闲,回去看了下SD的最新版本,也就是SDXL。
感到乐子不少,就打算回坑玩玩![[滑稽]](/static/emoticons/u6ed1u7a3d.png)
首先介绍一下SDXL是什么,SDXL是SD1.5这条技术路线上的终极产物,里面技术细节就没什么特别多好说的。
总而言之就是SD1.5的超级加倍版,参数量翻了几倍,摸到了人类对图像感知的临界点。
具体来说就是学啥像啥,不像SD1.5那样图像风格高度一致,看多了都是一眼AI。
虽然SDXL在绘图能力方面追上了midjourney v5,但受限于clip的性能,其并不如mid和niji那么方便易用。
但好在SDXL依然维持了stability ai的传统——真·开源,这使得该模型在用户社区中有着非常好的可拓展性以及无可比拟的可定制性。
你说是吧,close ai![[滑稽]](/static/emoticons/u6ed1u7a3d.png)
下一代SD,也就是SD的V3版本在这几天也公布了一个预览版。
应该是受到了openai的dall e3的启发,他们用上了新的diffusion transformer架构,同时可以确定他们彻底抛弃掉了clip。
stability ai接下来应该必然是全力梭哈这条技术路线,他们放出来的几个大模型预览效果都完全可以和open ai的dall e3以及sora比肩了。
而stability ai的CEO也都明确了,他们依然会保持开源策略(具体是否会有商用限制还要到时候再看)。
你说是吧,close ai![[滑稽]](/static/emoticons/u6ed1u7a3d.png)
扯远了,回到SDXL上。
SDXL是去年七月初发布的,起初社区里的人都不太待见这个新东西。
因为对硬件配置要求太高,部署难度高,易用性太差,训练难度过高等等问题生态发展很缓慢。
但随着webui支持了其fp8精度下的推理,社区大神对其技术的研究,到最近一段时间SDXL的社区生态已经被建设的很好了。
比起潜力已经被挖掘殆尽的SD1.5,XL明显更加优异的绘制性能显然是更吸引人的。
那么回到画制片人老婆这一点,我还是看到了novel ai v3版本后才对SDXL的性能到底有多强有一个明确的感知。
NAI3可以轻易的通过作品以及角色名称的提示词,来精确还原出这个角色,还可以风格词来定制一些绘制风格。
甚至可以通过一些抽象词汇来定制图像的情感传达方向。
但是十分可惜的是,NAI3不可能再像当年那样被泄露出来了,现阶段想体验这个最强的SDXL还是需要付费的。
但好在,民间大神也不甘示弱。
比如Animagine XL,他们在最新3.0版本里同样实现了和NAI3接近的效果。
实际上,这个模型使用了和NAI3类似的数据集来源和打标方式,但明显他们的数据集规模和打标强度要差不少。
它的性能距离NAI3还是存在不小的差距,但丝毫不影响其是目前为止开源社区里能被免费使用的,性能最好的二次元模型,没有之一。
例如输入【miyu/koharu/mika,blue archive】等提示词,便可以分别生成这些人设还原度较高,且十分精美的图像:





而从这几张例图可以看出,得益于XL模型在噪声随机分布方面的改进,已经很大程度上脱离了此前【一眼AI】的尴尬情况。
图片的明暗分布变得更加自由,更符合人眼的常识。
但这种程度的东西对我来说还不够,要解锁一些更加进阶的玩法那必然就要涉及到微调,定制自己更加中意和喜欢的模型。
我对这个模型目前的意见是:
1、色彩对比度偏灰,我对二次元艺术的喜好偏向于更高的对比度,更强烈的色彩风格。
2、角色的造型太普通了,我需要更加独特的,符合我的喜好的造型倾向。
于是我花了点时间,收集了二十几张我在网上浏览时发现的符合我喜好的作品。
【为避免争议,所有收集而来的作品均为原发布者声称为AI生成的图像】
在打标完成后,将Animagine XL 3.0作为基底大模型,调好学习画风的参数就丢进炼丹炉就开始训练了这个lora了。
我还配置了卷积层维度相关的参数,训练成了lora的变种模型,也就是lycoris。
经过一段时间的等待后训练完成,我根据每次保存时生成的样本图筛选了几个版本出来进行对比。
使用webui的xyz脚本功能生成如下表格:

综合对比下来,cute_v3_02这个版本我最满意。
画风学习的比较到位,且并未发现明显的过拟合现象,手指错误相对较少。
到这一版本应该是训练了21*25*3=1575步。
XL训练lora的效率比预想中的速度要快很多,在SD1.5版本中,应当是在2000-3000步左右才能获得相对效果较好的画风lora。
cute_v3_02版本的四张测试图片:







除了肉眼可见的偏向于萝莉、可爱风格外,还有着橙红色的线条、粗描边、扁平化的材质等特征。
色彩显著偏暖,亮度较高,明暗交接处有橘色的描边。
仅用21张图片作为素材,就可以微调到这么出色的效果,可见SDXL的性能和潜力。
感觉又可以玩上一段时间了
2024年02月25日 17点02分
1
但玩了几个月感觉没意思了,就放下了。
这段时间刚好有点闲,回去看了下SD的最新版本,也就是SDXL。
感到乐子不少,就打算回坑玩玩
首先介绍一下SDXL是什么,SDXL是SD1.5这条技术路线上的终极产物,里面技术细节就没什么特别多好说的。
总而言之就是SD1.5的超级加倍版,参数量翻了几倍,摸到了人类对图像感知的临界点。
具体来说就是学啥像啥,不像SD1.5那样图像风格高度一致,看多了都是一眼AI。
虽然SDXL在绘图能力方面追上了midjourney v5,但受限于clip的性能,其并不如mid和niji那么方便易用。
但好在SDXL依然维持了stability ai的传统——真·开源,这使得该模型在用户社区中有着非常好的可拓展性以及无可比拟的可定制性。
你说是吧,close ai
下一代SD,也就是SD的V3版本在这几天也公布了一个预览版。
应该是受到了openai的dall e3的启发,他们用上了新的diffusion transformer架构,同时可以确定他们彻底抛弃掉了clip。
stability ai接下来应该必然是全力梭哈这条技术路线,他们放出来的几个大模型预览效果都完全可以和open ai的dall e3以及sora比肩了。
而stability ai的CEO也都明确了,他们依然会保持开源策略(具体是否会有商用限制还要到时候再看)。
你说是吧,close ai
扯远了,回到SDXL上。
SDXL是去年七月初发布的,起初社区里的人都不太待见这个新东西。
因为对硬件配置要求太高,部署难度高,易用性太差,训练难度过高等等问题生态发展很缓慢。
但随着webui支持了其fp8精度下的推理,社区大神对其技术的研究,到最近一段时间SDXL的社区生态已经被建设的很好了。
比起潜力已经被挖掘殆尽的SD1.5,XL明显更加优异的绘制性能显然是更吸引人的。
那么回到画制片人老婆这一点,我还是看到了novel ai v3版本后才对SDXL的性能到底有多强有一个明确的感知。
NAI3可以轻易的通过作品以及角色名称的提示词,来精确还原出这个角色,还可以风格词来定制一些绘制风格。
甚至可以通过一些抽象词汇来定制图像的情感传达方向。
但是十分可惜的是,NAI3不可能再像当年那样被泄露出来了,现阶段想体验这个最强的SDXL还是需要付费的。
但好在,民间大神也不甘示弱。
比如Animagine XL,他们在最新3.0版本里同样实现了和NAI3接近的效果。
实际上,这个模型使用了和NAI3类似的数据集来源和打标方式,但明显他们的数据集规模和打标强度要差不少。
它的性能距离NAI3还是存在不小的差距,但丝毫不影响其是目前为止开源社区里能被免费使用的,性能最好的二次元模型,没有之一。
例如输入【miyu/koharu/mika,blue archive】等提示词,便可以分别生成这些人设还原度较高,且十分精美的图像:





而从这几张例图可以看出,得益于XL模型在噪声随机分布方面的改进,已经很大程度上脱离了此前【一眼AI】的尴尬情况。图片的明暗分布变得更加自由,更符合人眼的常识。
但这种程度的东西对我来说还不够,要解锁一些更加进阶的玩法那必然就要涉及到微调,定制自己更加中意和喜欢的模型。
我对这个模型目前的意见是:
1、色彩对比度偏灰,我对二次元艺术的喜好偏向于更高的对比度,更强烈的色彩风格。
2、角色的造型太普通了,我需要更加独特的,符合我的喜好的造型倾向。
于是我花了点时间,收集了二十几张我在网上浏览时发现的符合我喜好的作品。
【为避免争议,所有收集而来的作品均为原发布者声称为AI生成的图像】
在打标完成后,将Animagine XL 3.0作为基底大模型,调好学习画风的参数就丢进炼丹炉就开始训练了这个lora了。
我还配置了卷积层维度相关的参数,训练成了lora的变种模型,也就是lycoris。
经过一段时间的等待后训练完成,我根据每次保存时生成的样本图筛选了几个版本出来进行对比。
使用webui的xyz脚本功能生成如下表格:

综合对比下来,cute_v3_02这个版本我最满意。画风学习的比较到位,且并未发现明显的过拟合现象,手指错误相对较少。
到这一版本应该是训练了21*25*3=1575步。
XL训练lora的效率比预想中的速度要快很多,在SD1.5版本中,应当是在2000-3000步左右才能获得相对效果较好的画风lora。
cute_v3_02版本的四张测试图片:







除了肉眼可见的偏向于萝莉、可爱风格外,还有着橙红色的线条、粗描边、扁平化的材质等特征。色彩显著偏暖,亮度较高,明暗交接处有橘色的描边。
仅用21张图片作为素材,就可以微调到这么出色的效果,可见SDXL的性能和潜力。
感觉又可以玩上一段时间了