推荐一个自然语言打标模型
stablediffusion吧
全部回复
仅看楼主
level 10
colourfulbird 楼主
模型:Gliese-Qwen3.5-9B-Abliterated-Caption
仓库里面有gguf版本,选这两个文件就行:
Gliese-Qwen3.5-9B-Abliterated-Caption.Q8_0.gguf
Gliese-Qwen3.5-9B-Abliterated-Caption.mmproj-bf16.gguf
如果你显卡不支持bf混合精度就选择:
Gliese-Qwen3.5-9B-Abliterated-Caption.mmproj-f16.gguf
2026年07月25日 14点07分 1
level 10
colourfulbird 楼主
使用Comfyui-QwenVL插件的QwenVL Advanced (GGUF)来加载模型。该插件需要使用llama-cpp-python库,自己可以到github上的JamePeng/llama-cpp-python/releases里面直接下载相应版本whl文件。如果你是40系及以下显卡,建议从llama-cpp-python-0.3.39之前的版本尝试,比如0.3.38这种。至于选择哪个子版本需要根据你的comfyui安装的cuda版本和python版本来定,pytorch版本则无所谓可以忽略。releases里面各个文件名都有提示,比如llama_cpp_python-0.3.38+cu130.basic-cp311-cp311这种就是cuda130+python3.11的组合,你需要知道你自己comfyui环境安装的是哪个cuda和python版本。
2026年07月25日 14点07分 2
level 10
colourfulbird 楼主
需要手动修改节点目录custom_nodes\ComfyUI-QwenVL里面的gguf_models.json文件,在末尾添加如下这段:
2026年07月25日 14点07分 3
level 10
colourfulbird 楼主
添加完后重启comfyui,刷新网页。然后QwenVL Advanced (GGUF)节点的下拉菜单会多出这个模型的选项,选择它之后就可以使用了(会自动下载模型,需要保持网络顺畅),使用方法和WD14 Tagger节点差不多。自然语言方面描述比Qwen3-VL-8B好上太多,并且9g大小的模型其实也不算太大。更重要的是支持瑟瑟打标,并且准确度还挺高,我的temperature设置为0.2,大部分图片都能一次过,个别可能需要更改种子抽卡。至于system prompt可以自己用gemini这类ai生成一套模板,根据自己需求来添加限制,比如段落的长短,是否描述画面风格,是否支持瑟瑟等都可以自定义,懒人可以直接使用QwenVL Advanced (GGUF)预设的preset prompt,但效果不如自定义system prompt好。
2026年07月25日 14点07分 4
示例工作流我放在了16楼,不会设置gguf_models.json文件的直接使用我压缩包的文件覆盖你的原文件就行。
2026年07月26日 09点07分
level 1
大佬,这是反推还是扩写啊?
2026年07月25日 16点07分 5
图片反推,当然你可以在反推的同时扩写,只需要在system prompt写入你的需求就行。
2026年07月25日 16点07分
@colourfulbird 所以这个主要是为了色色图的反推嘛?如果不是色色的,交给豆包反推和这个模型比效果如何?
2026年07月25日 16点07分
@wow_buy_wlss 不是色色的表现也很好,都可以胜任,最起码用于打标训练是没问题。
2026年07月25日 16点07分
@colourfulbird 哦,明白了,原来可以为了出标签训练用,这个9G太大了,不知道能不能运行起来,下来试试扩写效果。我现在用Qwen3.5-4B 2.5G的gguf,勉强可以和画图模型一起塞到内存里。
2026年07月25日 16点07分
level 4
感觉本地部署joycaption也不错
2026年07月25日 16点07分 6
joycaption我也用过,感觉有点老,对于system prompt响应很差,比如我想让它开头不要以a detailed anime-style photo of这种形式开头它不听话,很多时候还容易输出像thinking模型那样输出一堆思考过程。
2026年07月25日 16点07分
这东西有点笨。甚至对中文一知半解
2026年07月26日 05点07分
level 5
格式和长度的指令遵从程度如何
2026年07月25日 16点07分 7
最大tokens 4096,指令遵循比joycaption好上好几倍。
2026年07月25日 16点07分
level 5
自然语言打标的优势是什么呀,不太清楚
2026年07月25日 17点07分 8
不容易过拟合。tag打标一大劣势就是权重很容易渗透到个别tag里面,尤其在训练画风lora时严重,比如出现即使你用了触发词,画风也不明显,但是在某个时刻你用了某个提示词画风反而明显了,就是在训练过程ai偷懒将某些权重渗透到其他tag里面去了。
2026年07月25日 17点07分
@colourfulbird 谢谢,正好打算炼一炉画风,听下来感觉是起到传统tag打标的正则集的作用?
2026年07月25日 17点07分
@Monarcho1 是的,传统画风训练如果不使用正则集很容易导致触发词不灵敏。
2026年07月25日 17点07分
@colourfulbird 但是自然语言打标准确度好差啊,修改起来不如tag方便
2026年07月29日 05点07分
level 5
佬有推荐的反推模板吗?主要是不知道anima适合什么样的句式
2026年07月25日 18点07分 9
直接问gemini就行,就说你想使用某某模型给图片打标,要求生成自然语言描述,不要忽视nsfw内容,字数多少,是否需要描述风格或者光线什么的,根据需求自己定义,ai会给出一套模板,你复制下来粘贴到string multiple里面,然后接到QwenVL Advanced (GGUF)节点的custom_promot上面就行。
2026年07月25日 18点07分
level 8
joycaption有年龄限制,导致对身高识别不敏感,这个呢
2026年07月25日 23点07分 10
abliterated就是解除限制的,我可以用萝莉图生成萝莉提示词,像是萝莉欧派这种也可以生成,它是基本是0拒绝的。
2026年07月26日 00点07分
level 7
qwen3.5的9b微调模型很多,你这个有什么特点?
2026年07月26日 01点07分 11
看模型标签就知道了,abliterated+caption,就是去除限制和打标。
2026年07月26日 01点07分
2026年07月26日 01点07分
level 1
天哪,这个模型用llamacpp加载,只会不停的输出提示词,完全没法正常交流。
2026年07月26日 01点07分 12
用QwenVL Advanced (GGUF)节点加载。
2026年07月26日 01点07分
level 7
刚开始还能识别到模型,重启刷新一下就识别不到了,大佬,这是什么情况?[泪]
2026年07月26日 02点07分 13
你插件下载错了,是ComfyUI-QwenVL不是ComfyUI-QwenVL-Mod,而且要参考三楼修改gguf的配置文件。
2026年07月26日 03点07分
@colourfulbird 模型已经好了,但现在一运行就报错,问ai也解决不了·
2026年07月26日 04点07分
@liyef 用ComfyUI-llama-cpp_vllm这个插件的节点加载就行啦,要是批量打标的话,写个py脚本也行
2026年07月26日 07点07分
@94松果果 一运行就退出程序了
2026年07月26日 10点07分
level 7
这个和Qwen3.5-9B-Uncensored-HauhauCS-Aggressive有什么区别?
2026年07月26日 03点07分 14
Uncensored我看ai说是不能100%拒绝,它和Abliterated的不同之处在于Abliterated几乎是100%去限制,拒绝率几乎为0,Uncensored有一定几率会拒绝回答,别并且它的去限制方式是通过微调得到的,微调过程中可能会出现降智。
2026年07月26日 03点07分
level 6
這是打標特化的模型嗎?為啥都推薦用qwen3.5 9b?往上還有3.6和gemma4等等 也有很多比9b高的高參數的模型不是嗎?幹活用這些9b 12b的感覺經常抽風很弱智
2026年07月26日 03点07分 15
gemma4的问题在于对nsfw的识别能力约等于0
2026年07月26日 23点07分
1 2 尾页