求助各位大佬看看本地乞丐环境还有救吗
comfyui吧
全部回复
仅看楼主
level 3
【求助】笔记本4060跑ComfyUI大模型频繁掉卡报WHEA 17/CUDA 999,求大佬指点!
【设备环境】
* 机器类型:笔记本(独显 RTX 4060 Laptop 8GB + 16GB 物理内存,Intel 核显混合输出/独显直连环境均测过)
* 系统与驱动:Windows 11,NVIDIA Studio616.92-发布日期.Wed Sep 9,2026
* 软件环境:ComfyUI 桌面版 / 独立环境,PyTorch 2.12.1+cu130,Python 3.13
* 虚拟内存:已在固态硬盘设置了充足的虚拟内存(几十G)
【使用背景与操作】
正在跑一套基于 MiniMax H3 的动作迁移长视频生成工作流(包含 Ref2VA + SDPose 全身姿态),主模型为约 20GB 的 INT8 混合去噪模型,文本编码器为 Qwen3-VL 32B(使用 qwen3vl_32b_minimax_h3_int8_convrot.safetensors)。
【具体故障现象】
1. 每次并不是在 KSampler 高负载算力满载(功耗拉满去噪)时报错,而是在刚起步、加载超大文本编码器(约 15G~26GB 权重分片进显存)的瞬间触发掉卡。
2. 控制台最底层报错为:
* hostbuf_file_reader_read: device copy failed result=999(CUDA Error 999: unknown error)
* 或者原生调度切片时的 r.copy_(weight, non_blocking=non_blocking) 异步拷贝直接抛出 torch.AcceleratorError: CUDA error: unknown error。
3. 查 Windows 事件查看器,系统日志里有明确的 WHEA-Logger Event 17(PCI Express 根端口已更正/未更正硬件错误),随后就是 DWM 闪烁黑屏、显卡驱动被系统 TDR 重置掉线。
【已做过的排查】
* 内存/显存防爆参数:加了 --disable-pinned-memory --disable-cuda-malloc,排除了锁页内存把 16GB 物理 RAM 吃死的问题。
* 旁路了工作流中强行预扣显存的节点(ReservedVRAM 节点已关)。
* 主模型的 Attention 切片已经设得很保守(head_chunks: 10,chunks: 4)。
* 原版 VAE 损坏的 JSON 解码问题已修复,模型文件哈希完整。
目前看像是在笔记本 8G 显存面对 20G+ 超大单体模型时,超大规模内存-显存异步分页传输瞬间打爆了 PCIe 总线带宽,导致触发 PCIe 硬件级 WHEA 17 报警与 WDDM 熔断。
请教各位大佬:针对笔记本移动端 4060 跑这种超大模型切片,WHEA 17 有没有特定的 BIOS PCIe ASPM(链路电源管理)优化、注册表 TdrDelay 调优,或者 ComfyUI 限制单次非阻塞传输流深度的启动参数?多谢!
网页链接这是我在github上传的日志,因为我刚开始用comfyui,很多东西我看不懂,都是让本地Harness传的,后面日志规范会好好优化,再次感谢愿意费时费力翻这坨垃圾堆的大佬。
2026年10月04日 05点10分 1
level 3
动作迁移绕过aimdo,光用cpu跑文本编码器倒是能出货,但2个小时只能出6s[委屈]
2026年10月04日 05点10分 2
level 7
没有
2026年10月04日 08点10分 3
level 3
不整了,上云了[吐舌]
2026年10月04日 17点10分 4
1