我就说llm大于多模态,还有一堆人喷我
deepseek吧
全部回复
仅看楼主
level 7
渡边丽莎 楼主
2026年10月04日 14点10分 1
level 7
渡边丽莎 楼主
太变态了,我没深研究,应该就是类似svg矢量技术做静态图,然后用类似动画补件技术,让静态动画动起来。
完全依靠数据驱动,llm只需要输出数据文本即可。
而且llm现在的主攻方向是代码,不是做视频,唯一的缺点就是太慢了,2分钟的视频跑了十多个小时。
当初gpt输给了字节的sd,如果gpt和a/在视频领域打一架,把耗时压缩,质量提升,说不定能顺便一脚踢死sd了
2026年10月04日 14点10分 2
level 6
但是纯代码出图/视频是不是太花token了,特别是视频,就算三十帧也是每秒三十张
2026年10月04日 15点10分 3
你要知道 llm 才刚刚训练出图和视频,完全飞跃式的,9 月初的 llm,画图突然变猛了,也就是我第二个镇楼图的帖子的时候,一堆人喷我不懂技术。 结果不到一个月直接能出 mv 了,进步速度巨离谱,那再给一个月呢?如果主攻视频而非代码呢? gpt 和 a 出几个月后,说不定能和 sd 扳扳手腕了
2026年10月04日 17点10分
视频不一定要每帧重生成 只改变的部分就行
2026年10月04日 15点10分
写个脚本,控制好重绘范围就行了
2026年10月04日 20点10分
level 2
肯定没问题,扩散模型暂时来看是有上限的,而llm可以无限接近于人的操控
2026年10月04日 15点10分 4
level 7
opus5.5生成的短篇视频和真正的视频差别还是太大了
2026年10月04日 16点10分 5
能用就行,9 月初还是出图,我说发展眼光看待,一堆人喷我。结果不到一个月 mv 都能出了,再给几个月看看吧
2026年10月04日 17点10分
level 9
目前AI短剧的工作流就是LLM写提示词指挥扩散模型再组装吧,感觉片段级别的生成扩散模型依旧是最好用的工具
2026年10月04日 17点10分 6
level 9
多模态输出确实有待考虑,但多模态输入还是有必要的,不然你要让纯语言模型一个像素点一个像素点去猜这张图是什么东西吗[吃瓜]
2026年10月04日 18点10分 7
level 6
我认为Seedance一辈子不会被超越[不高兴]
2026年10月04日 18点10分 8
level 11
感觉以后自回归与扩散相结合的视频模型才是主流啊
2026年10月04日 19点10分 10
level 1
扩散便宜啊,大伙当然知道最优解是llm自己调工具剪
2026年10月04日 20点10分 12
level 9
除了seedance不知道,目前主流生图生视频都是DiT模型啊,同时使用transformer和diffusion。纯靠transformer算力会撑不住的吧
2026年10月04日 22点10分 13
level 1
虽然但是,agent工作流完全可以调用生图工具作为素材/参考啥的,又不是矛盾的东西。当然如果你说一个够好的aigc视频是agent制作还是扩散直出,那我也觉得agent是正确的[吐舌]
2026年10月04日 23点10分 14
level 1
什么叫输出数据文本即可,llm逐像素打印RGB值吗?还是说先按几何空间分割画面然后逐个填充?感觉这部分总会用到专用输出模块,人脑也不是语言模块和空间认知模块混在一起的
2026年10月05日 00点10分 15
1