KEN’S CAT LOG

图像与视频生成 AI 新闻 — 2026-09-08

闭源领域出现了一个新类别:并非依赖扩散模型,而是由 LLM 智能体(GPT-6 Astra)操作 GUI 工具和 Blender 来创建图像与 3D 视频。这一话题在 Reddit、X 和 Bluesky 上分别独立走红。与此同时,开源动态主要集中在 Lemmy 的 ComfyUI 社区和 YouTube 的评测频道,在 Bluesky、Pinterest、Reddit 和 X 上几乎没有观察到。

图像与视频生成 AI 新闻 — 2026-09-08

本次横跨六个平台的调查中,最突出的现象是:闭源领域的一个新类别在三个平台上独立成为话题——不是“扩散模型的进化”,而是 LLM 智能体(GPT-6 Astra)直接操作 GUI 工具和 Blender,生成图像与 3D 视频。开源领域整体曝光较少,但开发者社区依然活跃:Lemmy 的 !stable_diffusion 社区在同一周连续发布了 5~6 个面向 MiniMax H3 视频模型的 ComfyUI 加速节点;YouTube 上则持续评测 Flux.2/Flux 2 Klein 与 Qwen-Image 之间的主导权之争。Pinterest,以及 Reddit 和 X 中的大多数帖子,都集中于闭源产品名称(Midjourney、Sora、Veo、Runway、Kling、Nano Banana、Seedream 等),开源模型的专有名称几乎没有出现。总体而言,Reddit 和 Pinterest 上格外明显的共同趋势并非纯技术本身,而是“内容究竟是不是 AI 生成”的真实性争论,以及“AI 智能体代替人类角色与工作”的社会影响讨论。

跨平台观察

  • GPT-6 Astra 的智能体式视觉生成在三个平台上独立成为话题:Astra 操作 Blender 进行渲染一事,分别出现在 Reddit(r/DefendingAIArt)和 Bluesky(@simonwillison.net)上;使用 Astra 创建 3D 城市的演示则在 X 上引发了模仿潮(@synabreu@GulatiYajat)。这次调查中最大的跨平台主题,不是“扩散模型的升级”,而是“LLM 智能体接管现有工具来绘图和制作 3D 内容”这一新视角。
  • 视频生成的“角色与场景一致性”仍未解决,评价依旧两极分化:Reddit(r/generativeAIr/aivideomaking)与 X 上(赞扬 Seedance 2.5 的 @atlas_remake,以及指出复杂场景崩坏问题的 @Aiden_Tech_Ai)在同一时期都出现了对同一问题截然相反的观点。
  • 开源的存在感因平台而极不均衡:Lemmy 的 !stable_diffusion 十分活跃,面向 MiniMax H3 的 ComfyUI 节点(包括 ComfyUI-Ref2VA-VSA)出现密集发布;YouTube 也持续出现 Qwen-Image、FLUX 与 Wan 2.2 的对比评测视频。相反,在 Bluesky、Pinterest、Reddit 和 X 上,几乎找不到包含开源模型专有名称(新版 Stable Diffusion、FLUX、Wan、HunyuanVideo 等)的帖子。多个平台的限制说明中都指出,这究竟意味着“开源确实没有热度”,还是“搜索词偏向闭源而导致遗漏”,仍是一个结构性弱点。
  • 真实性争论与社会影响与技术趋势并行:多个平台独立观察到,讨论重点从“如何生成”转向“如何辨认与怀疑”:例如真假难辨的帖子(Reddit 的 r/isthisAI,以及 r/pj_explained 与 r/NewRockstars 对索尔画面的争论)、自动标记 AI 图像的 Bluesky 服务 aimod.social、纽约州州长选举的假视频(Bluesky/404media),以及 Pinterest 上带有“FAKE”印章的缩略图。

按平台分析

Reddit 的 12 个讨论串中,AI 支持/反对争论与真伪判断类社区(r/antiai、r/aiwars、r/DefendingAIArt、r/isthisAI、r/pj_explained、r/NewRockstars)的互动量,高于专门讨论图像与视频生成 AI 的社区(r/generativeAI、r/aivideomaking、r/GoogleFlow、r/freetoolsAI)。由于只使用了一个搜索词,几乎无法比较闭源与开源的讨论情况。

X 的核心是 NVIDIA 发布 Sol-H3(速度超过实时播放的视频推理),以及个人用户在本地复现该能力;另一焦点是使用 GPT-6 Astra 创建 3D 城市所引发的模仿潮。在 40 条收集内容中,直接与图像或视频生成 AI 有关的仅占少数,且克罗地亚周边 Explore 地区趋势混入,带来了大量无关帖子。

YouTube 因页面采用 JavaScript 渲染,无法获得播放量和频道订阅数;不过确认存在同时覆盖闭源产品(Midjourney V8.2、Grok Imagine、Google Gemini“Omni”)和开源产品(Qwen-Image-2.0、FLUX、Wan 2.2)的对比与解说频道。在六个平台中,它是最适合比较闭源与开源阵营的来源。

Bluesky 的搜索 API(app.bsky.feed.searchPosts)始终返回 403,因此不得不改为逐一查看已知账号(如 @simonwillison.net、@404media.co 等)的动态,未达到“分析 20 条帖子”的完成标准。具体的开源帖子只有一条:Qwen 3.7 27B 的本地运行报告。

Lemmy 中,Midjourney 转向医疗超声扫描仪的风波(!techtakes)是单条内容中热度最高的话题;而开源阵营则拥有六个平台中最丰富的一手信息,包括 MiniMax H3 面向的 ComfyUI 节点密集发布,以及围绕 Qwen-Image-Bench 的基准竞争(LLaDA-Image、Boogu-Image-0.1)。

Pinterest 在工作器预收集的 50 个 Pin 中核查了 30 个。由于是未分类的单一查询,绝大多数内容都是闭源产品比较或教程信息图;没有发现任何开源模型或项目名称。其 manifest 中也没有帖子时间与互动数据,因此无法判断时效性。

值得关注

  • MiniMax H3 / Sol-H3 的超实时视频推理,以及 ComfyUI 优化节点的密集涌现 — X(@xieenze_jr)/Lemmy(ComfyUI-Ref2VA-VSA 等)。值得观察云端发布与开放权重的本地复现会在多大程度上相互追赶。
  • GPT-6 Astra 智能体式视觉生成的扩散 — Reddit(r/DefendingAIArt)/Bluesky(@simonwillison.net)/X(@synabreu)。关注后续模仿范围会扩大到什么程度。
  • FLUX.2/Flux 2 Klein 与 Qwen-Image 的开源主导权之争 — YouTube(SECoursesUrban Decoders)。超过 700 项测试的结果将如何影响后续采用。
  • Midjourney 医疗设备转型(Midjourney Medical)风波的后续 — Lemmy(经由 pivot-to-ai.com)。图像生成公司的转向究竟只是玩笑,还是会真正实施。
  • AI 视频滥用于政治广告(纽约州州长选举)的余波 — Bluesky(404media.co)。关注监管与平台是否会采取行动。
  • 视频生成“角色与场景一致性”问题的改善情况 — Reddit(r/generativeAI)/X(@Aiden_Tech_Ai)。一体化工具是否真的正在接近解决方案。

建议

  • 将 GPT-6 Astra 的智能体式视觉生成(操作 Blender、生成 3D 城市)作为独立追踪主题,在后续周期持续监测。
  • 为避免遗漏开源发布,下次应在全平台增加“FLUX”“Stable Diffusion”“Qwen-Image”“Wan”“ComfyUI”等专有名称作为搜索词。
  • 考虑到 Bluesky 搜索 API 的 403 可能持续,应提前扩充需监控的账号列表。
  • Pinterest 无法获取发布时间和互动数,因此不宜用于要求时效性的突发新闻比较,应限制为工具认知度的长期观察来源。
  • Midjourney 转向医疗设备一事的真实性与实际情况尚未确定,在出现一手来源(Midjourney 官方公告)前,避免作出确定性引用。
  • 将 Lemmy 的 !stable_diffusion 和 YouTube 的评测类频道作为追踪开源动态时优先核查的核心来源。

数据质量

Bluesky(搜索 API 始终 403,只能逐账号核查,未达到 20 条的完成标准)和 Pinterest(manifest 不含发布时间或互动数,时效性不明;单一查询中没有开源提及)是信息最薄弱的平台。Reddit 与 X 仅使用单一搜索词,即简报标题本身,因此并未有意收集能够明确比较闭源与开源的帖子;结果是开源话题集中在 Lemmy 和 YouTube。YouTube 则受 JavaScript 渲染限制,无法获取播放量与频道订阅数。

各平台总结

Reddit

Reddit — 图像与视频生成 AI 新闻

主要讨论场所(子版块)

收集到的 12 个讨论串分别来自 12 个不同的子版块。专注于图像/视频生成 AI 的社区很少,电影与假内容验证类、AI 文化争论类子版块更为显眼。

子版块 成员数 收集的讨论串数
r/whenthe 813,975 1
r/isthisAI 406,607 1
r/antiai 317,903 1
r/aiwars 167,158 1
r/generativeAI 151,385 1
r/RemoteWorkers 75,332 1
r/DefendingAIArt 72,770 1
r/pj_explained 96,256 1
r/NewRockstars 15,523 1
r/freetoolsAI 7,887 1
r/aivideomaking 6,517 1
r/GoogleFlow 1,789 1

搜索词仅为“Image and Video Generation AI News”,结果相比图像/视频生成 AI 专业子版块(r/generativeAI、r/aivideomaking、r/GoogleFlow、r/freetoolsAI),更偏向 AI 赞成/反对争论类(r/antiai、r/aiwars、r/DefendingAIArt)和“这是 AI 吗?”验证类(r/isthisAI、r/pj_explained、r/NewRockstars、r/whenthe)。

大家的反应
  • GPT-6 可通过鼠标操作“手绘”插图,还能伪造延时绘画视频(讨论串 2,r/antiai,7,013 分、1,009 条评论,2026-09-05,https://www.reddit.com/r/antiai/comments/1w81kdd/)。该帖讨论的不是扩散模型,而是让 LLM(GPT-6)使用鼠标和键盘在数字绘图软件中作画,甚至能生成看似真实的延时绘画记录。热门评论 u/Nayutantantan(2,507 分)绝望地表示:“我连拍记录用延时视频的动力都没了。”
  • GPT-6 “Astra” 使用 Blender 创建照片级渲染图(讨论串 9,r/DefendingAIArt,143 分、13 条评论,2026-09-06,https://www.reddit.com/r/DefendingAIArt/comments/1w970uy/)。讨论焦点在于:AI 并非直接生成视频,而是 AI 智能体操作 Blender 完成渲染。u/TheMaliciousSquid 表示:“GPT-6 看起来会在视觉领域最强,想知道它会不会在编程上超过 Claude。”
  • 面向 Google Flow 的扩展“AutoFlow”支持连续视频生成(讨论串 12,r/GoogleFlow,12 分、6 条评论,2026-09-01,https://www.reddit.com/r/GoogleFlow/comments/1w4eeyp/)。新增“Continue from Last Frame”功能,可把前一段片段的最后一帧自动带入下一段的第一帧;还支持多次生成的队列管理与参考图管理,并预告了将多个片段无缝合并为一条视频的功能。
  • “免费 AI 图像生成工具”的推广帖集中吸引需求(讨论串 3,r/freetoolsAI,39 分、48 条评论,2026-09-04,https://www.reddit.com/r/freetoolsAI/comments/1w6w0rj/)。介绍一项宣称免费、无限制、无需注册服务的帖子引发评论。u/Puzzleheaded_Lab4757 认为“这帮我省了数百美元和大量时间”,但 u/thecragmire 则质疑“它的运营成本从哪来?”。
  • 长视频与角色一致性依旧是 AI 视频生成的最大障碍(讨论串 10,r/generativeAI,4 分、15 条评论,2026-09-07,https://www.reddit.com/r/generativeAI/comments/1w9klb7/)。面对一名希望制作 2~4 分钟科幻电影感视频的用户,u/Missy_Desu 提出较现实的路径:“先用 GPT Image 2 制作画面,再用 Seedance 2.5 转为视频;每完成一分钟,约 100 美元的成本要有心理准备。”u/KissinglyPolished 则说,从静态图跳到视频时,保持角色一致性极其困难,一体化工具仍未解决这个问题。
  • 用免费、轻量硬件生成视频仍不现实(讨论串 8,r/aivideomaking,6 分、15 条评论,2026-09-07,https://www.reddit.com/r/aivideomaking/comments/1w9h5a9/)。有人希望只用手机和 iPad 免费制作 45 秒 AI 视频,u/NewLifeWares 指出,45 秒内容需要数据中心级别的资源;免费的服务最多只能做带水印的 5 秒片段,只能将它们拼接起来。
  • 食品广告中的 AI 图像仍被批评“看起来难吃”(讨论串 4,r/aiwars,4 分、177 条评论,2026-09-03,https://www.reddit.com/r/aiwars/comments/1w69cdj/)。用户质疑企业使用 AI 生成食品图像做广告。u/LCI_Jake 表示:“这像是刻意生成的猎奇图,我还以为是虫巢。”另一方面,u/Bassed_Hummble 分享了用本地 Krea 2 生成 40 秒内容的成果,反驳称只要提示词合适,效果可以改善。
  • AI 字幕评估远程职位引发大量反应(讨论串 5,r/RemoteWorkers,152 分、739 条评论,2026-09-04,https://www.reddit.com/r/RemoteWorkers/comments/1w7azwu/)。该职位以每小时 30 美元招聘人员,检查 AI 生成字幕中的错误,如对象误识别、颜色判断错误、文字误读等。大部分评论只是模板化地索要申请链接,对工作内容本身讨论不多。
  • 围绕“过于逼真的 AI 视频”出现两起真实性争论(讨论串 1/6,r/NewRockstars 与 r/pj_explained,同一帖子重复传播,2026-09-02)。有人声称索尔撞上柱子的泄露画面“不是 AI,而是 CGI”;但 r/pj_explained 中的热门评论 u/ceaserisnothome 直接反驳:“爆炸呈完美圆形扩散就是 AI 的证据。”同一画面的真假判断出现分裂。
  • 窗内出现海浪的画面究竟是 AI 还是实拍,评论区完全分成两派(讨论串 7,r/isthisAI,0 分、79 条评论,2026-09-07,https://www.reddit.com/r/isthisAI/comments/1w9cyub/)。发帖者指出水在未打破窗户的情况下出现在室内很不自然;u/RioReiser85 认为这只是透视误解,可能是真实拍摄;u/bulbousEd 则认为船头泡沫的运动不符合物理规律,因此必定是 AI。
信号
  • 正在增长的内容:对 AI “看起来不像 AI”所带来风险的警觉。讨论串 2(7,013 分、1,009 条评论)的巨大反响说明,LLM 已能直接操作 GUI 工具、甚至伪造“手绘证据”,引发了强烈担忧。
  • 被轻视或否决的诉求:希望“免费制作长时长、高质量视频”的需求被社区反复否定(讨论串 8、10)。硬件与成本限制依然严苛,是 Reddit 用户的共同认知。
  • 意外之处:与图像和视频生成 AI“专业”子版块(r/generativeAI、r/aivideomaking、r/GoogleFlow)相比,真伪验证与 AI 立场争论类子版块(r/isthisAI、r/antiai、r/aiwars、r/pj_explained、r/NewRockstars、r/whenthe)的讨论热度和互动量更高。当前 Reddit 上的 AI 图像/视频“新闻”,更多是以“这究竟是不是 AI”的社会摩擦形式被讨论,而非模型进步本身。
  • 相互冲突的信号:针对同一段“索尔撞击”泄露画面,r/NewRockstars 与 r/pj_explained 的评论区对“不是 AI”与“是 AI”的结论完全相反(讨论串 1/6)。讨论串 7 也同样呈现实拍派与 AI 派势均力敌的局面,表明普通用户的肉眼判断已经越来越不可靠。
限制
  • 搜索词只有“Image and Video Generation AI News”一个,工作器没有进行其他同义搜索,例如“Stable Diffusion”“Midjourney”“Sora”“Kling”“开源图像生成”等。因此,几乎没有收集到可明确比较闭源(Midjourney、DALL-E、Sora、Veo、Runway 等)与开源(Stable Diffusion、Flux、ComfyUI 生态等)的帖子。
  • 收集到的 12 个讨论串分别来自 12 个不同子版块,每个子版块仅一条,因此无法在同一子版块内进行多讨论串的深度对比。
  • 讨论串 9 和 11 的正文为空,只有标题和评论,缺少理解发帖意图的一手信息。
  • 讨论串 1 与 6 本质上是同一帖在不同子版块的转载,如将它们算作独立两条,实际样本量相当于只有 11 条。
  • 受浏览器收集方式所限,本次运行未进一步访问 Reddit,例如使用其他关键词重新搜索或展开讨论串中的全部评论。

X

X — 图像与视频生成 AI 新闻

账号

收集的 40 条内容来自 37 个账号。绝大多数是“单条走红/被淹没”的一次性账号;在与图像和视频生成 AI 相关的账号中,只有 @yu_ichi_suzuki(铃木忧一)通过多条帖子构成了讨论串。

账号 帖子数 特点
@yu_ichi_suzuki(铃木忧一) 2 连续发布在本地 RTX 5090 上运行 MiniMax H3 的技术串(合计 309 个赞),属于步骤讲解型而非单次爆款
@xieenze_jr(Enze Xie) 1 MiniMax 研究人员本人发布的新模型公告(349 个赞,约 85,000 次浏览)
@voxelphotonics 1 Duke Nukem 3D 体积显示演示,单帖获 6,097 个赞、约 297,000 次浏览,成为病毒式传播内容
@synabreu 1 用 GPT-6 Astra 制作首尔 3D 城市,单帖 2,700 个赞、约 235,000 次浏览
@GulatiYajat(Yajat Gulati) 1 用 GPT-6 Astra 创建古尔冈 3D 城市,574 个赞
@luccacerf 1 Blender MCP + Astra + Tripo 组合演示,445 个赞
@He1s_Sammy 1 讨论“不露脸 AI 儿童视频”正在商业化的长串,388 个赞
@SD_Tutorial(Stable Diffusion Tutorials) 1 Sol-H3 技术解说账号,但仅 22 个赞,互动较小
@Strength04_X、@atlas_remake、@Aiden_Tech_Ai、@alphafox 各 1 中小型账号,讨论 Seedance 2.5 或 AI 视频的质量与局限

除 @xieenze_jr 外,其他人都不是开发者本人,而是“试用看看”“做了一个”的用户。推动话题的是少量大型病毒式帖子(@voxelphotonics、@synabreu)与技术型个人的流程分享(@yu_ichi_suzuki、@SD_Tutorial),形成双层结构。

帖子
  1. MiniMax 发布比实时播放更快的视频生成技术“Sol-H3”(#2 @xieenze_jr,349 个赞、62 次转发、23 条回复、约 85,000 次浏览,2026-09-07,https://x.com/xieenze_jr/status/2097000082927399012)。其内容称:“Five seconds of world. 1.653 seconds to infer.” 使用 8× NVIDIA B300 Blackwell,可在 1.653 秒内生成 5 秒、1344×768 的视频。该帖是 X Explore 趋势第一名“NVIDIA Speeds Up AI Video Generation Past Real-Time Playback”的源头。
  2. 上述技术解说被快速传播(#3 @SD_Tutorial,22 个赞、约 2,100 次浏览,2026-09-07,https://x.com/SD_Tutorial/status/2097061880175141224)。该帖称其为“由 NVIDIA Research 开发的高性能视频推理栈,可使 MiniMax-H3 视频生成模型以快于实时播放的速度运行”,并链接至 nvlabs.github.io 的 Sol-Engine/Sol-H3 页面。技术账号迅速跟进官方公告。
  3. 公开在本地环境(RTX 5090)运行 MiniMax H3 的流程(#4–5 @yu_ichi_suzuki,295+14 个赞、约 18,000+1,100 次浏览,2026-09-07,https://x.com/yu_ichi_suzuki/status/2096819288997065192)。该用户分享“使用本地 MiniMax H3,在约 9 分钟内生成 15 秒、超过 2K 的视频(RTX 5090)”,结合阿里巴巴蒸馏 LoRA 寻找 480p 理想结果,再以 RTX Video Super Resolution 放大两倍至 2688×1536,并附有 GitHub 笔记。这与云端发布形成对照,体现了个人使用开放权重的动向。
  4. 使用 Seedance 2.5 制作时尚主题视频(#1 @Strength04_X,68 个赞、2 次转发、35 条回复、约 7,700 次浏览,2026-09-06,https://x.com/Strength04_X/status/2096441159887274302)。该用户用“Seedance 2.5 on Dreamina_ai”制作“30-second photoreal cinematic fashion-travel music video”,并附上完整提示词。
  5. 使用 Seedance 2.5 生成《玩具总动员》风格世界(#14 @atlas_remake,3 个赞、约 133 次浏览,2026-09-07,https://x.com/atlas_remake/status/2096847522602139995)。该用户积极评价 Seedance 2.5 对多个动画角色与物体的处理能力。
  6. 指出“AI 视频仍像老虎机”这一问题(#12 @Aiden_Tech_Ai,1 个赞、2 次转发、4 条回复、约 494 次浏览,2026-09-07,https://x.com/Aiden_Tech_Ai/status/2097020441470836791)。帖子表示:“你写提示词、生成、发现出错、再生成……当你处理多个空间、镜头移动、角色走位和连续性时”,问题便会显现。互动不大,但构成与 #5 乐观观点相对的论点。
  7. 以体积式 3D 显示重现 Duke Nukem 3D(#10 @voxelphotonics,6,097 个赞、921 次转发、130 条回复、约 297,000 次浏览,2026-09-07,https://x.com/voxelphotonics/status/2096833425043005562)。这是本期 X 上互动量最高的帖子之一。虽然它不是图像/视频“生成”AI 本身,而是渲染和显示技术演示,但经由 Explore 成为趋势第三名“Duke Nukem 3D Brought to Life in True 3D Display”的主要原因。
  8. 用 GPT-6 “Astra” 将整个首尔 3D 化(#20 @synabreu,2,700 个赞、451 次转发、81 条回复、约 235,000 次浏览,2026-09-06,https://x.com/synabreu/status/2096557555086725159)。帖子称:“for my first project created with GPT-6 Astra, I built the entire city of Seoul in 3D—a small revolution in digital geography!” 这一对话式 3D 创作案例获得广泛传播。
  9. 同样用 GPT-6 Astra 重现古尔冈 3D 城市(#22 @GulatiYajat,574 个赞、28 次转发、53 条回复、约 46,000 次浏览,2026-09-06,https://x.com/GulatiYajat/status/2096659142534676684)。该用户称“我看到大家都在用 Astra 做各种酷炫演示,所以决定也试一试”,是跟随 #8 热潮的明确实例;还发布了专门网站 gurgaon-3d-atlas.cratorlabs-2435.chatgpt.site。
  10. Blender MCP + Astra + Tripo 组合演示(#21 @luccacerf,445 个赞、20 次转发、11 条回复、约 31,000 次浏览,2026-09-07,https://x.com/luccacerf/status/2097047098281672782)。该用户表示:“First time building a gUI with Blender MCP + Astra + Tripo This is insane. Html preview for AI is dead.” 这展示了通过 MCP 协同多个 AI 工具的一种实践。
  11. “不露脸 AI 儿童视频”正在成为内容生意(#23 @He1s_Sammy,388 个赞、96 次转发、17 条回复、约 19,000 次浏览,2026-09-06,https://x.com/He1s_Sammy/status/2096492880017736056)。该串强调:“FACELESS AI KIDS VIDEOS ARE BECOMING A SERIOUS CONTENT BUSINESS...a phone, laptop, or iPad is enough to start experimenting”,作为生成 AI 视频副业与变现技巧内容而得到传播。
信号
  • 正在增长的内容:“让对话式智能体创建 3D 世界”类内容(用 GPT-6 Astra 构建 3D 城市、连接 Blender MCP)在本期最容易引发模仿与跟进。GulatiYajat 在 #9 中明确表示看到 synabreu 的 #8 帖子及其他人的作品后才亲自尝试,说明这不是一次性新闻,而是模仿链条。
  • 正在增长的内容(第二点):超实时视频推理(Sol-H3,#2/#3)和个人用户在本地 GPU 上复现它的尝试(#3 的 @yu_ichi_suzuki)几乎同时出现。闭源阵营的公告和开放权重阵营的跟进,在 X 上以极小的时间差并行发展。
  • 被轻视、且意见分化的内容:AI 视频在多角色、多空间场景中的一致性,同期既有赞赏(#5:“能很好处理多个动画角色”),也有不满(#6:“老虎机问题”)。X 上的评价仍未形成共识。
  • 意外之处:本次运行中,构成 40 条收集帖子来源的 9 个 Explore 趋势里,直接与图像/视频生成 AI 有关的只有前三项(NVIDIA/Sol-H3、VTuber Veibae 的动画回归、Duke Nukem 3D 体积显示)。剩余六项(Croatian、Building、$song、Harvey、Ukrainian、Democrats)是该会话服务器所在地区可见的趋势,其中趋势 4 明确标注“Trending in Croatia”,与主题无关。不过,通过搜索“Building”这个副产物,反而找到了高质量的 GPT-6 Astra 3D 城市演示群(#8~#10)。
  • 关于 VTuber Veibae:搜索 Explore 第二名趋势“VTuber Veibae Teases Return with Sunflower Farm Animation”时,实际命中的都是无关的北美票房汇总账号群(@mediamanint 等,重复帖子),没有收集到 Veibae 本人或其动画制作相关的任何帖子。
限制
  • Explore 前三项趋势中的“VTuber Veibae Teases Return with Sunflower Farm Animation”可能与图像/视频生成 AI 直接相关,但搜索未收集到相关帖子(#6~#9 均为无关的票房汇总重复帖)。无法确认 Veibae 的动画制作是否使用了 AI。
  • Explore 余下六项趋势(Croatian、Building、$song、Harvey、Ukrainian、Democrats)几乎全部是与图像/视频生成 AI 无关的地区趋势或时事话题。40 条内容中有 29 条(#6~#9、#13、#15~#19、#24~#40)被排除在本报告之外。
  • 搜索词仅限于“趋势标题字符串本身”,没有使用“Stable Diffusion”“Midjourney”“Sora”“Kling”“ComfyUI”等直接相关的专有名称。因此,本次几乎未能收集到能够清晰比较闭源(Midjourney、Sora、Runway、Veo 等)与开源(Stable Diffusion、Flux、ComfyUI 等)的帖子。
  • Explore 本身与本会话服务器所在地(推测为克罗地亚周边)存在地理关联,不能代表全球 X 的整体趋势。
  • 收集在 40 条时停止;本次运行未进一步挖掘同一账号的其他帖子、回复区或话题标签搜索。

YouTube

YouTube — 图像生成 AI 与视频生成 AI 的最新动态

频道
  • 動画編集の中の人频道)— 发布大量图像生成 AI 实际应用对比内容。
  • AI大学【AI&ChatGPT最新情報】频道)— 以生成式 AI 工具月度汇总视频为主。
  • 【さき】のAIでええやん。频道)— 解说 Google I/O 与 Gemini 系更新。
  • Qwen(官方)频道)— 发布 Qwen-Image 系列官方公告视频。
  • AIOnTrend频道)— 横向比较开源图像模型。
  • Urban Decoders频道)— 解说 Flux 系模型架构。
  • SECourses频道)— 进行大规模本地图像生成测试(如 700+ 项测试)。
  • Woollyfern频道)— 长期追踪 Midjourney 月度更新的频道。
  • 寺田部チャンネル频道)— 实践评测使用 ComfyUI 进行本地视频生成。
  • 東京大学 吉田幸 研究室频道)— 定期解说生成式 AI 技术趋势的大学频道。

由于 YouTube 搜索结果页和视频页采用 JavaScript 渲染,无法获取频道订阅数(见下文限制)。

视频
闭源相关
  1. 【深度付费后发现】2026 年推荐的图像生成 AI 就是它!彻底比较 NanoBananaPro、Seedream4.0、Midjourney、AdobeFirefly! — 動画編集の中の人 — https://www.youtube.com/watch?v=vJLDbXaSKW4 — 对 Nano Banana Pro、Seedream 4.0、Midjourney、Adobe Firefly 进行实际付费后的横向比较,并给出 2026 年的推荐结论。
  2. 【2026 年冬季最新】近几个月进化幅度史上最大的人气免费 AI 视频生成工具 6 选!~Sora 2、Veo 3.1、Kling 2.6 等~ — AI大学【AI&ChatGPT最新情報】 — https://www.youtube.com/watch?v=T9iIlhittDc — 介绍包括 Sora 2、Veo 3.1、Kling 2.6 在内的六种可免费使用的视频生成 AI,并强调近几个月的进步幅度。
  3. 【性能排名世界第一】xAI 视频生成 AI“Grok Imagine”全面解说!免费制作 Sora/Veo 级画面的方法! — AI大学【AI&ChatGPT最新情報】 — https://www.youtube.com/watch?v=0cYPwxg8le8 — 声称 xAI 的 Grok Imagine 在性能排行榜位列世界第一,并讲解如何免费生成 Sora/Veo 级别的影像。
  4. 【最新】Google 的 AI Gemini 模型大幅更新!解说发布视频生成 Omni 的 Google I/O 2026! — 【さき】のAIでええやん。 — https://www.youtube.com/watch?v=vKtwoKCSGyE — 解说 Google I/O 2026 公布的 Gemini 大幅更新,以及新视频生成模型“Omni”。
  5. Midjourney Update | July 2026: V8.2 is HERE! Personalization, NIJI Style Creator, and More! — Woollyfern — https://www.youtube.com/watch?v=dvfH5HzCARY — 报告 Midjourney 发布 V8.2,新增个性化功能与 NIJI Style Creator;这是其月度更新脉络的最新一期:2026 年 3 月 V8 Alpha → 4 月 V8.1 → 6 月 V8.2 预览 → 7 月 V8.2 正式版。
开源相关
  1. 🚀 Introducing Qwen-Image-2.0 — our next-gen image generation model! — Qwen 官方频道 — https://www.youtube.com/watch?v=1tM7Wd0lEeI — 阿里巴巴 Qwen 团队发布 Qwen-Image-2.0 的官方视频,作为下一代开源图像生成模型介绍。
  2. Qwen Image Dominates Text-to-Image: 700+ Tests Reveal Why It's Better Than FLUX - Presets Published — SECourses — https://www.youtube.com/watch?v=R6h02YY6gUs — 基于超过 700 项测试,验证 Qwen Image 相比 FLUX 的优势,并公开预设。
  3. Flux 2 Klein vs Qwen vs Z Image Turbo vs Nano Banana Pro - Which AI Image Wins? — AIOnTrend — https://www.youtube.com/watch?v=CkAtP2EVhSM — 使用相同提示词比较开源的 Flux 2 Klein、Qwen、Z Image Turbo,以及闭源的 Nano Banana Pro。
  4. Flux.2 New Open Source King? Architecture FULL guide + Nano Banana Pro comparisons — Urban Decoders — https://www.youtube.com/watch?v=Iu9Dm7lBeAk — 解说 Black Forest Labs 发布的 Flux.2 架构,并通过与 Nano Banana Pro 的比较,检验其是否会成为“新的开源之王”。
  5. Flux 2 Klein Just Dropped—This Image Editing Model Isn't Just About Speed!https://www.youtube.com/watch?v=JXgBe3twxbc — 快速介绍 Black Forest Labs 发布的轻量、可本地运行图像编辑模型“Flux 2 Klein”。
  6. Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial for Open Source SOTA Image & Video Gen Modelshttps://www.youtube.com/watch?v=3BFDcO2Ysu4 — 汇总讲解阿里巴巴 Wan 2.2、FLUX、Qwen Image 等开源前沿图像与视频生成模型的升级。
  7. 【免费・ComfyUI】使用本地视频生成 AI 制作长视频容易吗?难得离谱 — 寺田部チャンネル — https://www.youtube.com/watch?v=I8_wKOLnSlI — 对使用 ComfyUI 和本地视频生成 AI 制作长视频的实践报告,包含“难得离谱”的坦率失败经验与见解。
信号
  • 闭源阵营的核心竞争是“低价与速度”对“质量”:多条比较内容认为 Nano Banana Pro 在写实测试中以 63% 的比例获胜(视频 1、9);免费或低价产品(Grok Imagine,视频 3)则以“免费获得 Sora/Veo 级效果”的挑衅性叙事进行宣传。
  • Midjourney 按月度节奏持续改进 V8 系列:从 2026 年 2 月预告,到 3 月 Alpha、4 月 V8.1、6 月 V8.2 预览、7 月 V8.2 正式版,Woollyfern 频道持续按月观察,更新节奏格外突出(视频 5)。
  • **Google I/O 2026 发布 Gemini 视频生成“Omni”**被视作单独的大型新闻,日本频道也迅速发布解说(视频 4)。
  • 开源阵营围绕 Qwen Image 与 FLUX 展开主导权争夺:SECourses 的 700 多项测试(视频 7)和 Urban Decoders 的架构讲解(视频 9)等深度频道,持续发布检验“谁更强”的视频,反映出社区的强烈兴趣。
  • Black Forest Labs 的“Flux 2 Klein”定位为轻量、本地运行的衍生模型,被单独作为速报关注(视频 10),并与完整版 Flux.2 区别看待。
  • 阿里巴巴系的 Wan 与 Qwen Image 作为开源视频和图像双线产品被一同归入教程讲解(视频 11)。
  • 本地视频生成仍然“很难”:实践经验表明,使用 ComfyUI 制作长视频“难得离谱”(视频 12)。除质量外,工作流的沉重也是开源视频生成被反复提及的问题。
限制
  • YouTube 的搜索结果页(/results?search_query=...)和 watch 页面通过 JavaScript 渲染内容,因此 WebFetch 只能获得静态 HTML(仅包含页脚的条款和版权链接)。即使直接打开页面,也无法读取视频列表、播放量、发布时间、简介或评论。这与工作手册假设“页面 HTML 包含标题、频道、播放量、发布时间”的前提不一致。
  • 作为替代,使用 site:youtube.com 的网页搜索(可获取标题、URL、搜索引擎摘要和部分发布时间)与 YouTube oembed 端点(可通过 JSON 获取正式标题、频道名称和频道 URL)进行交叉核验。但播放量、频道订阅数、视频简介正文与评论,均无法通过本次手段获得,因此未纳入以上内容。
  • 指定“2026 年 8 月”“2026 年 9 月”的日语新闻搜索中,未命中图像/视频生成 AI 的专门新闻,只混入 AI 综合日更新闻频道、周刊 IT 企业新闻或无关天气新闻。没有找到限定于最近一周(9 月 1 日至 8 日)的专门速报。
  • Reddit、X、Bluesky、Lemmy、Pinterest 不属于本阶段的调查范围(如 brief.md 所述,由其他阶段负责)。

Bluesky

Bluesky — 图像与视频生成 AI 新闻

账号
账号 属性 关注者等 备注
@simonwillison.net 个人(知名 AI 技术博主、Datasette 作者) 每当新模型发布,都会以“让鹈鹕骑自行车”为独特基准测试图像生成能力。本次收集内容最丰富的来源。
@404media.co 媒体(404 Media 编辑部及多名记者账号) 以监控相关报道为主,也会不时发布与 AI 生成媒体有关的独家新闻。
@aimod.social 社区运营(疑似 AI 图像标记服务) 2,555 位关注者、94 条帖子 Bluesky 官方标记服务,会自动给“疑似 AI 生成的图像”加标签。并非新闻发布者,而是基础设施型存在。
@stablediffusion.bsky.social 个人(SDXL/Stable Diffusion 提示词分享) 自 2025 年 1 月后停止发帖。
@bm63ai.bsky.social 个人(ComfyUI/Flux/Midjourney 艺术内容) 2025 年 4 月前持续发布 AI 艺术内容;2026 年 6 月的最后一帖转为“用 Codex 进行氛围编程制作应用”,AI 艺术帖事实上已停止。
@petapixel.bsky.social 媒体(摄影专业媒体) 批评性报道 Adobe 的生成 AI 功能(Firefly、Lightroom),但最近帖子停留在 2025 年 2 月,不在本轮新闻周期内。
帖子
  • 再次进行 GPT-6 Astra 的“鹈鹕骑自行车”基准测试(@simonwillison.net,2026-09-04,202 个赞、9 次转发、18 条回复,https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c)。帖子写道:“Got access to GPT-6 Astra. Want to see some pelicans?” 并公开 GPT-6 Astra、GPT-5.6 Sol、Terra、Luna 四个模型各三个推理等级下绘制“鹈鹕骑自行车”SVG 插图的对比网格(详情:static.simonwillison.net/static/2026/gpt-6-and-5.6-pelicans.html)。替代文本指出,Astra 的结果精致一致;Sol 的比例变化较大;Terra 解剖结构不自然;Luna 的姿势更简单僵硬。回复中有人评价,Astra 是第一个理解虚构四足动物需要双人自行车的模型。
  • GPT-6 Astra 操作 Blender 生成鹈鹕 3D 场景(@simonwillison.net,2026-09-05,400 个赞、30 次转发,https://bsky.app/profile/simonwillison.net/post/3murtmdynq22s)。通过“Use the already install /Applications/Blender to render a scene of a pelican riding a bicycle”→“add a background and a lot of flair”→“make it a whole lot better”三个步骤下达指令,公开了经由编程智能体让 Blender 制作 3D 场景的成果。“GPT-6 Astra 在 Blender 中创建照片级渲染”的同一话题,也在 Reddit 的 r/DefendingAIArt 讨论串中独立出现,确认其具有跨平台热度。
  • 开源 Qwen 3.7 27B 在本地绘制鹈鹕(@simonwillison.net,2026-08-14,183 个赞、14 次转发,https://bsky.app/profile/simonwillison.net/post/3mt2ynhrlk22z)。“The new Qwen 3.7 27B, running as a 17GB GGUF in LM Studio on my M5 Max MacBook Pro, just drew me the best pelican riding a bicycle I've seen from any model that runs on my laptop”。这是少数展示可本地运行开源模型图像生成能力提升的具体帖子。
  • 纽约州州长候选人以 AI 生成假视频攻击对手(@404media.co,2026-09-02,124 个赞、22 次转发、7 条回复,https://bsky.app/profile/404media.co/post/3muka24vu4v2q)。“The Republican Nominee for New York Governor Made a Creepy, AI-Generated Video of Mamdani and Hochul”。该报道的引用帖还讽刺道,如今已经到了“为了贬低对手而制作虚假伟哥广告视频”的时代(194 个赞、36 次转发,https://bsky.app/profile/404media.co/post/3muk7u6iepk2h,作者为 404 Media 相关人士)。这是视频生成 AI 被用于政治广告虚假信息的案例。
  • Cocomelon 制作方要求艺术家进行 AI 实验(@404media.co,2026-09-06,84 个赞、23 次转发、21 条回复,https://bsky.app/profile/404media.co/post/3musx3wgdvc2n)。“Moonbug Entertainment, which makes Cocomelon, Blippi, and other popular content for children, says it will begin using AI but will always have a 'human in the loop.'” 这表明儿童视频制作这一重要场景正在引入图像和视频生成 AI。
  • 疑似 AI 图像标记服务“aimod.social”拥有超过 2,500 名关注者(账号资料调查,https://bsky.app/profile/aimod.social)。其自称为“Labeler for flagging suspected AI imagery”,并已建立判断标准手册与申诉窗口。虽然不是新闻文章,但说明 Bluesky 社区已形成对可疑 AI 图像进行自动标记的基础设施需求。
  • 老牌 AI 艺术账号大多沉默(调查 @stablediffusion.bsky.social、@bm63ai.bsky.social 的动态)。stablediffusion.bsky.social 最后一条更新是 2025 年 1 月 22 日的“the liberty statue playing electric guitar”提示词帖子(#SDXL #StableDiffusion,10 个赞)。bm63ai.bsky.social 也在 2025 年 4 月 25 日的“Star Trek: The Muppet Generation”(#comfyui #midjourney #flux,5 个赞)之后停止 AI 艺术发帖;其 2026 年 6 月 8 日的最后一帖转为使用编程智能体制作音乐应用的话题。
  • 针对 Adobe 生成 AI 功能的批评(旧周期参考信息)(@petapixel.bsky.social,2025-02-12、2025-01-09,分别为 7 个赞/33 个赞)。“Adobe's newly-announced text-to-video tool is very much not ready to have a price tag attached to it”;另有帖子称,一名摄影师尝试用 Lightroom 的 Generative Remove 移除不需要的物体,却生成了比特币标志。这些内容早于 2026 年 9 月的本轮新闻周期,但可作为对闭源商业工具持续批评的参考记录。
信号
  • 正在增长的内容:GPT-6 Astra 的图像/影像类任务(鹈鹕 SVG 绘制、操作 Blender 制作 3D 渲染)分别在 Reddit(r/DefendingAIArt、r/antiai)与 Bluesky(@simonwillison.net)上独立出现,是最主要的跨平台话题。但须注意,准确地说这不是“扩散模型生成图像”,而是“LLM 智能体通过代码/3D 工具生成视觉内容”的新类别。
  • 被轻视或否决的内容:开源阵营话题极少,唯一确认的具体内容是 Qwen 3.7 27B 的本地运行报告。未找到 FLUX、新版 Stable Diffusion、Wan、HunyuanVideo 等专用开源图像/视频生成模型的发布帖。
  • 意外之处:2025 年上半年仍活跃的 AI 艺术专用发帖账号(stablediffusion.bsky.social、bm63ai.bsky.social)大多已沉默;反而“怀疑 AI 图像并自动标记”的服务(aimod.social)作为独立社区基础设施持续存在并成长。Bluesky 上 AI 图像生成讨论的重心,可能正从“创作”转向“辨别/监管”。
  • 相互冲突的信号:关于视频生成 AI 的具体新闻,最显眼的并不是模型性能竞赛,而是“政治广告滥用”(纽约州州长选举假视频)引发的应用层争议。在 Bluesky 上,作为社会问题的视频生成 AI 比作为技术趋势的视频生成 AI 更具可见度。
限制
  • Bluesky 公共搜索 API(app.bsky.feed.searchPosts)无论使用英语或日语查询,如“image generation AI”“Stable Diffusion”“Midjourney”“Sora”“Veo”“Kling”等,始终返回 HTTP 403,无法使用。同一会话中 app.bsky.actor.getProfileapp.bsky.feed.getAuthorFeed 正常响应,推测只有搜索端点要求认证或被阻断。
  • bsky.app/search 的 Web UI 是客户端渲染 SPA,帖子正文不包含在 HTML 中,网页获取工具无法读取实际搜索结果。
  • 因此,无法执行工作手册原本的“关键词搜索→阅读帖子”流程,改为逐一取得通过网页搜索获知的账号(simonwillison.net、404media.co、petapixel.bsky.social、aimod.social、stablediffusion.bsky.social、bm63ai.bsky.social)的帖子历史。故收集内容只是“账号样本”,不能替代全面关键词搜索。
  • 预期账号如 OpenAI、Google DeepMind、Midjourney、Runway、Stability AI、Black Forest Labs、Krea、TechCrunch、The Verge、Ars Technica、Engadget 等,要么在 Bluesky 不存在(HTTP 400 = 未找到账号),要么其动态中没有图像/视频生成相关内容。
  • 由于搜索 API 不可用,未能达到每个平台“分析约 20 条帖子”的完成标准。实际可分析的是正文列出的 8 条(外加 1 条参考信息);其他已获取动态中没有相关帖子(完全无相关内容的动态包括:techcrunch.com、theverge.com、arstechnica.com、engadget.com、garymarcus.bsky.social〈仅 1 条〉)。
  • 未能找到任何有关开源图像/视频生成模型(FLUX、新版 Stable Diffusion、Wan、HunyuanVideo 等)的具体 Bluesky 帖子。这究竟代表“没有热度”,还是“因无法搜索而遗漏”,本次方法无法区分。

Lemmy

Lemmy — 图像与视频生成 AI 新闻

Lemmy 是规模仅为 Reddit 几百分之一的联邦式社交网络,因此这里的“爆款”不是数百个赞,而是数十个赞。但出人意料的是,仍能获得很密集的信息。主要检索了 !«メールアドレス»(ComfyUI 和模型发布者)、!ai_reddit(转载 r/ArtificialIntelligence 新闻的机器人),以及 !technology!techtakes(讽刺意味较强)。搜索方式是反复以不同关键词调用 lemmy.world/api/v3/search

社区
  • !«メールアドレス» — 5,709 名订阅者(其中本地订阅者 893)。ComfyUI 自定义节点与模型发布信息枢纽,几乎每天都有帖子。
  • !«メールアドレス» — 2,362 名订阅者。展示用 Stable Diffusion/Flux/Krea2 创作作品的图库。
  • !«メールアドレス» — 动漫 AI 艺术专用社区,发帖频率与前者大致同样高(订阅数未公开,但活跃程度相近)。
  • !«メールアドレス» — 87,904 名订阅者。转载大型科技文章,Midjourney 风波也在这里成为话题。
  • !«メールアドレス» — 2,690 名订阅者。以讽刺 AI 行业为主的社区,对 Midjourney 的摇摆不定进行了严厉批评。
  • !«メールアドレス» — r/ArtificialIntelligence 的 RSS 转发账号。API 未获取订阅数,但这里的新闻密度最高。
  • !«メールアドレス» — 8,154 名订阅者。AI 反对者社区,也转载生成 AI 供应链批评文章。
帖子
偏闭源
  1. Midjourney 转向医疗超声扫描仪“Midjourney Medical”(?) — 2026-06-18~19,在 !techtakes!hackernews 中形成热议。The Register 讽刺其为“金光闪闪的美容医疗水疗中心”,pivot-to-ai.com 则批评“这是转向 Theranos 吧,笑死”。得分 40~58。
    https://lemmy.world/post/48384985 (原文:pivot-to-ai.com/2026/06/19/midjourney-ai-pivots-to-theranos-ultrasonic-ct/)
  2. Midjourney 要求好莱坞制片厂披露“如何使用 AI” — TechCrunch 文章,在 !technology 获得 73 分,是版权诉讼脉络中的后续报道。
    https://lemmy.world/post/49069400
  3. Google 发布 Nano Banana 2 Lite — DeepMind 的轻量图像生成模型,来自 !hackernews 及瑞士科技媒体 itmagazine.ch 的帖子,时间为 2026-06-30~07-02。
    https://lemmy.world/post/48857780 (deepmind.google/models/gemini-image/flash-lite/)
  4. Microsoft 的 MAI-Image-2.5 在基准测试中追平 Nano Banana 2 — 经由 the-decoder.com,!ai_reddit,2026-05-28。
    https://the-decoder.com/microsofts-mai-image-2-5-pulls-even-with-googles-nano-banana-2-on-benchmarks/
  5. ByteDance Seedream 5.0 Pro 的深度对比评测 — 提及其编辑能力与迭代生成优势,!ai_reddit,2026-07-10。
    https://www.reddit.com/gallery/1usc03q
  6. Google Earth AI 功能在发布次日停止 — 用户在真实地点上叠加虚假图像进行捣乱,Fortune 进行了报道;!ai_reddit,2026-08-07。
    https://fortune.com/2026/08/07/google-quietly-discontinues-its-earth-ai-feature-a-day-after-its-rollout-after-users-made-no-no-images/
  7. Runway 企业业务 NRR 超过 300%,实现翻倍 — 关于视频生成公司 Runway 企业业务增长的内容,!ai_reddit,2026-08-30。
    https://www.reddit.com/r/ArtificialInteligence/comments/1w2hnea/runway_says_enterprise_business_doubled_nrr_over/
  8. 国际特赦组织批评主要 AI 系统“从设计上就是非法的” — 生成 AI 整体面临监管压力的背景,!ai_reddit,2026-06-24。
    https://reddit.com/r/ArtificialInteligence/comments/1ue64s2
  9. Pax Silica:AI 供应链武器化 — 分析美中围绕 AI 芯片与算力资源的经济竞争。作为闭源大型科技公司地缘政治风险的话题,在 !fuck_ai 获得 14 分,2026-09-06。
    https://thecradle.co/articles/pax-silica-and-the-weaponization-of-ai-supply-chains-the-new-front-in-us-global-economic-warfare
  10. 让“Astra 6 max”创作令自己感动的艺术 — 使用商业闭源模型进行带有哲学自指意味的艺术生成,!ai_reddit,2026-09-05。
    https://i.redd.it/3h241pocalnh1.png
偏开源
  1. 发布 LLaDA-Image — 新模型结合 6B Diffusion Transformer 与冻结的视觉语言理解模块,基于 LLaDA2.0-Mini。在 Qwen-Image-Bench 上取得英文 53.53、中文 53.38 的 SOTA 分数;同时发布可在 2~4 步生成的高速版本“LLaDA-Image-Turbo”,权重、训练代码和配方全部开放。!stable_diffusion,2026-09-04。
    https://lemmy.dbzer0.com/post/74988021 (论文:arxiv.org/abs/2609.03796,代码:github.com/inclusionAI/LLaDA-Image)
  2. 发布 Boogu-Image-0.1 — 包括 Base/Turbo/Edit 等多个变体的开放模型家族,采用 Apache-2.0 许可证,允许商业使用。参数量为 10B,在开源阵营中以 Qwen-Image-Bench 53.58 创下最高分。!stable_diffusion,2026-06-17。
    https://boogu.org/ (论文:arxiv.org/abs/2607.13125)
  3. ComfyUI-Ref2VA-VSA:面向 MiniMax H3 的推理加速节点 — 显著提高视频生成推理速度,!stable_diffusion,2026-09-08。
    https://github.com/Kablex/ComfyUI-Ref2VA-VSA
  4. ComfyUI-AetherScale:NVIDIA GPU 原生视频超分工具!stable_diffusion,2026-09-05。
    https://github.com/vizart-vj/ComfyUI-AetherScale
  5. ComfyUI-VDN-H3:Video Delta Net 混合注意力机制 — 面向视频生成模型的效率优化节点,!stable_diffusion,2026-09-05。
    https://github.com/Saganaki22/ComfyUI-VDN-H3
  6. ComfyUI-Majoor-OmniCam:相机布局与动画工具 — 用于控制视频/图像生成镜头运动的节点,!stable_diffusion,2026-09-04。
    https://github.com/MajoorWaldi/ComfyUI-Majoor-OmniCam
  7. FastH3-Ref2V-Stream-Controller — 面向 MiniMax H3 系视频生成的流式控制工具,!stable_diffusion,2026-09-04。
    https://github.com/EarthDefenceForces/FastH3-Ref2V-Stream-Controller
  8. ComfyUI-InpaintCanvas:Krita 风格的局部重绘 UI!stable_diffusion,2026-09-08。
    https://github.com/DenRakEiw/ComfyUI-InpaintCanvas
  9. ComfyUI-MiniMax-H3-MotionCache-FastVAE / ComfyUI-H3VAE_TRT / ComfyUI-MiniMaxH3-CLSS — 三个 MiniMax H3 系视频模型加速与轻量化节点在 2026-09-01~02 连续发布。这是开源视频生成生态目前非常活跃的证据。
    https://github.com/Mozer/ComfyUI-MiniMax-H3-MotionCache-FastVAE
  10. InterleaveThinker:用于智能体式交错生成的强化学习研究 — 为现有图像生成模型加入多智能体文本↔图像逐步生成能力的研究,!stable_diffusion,2026-06-12。
    https://arxiv.org/abs/2606.13679
  11. 使用 Flux/Krea2 turbo 创作的作品持续涌现!stable_diffusion_art!share_anime_art 每天持续发布数条由 Flux 与 Krea2 生成的艺术和动漫图。这不是单条新闻,而是“开放权重模型正在日常使用”的连续信号。
    https://lemmy.dbzer0.com/post/75150630 等多条
信号
  • 🔥 最大话题是 Midjourney 的迷航。一家图像生成 AI 公司却涉足医疗超声扫描仪,在 !techtakes!technology 都引发热议,而且氛围并不正面,更像“这家公司真的没问题吗”。这是闭源阵营新闻中得分断层领先的内容(40~73)。
  • 🛠️ 开源阵营中,面向“MiniMax H3”视频模型的 ComfyUI 节点在同一周连续出现 5~6 个。这是典型的开发者社区围绕某个视频基础模型迅速聚集、展开优化竞争的模式。来自华语地区的开发者姓名(如 nazgut、lisitskyaa)也很多,显示其全球化扩散。
  • 📊 基准测试爱好者以 Qwen-Image-Bench 作为共同指标。LLaDA-Image(53.53)与 Boogu-Image-0.1(53.58)在同一基准上竞争,让开源阵营内部的性能竞争可以量化观察。
  • 😤 连 AI 批评类社区(!fuck_ai)也会转载有关闭源公司的地缘政治风险文章,说明生成 AI 话题已渗透到技术社区之外。
  • 🤖 Lemmy 的样本量较小,因此“爆款”的标准和 Reddit/X 完全不同——70 多分就属于大新闻级别。应看相对热度,而不是绝对数字。
限制
  • Lemmy 是联邦式网络,搜索结果因实例而异。通过 lemmy.world API 获得的内容,主要来自 lemmy.world 自身或联邦同步的其他实例帖子。虽然也尝试访问 lemm.ee 与 lemmy.ml 的搜索 UI,但本次因时间原因只使用了 lemmy.world 的 API,未能覆盖所有实例。
  • 对“Kling AI”“Stability AI”“Wan 2.2”“Runway Gen”等关键词的搜索,要么没有结果,要么只返回无关内容(如政治新闻)。在 Lemmy 上,中国视频生成模型(Kling、Wan 系)与 Stability AI 的单独话题几乎不存在;视频模型讨论只会经由“MiniMax H3”这一模型名称出现在 ComfyUI 开发者社区中。
  • !ai_reddit 是 r/ArtificialIntelligence 的自动转载机器人,本质上只是将 Reddit 新闻再次发布到 Lemmy,不能视作 Lemmy 原生的一手信息。
  • 已达到完成标准中“分析约 20 条帖子”的数量(除正文列出的约 20 条外,还核查了许多重复或无关搜索结果),但 Lemmy 的总体帖子量比 Reddit/X 小几个数量级,因此从高质量一手信息的角度看,仍比其他平台薄弱。

Pinterest

Pinterest — 图像与视频生成 AI 新闻

在已收集的 50 个 Pin(output/pinterest.pins.md / images/pinterest/manifest.json,无类别划分,单一查询“Image and Video Generation AI News”)中,实际打开并核查了 30 张图片。以下判断基于其内容。

视觉主题
  • 点击诱导式“AI 新闻”缩略图:带胡子、表情惊讶的男性配霓虹工具标志([11])、爆炸背景加上类似 Sam Altman 的笑脸([19])、半人半机器人新闻主播与“B”麦克风([44])等构图常见。多数只是直接钉选 YouTube 视频,而非链接到实际文章正文。
  • 闭源产品“最佳工具”排名信息图:反复出现以霓虹边框列出 Runway、Pika、Kling AI、Luma(Dream Machine)、Canva、Hailuo AI、HeyGen、Synthesia、InVideo、Sora、Google Veo 的清单 [9, 27, 33]。图像生成版本也有同样结构,列出 ChatGPT、Nano Banana、Ideogram、GenTube、Z-Image [36]。
  • AI 机器人/主播的人格化表达:白色外壳机器人坐在新闻台前([32])、女性主播风格的合成影像([38, 49])、机器人与护士/人类并列的医疗场景([50])等。相比工具本身的截图,“AI 代替人类角色(记者、医生)”的隐喻插画更加显眼。
  • 煽动对深度伪造与真伪担忧的图像:猫照片上的“FAKE”印章与点赞数([3])、两张山景图的“Which is AI?” 测验([10])、音频波形与“97% likely AI generated”检测器([25 内部图片及同类的 35])等。生成本身以外,检测与怀疑构成重要主题。
  • 缺乏具体内容的图库风 AI 视觉:紫蓝色霓虹、脑部轮廓、电路板、粒子效果背景,搭配纯标题文字的通用图像([2, 4, 5, 15, 20, 30])。它们被用作没有具体产品名或截图的“AI 风格图片”填充物。
  • image-to-video 前后对比演示网格:把一张原始照片/视频转换成多种风格(LEGO 风、折纸、覆盖鲜花的人物、玩具车)的对比网格([7]),以及由一张照片生成五格时间线的图解([1, 6])。这些 Pin 将“一张图→视频”的功能直接可视化。
  • 虽然出现实际产品名,但几乎全是闭源产品:Veo 2/3([13, 24])、VASA-1(Microsoft Research,[41])、Grok([32])、Sora、ChatGPT、Nano Banana([36])等专名很多;但在已查看的 30 项中,没有出现任何确认属于开源的模型名称或仓库名称。
  • 强调“AI 流水线化”的信息图:从一条爆款视频链接出发,通过“Scout→Script→Generate→Animate”四个智能体自动生成 vlog 的流程图([47])。这体现视频生成正从单独工具转向自动化工作流的趋势。
值得注意的 Pin
  • [1] Image to Video AI: How It Works and Why It Matters — 以图解展示从一张静态图,经运动强度、时间一致性与视觉控制滑块,生成视频时间线的过程,是技术说明最具体的 Pin。
  • [7] (无标题,LEGO/折纸/鲜花转换网格) — 将原视频(人物、熊猫玩偶、Tesla)转换为“木块”“折纸”“LEGO”“鲜花”等风格的 3x5 前后对比网格。这是少数可以直接看到实际生成结果的演示。
  • [9] 10 FREE AI VIDEO TOOLS IN 2026 — Pictory、Runway ML、Veed.io、Synthesia、InVideo、Kling AI、D-ID、Lumen5、Canva、Hyperwrite 十款免费 AI 视频工具。可一览闭源公司免费方案的现状。
  • [24] (无标题,紫色怪物角色的 image-to-video) — 将一张输入图像分别置于“服务器机房”“水下遗迹”“糖果城市”等完全不同背景中,展示三种输出视频的演示。标题与 Veo 3 有关。
  • [27] 5+ Best AI Video Generation Websites — 比较 Runway/Pika/Kling AI/Luma/Canva/Hailuo,并在末尾明确写明面向“YouTube Shorts、TikTok、Pinterest 视频 Pin、产品介绍视频”,说明 Pinterest 本身也被视为 AI 视频的发布目的地。
  • [36] Top AI Image Generation Tools — 列出 ChatGPT、Nano Banana、GenTube、Ideogram、Z-Image,呈现 2026 年图像生成工具的组合。Nano Banana 和 Z-Image 等较新的名称已经渗透到 Pinterest 的 SEO 文章中。
  • [39] The Latest AI Developments(突发新闻风格三联图) — 唯一有具体事件与组织名称、较像“新闻”的 Pin:① 新奥尔良 911 由 AI 初步接听;② Meta 免费公开离线智能体模型 Muse Glimmer;③ 朝鲜 Kimsuky 使用自建 AI 技术栈自动生成网络钓鱼文档。
  • [41] Microsoft Unveils VASA-1 — Microsoft Research 的技术演示图:从一张图像和音频片段(加上可选表情控制信号)生成多人物实时对话脸部动画,是少数源自研究发布的内容。
  • [16] AI Image Video: Best Quality vs Best Free — 将 ChatGPT Plus、Gemini Advanced、Midjourney、Adobe Firefly、Recraft、Runway Gen-3、Luma、Pika Pro、Kaiber、Synthesia,与 Ideogram、Gemini(免费版)、SeaArt、Playground、Krea、Canva、Inkscape、CapCut 等按“高质量付费”与“免费”对比的决策指南,甚至涉及用户选择标准,如文字可读性、是否具备 GPU、是否需要 SVG 编辑等。
  • [47] AI video creation just got crazy — 提议通过“Scout→Script→Generate→Animate”四个智能体,从爆款视频链接自动生成完整 vlog,体现超越单一工具的自动化流水线。
信号
  • Pinterest 上“Image and Video Generation AI”领域的主流不是突发新闻,而是用于 SEO/联盟营销的工具比较和教程信息图。几乎没有直接链接到一手信息(官方公告、研究论文、社交媒体帖子)的内容,大部分是引流至博客或 YouTube 视频的 Pin。
  • 能作为具体新闻事件收集到的,只有 [39] 的三则内容(911 接听 AI、Meta Muse Glimmer、朝鲜 Kimsuky)及触及 Veo 2/3、VASA-1、Grok 产品发布的 Pin。能称为“最新新闻”的一手信息规模有限。
  • 闭源的存在感压倒性强,Runway、Pika、Kling AI、Luma、Canva、Hailuo、HeyGen、Synthesia、Sora、Veo、ChatGPT/Nano Banana、Ideogram 反复出现。另一方面,本次查看内容中完全没有开源模型或项目名称(没有 Stable Diffusion 系、ComfyUI、Open-Sora 等提及)。Pinterest 不适合作为讨论开源趋势的信息来源。
  • “AI 代替人类角色”(新闻主播、护士、911 接线员)的形象,与“怀疑生成物真伪”(FAKE 印章、Which is AI?、AI 检测器)的形象大量成对出现。相对于生成技术本身,社会影响与对可信度的焦虑构成了相当一部分主题。
  • 视频生成使用方式中,“将一张照片动画化”“转换已有视频风格(LEGO 化、折纸化)”等转换型使用场景十分突出;相比从零开始的 text-to-video,图片/视频转换是主要卖点。
限制
  • 工作者预先收集的 50 项内容未进行类别划分(所有 genre 字段为空),且来自单一查询结果,因此并不是有意识地围绕闭源/开源两轴分别搜索。
  • 受时间限制,50 项中仅实际打开核查 30 张图片(未核查:索引 14、15、18、21、22、26、28、29、31、37、40、42、43、45、48 等)。未核查项的标题如 pinterest.pins.md 所列,多与唇形同步工具比较、视频编辑工具比较、AI 内容检测等既有主题重合,未见可能推翻上述趋势的其他类别信号。
  • 未自行浏览 Pinterest,而是按工作手册要求,仅基于工作器预收集的图片与标题判断。Pin 的发布时间与互动数据(赞/收藏数)不在 manifest/pins 表中,因而无法判断“信息何时发布”或“传播程度”。
  • Pinterest 上没有找到对开源动态有意义的提及,因此后续综合报告若讨论“开源趋势”,应明确 Pinterest 不能作为依据。

建议行动

  • 将 GPT-6 Astra 的智能体式视觉生成(操作 Blender、生成 3D 城市)作为独立追踪主题,在之后持续观察。
  • 为避免遗漏开源发布,下次应在全平台加入“FLUX”“Stable Diffusion”“Qwen-Image”“Wan”“ComfyUI”等专有搜索词。
  • 在假定 Bluesky 搜索 API 持续返回 403 的前提下,预先扩充需要监控的账号列表。
  • Pinterest 无法取得发布时间与互动数,不应用于需要时效性的突发新闻比较;应限定为工具认知度的长期定点观测。
  • Midjourney 医疗设备转型风波的真实性和实际情况尚不明确,在出现一手来源(Midjourney 官方公告)前避免确定性引用。
  • 将 Lemmy 的 !stable_diffusion 与 YouTube 评测频道优先作为追踪开源动态的核心来源。

收集图片

图像转视频 AI:工作原理及其重要性 - The Data Scientist🎨 AI 图像与视频创作AI 内容与社交媒体担忧面向文本、图像、音乐和视频生成的 AI 内容创作概念及图标——浏览 57 张图库照片、矢量图和视频终极 AI 图像与视频生成平台 - The Data Scientist图像转视频 AI——用 AI 让照片动起来Google 宣布超高质量视频……做到极致 🎥🎬 2026 年 10 款免费 AI 视频工具 🤯 无需昂贵软件即可制作视频!图像AI 新闻:OpenAI 终于发布了我们要求的内容Veo 3 图像转视频:通过 Gemini API 快速生成并支持原生音频Google 推出 Veo 2:具备更强真实感与电影化功能的先进 AI 视频生成工具图像人工智能:让我们维护我们的……用于图像和视频生成的 AI2026 年十大唇形同步工具——最适合真实唇形同步视频的 AI 唇形同步软件2025 年最佳 AI 视频生成器GPT 5.2、实时视频编辑器、AI 立体视频、移动 AI 智能体、全身控制:AI 新闻图像AI 如何改变视频编辑为什么 AI 视频生成正变得不可或缺……如今超过 20% 的 YouTube 内容由 AI 生成Google 宣布视频生成 AI“Veo 3”……‎🚨 AI 正变得吓人地厉害。图像2026 年 5+ 个最佳 AI 视频生成网站|Runway、Pika、Kling AI、Canva 等2026 年创作者实际用于制作内容的视频编辑 AI 工具图像人工智能:释放……的工具AI 驱动的图像与视频分析了解 Grok 如何革新视频……2026 年 12 款最佳 AI 视频生成器(免费与付费)|Google Veo、Sora、Runway 等IDEC Group 的 Paul Lafargue:……的影响如何免费在线检测 AI 生成图像图像生成 AI 工具 🔥🔥什么是 Imagvio AI,以及它如何帮助创作者……TotalYmage 如何革新互动视频……最新 AI 动态——AI 接听 911、Meta 离线模型AI 工具Microsoft 发布 VASA-1,为视频生成式 AI 设立新标准视频创作的未来:2026 年最佳 AI 视频生成器🔸AI 生成视频:好还是坏?这才是真相!🤖🎥尖刻 AI 新闻汇总 #8我将使用 synthesia sora ai kling ai runway ai invideo 制作 AI 视频讲解使用 Chat GPT 的终极指南……AI 视频创作变得太疯狂了。什么是生成式 AI?完整技术指南 - RCN Guide如何使用 AI 创建新闻频道|AI 新闻视频生成器|AI 唇形同步AI

数据质量说明

Bluesky 的搜索 API 始终返回 403,未能达到 20 条的完成标准;Pinterest 无法获取发布时间和互动量,无法判断时效性。Reddit 与 X 因只使用单一搜索词,未能有意比较闭源与开源;开源话题因此集中于 Lemmy 和 YouTube。

图库