图像与视频生成 AI 新闻 — 2026-09-05
GPT-6 “Astra”本周在 X 和 Bluesky 上主导了闭源模型的话题热度;与此同时,开源视频/图像模型(LTX-2.5、MiniMax H3、Qwen-Image-3.0)几乎完全在 ComfyUI 生态中紧追不舍。而整体最重磅的一则新闻,是 Midjourney 从图像生成转向医疗超声设备。
图像与视频生成 AI 新闻汇总 ~闭源 vs 开源~ — 2026-09-05
嗨!本周图像与视频生成 AI 圈简直乱成一团www🔥 闭源阵营方面,**OpenAI 的 GPT-6「Astra」**在 X(原 Twitter)掀起了超过 1 亿播放量的热潮,几乎一骑绝尘😳 不过开源阵营也毫不逊色,LTX-2.5、MiniMax H3、Qwen-Image-3.0 等强劲模型接连以开放权重形式推出,ComfyUI 已经成了名副其实的母舰🛠️ 还有一件低调却很炸裂的事:Midjourney 据称放弃图像生成,转型为医疗超声扫描仪公司😱 这确实令人震惊。这次还有一个发现:比起技术进展,Reddit 用户更关心“AI 生成内容的法律认定”争议!
跨平台观察
- GPT-6 Astra 热潮:迅速登上 X 和 Bluesky(Simon Willison 的鹈鹕图像基准测试)的话题榜。X: https://x.com/OpenAI/status/2095595741528125780 / Bluesky: https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c 。有趣的是,Astra 并未被作为“图像/视频生成 AI”来营销,但大家都在用它测试 3D 建模和动画😂
- ComfyUI 成为事实上的开源基地:YouTube 和 Lemmy 都把 Wan、FLUX、Qwen-Image、LTX-2.5、MiniMax H3、Trellis.2 与 ComfyUI 一同讨论。YouTube: https://www.youtube.com/watch?v=3BFDcO2Ysu4 / Lemmy: https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native
- MiniMax H3 的“开源但商用收费”问题:Lemmy 上也成为话题(即使是 RTX 3060 级别设备可运行的视频模型,也需要经由 Comfy 的付费许可)https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller 。开源与闭源的边界正变得非常模糊🤔
- “争议与转型”比技术更容易爆火:Reddit(AI 生成 CSAM 的司法裁定,超过 800 条评论)https://www.reddit.com/r/news/comments/1w5k6pr/ 与 Lemmy(Midjourney 转向医疗设备,score 58~73)https://lemmy.zip/post/66397234 都呈现出这一共同现象。
分平台观察
Reddit:r/StableDiffusion 的月度汇总帖(Qwen3.8、DeepSeek-V4-Pro、Ling-3.0、Gemma-4-31B 等大量开源模型集中发布,连评论区都跟不上节奏)是神帖 https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/ 。另一个亮点是 World Labs 的 Atlas:可从视频/照片即时生成 3D 世界,也可能延伸至机器人领域 https://www.reddit.com/r/accelerate/comments/1w5ye9s/ 。不过热度最高的并非技术新闻,而是“AI 生成儿童色情内容受宪法保护”的判决讨论;法律和伦理话题似乎更能带动 Reddit。
X:搜索结果只得到 4 条 Astra 相关内容,GPT-6 Astra 基本独占舞台🎤 在 108,000,000 播放量的官宣推文之外,开发者 @Dimillian 展示的“从 Blender 到 UE5”3D 工作流最具技术含量https://x.com/Dimillian/status/2095596700815516004 。本次搜索范围内没有找到任何开源相关内容(Stable Diffusion、Flux、Wan 等),这是一个明显缺口。
YouTube:闭源阵营有 Nano Banana 2、Kling 3.0 vs Veo3.1 vs Sora2、Seedance2.5、Seedream5.0 Pro 等大量比较测评 https://www.youtube.com/watch?v=AAD7wJ3DWiA 。开源阵营则有 LTX-2.5(可在 6.8 秒生成 10 秒 720p 视频的极速模型)https://www.youtube.com/watch?v=RjlbDhs1MPk 、HunyuanImage3.0(800 亿参数 MoE)https://www.youtube.com/watch?v=U-8RjjU7x14 等。开放权重模型已经在发布后立刻被拿来与闭源模型直接比较。另有消息称 OpenAI 将结束 Sora API,并把资源集中到下一代模型“Spud”(YouTube 视频本身尚未核实,来自新闻渠道)。
Bluesky:Simon Willison 定期发布的“鹈鹕图像基准测试”已成为检验闭源模型质量的固定观测点 https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c 。Replicate 官方账号则充当 Kling3.0、Seedance2.0、Runway Gen-4.5、Vidu Q3 等视频模型发布快讯中心 https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c 。开源模型的第一手信息几乎不存在,甚至 LoRA 工具开发者 ostris 本人都说“AI/ML 圈基本还留在 X(Twitter)”😅 日语内容则主要是 GIGAZINE 分享 Qwen-Image-3.0 的文章 https://gigazine.net/news/20260722-qwen-image-3/ 。
Lemmy:!«メールアドレス» 是开源信息密度最高的社区。MiniMax H3 相关内容(Comfy 变为商业经销商https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller 、可在 16GB VRAM 上运行的工具等)占据近半数帖子。完整公开训练配方的 LLaDA-Image https://arxiv.org/abs/2609.03796 也很受关注。闭源方面,最受关注的不是新模型,而是“Midjourney 从图像生成转向医疗超声扫描仪业务”的新闻,得分远高于其他内容(58~73),成为 Lemmy 用户最关注的话题。
Pinterest:在视觉层面,闭源模型明显占主导:Google Veo2/3、Microsoft VASA-1、Grok4.6、Gemini 突破 10 亿用户都成了汇总图片题材;开源领域的专有名称几乎只有 AMD 的本地工具“Amuse 3.0”。“让脸动起来/生成脸部”的使用场景(口型同步、表情复现、肖像生成)尤其多,这似乎反映了 Pinterest 用户群(美容、社交媒体内容)与 AI 视频的高度契合。
值得关注
- GPT-6 Astra 的图像/视频方向后续消息 — X, https://x.com/flowith/status/2095750768204877858(GPT-6 Astra 与 GPT-5.6 的动画对决,预告即将推出)
- Sora API 结束→下一代模型“Spud” — 据 YouTube 调查,API 计划于 2026-09-24 结束。实际影像和功能仍无人确认
- MiniMax H3 商业许可化的走向 — Lemmy, https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller (开放权重、但商用收费的混合路线会否常态化)
- Midjourney 转向医疗设备 — Lemmy, https://lemmy.zip/post/66397234 (这家老牌闭源厂商是否会真正退出 AI 图像生成)
- LLaDA-Image 的完整开放训练配方 — Lemmy/arXiv, https://arxiv.org/abs/2609.03796 (在 Qwen-Image-Bench 名列前茅的开源模型将被多大程度复刻)
- World Labs 的 Atlas — Reddit, https://www.reddit.com/r/accelerate/comments/1w5ye9s/ (视频→3D 世界生成将如何转用于机器人训练数据)
建议
- X 的搜索不应继续依赖趋势话题,应改用“Stable Diffusion”“ComfyUI”“Flux”“Wan”“Kling”“Sora”等具体标签重新收集。
- Bluesky 的
searchPostsAPI 返回 403;下次可预先通过 Google 搜索扩充已知账号列表,以提高效率。 - 对 MiniMax H3 这类“开放权重但商用收费”的模型,报告中不应简单归类为“开源”,而应单独注明。
- Midjourney 转型、OpenAI 结束 Sora 等“大厂退出或转向”新闻,应在后续建立持续观察项,因为它们比技术新闻更容易吸引读者。
- Pinterest 的一手信息不足,更适合当作衡量普通消费者接受度的温度计,而不是技术趋势的一手来源。
- Reddit 和 Lemmy 显示,“司法裁定、伦理争议比技术新闻更容易爆火”的趋势,值得在下次简报中作为单独信号收录。
数据质量
- X:收集到的帖子由克罗地亚地区趋势驱动,除 4 条 GPT-6 Astra 内容外,其余均为无关噪声(加密货币、马斯克圈、体育等)。没有开源内容,未达到简报要求的“分析 20 条”。
- Bluesky:官方搜索 API 返回 403,改用逐一查看已知账号动态的方式。直接相关帖子约 12 条,几乎无法获取开源领域的一手信息。
- Reddit:仅使用一个搜索词,得到 12 个帖子、9 个子版块,未达到 20 条标准;但每帖最多记录了 6 条热门评论。
- YouTube:搜索结果与视频页为 JavaScript 渲染,无法直接确认播放量、订阅数和精确发布日期;日期由摘要中的相对时间推定。
- Lemmy:联邦式架构导致单一实例搜索会遗漏其他实例内容;直接搜索闭源视频服务(Sora、Kling、Veo 等)几乎没有结果。
- Pinterest:50 个条目中仅实际打开检查了 24 张图片,其余只查看标题;收集数据不含点赞、收藏等互动指标。
按平台汇总
Reddit — 图像与视频生成 AI 新闻
来源
收集到的 12 个帖子来自 9 个子版块。搜索词只有“Image and Video Generation AI News”。
| 子版块 | 订阅者数 | 收集帖子数 |
|---|---|---|
| r/generativeAI | 150,575 | 4 |
| r/GrokAiDiscussion | 4,883 | 1 |
| r/freetoolsAI | 7,616 | 1 |
| r/StableDiffusion | 1,000,814 | 1 |
| r/accelerate | 77,800 | 1 |
| r/news | 31,531,475 | 1 |
| r/antiai | 313,317 | 1 |
| r/allthequestions | 127,064 | 1 |
| r/teenagers | 3,673,210 | 1 |
r/generativeAI 的帖子数量最多(4 条),是工具寻找与比较类轻量讨论的中心。其他子版块各有一条;值得注意的是,话题已扩散至 r/news、r/teenagers 等并非专注于图像/视频生成的社区。
用户怎么说
- #4 r/StableDiffusion「Local AI News You Missed - August 2026」(201pt・22评论・2026-08-31, https://www.reddit.com/r/StableDiffusion/comments/1w3rwoe/) — 月度汇总称,仅 8 月就发布了 Qwen3.8、DeepSeek-V4-Pro-0813、Ling-3.0 系列、Gemma-4-31B 等大量开源模型。评论区还不断补充,u/Narutobirama(20) 表示“你可能漏掉了 Qwen3.8 Flash Next。”,u/MoJaKF(14) 表示“Anima-3.8B 已经发布 1.1 版本,3 小时前刚上线。”,显示模型发布速度快到汇总帖本身都难以跟上。
- #5 r/accelerate「…They built an AI that looks at a few casual real-world videos or photos and instantly turns them into a full 3D playground」(763pt・76评论・2026-09-03, https://www.reddit.com/r/accelerate/comments/1w5ye9s/) — 关于 World Labs 的 Atlas 可从视频/照片生成交互式 3D 世界。u/stainless_steelcat(48) 说:“《黑客帝国》的子弹时间来到了现实……现在我知道它当初还不够大胆。”反应很热烈,人们也在讨论视频生成技术成为机器人训练数据的可能性。
- #6 r/generativeAI「Same prompt. Same 30 seconds. Two different AI video models.」(98pt・30评论・2026-09-03, https://www.reddit.com/r/generativeAI/comments/1w60fip/) — 用相同提示词比较 Seedance 2.5 与 Wan 3.0。u/SpecialistDragonfly9(5) 认为“Seedance 明显强得多”,而 u/Positive-Key6640(4) 则质疑:“相同提示词比较很有趣,但它主要衡量模型是否碰巧喜欢你的提示词风格,而非哪个模型更好。”
- #2 r/GrokAiDiscussion「Have they loosened the image to video generation moderation」(14pt・28评论・2026-08-29, https://www.reddit.com/r/GrokAiDiscussion/comments/1w1w0e8/) — 用户对 Grok Imagine 的审核政策感受分歧。u/Miserable_Appeal515(2) 称“它变好了”,但 u/joderrelldalejr(2) 则说:“完全没有,它越来越糟,后来甚至开始限制你每周能生成多少图。”
- #1 r/generativeAI「List of daily AI video generative websites」(38pt・27评论・2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3frr2/) — 面向充分利用免费额度用户的信息交流。Kling AI 被介绍为“每 24 小时 66 个免费积分”;u/Murky-Race-3443(1) 提到“CapCut 也提供每日免费积分”;u/Julia_Leeds94(1) 介绍 YalleryLabs,“3 美元预算下,5 秒 720p 视频起价 0.18 美元”。
- #3 r/freetoolsAI「Free AI Image Generator」(31pt・31评论・2026-09-04, https://www.reddit.com/r/freetoolsAI/comments/1w6w0rj/) — 宣传免费、无需注册图像生成网站的帖子引发评论,u/Odd-Lingonberry1516(2) 列出了 Deepany、Aifun、Perchance 等替代工具。u/thecragmire(1) 也提出商业模式疑问:“你怎么维持它?肯定需要成本吧?”
- #11 r/generativeAI「GOOD image-to-video ??」(1pt・13评论・2026-08-29, https://www.reddit.com/r/generativeAI/comments/1w20rq1/) — Kling AI 被称为“真实人物动作方面几乎是王者”,Runway 则被评价为“创意控制的黄金标准”。本地方案方面,u/Ok-Addition1264(2) 推荐 ComfyUI+WAN22/LTX2.3。
- #7 r/generativeAI「Any good Ai video site ? Even if it paid ?」(0pt・15评论・2026-08-31, https://www.reddit.com/r/generativeAI/comments/1w3kptg/) — u/Previous-Course-5160(1) 认为 Runway 的 gen-3“相比很多粗糙输出,动作处理确实很好”,同时批评 Pika“很适合快速做小循环……但输出过一阵会变得千篇一律”。
- #8/#10 r/news「Federal Judge rules AI generated child sex abuse material is protected by First Amendment.」(1,379pt・545评论・2026-09-02, https://www.reddit.com/r/news/comments/1w5k6pr/) 与 r/allthequestions「Why did a federal judge declare the creation of AI generated child porn as legal?」(31pt・277评论・2026-08-31, https://www.reddit.com/r/allthequestions/comments/1w3hf3o/) — 围绕 AI 生成内容法律地位的讨论获得了异常高的互动。u/Ntroepy(414) 指出“这个标题像点击诱饵……受 2002 年最高法院判决约束”,认为标题容易误导;r/allthequestions 的 u/TheGracefulCrane(31) 则整理法律解释:“法官不制定法律,而法律尚未更新为禁止,因此才有该裁定。”
- #9 r/antiai「AI generated images are becoming harder to detect」(113pt・30评论・2026-08-30, https://www.reddit.com/r/antiai/comments/1w2mr8g/) — 与标题相反,实际评论主要在拿肢体崩坏开玩笑,例如 u/GurInside278(31) 说:“为什么她的脚是手?”形成讽刺反差。
- #12 r/teenagers「To all AI image/video generator users」(7pt・41评论・2026-08-31, https://www.reddit.com/r/teenagers/comments/1w2y305/) — 针对“AI 艺术不需要艺术家劳动”这一主张的反驳帖。u/LiterallyGarbage_0(5) 说:“使用 AI 做‘艺术’的人真的让我很难受……去拿起一支铅笔吧。”显示青少年群体强烈的反 AI 情绪。
信号
- 上升:开源本地模型(LLM/图像/视频)的发布频率高到仅 #4 的评论区就难以追踪。World Labs 的 Atlas(#5)这类“视频生成→机器人训练数据”的转用,也是新的热度方向。
- 观点冲突:Grok Imagine 的审核(#2)评价完全两极;Seedance vs Wan(#6)也同时存在“Seedance 碾压”和“同提示词比较本就意义有限”的观点,不能得出单一结论。
- 被轻视/受质疑:以相同提示词比较模型这一常见格式(#6)本身,就受到 u/Positive-Key6640 的方法论批评。
- 意外之处:标题称“AI 图像更难辨认”的 #9,实际却成了肢体崩坏笑话;此外,司法裁定(#8、#10,合计超过 800 条评论)的互动规模远超产品新闻,说明 Reddit 上“AI 生成内容的法律与伦理处理”比“技术进步”更容易引爆争议。
限制
- 搜索词只有“Image and Video Generation AI News”,仅收集到 12 个帖子、9 个子版块,未达到 brief.md 要求的“每个网络约 20 个帖子”。
- 本阶段只读取工作器预先收集的
output/reddit.threads.md/.threads.json,没有使用额外搜索词重新收集,也未直接访问单独帖子或评论(遵照 playbook 指示)。可能的遗漏很可能在该单一搜索词范围之外。 - 每个帖子最多记录 6 条热门评论,较低排名的反应及少数意见未被纳入本报告。
X
X — 图像与视频生成 AI 新闻
账号
在本次收集的 34 个账号中,只有 4 个发布了与图像/视频生成 AI 有关的内容,而且都围绕同一次发布、集中在同一 24 小时内(2026-09-03):
- @OpenAI (OpenAI) — 仅一条帖子,却占据了整个叙事:309,095 个赞、55,587 次转发、约 108,000,000 次浏览。该账号只发了一条带图片的官宣推文,热度自行爆发。
- @MatthewBerman (Matthew Berman) — AI 网红账号,一条帖子(4,054 个赞、约 1,500,000 次浏览),以“提前体验”的实测串文呈现,将自己定位为测试者而非消息源。
- @Dimillian (Thomas Ricouard) — 一条帖子(7,199 个赞、约 2,300,000 次浏览),展示具体的 Blender → Unreal Engine 5 流程,而非泛泛炒作,是集合中最具体的技术主张。
- @flowith (Flowith) — 本组最小账号(947 个赞、约 115,000 次浏览),借发布热度推广其与上一代模型的正面对比。
集合中的其他账号(共 34 个账号、40 条帖子)——加密货币/迷因账号(@songoncardano、@nmkr_io、@legsdotfun、@robincatonhood)、马斯克/Tesla 粉丝账号(@LunarOptimus、@Optimus_RH、@HeavyMetalShip)、网络安全网红(@corewarrior、@hackerzspace)、波兰/非洲/波斯尼亚新闻及迷因账号、Ariana Grande 粉丝账号(@vodolove 的 4 条中有 3 条),以及啤酒品牌抽奖账号(@naturallight、@ChinookCi)——均与图像或视频生成 AI 无关。之所以提及它们,只是因为这就是收集实际返回的结果;参见限制部分。
帖子
1. GPT-6 “Astra”发布 — @OpenAI
- 309,095 个赞 · 55,587 次转发 · 7,713 条回复 · 约 108,000,000 次浏览 · 2026-09-03
- https://x.com/OpenAI/status/2095595741528125780
“这就是 GPT-6 Astra。凡是你能在电脑上做的事,Astra 都能快速替你完成。”
这是全部收集内容中规模最大的一条,远超其余帖子。其定位是通用计算机操作代理,而非专门的图像/视频模型;但其他账号随后展示的内容(如下)均与视觉/3D 有关,暗示 Astra 展示的强项更偏向这一侧。
2. Astra 与上一代模型的动画对比 — @flowith
- 947 个赞 · 69 次转发 · 19 条回复 · 约 115,000 次浏览 · 2026-09-04
- https://x.com/flowith/status/2095750768204877858
“GPT-6 Astra VS GPT-5.6 的动画对比即将在 flowith.io 推出”
第三方产品账号明确设置了 Astra 与上一代模型的动画能力对比——这是 Astra 正被专门测试、营销为动画生成能力的直接信号,而不只是通用计算机操作。
3. 提前体验实测串文 — @MatthewBerman
- 4,054 个赞 · 494 次转发 · 210 条回复 · 约 1,500,000 次浏览 · 2026-09-03
- https://x.com/MatthewBerman/status/2095595892464333065
“Astra(GPT-6)来了!!!我提前获得了使用权,疯狂测试了游戏、代码、写作、浏览器控制、演示文稿和通用知识工作等内容。这是我用过的最好的模型。毫无疑问。”
值得注意的是它没有提到什么:尽管串文承诺下方有“精彩演示”,能力列表中没有明确提及图像或视频生成。
4. Blender 到 Unreal Engine 5 演示 — @Dimillian
- 7,199 个赞 · 1,145 次转发 · 259 条回复 · 约 2,300,000 次浏览 · 2026-09-03
- https://x.com/Dimillian/status/2095596700815516004
“Astra 很擅长 3D 建模,我迫不及待想让大家体验它。现在先来看看我是如何构建发布博客中演示房屋的:从 Blender 场景到 Unreal Engine 5 中可行走的体验。”
这是集合中最具体、最依赖工具的主张:Astra 用于真实的 3D 内容管线(Blender → UE5),比 X 本次发现的其他内容都更接近视频/视觉生成工作流。
信号
- 上升:GPT-6 “Astra”是本次收集唯一出现的图像/视频相关故事,互动量压倒性领先(仅官宣就约 1.08 亿浏览,而其他内容只有十万至数百万)。在 24 小时内出现的产品对比、网红实测、开发者 3D 工作流演示,读起来更像协同发布,而非自然发现。
- 被忽略/缺席:本次收集没有出现任何开源图像或视频模型(Stable Diffusion、Flux、Wan、HunyuanVideo、Kling、ComfyUI 等)。如果 X 上目前确有开源图像/视频 AI 动态,这轮搜索没有触及。
- 意外之处:这场“AI”发布讨论几乎没有直接把图像或视频生成列为功能——Matthew Berman 的提前体验列表完全没提到,Astra 也被宣传为通用代理(“凡是你能在电脑上做的事”)。图像/视频角度来自早期测试者选择展示的内容(3D 建模、动画对比),而非 OpenAI 自身的表述。
限制
- 收集搜索并未面向此主题。 实际搜索的十个词——“Astra”“$SONG”“Robinhood”“Elon”“#CyberSecurity”“Poland”“Africa”“Bosnia”“ariana”“#Sweepstakes”——是本次 X 自身趋势话题列表(参见
x.posts.md中的 Explore 表),而非为图像/视频生成 AI 选择的搜索词。只有 “Astra” 搜索(帖子 #1–4)得到主题相关结果;另 36 条(加密代币、马斯克/Tesla 粉丝内容、网络安全网红、波兰/非洲/波斯尼亚新闻及迷因、Ariana Grande 粉丝账号、啤酒抽奖)均为搜索词不匹配造成的无关噪声。 - 数据未达到完成标准。 简报要求每个平台分析约 20 个与主题相关的帖子;本次仅有 4 条可用帖子,且全都围绕同一闭源发布(GPT-6 Astra),开源图像/视频生成内容为零。要真正覆盖简报主题,需要使用“Stable Diffusion”“ComfyUI”“Flux”“Kling AI”“Runway”“Sora”“Midjourney”“Wan 2.x”或“HunyuanVideo”等词重新搜索。
- 地理定位提醒: 本会话中 X Explore 的趋势大多明确标注为“Trending in Croatia”,因此加密代币、波斯尼亚足球和巴尔干地区新闻/迷因占据了种子趋势列表——这代表一个服务器位置的趋势,而非全球情况。
- 完全没有开源覆盖。 本次收集没有触及任何开源图像/视频生成新闻、工具或发布;这不是部分缺失,而是彻底缺口。
YouTube
YouTube — 图像与视频生成 AI 新闻(闭源 / 开源)
频道
通过 YouTube 搜索结果和新闻搜索发现的频道。许多视频页为 JavaScript 渲染,无法直接确认订阅者数(详见 ## 限制)。
- Theoretically Media — 经常用 ComfyUI 测试 Wan / FLUX / Qwen-Image 等开源生成 AI 的代表频道。("Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial..." https://www.youtube.com/watch?v=3BFDcO2Ysu4)
- Matt Wolfe / The Next Wave — 以 Runway、Kling、Veo、Sora 等闭源 AI 工具比较企划而闻名。
- 发布 LTX-2.5、MiniMax H3、Nano Banana 2 等个别模型评测的多个人工智能工具个人频道(搜索结果未显示频道名,只能确认视频标题)。
视频
闭源模型
- 「Nano Banana 2 Is INSANE – Full Test of Google's New Image Model!」 — 约 2026-02-26 — https://www.youtube.com/watch?v=k0dujOUePeU — 实测 Google 的 Gemini 3.1 Flash Image(昵称 Nano Banana 2),声称其解决了速度与画质之间的取舍。
- 「Nano Banana 2 vs Nano Banana Pro: I Tested Both So You Don't Have To」 — 2026 年 2 月底 — https://www.youtube.com/watch?v=B1d3SIfoQLk — 比较标准版与 Pro 的输出,验证该选哪个。
- 「Kling 3.0 Surprised Me! Compared To Veo 3.1 & Sora 2」 — 约 2026-02-05 — https://www.youtube.com/watch?v=AAD7wJ3DWiA — 将快手的 Kling 3.0 与 Veo 3.1、Sora 2 直接比较,认为其在影像真实感与镜头调度上表现不俗。
- 「Is Kling 3.0 Actually Good? (I Spent $500 Testing For You)」 — 约 2026-02-04 — https://www.youtube.com/watch?v=Rme22R7a9O8 — 实际付费测试 Kling 3.0 的多镜头与 4K60fps 输出。
- 「Seedream 5.0 Tested & Seedance 2.5 Leaks Are Unreal!」 — 约 2026-07-15 — https://www.youtube.com/watch?v=pn-YwWn3kkM — 测试字节跳动的 Seedream 5.0 Pro 图像模型及尚未发布的 Seedance 2.5(提到字节跳动跳过了 Seedance 2.1)。
- 「Seedance 2.5 Is Insane — 30 Seconds In ONE Shot?」 — 约 2026-06-23 — https://www.youtube.com/watch?v=8sGVhuoPOXI — 验证 Seedance 2.5 可在单个镜头中生成连续 30 秒画面。
- 「MiniMax H3 Review | Testing Hailuo's New 2K AI Video Model」 — 2026 年 8 月上旬 — https://www.youtube.com/watch?v=67CCQBAwZiA — 实测 2026-07-31 发布的 MiniMax H3(Hailuo 3.0),确认 2K、15 秒和原生立体声音频。
- 「Hailuo AI's NEW MiniMax H3 Model Is INCREDIBLE! (Full Test)」 — 约 2026 年 8 月 — https://www.youtube.com/watch?v=la0iBk8g8_g — 全面测试 MiniMax H3 的全模态能力(同时输入文本、图像、视频和音频)。
- 「FLUX 3 Sneak Peek」 — 2026-07-23 — https://www.youtube.com/watch?v=PCPhl8qMF_Y — 预览 Black Forest Labs 的 FLUX 3(图像、20 秒视频、音频、动作的多模态能力;视频于 2026-08-04 正式可用)。
- 「Gen-4.5 Updates — Research Demo Day 2025 | Runway」 — 2025-12-16 — https://www.youtube.com/watch?v=yNXxuzmiwEo — Runway 官方对 Gen-4.5 技术更新的说明(镜头控制、角色一致性)。
- 「All in one AI | Text to Image & Video AI | Kling, Veo, Sora, Nano Banana Pro | Daily Free Credits!」 — 最近 — https://www.youtube.com/watch?v=SnmRpf_VfgU — 介绍如何通过免费额度集中使用多个闭源 AI(Kling、Veo、Sora、Nano Banana Pro)。
开源模型
- 「LTX 2.5 In ComfyUI — Setup, First Gens, And The Catch」 — 2026 年 8 月中旬(发布约 3 周后,针对 2026-08-11 的 LTX-2.5 开放权重发布)— https://www.youtube.com/watch?v=RjlbDhs1MPk — 在 ComfyUI 中原生接入 Lightricks 的 220 亿参数世界模型 LTX-2.5,确认其可在 6.8 秒生成 10 秒 720p 视频。
- 「LTX 2.5 ComfyUI: Physics Test vs MiniMax H3 + Free Workflows」 — 约 3 周前 — https://www.youtube.com/watch?v=WpKNXZZqQEU — 让开放权重 LTX-2.5 与闭源 MiniMax H3 在物理模拟和多镜头方面直接对比。
- 「New LTX 2.5 Video Model is INSANELY Fast (ComfyUI Local)」 — 约 3 周前 — https://www.youtube.com/watch?v=pA2BQw9LY8A — 聚焦本地运行速度的测试。
- 「Wan 2.2, FLUX & Qwen Image Upgraded: Ultimate Tutorial for Open Source SOTA Image & Video Gen Models」 — Theoretically Media — https://www.youtube.com/watch?v=3BFDcO2Ysu4 — 在 ComfyUI 中讲解 Wan 2.2(MoE 视频模型)、FLUX、FLUX Krea 和 Qwen Image;评价 Wan 2.2 的一致性接近 Sora,FLUX 则在细节上更有优势。
- 「HunyuanImage 3.0 — The Most Powerful Open-Source Image Generator Yet」 — 2025-09-30 — https://www.youtube.com/watch?v=U-8RjjU7x14 — 介绍腾讯 800 亿参数 MoE 图像模型;提到它相较 Seedream 4.0、Nano Banana、GPT-Image 以微弱差距取得更高胜率。
- 「Flux.2 Dev: Full Review, Pros & Cons, ComfyUI Setup!」 — 约 2025-11-26 — https://www.youtube.com/watch?v=MoAwonm53hQ — 评测 Black Forest Labs 的 FLUX.2(含开放权重版本)及其 ComfyUI 设置;介绍它最多可用 10 张参考图维持主体一致性。
- 「FLUX 2 Released! 🤯 ComfyUI Install, Workflow & The "Active Parameter" Secret」 — 约 2025-11-26 — https://www.youtube.com/watch?v=nfeDS_EoblE — 讲解 FLUX.2 的 ComfyUI 安装步骤和新功能。
- 「Qwen Image First Look & LOCAL Testing (The BEST New Image Model?)」 — 2025-08-05 — https://www.youtube.com/watch?v=ex2YCqtTHSY — 首次验证阿里巴巴 Qwen-Image 的本地运行(后续 Qwen-Image-2512 的前身)。
- 「Qwen Image Edit 2511–Local Image Editing in ComfyUI | Multi-Reference Style Transfer & GGUF Workflow」 — 2025-12-26 — https://www.youtube.com/watch?v=iFnTqZmsRIc — 在 ComfyUI 的 GGUF 工作流中测试 Qwen Image Edit 的多参考图风格迁移。
- 「MiniMax H3: The New Open-Source Video Champ?」 — 约 2026 年 8 月 — https://www.youtube.com/watch?v=3R5GROj8Tcg — 将 MiniMax H3 介绍为开放权重发布的全模态视频模型,并提及其在视频编辑排行榜上排名第一。
信号
- 开放权重快速逼近前沿水平:LTX-2.5(2026-08-11)和 MiniMax H3(2026-07-31)均在最近 60 天内以开放权重发布,视频缩略图中常见“媲美/超越闭源 MiniMax H3”的比较切入点。开源阵营不再是“追随者”,发布后立即成为对照对象。
- 字节跳动的快速发布周期:Seedream 5.0 Pro 与 Seedance 2.5(跳过 2.1)每隔数月更新,YouTuber 的测试内容也带有强烈的“Tested”“Leaks”即时新闻色彩。
- Google 阵营重组:整个 Imagen 产品线计划于 2026-08-17 停止,向 Nano Banana(Gemini 3.x Image 系列)迁移正在进行。Nano Banana 2(2026-02-26)本身也已经出现多支后续比较视频(vs Pro)。
- 闭源大厂退出:据搜索结果,OpenAI 将于 2026-09-24 结束 Sora API,并将算力转向下一代模型“Spud”(YouTube 视频未确认)。这直接构成闭源动态的重要转折。
- ComfyUI 成为事实上的开源验证底座:Wan、FLUX、Qwen-Image、LTX-2.5 等开源模型的评测,几乎都与 ComfyUI 的安装步骤一同出现。
限制
- YouTube 搜索页(
youtube.com/results?...)和视频页(youtube.com/watch?v=...)由 JavaScript 渲染,直接抓取只得到页脚导航链接,无法直接读取播放量、订阅数、发布日期等原始数据(ytInitialData等)。因此日期由搜索引擎摘要出现的信息(如“3 weeks ago”等相对时间)和文章内提及推定,大多数视频的准确播放量和频道订阅数无法确认。 - 未找到直接讨论 OpenAI 结束 Sora、后续模型“Spud”的 YouTube 视频;此项依据新闻文章提及,YouTube 上的反应视频尚未确认。
- 本次搜索找到了 Runway Gen-4.5 和 Midjourney 的官方发布视频,但未找到独立评测者在最近 60 天内制作的直接验证视频。
- 能确认 Nano Banana Pro 单独测评视频链接(如标题“Nano Banana Pro… wtf”),但无法获得频道名和播放量。
Bluesky
Bluesky — 图像生成 AI、视频生成 AI 最新动态
账号
- Simon Willison @simonwillison.net — 以评测 LLM/图像生成模型闻名的开发者。每次新模型出现时,都会用固定的“鹈鹕图像基准测试”发布对比图。其关注者互动也多,是优质的闭源新闻一手来源。
- fofr @fofr.ai — 活跃于 Replicate 周边的图像生成提示词创作者,经常分享 Nano Banana Pro(Gemini 3 Pro Image)的实用方法。
- Replicate(官方) @replicate.com — AI 模型 API 托管公司的官方账号。每当新模型上线 Replicate 即发布公告,是闭源和开源视频生成模型的发布快讯来源。
- Amanda Silberling(TechCrunch 记者) @amanda.omg.lol — 关注 AI 图像生成文化层面的记者。
- AI News Updates @ai-latestnews.bsky.social — 自动发布 AI 行业新闻的机器人账号。
- gigowat @gigowat.bsky.social — 分享日本数码新闻网站 GIGAZINE 文章的账号,是少数使用日语发布图像生成 AI 新闻的来源。
- ostris @ostris.com — 开源 LoRA 训练工具“AI-Toolkit”开发者。会发布 Flex 系模型消息,但据其本人所说“AI/ML 圈基本都还在 Twitter”,因此 Bluesky 上更新较少。
帖子
-
Simon Willison — 发布 GPT-6 Astra 与 GPT-5.6 Sol/Terra/Luna 的鹈鹕图像对比网格(闭源、OpenAI 系图像模型比较)。2026-09-04,👍91・🔁6・💬12。
https://bsky.app/profile/simonwillison.net/post/3mupxubgrls2c
后续还发布了生成图像的全尺寸版(替代文本也由 GPT-5-astra 生成)。👍23。
https://bsky.app/profile/simonwillison.net/post/3mupxztoyqs2c -
Simon Willison — 发布使用 Google Gemini 3.7 Flash 生成的鹈鹕图像对比。2026-09-02,👍6。
https://bsky.app/profile/simonwillison.net/post/3muitt5g3q22r -
fofr — 分享用 Nano Banana Pro(Gemini 3 Pro Image)复现复古游戏风格渲染的详细提示词。2026-01-19,👍31。
https://bsky.app/profile/fofr.ai/post/3mcrt3avp222p
同日还发布了生成街景视图风格截图的提示词。👍10。
https://bsky.app/profile/fofr.ai/post/3mcrilugr5c2m -
Replicate(官方) — 宣布 OpenAI 的“GPT Image 2”已在 Replicate 可用,介绍其写实性、文字渲染精度以及在 UI/设计用途上的优势(闭源)。2026-04-21。
https://bsky.app/profile/replicate.com/post/3mjzygaefs224 -
Replicate(官方) — 宣布字节跳动视频生成模型“Seedance 2.0”向全部用户开放。它可将文本、图像、视频、音频整合到同一场景,并同步生成立体声(闭源)。2026-04-09。
https://bsky.app/profile/replicate.com/post/3mj3junhvnh26 -
Replicate(官方) — Runway 的 Gen-4.5 上线 Replicate,强调物理真实感的视频生成能力(闭源)。2026-02-18。
https://bsky.app/profile/replicate.com/post/3mf5fbf6u4l2c -
Replicate(官方) — 快手 Kling 3.0(+o3)上线 Replicate,支持多镜头 4K 和音频同步(闭源)。2026-02-17。
https://bsky.app/profile/replicate.com/post/3mf35lkhoyw2q -
Replicate(官方) — 视频生成模型“Vidu Q3”上线 Replicate。支持从文本/图像/首尾帧生成,最长 16 秒、1080p(闭源)。2026-03-11。
https://bsky.app/profile/replicate.com/post/3mgsan3ddpl2w -
Amanda Silberling(TechCrunch) — 征集专家意见,询问为什么 AI 生成食物图像常有独特的视觉观感;是关于 AI 图像美学特征的采访请求。2026-08-28,👍17・🔁5・💬4。
https://bsky.app/profile/amanda.omg.lol/post/3mu5itcncgc2x -
AI News Updates(机器人) — 报道“Midjourney Inc. 收购了占星应用 Co-Star,并将推出新的图像生成应用”。2026-07-25。内容与 TechCrunch、Bloomberg 的报道(2026-07-24,报道称收购于当年春季完成)相符,可交叉验证。
https://bsky.app/profile/ai-latestnews.bsky.social/post/3mrh6gdxnqy2s -
gigowat(分享 GIGAZINE 的日语文章) — 分享介绍开源图像生成 AI“Qwen-Image-3.0”的 GIGAZINE 文章,文章测试了它在插画和日语文字绘制方面的性能。2026-07-22。
https://bsky.app/profile/gigowat.bsky.social/post/3mr7dvb332z2q
(原文: https://gigazine.net/news/20260722-qwen-image-3/ ) -
ostris — 宣布开源图像模型“Flex.2-preview”发布,整合 text-to-image、universal control 与 inpainting。虽然是较早帖子(2025-04-22),但仍是 Bluesky 上开源模型开发者直接发声的少数例子。👍4。
https://bsky.app/profile/ostris.com/post/3lngo5cf66k2a
信号
- 闭源占优:Bluesky 上真正有互动的帖子集中在 GPT、Gemini(Nano Banana Pro)、Midjourney 等大型闭源模型。特别是 Simon Willison 的“鹈鹕图像基准测试”,每当新模型出现便会进行持续对比,实际上已成为闭源图像模型质量检查点。
- Replicate 账号是视频生成快讯中心:Kling 3.0、Seedance 2.0、Runway Gen-4.5、Vidu Q3 等 2026 年主要视频模型均通过 Replicate 官方账号发布。点赞数不高(1~2 个),但适合按时间线追踪模型登场顺序。
- 开源阵营在 Bluesky 上发声不足:对于 Wan 2.7(阿里巴巴)、HunyuanVideo 1.5(腾讯)、Chroma、LTX-2.3 等 2026 年主要开放权重模型,几乎找不到 Bluesky 上的一手提及。开源 LoRA 训练工具开发者 ostris 也亲自称“AI/ML 圈基本还留在 Twitter”,表明社区重心偏向 X(原 Twitter)。
- 日语内容主要来自 GIGAZINE 转发:日语帖子以 gigowat 这类新闻网站文章转载为主,未找到独立的一手分析。
限制
- Bluesky 官方帖子搜索 API(
app.bsky.feed.searchPosts)在本次 WebFetch 中始终返回403 Forbidden,无法通过关键词全面收集带点赞和转发数的帖子(getProfile、getAuthorFeed、getPostThread、oEmbed 正常)。因此改为通过 Google 搜索发现已知账号,再逐一使用getAuthorFeed查看。 bsky.app搜索页本身是 JavaScript 渲染的 SPA,因此 WebFetch(仅 HTML→Markdown 转换)无法获得帖子正文。- 受此限制,无法以“按特定模型名检索并检查所有帖子”的方式做完整调查,只能从知名账号近期动态中筛选相关内容。合计检查了 20 多条帖子/动态,但直接与图像、视频生成 AI 相关的约为上述 12 条。
- 对 Wan、HunyuanVideo、Chroma、Z-Image 本体、LTX-2.3 等开源模型,尝试多个相关账号后仍未找到 2026 年的对应帖子。huggingface.bsky.social 的帖子流为空,civitai-bot.bsky.social 则自 2024 年 5 月起停止更新。
- 曾发现个人账号帖子声称“Midjourney 成为 Meta.ai 的一部分”(2026 年 2 月),但外部报道核实后发现实际是 2025 年 8 月的许可协议,Midjourney 仍保持独立,并非收购,因此未采用该不准确信息。
Lemmy
Lemmy — 图像与视频生成 AI 最新动态(闭源/开源)
社区 (Communities)
- !«メールアドレス» — 5,708 人。讨论各类开放权重图像、视频生成 AI 的技术社区,是本次调查信息密度最高的社区。
- !«メールアドレス» — 2,360 人。分享 Stable Diffusion 系模型作品,新闻内容较少。
- !«メールアドレス» — 1,593 人。动漫 AI 艺术专用,新闻性较低。
- !«メールアドレス» — 50 人。自动转载 Reddit RSS 的机器人社区;需注意不是人类讨论。
- !«メールアドレス» 以及 !«メールアドレス» — 通用科技新闻社区。单独关于图像/视频生成 AI 的内容较少,常被埋没在泛 AI 文章中。
- Lemmy 上没有类似 Reddit r/StableDiffusion 规模的大型图像/视频生成 AI 专属社区;话题分散在上述较小社区中。
帖子 (Posts)
开源模型
- MiniMax H3:Comfy 成为商业许可证官方经销商 — !«メールアドレス»,score 4,2026-08-28。原文: https://blog.comfy.org/p/comfy-is-now-the-only-official-reseller 。MiniMax H3 是 2026 年 8 月发布的开放权重视频生成模型,可在 RTX 3060 级 GPU 上本地运行,生成 2K、带原生立体声音频的视频。Comfy 成为其商业许可证(Professional/Enterprise)的销售代理,Enterprise 版还可使用未蒸馏模型。
- LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes — !«メールアドレス»,score 2,2026-09-04。https://arxiv.org/abs/2609.03796 。图像生成模型的训练配方完全公开,在 Qwen-Image-Bench 获得顶尖分数,也有快速蒸馏 Turbo 版本。
- Trellis.2 和 Pixal3D 原生集成进 ComfyUI — !«メールアドレス»,score 4,2026-09-01。https://blog.comfy.org/p/trellis2-and-pixal3d-are-now-native 。公告称“最好的开放 3D 生成模型已成为 ComfyUI 核心的一部分”。
- ComfyUI-MiniMaxH3-CLSS — !«メールアドレス»,score 0,2026-09-01。https://github.com/nazgut/ComfyUI-MiniMaxH3-CLSS 。面向 MiniMax H3 的工具,声称在仅 16GB VRAM 的消费级设备上也可生成任意长度、带声音的视频。
- Fizgig LoRA/LoKR Studio — !«メールアドレス»,score 4,2026-08-30。https://github.com/shootthesound/Fizgig 。面向 Krea 2、MiniMax、Klein 9B 等多个模型家族训练、提取 LoRA/LoKR 的开放工具。
- VibeVoice-ComfyUI(将 Microsoft 开源 TTS 整合至 ComfyUI) — !«メールアドレス»,score 1,2026-08-28。https://github.com/nikhilprasanth/VibeVoice-ComfyUI 。把声音纳入视频生成工作流的一个例子。
- Boogu-Image-0.1 — Efficient Image Generation Foundation Model — !«メールアドレス»,score 5,2026-06-17。轻量、高效率导向的开放图像生成基础模型。
闭源模型
- Midjourney 从图像生成 AI 转向医疗超声扫描仪业务 — !«メールアドレス»,score 58,2026-06-18。https://lemmy.zip/post/66397234 。相关讨论很多(Hacker News 镜像等,score 40 以上),围绕“Midjourney Medical”“Ultrasonic CT”展开,是老牌闭源图像生成服务转向的重大新闻。
- Midjourney 要求好莱坞工作室披露 AI 使用细节 — !«メールアドレス»,score 73,2026-07-05。https://lemmy.today/post/56011946
- Google 推出新图像生成模型“Nano Banana 2 Lite” — !«メールアドレス»,score 0,2026-07-02。https://lemmy.world/post/48936394(hackernews镜像: https://lemmy.bestiver.se/post/1199483 )
- Microsoft 的 MAI-Image-2.5 在基准测试中逼近 Google Nano Banana 2 — !«メールアドレス»,score 1,2026-05-28。https://lemmy.durstig.online/post/35068
- Seedream 5.0 Pro 实机比较评测 — !«メールアドレス»,score 1,2026-07-10。https://lemmy.durstig.online/post/46063
- Runway 宣布企业业务翻倍、净收入留存率超过 300% — !«メールアドレス»,score 0,2026-08-30。https://lemmy.durstig.online/post/56937
- Google Earth AI 功能在公开翌日因 NSFW 生成问题悄然撤回 — !«メールアドレス»,score 1,2026-08-07。https://lemmy.durstig.online/post/52162
信号 (Signals)
- 开源一侧几乎全是“MiniMax H3”:2026 年 8 月末到 9 月初,stable_diffusion 社区近半帖子都围绕 MiniMax H3——视频生成、可在 RTX 3060 级别本地运行、支持音频——的 ComfyUI 扩展和加速工具。它正呈现成为开放视频生成事实标准的势头。
- 开源和闭源边界模糊:MiniMax H3 是“开放权重”,但商用需要通过 Comfy 购买许可证。免费使用、商用收费的开源/闭源混合模式正显示出成为主流的迹象。
- 闭源最大新闻是“退出”:相较新模型竞赛,Midjourney 从图像生成转向医疗设备的新闻——即闭源巨头之一跨界转向——得分高得多(58~73),最受 Lemmy 用户关注。
- 3D 生成也在整合进 ComfyUI:Trellis.2、Pixal3D 等开放 Text/Image-to-3D 模型成为 ComfyUI 核心功能,说明不仅图像与视频,3D 资产生成也正进入本地工作流。
- Lemmy 整体没有大型图像/视频生成 AI 专属社区,话题分散在数千人规模、偏技术的 stable_diffusion 社区,以及如自动转载 Reddit 内容、仅 50 人的 ai_reddit 小型机器人社区中。
限制事项 (Limits)
- Lemmy 为联邦式网络,搜索 API 只覆盖单一实例的索引,因此
lemmy.worldAPI 搜索会遗漏其他实例(lemmy.dbzer0.com、lemmy.today等)的帖子。本次跨多个实例 API 和搜索补充,但并不完整。 lemmy.ml的localllama社区在直接获取社区信息(/api/v3/community)时返回 404,无法确认详情。!«メールアドレス»是机械转载 Reddit RSS 的机器人社区,订阅者仅 50 人,几乎无人类讨论。可作为新闻线索,但不应当作“Lemmy 讨论热度”指标。- 对闭源视频服务(Sora、Kling、Runway Gen、Veo 等)的 Lemmy 直接搜索(
Sora、Kling AI、Veo、Runway Gen)几乎只得到无关帖子(地名、人名、时事),找不到具体讨论。有关 Runway 的内容只收集到一条财报相关帖子。 - 帖子数量相比 Reddit 等极少(得分大多在个位数到几十),Lemmy 单独不足以支撑“精读 20 条帖子后总结趋势”。本次使用 7 种相关查询跨多个实例执行,从真实命中的帖子中挑选代表例。
Pinterest — 图像与视频生成 AI 新闻
视觉主题
- “YouTube 缩略图/博客头图”风格占绝大多数。 黑色至深蓝背景,搭配霓虹蓝、紫、橙色渐变和粗无衬线标题(“AI NEWS”“THE FUTURE IS AI”“BREAKING NEWS”“AI IS CHANGING EVERYTHING!”等)。多数内容并非实际生成结果,而是谈论 AI 的文章或视频封面 [2, 7, 11, 38, 39, 42, 48]
- 人脸和肖像是核心母题。 表情动画、口型同步、脸部复现(Microsoft VASA-1)、AI 肖像拍摄(ChatGPT+Higgsfield)等“让脸动起来/生成脸”的用途反复出现 [13, 14, 18, 23, 50]
- 人形机器人/机器人视觉经常被用作泛 AI 的符号。 大量与具体工具无关的白色机器人侧脸或赛博女性等通用素材图 [2, 39]
- “前后对比”“一张输入图→多种风格输出”的网格布局。 将实拍视频变为木质、折纸、乐高积木、花束等的比较网格(推测为 Luma 类工具),以及将毛绒角色合成到真实背景中的对比图 [3, 31]
- 工具比较、排行形式的信息图。 以 Logo 排列清单、“Best Quality (Paid) vs Best Free”对照、带勾选符号的功能比较等,帮助选择工具的汇总图很显眼 [7, 37]
- 使用现实名人风格人脸的缩略图。 类 Jeff Bezos 的 AI 肖像、像 YouTuber 的胡须“AI NEWS”解说者、NVIDIA 的 Jensen Huang 演讲照片等,意在营造可信度与话题性 [11, 36, 40]
- 脸部网格/线框叠加效果。 在人物脸部和颈部叠加网格线、数字标签,呈现类似表情分析或生物识别的画面,用于广告式 Pin [23, 50]
- 统一的色彩调性。 深色基调加青色/洋红/黄色霓虹点缀,已成为几乎所有 AI 工具 Pin 的共同视觉语言 [2, 7, 38, 39, 42]
重点 Pin
- [1] Image to Video AI: How It Works and Why It Matters — 一篇解释文章的头图,以图示说明从一张静态图生成多个帧组成“视频时间线”的机制。
- [3] Google announces ultra-high quality video...(实际为 Luma 类身份保持风格转换演示) — 将源视频转换为木材、折纸、乐高、花朵等材质的 3×5 网格。在保持同一人物、同一车辆一致性的同时只改变质感,是容易理解的技术演示。
- [7] 6+ Best AI Video Generation Websites — 将 Runway、Pika、Kling AI、Luma AI(Dream Machine)、Canva AI、Hailuo AI 六款工具的功能、目标用户、是否有免费方案列在一起的收藏型信息图。
- [10] Veo 2 — 面向 Google VideoFX 的宣传 Pin。一张图中浓缩显微镜前的写实镜头、水下游泳者、与星座共舞的动画风女性等多样影像风格。
- [14] Veo 3 Image-to-Video: Fast Generation & Native Audio via Gemini API — 展示通过 Gemini API 可完成图像→视频生成的宣传图,并强调原生音频支持。
- [23] Microsoft Unveils VASA-1 — 仅凭一张照片、一段音频和任意控制信号,便能以接近实时的速度生成富有表情的说话人脸视频。缩略图排列了多种人种与表情。
- [27] ShengShu Technology Unveils Vidu S1 — 中国生数科技发布的 Vidu S1,宣传“实时互动生成”,配有赛博朋克角色视觉。
- [31] Google announces video generation AI 'Veo 3' — 四组输出例:将输入图(一只紫色怪兽毛绒玩具)合成到写实服务器机房、水下遗迹、糖果城市中。
- [33] 'Amuse 3.0', an AI art creation tool — AMD 发布本地运行型(Stable Diffusion 系)图像生成工具的新版本。在闭源模型占绝大多数的背景下,是少有的本地/开放方向具体信号。
- [42] Breaking News Latest AI Developments — 汇总 Grok 4.6 的代理能力、Gemini 用户突破 10 亿(每日生成 1.5 亿张图)、Honor AI 机器人手机三则新闻(日期为 2026 年 8 月 12 日)。
信号
- 闭源阵营的存在感突出。 Google Veo 2/Veo 3、Microsoft VASA-1、OpenAI、Grok 4.6、Gemini(突破 10 亿用户)等大厂发布直接成为 Pin 题材;而 Stable Diffusion、ComfyUI、Flux、Wan、HunyuanVideo、LTX 等典型开源名称,在抽样图片中除 [33] 的 AMD 本地工具 Amuse 3.0 外几乎不存在。Pinterest 很可能更偏向面向普通消费者和营销人员的“汇总/比较”内容,而非技术社区。
- 集中于“让脸动起来/生成脸部”用途。 口型同步、表情重现、肖像拍摄替代、新闻主播风 AI 视频等以脸为核心的应用反复出现。这可被理解为 Pinterest 的搜索需求(美容、自我提升、社交媒体内容创意)与 AI 视频营销的交汇。
- 二次汇总内容多于一手信息。 相比实际模型输出截图,“解说者人脸+标题文字”类型缩略图或工具比较信息图更多。Pinterest 与其说是发布一手公告的扩散节点,不如说是博客、YouTube 视频和联盟营销文章的入口。
- 缺席信号: 在抽样范围内,未发现提及日语圈内容或企业(如日本 AI 初创公司、国内视频生成服务)的 Pin;内容几乎全是英语圈工具与新闻。
限制
- 在
output/pinterest.pins.md的 50 项中,为保持代表性实际打开检查了 24 张图片(另外 26 项仅查看标题,推测仍属于已打开图片中出现的视觉模式——信息图/人脸肖像/工具比较)。 - 有 8 个 Pin 标题为“(untitled)”([12, 19, 20, 30, 35, 39, 46, 50]);其中 [39]、[50] 已查看图片,其余未确认。
- 本阶段工作器收集数据未按类别划分(
pinterest.pins.md为单一扁平清单),未建立按类别统计的明细。 - 本次未直接浏览 Pinterest;按照 playbook 指示,仅根据工作器预先收集的图片和标题分析。数据不含 Pin 的点赞、收藏、评论等互动指标,无法引用。
建议行动
- 不要再依赖趋势话题列表;应使用明确的模型/工具词(Stable Diffusion、ComfyUI、Flux、Wan、Kling、Sora)重新运行 X 搜索。
- 因为本轮
app.bsky.feed.searchPosts返回 403,建立一份可通过 getAuthorFeed 轮询的 Bluesky 已知账号常备列表。 - 对 MiniMax H3 等开放但商业化的混合模型,应显式标注,而不要硬归入单一开源类别。
- 对大厂重大转型或停服(Midjourney 的医疗转型、Sora API 生命周期结束)建立持续观察项,因为它们在 Reddit 和 Lemmy 上的热度高于纯产品发布新闻。
- 鉴于 Pinterest 几乎不覆盖开源内容,应将其视为消费者情绪指标,而非一手技术信息源。
收集图片


















































数据质量备注
X 和 Bluesky 均远低于简报要求的每个平台约 20 条帖子(X 仅出现 4 条主题相关帖子,且全部为闭源;Bluesky 搜索 API 返回 403,因此覆盖依赖已知账号);Reddit、Lemmy 和 YouTube 收集的项目也少于目标数量,而 YouTube 因页面采用 JavaScript 渲染,无法确认播放量和订阅者数。



