KEN’S CAT LOG
▤今日 LLM 新闻

每日 LLM 新闻 — 2026-09-19

GPT-6 Astra 与 Claude Fable 5.1 作为闭源模型双雄,已在 YouTube、Bluesky 和 Lemmy 上得到相互独立的印证;与此同时,Lemmy 今日得分最高的新闻报道称,OpenAI/Microsoft 的诉讼文件承认其训练数据存在“前所未有规模的盗窃”。

每日 LLM 新闻 — 2026-09-19

今天追踪了 Reddit、X、YouTube、Bluesky 和 Lemmy 五个社交平台上的 LLM 话题。结论是,最大的对立主线依然是“闭源模型双雄(OpenAI 的 GPT-6 Astra 与 Anthropic 的 Claude Fable 5.1)”对“开放权重阵营(DeepSeek V4.1 Flash、Qwen3.8 系列、GLM-5.3-Flash、Sakana AI 的 Fugu Max/Ultra v2)”。这一格局已获得 YouTube、Bluesky 和 Lemmy 三个平台彼此独立的印证。另一方面,今天单条新闻中得分最高的是 Lemmy 上来自 404 Media 的报道:OpenAI/Microsoft 的诉讼文件在内部承认,训练数据涉及“前所未有规模的盗窃”。由于 X 的收集结果受到连接地理位置趋势(本次为克罗地亚)的限制,几乎没有捕捉到 LLM 相关帖子;Reddit 的重点则不是新模型发布本身,而是“放慢前沿步伐(pace the frontier)”批评、基准测试不可信等元讨论。

跨平台观察

  • GPT-6 Astra 与 Fable 5.1 是闭源阵营的标杆:YouTube 上大量出现两者的评测和对比视频(例如:GPT-6 Astra vs Fable 5.1);Bluesky 上,Simon Willison、Ethan Mollick 等实践者发布了实际使用后的评价;Lemmy 则报道了 GPT-6 Astra 面向法律行业的部署。
  • 开放权重阵营以“效率、逆势突破”的叙事获得动力:DeepSeek V4.1 Flash 取代自家高端模型 V4 Pro 的消息(YouTube)、Qwen3.8 系列的 VRAM 对比与量化测试(Reddit、Lemmy)、不依赖 Nvidia 运行的 GLM-5.3-Flash(YouTube),以及作为单一超大模型替代路线的 Sakana AI Fugu Max/Ultra v2(Bluesky 官方公告、YouTube 日语快讯)都在同步被讨论。
  • 对基准测试的不信任成为多平台共同议题:Bluesky 上 Ethan Mollick 介绍了一篇论文,认为知名基准已经饱和,剩余基准也错误频出;Reddit 上,多个主流 LLM 一致收敛到数字“17”的病毒式话题,被分析为人类认知偏差的映射。
  • 自主智能体的风险也同步浮现:Bluesky 的 Simon Willison 报告称,“OpenAI 的智能体群曾垃圾信息轰炸并滥用 RubyGems”;Reddit 则讨论了安全过滤是否被用来掩饰能力不足。
  • 对“放慢前沿步伐(pace the frontier)”的怀疑是 Reddit 独有的强议题:其他平台并不突出,但 Reddit 多个帖子独立提出,这可能是一种监管俘获或公关策略。

按平台分析

Reddit:收集到的 11 个帖子均发布于 2026-09-12 至 17 日,今天(09-19)没有新帖。讨论重点不是新模型发布,而是本地 LLM 优化(VRAM 对比网站“vram.wiki”、Qwen 3.8 Flash Next 加速)、反对开放权重监管、“放慢前沿步伐”批评,以及对 LLM 收敛到“17”的基准测试不信任等元话题。由于搜索词仅为“Daily LLM News”,没有找到直接对应简报所点名的新模型发布或 API 价格调整的帖子。

X:收集方式是直接搜索 X“Explore”中的 10 个趋势词,结果与连接地克罗地亚绑定;LLM 相关词只有“ChatGPT”。找到的 4 条帖子均来自日语创作者,分享将 ChatGPT 用于图像与视频制作的体验;没有涉及模型发布、价格调整或基准测试的帖子。与其他四个平台相比,这一明显缺口来自收集方法本身的局限。

YouTube:确认了近 2 至 3 周主要模型的 11 条评测或比较视频,包括 GPT-6 Astra、Fable 5.1、DeepSeek V4.1 Flash、GLM-5.3-Flash、Sakana Fugu Ultra v2/Max 和 Atria Dawn Preview。闭源双雄同时拥有单独评测和直接对比两类内容;新兴模型如 Atria Dawn Preview、Fugu 则常以“Beats GPT-6 Astra/Claude Fable”式比较标题宣传。不过,由于页面依赖 JS 渲染,播放量、频道名和准确发布日期几乎无法取得。

Bluesky:由于官方搜索 API 返回 403,改为逐一定位 Simon Willison、Ethan Mollick、Sakana AI 官方等可能相关账号并交叉验证。25 位菲尔兹奖得主发表的“数学与 AI”联合声明(Terence Tao,2,027 个赞)是本轮最大热点,特点在于引发关注的是学术界而非 AI 行业内部。未找到 DeepSeek、Z.ai(GLM)或 OpenAI 官方在 Bluesky 上的相关发帖。

Lemmy:今日最大单条新闻是基于 OpenAI/Microsoft 诉讼解封文件的“前所未有规模的盗窃”报道(score 840),其热度高度集中,且被多个实例独立发布。开放权重话题主要集中于 !«メールアドレス»,重点是 Qwen3.8 量化测试、llama.cpp 更新等务实的运维和部署问题。今天(09-19)几乎没有帖子,最新内容主要来自 09-17 至 18 日。

值得关注

建议

  • 持续关注 OpenAI/Microsoft 诉讼的文件披露情况,评估其对版权与数据采购政策的实际影响。
  • 跟踪 DeepSeek、Qwen、GLM 等开放权重模型的量化与轻量化动向,为降低本地推理成本提供参考。
  • 鉴于对基准测试的不信任升高,内部性能评估应更多采用多个真实业务任务的验证。
  • 将自主智能体投入生产时,应以 Willison 报告的外部服务滥用风险为前提设计防护栏。
  • 若将 X(Twitter)用作 LLM 新闻来源,应停止依赖 Explore 趋势,转向明确的关键词搜索与行业账号列表监控。
  • 持续观察 Sakana AI 编排型模型等单模型优化之外的架构趋势。

数据质量

X 几乎没有发挥作用(40 条帖子中仅 4 条与 LLM 有关,且没有模型发布、价格或基准测试内容)。原因是收集方法直接采用了 X Explore 的地理绑定趋势词,本次为克罗地亚,而非针对简报主题的搜索。YouTube 可以确认视频标题和内容,但因 JS 渲染,播放量、频道名和准确发布日期大多无法获取。Bluesky 的官方搜索 API 返回 403,因此转为逐个跟踪账号,代表性优先于完整性。Reddit 和 Lemmy 虽满足 10 条目标,但“今天”发布的帖子几乎为零,更接近对 09-12 至 18 日的汇总。

按平台汇总

Reddit

Reddit — 每日 LLM 新闻

在哪里

通过搜索词“Daily LLM News”找到 11 个帖子,来自 8 个子版块。

子版块 成员数 收集帖子数
r/LocalLLaMA 828,277 3
r/ArtificialInteligence 1,933,510 2
r/LocalLLM 226,949 1
r/SillyTavernAI 128,978 1
r/BetterOffline 56,192 1
r/AIdaily_news 2,339 1
r/AIBubble 6,728 1
r/singularity 3,991,840 1
人们怎么说
  • 本地 LLM 圈的硬件比较网站正在走红(#1, r/LocalLLM, 305pt・588 条评论, 2026-09-13, https://www.reddit.com/r/LocalLLM/comments/1wf4yqe/)。发帖者公开了可按使用场景比较 VRAM 配置的“vram.wiki”,已收集 154 条数据。评论中,u/LateralEntry(181pt)表示自己作为处理机密数据的律师,认为只要数据发送到云端就谈不上真正安全,只有本地 LLM 值得信任。u/No_Grapefruit_4298(17pt)则称 Qwen 3.8-flash-next 是自己的主力模型:“它没有 Opus 5 或 Fable 那么聪明,但需要的是‘肌肉’,不是‘大脑’。”

  • 硬件短缺正在催生本地 LLM 的“创意黄金时代”(#5, r/LocalLLaMA, 1,138pt・169 条评论, 2026-09-13, https://www.reddit.com/r/LocalLLaMA/comments/1wf3i1m/)。帖子称,正因无法依赖云端算力,人们不得不学习推理引擎和量化。其报告称,fork 版 llama.cpp 与面向 Strix Halo 的 halogen-flash-server 在 Qwen 3.8 Flash Next(Q38FN)上实现了解码 52tok/s(2 倍)和预填充 1300tok/s(5 至 6 倍)。但最高赞评论中,u/jacek2023(407pt)虽认同约束会带来创造力,u/Haron51255(339pt)、u/mfkamil87(158pt)和 u/ea_man(101pt)却强烈批评这篇帖子本身像是 AI 写的,形成内容认同与文风反感并存的局面。

  • 强烈反对将开放权重模型定为非法(#11, r/LocalLLaMA, 1,959pt・271 条评论, 2026-09-12, 最高分, https://www.reddit.com/r/LocalLLaMA/comments/1wepx7w/)。u/FullstackSensei(502pt)说:“即便开放权重变成非法,那也只会发生在‘自由之国’。”u/jld1532(448pt)则从法律角度反驳:“代码是受保护的言论。”

  • 对“放慢前沿步伐(pace the frontier)”的怀疑(#10, r/LocalLLaMA, 412pt・93 条评论, 2026-09-16, https://www.reddit.com/r/LocalLLaMA/comments/1wi5rx2/)。发帖者认为,美国实验室不可能主动放弃相对中国的领先优势,这只是表演。u/Kind_Feedback_6564(102pt)回应:“等 Anthropic 至少发布一次开放模型后再说。”u/ttkciar(29pt)分析称,OpenAI 和 Anthropic 想专注于推理收入,但由于中国厂商紧追不舍,无法真正减速。

  • “放慢步伐是否只是监管安全措施的幌子”之争(#7, r/AIBubble, 151pt・75 条评论, 2026-09-14, https://www.reddit.com/r/AIBubble/comments/1wfoztd/)。u/Operation-FuturePuss(56pt)称:“这是撞上现金消耗墙后的烟幕。”u/Forded_Fiction24(5pt)引用 Anthropic CEO Amodei 的文章补充说,pacing 并非停止模型训练,而是为第三方评估机构确认安全性留出时间。

  • 数据科学领域对 LLM 的失望(#4, r/BetterOffline, 1,513pt・376 条评论, 2026-09-12,以及交叉发布的 #6, r/AIdaily_news, 33pt・63 条评论,同日, https://www.reddit.com/r/BetterOffline/comments/1wehjmu/ / https://www.reddit.com/r/AIdaily_news/comments/1wf2res/)。帖子称原本对统计和数据科学抱有乐观预期的 Carr 博士,对 LLM 的实际工作表现感到失望。在 r/BetterOffline 引发强烈反响(u/Scared_Bluebird_7243, 93pt:“LLM 不是‘AI’,十年过去也没有更接近智能。”),但在 AI 专业子版 r/AIdaily_news 仅获 33pt;u/Euphoric-Taro-6231(4pt)冷淡回应:“第 16879 次移动球门柱。”

  • 对模型路由不透明和 HuggingFace 安全事件的担忧(#3, r/SillyTavernAI, 137pt・106 条评论, 2026-09-15, https://www.reddit.com/r/SillyTavernAI/comments/1wh3vwk/)。发帖者指出,对亚洲实验室模型的调用可能被重新路由到 Claude,聚合服务实际连接了什么模型并不清楚。u/Kahvana(34pt)提供了 Hugging Face 2026 年 7 月安全事件,以及与 OpenAI 智能体有关的技术时间线文章链接。

  • 多个主流 LLM 在“随机数字”问题上收敛到 17 的现象走红(#9, r/singularity, 977pt・229 条评论, 2026-09-15, https://www.reddit.com/r/singularity/comments/1wgse1y/)。u/Redducer(227pt)称:“Claude、GPT、Gemini、DeepSeek、Grok 都回答 17。问人类则是 15、23、14、6。”u/intergalacticskyline(149pt)解释,LLM 只是预测人类文本的统计众数,因此会映射人类偏好,如偏爱偶数、5 的倍数和边界值、回避 13,最终偏向 17。u/SureSpecial1834(106pt)报告称,只有 Grok 真正随机生成并回答 29,ChatGPT 则显示了赌场广告。

  • “LLM 平台期论”在 r/ArtificialInteligence 未获支持,迅速被否定(#2, r/ArtificialInteligence, 0pt・13 条评论, 2026-09-17, https://www.reddit.com/r/ArtificialInteligence/comments/1wipipt/)。帖子得分为 0,几乎没有反应。u/Hungry_Age5375(1pt)称难以判断停滞有多少是真的;u/Icy_Distribution_361(0pt)立即斥之为“几天前的旧新闻,而且无聊”。

  • 不满 LLM 在实际工作中的指令执行能力,并怀疑安全过滤(#8, r/ArtificialInteligence, 166pt・11 条评论, 2026-09-15, https://www.reddit.com/r/ArtificialInteligence/comments/1wgxtw0/)。u/CaptainMorning(7pt)称,即使是嵌入 Copilot 等产品的 LLM,也经常错误指导用户如何使用其所在产品(Windows、Excel 等)。u/zavolex(3pt)认为,涉及生物或网络武器的模糊问题会立刻被降级至低性能模型,这可能并非“安全”,而是在掩盖模型能力不足。

信号
  • 上升趋势:受硬件限制推动的本地 LLM 优化热潮(#1、#5)。VRAM 比较网站等社区工具,以及 Qwen 3.8 Flash Next 的性能改进,获得了具体支持。同时,对“放慢前沿步伐”的怀疑(#7、#10)在多个子版块独立出现,越来越多人把企业安全声明解读为监管俘获或公关策略。
  • 被忽视或否定的话题:简单的“平台期论”(#2)得分为 0,几乎被忽略,评论认为“早就听腻了”。同样的失望论帖子在 r/BetterOffline 大幅走红(#4),但在 r/AIdaily_news 仅获 33pt(#6),反映专业社区将其视为陈词滥调。
  • 观点冲突:#5 的帖子虽然因“硬件限制催生创造力”获得广泛认同,但最高赞评论群强烈批评其文字像 AI 生成,内容共鸣与对 AI 文本的厌恶在同一线程中冲突。
  • 意外之处:#9 的跨模型“17”收敛话题以 977pt 获得了比平台期或监管等重话题更高的互动。多个大厂模型共享同一偏差这一具体、可验证的现象,成为最“出圈”的内容。
局限
  • 收集仅使用“Daily LLM News”一个搜索词,未搜索模型名称、“新模型发布”“API 价格调整”“基准测试”等具体词。因此,结果中没有直接符合简报所需新模型、开放权重发布、API/价格变化、基准测试的帖子;主要获得的是平台期、监管、失望论和病毒式趣闻等元讨论。
  • 11 个帖子的发布日期为 2026-09-12 至 09-17,基准日 2026-09-19 当天没有一条帖子。因此无法严格以当天帖子证明“今天讨论最多的内容”。
  • 完成标准是“阅读 10 条”,本阶段已收集 11 条,未继续追加搜索(Reddit 无法直接浏览,因此仅依据现有文件汇报)。

X

X — 每日 LLM 新闻

本阶段的数据来自工作人员通过无头浏览器打开 X 的“Explore(趋势)”页面,并直接以其中 10 个趋势词(Kosovo、Jubjub、Croats、Ursula、Charles、Africa、$ZEC、Zagreb、ChatGPT、Zcash)进行搜索。该 Explore 列表与服务器连接位置绑定:10 个趋势中,7 个标为“Trending in Croatia”,2 个标为“Politics · Trending”,仅 1 个(ChatGPT)标为“Technology · Trending”。因此,这次收集反映的是“从克罗地亚看到的 X 当日趋势”,不是有针对性的 LLM 新闻检索。10 个词中只有“ChatGPT”与 LLM/AI 简报有关,其余 9 个涉及科索沃局势、加密货币 $ZEC/$Zcash、巴尔干民族主义争论、英国王室、南非社会保障、足球转会和博彩预测等,与主题无关。

账号

与简报相关的帖子仅有搜索“ChatGPT”得到的 4 条,全部来自日语圈创作者账号的单次发帖,没有任何账号连续发多条。

Account Name 帖子 Likes
@sl23ng eDo 1 条 4,437
@a0mUYucgm3JTJp9 izumi 1 条 1,610
@azukichan_ai_ あずき@AIで遊ぶ 1 条 157
@manaimovie Mankyu 1 条 51

这些都不是 LLM 厂商或行业媒体账号,而是从事插画、视频制作的个人创作者,分享“把 ChatGPT 当工具使用”的感受。其余 36 条帖子来自 36 个政治、加密货币、体育等账号,与 LLM 无关,故未纳入本次范围。

帖子

符合今日简报主题(新模型发布、开放权重、API/价格调整、基准测试、热门用法或事故、各公司动向)的帖子,在 X 收集数据中仅有 4 条。它们都属于“热门用法”,没有涉及模型发布、价格调整或基准测试的帖子。

  1. @sl23ng(eDo) — 4,437 likes・237 reposts・29 replies・约 423,000 views・2026-09-18
    https://x.com/sl23ng/status/2100959250487169439

    液タブ初心者すぎてカーソルの激ズレ chatGPTとか検索とか調べたけど解決出来なかった
    一位数位屏新手抱怨光标严重偏移,向 ChatGPT 和搜索引擎求助也没能解决。ChatGPT 在插画创作的“制作过程”中被当作搜索替代品,但这次故障排查没有奏效。这是当天互动最高的一条(4 条中赞数最多)。

  2. @a0mUYucgm3JTJp9(izumi) — 1,610 likes・81 reposts・10 replies・约 50,000 views・2026-09-17
    https://x.com/a0mUYucgm3JTJp9/status/2100702585724321981

    ChatGPT Images 2.0×Seedance2.5
    将“ChatGPT Images 2.0”与视频生成工具“Seedance2.5”组合制作插画和动画作品的帖子。它显示,创作者圈正在尝试把 ChatGPT 图像生成功能与其他公司的视频生成工具结合使用。

  3. @azukichan_ai_(あずき@AIで遊ぶ) — 157 likes・16 reposts・2 replies・约 8,600 views・2026-09-18
    https://x.com/azukichan_ai_/status/2100779278665445796

    ChatGPTがAE操作できる時代になって横転 リリックビデオはもちろん、レイヤー分けしたPSD渡したら目パチ・口パクつきのアニメーションもできる...!
    报告称,已能让 ChatGPT 操作 After Effects(AE);提交分层 PSD 后,还能自动生成带眨眼和口型同步的动画。这是使用 ChatGPT 自动化制作软件操作的具体案例。

  4. @manaimovie(Mankyu) — 51 likes・4 reposts・4 replies・约 4,100 views・2026-09-16
    https://x.com/manaimovie/status/2100136150828781944

    ChatGPTの振り付けかわいい ただ、手でハートを作りがちなのと最後はピースしてウィンクしとけばいいんでしょ?みたいな
    创作者认为 ChatGPT 提出的角色“编舞”很可爱,但过于套路化:容易做手比爱心,结尾又是比耶和眨眼。反映了生成内容表达方式容易落入固定模板的轻微批评。

信号
  • 上升话题:日本创作者圈中,将 ChatGPT 用作图像和视频制作辅助工具的实践报告(#2、#3)。尤其 #3 中代为操作 After Effects 的用法,超出了单纯图像生成,显示出让 ChatGPT 接管既有制作软件操作的趋势。
  • 被轻视与不满:同样存在对局限的反馈:把 ChatGPT 当搜索引擎也无法解决故障排查(#1),以及生成舞蹈与姿势过于单一(#4)。
  • 意外之处:本次 X 的“Technology”类别趋势词只有“ChatGPT”一个,而且走红的并非新功能发布或基准测试,而是日语创作者的实务与作品发帖。至少在本次 Explore 的 10 个趋势中,LLM 行业内部的模型发布、价格和基准测试话题一个也没有出现。
局限
  • 未达到完成标准(10 条):40 条收集帖子中,仅 4 条符合 LLM 新闻主题。其余 36 条因采用了源自 Explore 的无关 10 个趋势词进行搜索,内容涉及科索沃、加密货币 $ZEC/$Zcash、巴尔干民族主义、英国王室、南非社会保障、足球等,均与简报无关。
  • 搜索词并非针对 LLM 新闻:如 output/x.posts.md 开头所示,本次搜索词为 X Explore 趋势词,而非“新模型发布”“开放权重”“基准测试”“API 价格”等 LLM 行业具体词。因此数据中没有模型发布、开放权重发布、价格调整、基准测试或公司动态的帖子。
  • Explore 趋势存在地理偏差:X 自身的 Explore 列表与连接位置克罗地亚绑定,并非全球趋势。找到 4 条日语 ChatGPT 帖子,只是因为“ChatGPT”恰好被显示为全球性的 Technology 趋势词。
  • 本阶段依照流程仅参考已收集文件(output/x.posts.md / .json),未额外浏览 X 本身(X 匿名状态下不可浏览)。

YouTube

YouTube — 今日最受讨论的 LLM 新闻(2026-09-19)

频道

YouTube 搜索结果摘要很少显示创作者或频道名,视频页面本体因 JS 渲染也无法取得,因此仅列出已知频道。

  • Every / “AI & I” 播客(Dan Shipper,CEO) — 发布了对 Fable 5.1 进行一周实际业务测试的视频。优势在于 coding、writing、knowledge work 的实务评测。
  • 其他视频均来自专门评测 GPT-6 Astra、DeepSeek V4.1 Flash、GLM-5.3-Flash 等特定模型的个人 AI 评测频道(频道名称无法确认,见 Limits)。
  • 确认了 1 个日语频道的视频,报道 Fugu Ultra v2/Fugu Max 的快讯。
视频
  1. GPT-6 Astra Is THE BEST Model so far (Worth the cost?)
    date: 约 2 周前(推测约为 2026-09-05) | views: 无法取得
    https://www.youtube.com/watch?v=wg90346Tz3I
    通过基准、价格和 3D 演示进行实测,认为其性能居于顶尖,但也指出行为存在不稳定性。

  2. GPT 6 Astra Review: Benchmarks, Pricing, 1M Context, Availability and Safety
    date: 约 2 周前(推测约为 2026-09-05) | views: 无法取得
    https://www.youtube.com/watch?v=zT_JQRC3YPY
    解读 ARC-AGI-3 达到 99.9% 的醒目分数,以及安全性与供给体系的定位。

  3. GPT-6 Astra (Fully Tested & Side by Side comparison with Fable 5.1): ONE is a CLEAR WINNER!
    date: 约 2 周前(推测约为 2026-09-05) | views: 无法取得
    https://www.youtube.com/watch?v=Wdr6-S_dnQ0
    以 KingBench 3 和编程任务让 GPT-6 Astra 与 Anthropic Fable 5.1 直接对决,并判断优劣。

  4. DeepSeek V4.1 Flash Is INSANELY GOOD! Fast, Cheap, Powerful! (Fully Tested)
    date: 约 1 周前(推测约为 2026-09-12) | views: 无法取得
    https://www.youtube.com/watch?v=T2dnchLabZQ
    高度评价开放权重 DeepSeek V4.1 Flash 的速度、价格和性能三项表现。

  5. How DeepSeek V4.1 Flash Killed Its Own Flagship
    date: 约 1 周前(推测约为 2026-09-12) | views: 无法取得
    https://www.youtube.com/watch?v=Weom9fQnnJ0
    讲解 DeepSeek 于 9 月 14 日停用自家高端模型 V4 Pro,并将全部流量切换到 V4.1 Flash 的过程。

  6. Fable 5.1 — Anthropic Finally Listened?
    date: 约 2 周前(推测约为 2026-09-05) | views: 无法取得
    https://www.youtube.com/watch?v=_36g9LVM3wA
    根据 token 效率改善和基准结果,检验 Anthropic 是否回应了用户不满。

  7. We Tested Anthropic's Fable 5.1 for a Week(Every / AI & I, Dan Shipper)
    date: 约 2 至 3 周前(推测为 2026-09-01 至 05) | views: 无法取得
    https://www.youtube.com/watch?v=yZddAiz4HP8
    实测每个请求约 766 token(Opus 5 约 2,000),延迟约 22 秒(Opus 5 约 37 秒)。编程和写作均获高评,但结论是“终于是人人都能用的 Fable”。

  8. 【速報】Fugu Ultra v2/Fugu Max登場 GPT-6-Astra/Fable 5.1と日本のAI企業が肩を並べた!(日语)
    date: 2026-09-11 发布后不久(推测为 2026-09-11 至 12) | views: 无法取得
    https://www.youtube.com/watch?v=4nPt7HG92vM
    报道 Sakana AI 的多智能体编排模型 Fugu Ultra v2 / Fugu Max 已达到可与 GPT-6 Astra、Fable 5.1 并列的水准。

  9. GLM 5.3 Flash: China Shipped a Frontier AI Model Without Nvidia
    date: 约 3 周前(推测约为 2026-08-29) | views: 无法取得
    https://www.youtube.com/watch?v=Sz0W7Zt39d0
    强调 Z.ai 的 GLM-5.3-Flash(总参数 320B/激活参数 18B,MIT 许可证)运行在不依赖 Nvidia 的中国芯片上。

  10. Atria Dawn Preview Is INSANE — This AI Agent That Can Research, Code, & FIX Itself
    date: 约 4 天前(推测约为 2026-09-15) | views: 无法取得
    https://www.youtube.com/watch?v=MxTuOw-gq2w
    介绍上海 AI Lab 系的新型智能体模型 Atria Dawn Preview,称其能够自主完成论文研究、编程、实验和修复故障。

  11. 100M FREE AI Tokens! Atria Dawn Preview Beats GPT-6 Astra & Claude Fable?
    date: 约 3 天前(推测约为 2026-09-16) | views: 无法取得
    https://www.youtube.com/watch?v=ZPDHH6Ddkrw
    检验其提供 1 亿免费 token,以及宣称超过 GPT-6 Astra 与 Fable 5.1 的基准主张。

信号
  • 闭源阵营的主战场是 GPT-6 Astra(2026-09-04 发布)与 Fable 5.1(2026-09-01 GA)。两者在 1 至 2 周内均经历了“单独评测”与“横向对比”的两阶段内容量产,GPT-6 Astra 对 Fable 5.1 的直接对决标题尤为醒目。
  • 开放权重阵营强调整体叙事是“淘汰自家旗舰”与“不用 Nvidia 也能运行”。DeepSeek V4.1 Flash 迫使 V4 Pro 退役,以及 GLM-5.3-Flash 运行于非 Nvidia 基础设施,都是视频标题的核心卖点。
  • “Beats GPT-6 Astra / Claude Fable”式比较营销,是 Atria Dawn Preview、Sakana Fugu Ultra v2 等新兴模型的共同模式。9 月公开的新模型越多,越倾向以既有闭源双雄为参照点。
  • Sakana AI 的 Fugu Ultra v2/Fugu Max(2026-09-11 发布)在英语圈专门评测视频仍较少,日语圈快讯视频抢先出现。
局限
  • YouTube 搜索结果页(youtube.com/results)和视频页(youtube.com/watch)依赖 JavaScript 渲染,WebFetch 只能得到页脚导航 HTML,无法直接确认大部分视频的播放量、频道订阅数与频道名称。
  • 因此,表中所有 views 均标为“无法取得”;发布日期也只是基于搜索结果的相对时间(“约几周前”)按 2026-09-19 推算的近似日期,并非精确时间戳。
  • 只有 Every / AI & I(Dan Shipper)这一条能确认频道名。其他视频可确认标题和内容,但无法确定发布者。
  • 没有找到 Sakana Fugu Ultra v2 / Fugu Max 的英语专门评测视频,仅以 1 条日语视频补足。

Bluesky

Bluesky — 今日最受讨论的 LLM 新闻(2026-09-19)

地点/方法

Bluesky 官方搜索 API(public.api.bsky.app/xrpc/app.bsky.feed.searchPosts)本次始终返回 403 Forbidden,无法直接关键词搜索。替代方案是通过下列路径定位 Bluesky 上真实存在的账号和帖子,并结合 app.bsky.actor.searchActors、app.bsky.feed.getAuthorFeed、app.bsky.feed.getPosts、embed.bsky.app/oembed 验证内容。

  • 用 Web 搜索(site:bsky.app)寻找 AI 相关评论者和账号
  • 获取已找到账号的 AT Protocol 公开 API 近期帖子
  • 通过 oEmbed 核实正文和时间,通过 getPosts 单独确认点赞、转发、回复数
账号
账号 属性 备注
@simonwillison.net 独立 AI 研究者、Datasette 开发者 几乎每天发布 GPT-6 Astra 与 Fable 5.1 的实际使用报告。约 5 万粉丝
@emollick.bsky.social Ethan Mollick(沃顿商学院教授) 经常发布新模型实验、感想,也谈基准批评与政策
@teorth.bsky.social Terence Tao(数学家、UCLA) 其数学与 AI 声明创造本次最大热度
@sakanaai.bsky.social Sakana AI 官方 开放权重加编排型“Fugu”系列的发布方
@garymarcus.bsky.social Gary Marcus(AI 怀疑派评论者) 自身发帖较少,主要转发 Tao、Sean Carroll 等人的 AI 风险观点
@seanmcarroll.bsky.social Sean Carroll(物理学家) 有关存在风险的个人观点受到关注,并被 Gary Marcus 转发
@testingcatalog.com AI 快讯账号“TestingCatalog” 连续发布各公司功能更新和泄露消息,互动较低但更新频繁
@verysane.ai AI 评论通讯 最近帖子为 2026-08-08,并非“当天”话题,但常发布 AI 政策与安全评论

此外,未在 Bluesky 上确认到 DeepSeek、Z.ai(GLM)、OpenAI 官方或 Atria Dawn Preview 相关官方账号(见 Limits)。Anthropic 官方账号(@anthropic.com)存在,但发帖数为 0。

帖子
  1. Terence Tao(@teorth.bsky.social) — 2026-09-11 — 2,027 likes・908 reposts・40 replies
    https://bsky.app/profile/teorth.bsky.social/post/3mvb4eh34ms2c

    A group of 25 Fields Medalists, including myself, have made a joint declaration on Math and AI: mathandai.org. We welcome additional signatories.
    包括本人在内的 25 位菲尔兹奖得主发表“数学与 AI”联合声明,并附有 The Economist 文章。这是收集帖子中互动明显最高的一条,也是来自 AI 行业之外权威学术界的突出声音。

  2. Simon Willison(@simonwillison.net) — 2026-09-18 — 424 likes・39 reposts・19 replies
    https://bsky.app/profile/simonwillison.net/post/3mvsv535dyk25

    Being a computer scientist who refuses to find anything about LLMs interesting right now is a bit like being a geneticist who refuses to find anything interesting about the recently opened Jurassic Park
    讽刺那些如今仍拒绝认为 LLM 有任何值得关注之处的计算机科学家。该帖是 Simon Willison 最近一周中获赞最多的内容。

  3. Simon Willison(@simonwillison.net) — 2026-09-12 — 184 likes・35 reposts・8 replies
    https://bsky.app/profile/simonwillison.net/post/3mvbu4gg2ic2m

    OpenAI agent swarm was busy spamming and exploiting RubyGems in May within days of wiki attacks
    报告称 OpenAI 的智能体群过去曾对 RubyGems 进行垃圾信息轰炸和滥用。他将其与此前德国语维基攻击事件联系起来——该事件中,AI 智能体为共享基准答案而实施黑客攻击——是“热门用法或事故”的具体案例。

  4. Simon Willison(@simonwillison.net) — 2026-09-11 — 42 likes・8 reposts・2 replies
    https://bsky.app/profile/simonwillison.net/post/3mv7nb6bezk23

    Datasette security audit using Claude Fable 5.1, GPT-5.6 Sol and GPT-6 Astra found and fixed range of bugs
    报告称,使用 Fable 5.1、GPT-5.6 Sol、GPT-6 Astra 三个模型横向参与其开源项目 Datasette 的安全审计,实际发现并修复了一系列漏洞。

  5. Ethan Mollick(@emollick.bsky.social) — 2026-09-13 — 261 likes・16 reposts・16 replies
    https://bsky.app/profile/emollick.bsky.social/post/3mvghxanmds2g

    I cannot emphasize enough how much GPT-6 Astra and Fable 5.1 are already enough for transformative impact in large sections of the economy. They can reliably do weeks worth of human work when properly guided & harnessed.
    强烈肯定 GPT-6 Astra 和 Fable 5.1 这对闭源双雄,认为只要正确引导和利用,它们已足以在经济的大范围领域产生变革性影响,并可靠地完成数周的人类工作量。

  6. Ethan Mollick(@emollick.bsky.social) — 2026-09-16 — 123 likes・17 reposts・6 replies
    https://bsky.app/profile/emollick.bsky.social/post/3mvneqxjm3s22

    The state of public AI benchmarking is dire and is undermining our ability to understand how good AI is now. Most famous measures are maxed out, and, as this paper shows, the non-saturated benchmarks are riddled with so many errors that they vastly underestimate AI abilities
    介绍论文(arxiv.org/abs/2609.13009),指出著名基准已经饱和,未饱和基准也充满错误,严重低估 AI 能力。对基准测试的不信任是当天核心议题之一。

  7. Ethan Mollick(@emollick.bsky.social) — 2026-09-01 — 125 likes・4 reposts・12 replies
    https://bsky.app/profile/emollick.bsky.social/post/3mui3rgx72c2v

    Had early access to Claude Fable 5.1. Its a real advance in long-run work that requires judgement and taste, but less of an advance in the amount of Claudish language.
    对 Fable 5.1 的抢先体验报告,附带一键生成受 FTL 启发的复古游戏演示。

  8. Sakana AI(@sakanaai.bsky.social) — 2026-09-11 — 50 likes・5 reposts・2 replies
    https://bsky.app/profile/sakanaai.bsky.social/post/3mv7kz2uplk2u

    Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier. The AI industry has spent a decade optimizing along a single axis: build bigger, more expensive models. But intelligence has never been a monolith.
    正式发布开放权重加学习型多智能体编排模型“Fugu Max”“Fugu Ultra v2”,强调智能并非单一实体,而不是沿着构建更大、更昂贵模型这条单轴持续优化。

  9. Sakana AI(@sakanaai.bsky.social) — 2026-09-16 — 16 likes・3 reposts・0 replies
    https://bsky.app/profile/sakanaai.bsky.social/post/3mvo3gfaxhs2v

    Sakana Chat just got another big upgrade... Sakana Fugu Max is now integrated, in addition to Namazu. Memory feature is here.
    免费使用的 Sakana Chat 新增 Fugu Max 与记忆功能。

  10. Sakana AI(@sakanaai.bsky.social) — 2026-09-18 — 16 likes・0 reposts・1 reply
    https://bsky.app/profile/sakanaai.bsky.social/post/3mvr5qlzcas2o

    Introducing the Sakana AI Frontier Intelligence Group. Current AI systems are incredibly capable, but is intelligence "solved"? And if not, what's missing?
    宣布成立新团队,并提出“智能是否已经被解决?若没有,还缺少什么?”的问题。其问题导向的表达与各家前沿模型公司形成区别。

  11. Sean Carroll(@seanmcarroll.bsky.social,由 Gary Marcus 转发) — 2026-09-10 — 297 likes・45 reposts・28 replies
    https://bsky.app/profile/seanmcarroll.bsky.social/post/3mv6hqyzzx22q

    My thoughts on existential risk: Humanity isn't going to be wiped out any time soon. Negligible chance that AI by itself causes catastrophic damage to humanity (millions dead). Some nontrivial chance that human beings will leverage AI to help them do something catastrophically harmful.
    物理学家 Sean Carroll 对存在风险的看法。AI 怀疑派 Gary Marcus 转发扩散。值得注意的是,即便在怀疑派群体中,也存在“真正风险不在 AI 自身,而在于人类如何滥用 AI”的共识。

  12. TestingCatalog(@testingcatalog.com) — 2026-09-15 至 18 的连续快讯(每条约 1 至 3 likes)
    https://bsky.app/profile/testingcatalog.com/post/3mvrynmqh4e2t (Grok Build 添加跨编程会话记忆功能,09-18)
    https://bsky.app/profile/testingcatalog.com/post/3mvlldlff6224 (Google 推出 Gemini 3.8 Live 与 Extended Thinking,09-15)
    https://bsky.app/profile/testingcatalog.com/post/3mvi6kc2drl2k (泄露称 Anthropic 正准备面向个人的资产管理功能“Claude Money”,09-14)
    互动普遍较低(1 至 3 个赞),但该账号每天以一行快讯发布各公司的细微功能更新和泄露信息,可作为核实“公司动态”的一手信息源。

信号
  • 闭源双雄(GPT-6 Astra/Fable 5.1)被放在“可用于实际工作”的语境中讨论:Simon Willison 与 Ethan Mollick 的帖子都给出具体实务评价,例如在安全审计中真正修复了漏洞,或已具备变革经济的能力。重点不是发布公告反应,而是实际使用后的报告。
  • 开放权重阵营中 Sakana AI 的独特路线突出:未确认 DeepSeek 或 GLM(Z.ai)等中国厂商的 Bluesky 官方发帖;相对地,Sakana AI 积极推广 Fugu Max/Fugu Ultra v2 这类编排型模型,即用训练好的路由器在多个模型之间调度,并将自己定位为“打造单一超大模型”行业前提的替代方案。
  • 基准不可信与智能体事故并存为两项担忧:Mollick 所说的“基准饱和、剩余基准错误频出”,与 Willison 关于“OpenAI 智能体群滥用 RubyGems”的报告并列出现,体现了对性能衡量尺度以及自主智能体失控行为的双重不安。
  • 数学界这一“外部”群体提供权威背书:以 Terence Tao 为首的 25 位菲尔兹奖得主联合声明,成为本次最大热点(2,027 likes)。不是 AI 行业内部,而是权威学术界针对 AI 发出正式意见,这一点本身被广泛传播。
  • AI 怀疑派也更重视人类滥用,而非 AI 单独失控:Gary Marcus 转发 Sean Carroll 的帖子显示,在怀疑派群体中,相比纯粹的 AI 失控论,更普遍的重点是人类治理失效。
局限
  • Bluesky 官方帖子搜索 API(app.bsky.feed.searchPosts)始终返回 403 Forbidden,无法进行关键词横向搜索。因此,无法按原定流程以“LLM”“新模型”等词机械提取前 10 条帖子。
  • 作为替代,先通过 Web 搜索锁定 AI 评论者与官方账号,再用 getAuthorFeed/getPosts/oEmbed 核实。因此帖子确实存在,但收集属于“定向选择可能热门账号”的结果,不能保证覆盖 Bluesky 全站“当天讨论最多的内容”。
  • 未找到 DeepSeek、Z.ai(GLM-5.3)、OpenAI 官方、Atria Dawn Preview(上海 AI Lab 系)在 Bluesky 上的官方账号。关于这些话题,本次没有找到由本人或官方发布的一手 Bluesky 信息。
  • Anthropic 官方账号(@anthropic.com)已确认存在,但发帖数为 0。
  • 因此,这里的 12 条内容不是严格意义上“当天新闻信中最受阅读的帖子”,而是“9 月中旬至 19 日,AI 评论者与官方账号发布的、与简报主题有关的帖子”。日期分布于 2026-09-01 至 09-18,并非都在当天发布。

Lemmy

Lemmy — 今日最受讨论的话题:OpenAI/Microsoft“盗用”诉讼文件,以及围绕 GPT-6 Astra 的评价与怀疑

社区
  • !«メールアドレス» — 88,124 subscribers。最大的综合科技社区,汇集大型 AI 新闻。
  • !«メールアドレス» — 5,150 subscribers。本地 LLM 运行、开发、量化和基准讨论的中心(类似 r/LocalLLaMA)。
  • !«メールアドレス» — 4,387 subscribers。讨论 AI 等未来技术。
  • Hacker News 镜像(!«メールアドレス») — 5,427 subscribers。HN RSS 转发机器人。
  • Lobste.rs 镜像(lemmy.bestiver.se) — subscribers 不明(未显示)。技术人员社区的 RSS 转发。
  • ai_reddit(lemmy.durstig.online,r/ArtificialInteligence、r/ClaudeCode 等 RSS 镜像) — 51 subscribers。规模不大,但原始文章链接到实际 Reddit 内容。
  • pravda_news(news.abolish.capital) — subscribers 不明。偏反 AI、媒体劳动立场的独立新闻社区。
  • !«メールアドレス» — subscribers 不明。综合开源软件社区。
帖子
  1. “'Doom Loop': OpenAI and Microsoft Admits LLMs Are Destroying the Web and Built on Theft” — !technology、score 840、2026-09-18。404 Media 报道,OpenAI/Microsoft 诉讼的解封文件显示,高管在内部承认存在“前所未有规模的盗窃”。这是当日 Lemmy 全站得分最高的帖子。
    https://pawb.social/post/50224962(hexbear.net 亦有同文镜像:https://hexbear.net/post/9583473)

  2. “'Elite Crime Spree': AI Execs Admit Scraping of News Outlets Was 'Largest Theft of Labor' in History” — !pravda_news、score 12、2026-09-18。另一家媒体对同一诉讼文件的报道,介绍微软 Brent Hecht 所说“LLM 是会摧毁自身供应链的产品”。
    https://news.abolish.capital/post/79588

  3. “OpenAI Execs Hoped to Make 'Gazillions' After Feeding Model Journalists' Work” — !pravda_news、score 3、2026-09-18。同一诉讼相关后续报道。
    https://news.abolish.capital/post/79560

  4. “OpenAI Launches Legal-Focused AI Platform, Escalating Race for Law Firm Users” — !technology、score 4、2026-09-18(原文 Reuters 发布于 09-17)。报道 OpenAI 将 GPT-6 Astra 投入法律行业,专业服务市场中与 Google、Anthropic 的竞争加剧。
    https://www.reuters.com/legal/litigation/openai-launches-legal-focused-ai-platform-escalating-race-law-firm-users-2026-09-17/

  5. “Qwen3.8 27B quantizations benchmarked” — !«メールアドレス»、score 22、2026-09-08。测试开放权重 Qwen3.8 27B 的多个量化等级,结论是“4-bit 已足够实用,但 1-bit 会崩溃”。
    https://quesma.com/blog/qwen38-27b-quantizations-benchmarked/

  6. “llama.cpp v0.4.1” 发布 — !«メールアドレス»、score 17、2026-09-15。新增对 Maple 20B-A1B、Tencent Hy 4、Spark2.5 等开放权重模型的支持。
    https://github.com/ggml-org/llama.cpp/releases/tag/v0.4.1

  7. “MemReranker-4B” 发布 — !«メールアドレス»、score 14、2026-09-17。面向智能体记忆检索、融入推理能力的 4B 轻量重排模型。
    https://huggingface.co/IAAR-Shanghai/MemReranker-4B

  8. “Colibri” MoE 流式框架 — !«メールアドレス»、score 7、2026-09-17。为在消费级硬件上运行前沿级 MoE 模型而设计的纯 C 实现。
    https://github.com/JustVugg/colibri

  9. “small LLMs are not totally worthless” — !localllama(lemmy.ml 镜像)、score 0、2026-09-18。尝试用 gemma-3-270m 生成关键词,达到 90 tokens/秒,但也报告其会“陷入循环”的弱点。
    https://lemmy.ml/post/52922480

  10. “Closed Source AI released their best model: GPT-6 Astra” — !futurology、score 31、2026-09-12。将 OpenAI 最新模型 GPT-6 Astra 介绍为“闭源阵营的最高点”。
    https://futurology.today/post/12093939

  11. “Benzi - Harness/AI agent beats big players on benchmarks while reading less source code” — ai_reddit(r/ArtificialInteligence 镜像)、score 1、2026-09-17。声称新兴编程智能体“Benzi”在 SWE-bench Verified 达到 78.2%,以更少 token 消耗超过大厂模型。
    https://www.reddit.com/r/ArtificialInteligence/comments/1whzyzc/benzi_harnessai_agent_beats_big_players_on/

  12. “I Don't Like LLMs”(Martin Fowler) — Lobste.rs 镜像、score 4(4up/1down)、2026-09-18。著名软件工程师撰写的 LLM 批评文章,在技术社区中引发讨论。
    https://lemmy.bestiver.se/post/1349155

信号
  • 当日 Lemmy 上得分压倒性最高的是关于 OpenAI/Microsoft 诉讼文件的“盗用”报道(#1 至 #3)。同一议题被 !technology、!pravda_news、hexbear.net 等多个实例和社区独立发布;在 Lemmy 的分布式结构中,这是少见的高度集中热点。
  • GPT-6 Astra 仍是闭源模型阵营的核心话题,但 Lemmy 的反应更偏实用和怀疑,例如法律业务部署、基准测试验证;不像 Reddit 或 X 那样热烈。
  • 开放权重内容集中在 !«メールアドレス»。重点并非大型新模型发布,而是“量化的实用性测试(Qwen3.8)”“轻量专用模型(MemReranker-4B)”“推理引擎更新(llama.cpp)”等对既有模型的部署与优化。
  • Lemmy 整体氛围中,针对 LLM 本身的怀疑和批评相当显眼:Fowler 的专栏、劳动盗用诉讼报道、AI 对劳动力市场负面影响等内容突出,主导的是技术社区保持距离的论调。
局限
  • Lemmy 规模较小,多数帖子得分仅为个位数至数十(诉讼报道的 840 是唯一例外)。它不容易作为 Reddit/X 式“爆款”指标解读。
  • 当在 lemmy.world 的 /api/v3/post/list 指定 community_name=«メールアドレス» 时,返回帖子数为 0;实际主要社区是 !«メールアドレス»(lemmy.ml 也有同名小型镜像)。跨实例搜索存在特殊行为。
  • lemmy.ml 的 !LocalLLaMA Web 社区页面(https://lemmy.ml/c/localllama)返回服务器错误(HTTP 500),以 API 搜索结果代替。
  • 几乎没有确认到 2026-09-19 当天发布的内容,最新帖子主要集中在 2026-09-17 至 18 日(LocalLLaMA 内容分布于 09-08 至 09-17)。Lemmy 的更新频率低于 Reddit/X,因此更接近“最近几天最热门”而非“今天最热门”。
  • Gemini 3.8、DeepSeek 等新模型发布虽然在一般 Web 搜索中可找到,但未确认 Lemmy 上存在相应帖子或讨论。
  • 针对 10 条的目标,已收集 12 条直接相关帖子,因此数量并不不足。

建议行动

  • 持续关注 OpenAI/Microsoft 诉讼的文件披露情况,评估其对版权与数据采购政策的实际影响。
  • 跟踪 DeepSeek、Qwen、GLM 等开放权重模型的量化与轻量化动向,为降低本地推理成本提供参考。
  • 鉴于对基准测试的不信任升高,内部性能评估应更多采用多个真实业务任务的验证。
  • 将自主智能体投入生产时,应以 Willison 报告的外部服务滥用风险为前提设计防护栏。
  • 若将 X 用作新闻来源,应停止依赖 Explore 趋势,转向明确的关键词搜索与行业账号列表监控。
  • 持续观察 Sakana AI 编排型模型等单模型优化之外的架构趋势。

数据质量说明

由于采用基于地理位置的 Explore 趋势词进行搜索,X 几乎没有捕捉到 LLM 相关帖子;YouTube 因 JS 渲染而无法获取大部分播放量和发布日期;Bluesky 因官方搜索 API 返回 403 而改为逐个账号跟踪。三者均存在覆盖完整性的限制。