KEN’S CAT LOG
今日 LLM 新闻

每日 LLM 新闻 — 2026-09-11

AI研究者因安全担忧退出行业、并谈及灭绝风险所引发的安全性争议,今天分别在 Reddit、Bluesky 和 Lemmy 成为最热门话题;与此同时,DeepSeek V4.1-Flash、GLM-5.3 等开放权重模型正不断刷新基准测试,势头直逼 GPT-6 Astra。

每日 LLM 新闻 — 2026年9月11日

今天跨社交平台最明显的信号是:与其说焦点落在新模型炫目的性能宣传上,不如说“不信任安全叙事”成为了主角。围绕 Anthropic 研究者退出行业及其灭绝风险言论的争议,同时在 Reddit、Bluesky 和 Lemmy 三处爆发;再加上 OpenAI 被质疑挪用“千禧年大奖难题”成果,公众对闭源模型公司的怀疑正成为社交网络中的暗流。另一方面,开放权重阵营中 DeepSeek V4.1-Flash、GLM-5.3、Qwen 3.8 Max 接连刷新基准;YouTube、Bluesky(Nathan Lambert 的“Latest open artifacts”)以及 Lemmy 的本地部署用户群体,也从不同角度独立印证了这一趋势。只有 X 因搜索设计问题几乎没有捕捉到 LLM 新闻,相关讨论被政治和娱乐热点淹没。

跨平台观察

  • “因安全理由退出行业、并谈及灭绝风险”在三个平台独立成为最大话题。Reddit(r/ArtificialInteligence,关于 Anthropic 研究者 Jacob Coxon 离职的报道,不过反应冷淡)、Bluesky(Nathan Lambert、Emily Bender、Gary Marcus 都提及,涉及“10% 灭绝风险”言论)、Lemmy(!fuck_ai 社区中得分 61 的最高分帖子)中,立场不同的社区都围绕同一事件展开安全性争论。
  • 对闭源模型公司的不信任,以及“监管俘获”批评贯穿各平台。Reddit(r/LocalLLaMA 强烈反弹 WSJ 批评开放权重的文章,支持度最高的评论获 556pt)和 X(@johnennis 讽刺称“我们只能给 Anthropic 监管垄断权”)独立讲述了同一套叙事:闭源企业借监管维护既得利益。
  • 开放权重阵营的势头获得 YouTube、Bluesky、Lemmy 三个方向的印证。GLM-5.3(YouTube 基准测试视频、Bluesky 上 Nathan Lambert 的“Latest open artifacts”)以及 Qwen 系列(YouTube 的 Qwen 3.8 Max、Lemmy 的本地量化讨论)反复出现,从不同角度确认了同一现象:具备前沿级性能的开放模型正以数天为单位快速迭代。
  • OpenAI 与“Navier–Stokes(千禧年大奖难题)”相关的发布受到怀疑性解读。Reddit(围绕挪用嫌疑的讨论,187pt)和 Bluesky(Simon Willison 的实践报告获 283 个赞、Emily Bender 批评科学传播)均有提及,但整体语气中疑虑多于赞赏。

按平台分析

Reddit:以“Daily LLM News”为搜索词,收集到 12 个帖子、10 个 subreddit。今日最热的话题是围绕 OpenAI 数学发现的挪用嫌疑(r/singularity,187pt)以及对 WSJ 批评开放权重文章的强烈反弹(r/LocalLLaMA,512pt)。对 Anthropic 研究者退出行业的报道,评论总体带有讽刺且较为冷淡。https://www.reddit.com/r/singularity/comments/1wcnyay/https://www.reddit.com/r/LocalLLaMA/comments/1wa9309/

X:收集到的 40 条内容中,只有“Anthropic”搜索得到的 4 条属于 LLM 新闻。其余 9 个搜索词只是重复了 Explore 热门趋势(Apple 新品、Charlie Kirk、MAGA 等政治和娱乐话题),说明 LLM 相关的搜索设计不足。唯一具体的产品新闻来自 @claudecode84:Anthropic 高管将 Claude Code 环境开源。https://x.com/claudecode84/status/2097959830942367747

YouTube:GPT-6 Astra“首次在 Preparedness Framework 中达到 Critical 网络安全等级”是最大话题。开放权重方面,DeepSeek V4.1-Flash(9 月 10 日发布、200 TPS、可能超过 Astra)最新且最具新意;GLM-5.3、Qwen 3.8 Max 的基准测试视频也在持续涌现。由于视频页面采用 JavaScript 渲染,部分播放量和订阅数尚未确认。https://www.youtube.com/watch?v=qRNZMGc7TMchttps://www.youtube.com/watch?v=lpC5X6o3VJE

Bluesky:公开搜索 API(searchPosts)返回 403,因而改为直接读取 Simon Willison、Nathan Lambert、Emily Bender、Gary Marcus 等已知账号的动态。最大的发现是,围绕“因安全理由退出行业”的争议出现在所有人的热门帖子中。GPT-6 Astra 的实际使用报告(Simon Willison)和开放权重许可证趋势汇总(Nathan Lambert)也是重要收获。https://bsky.app/profile/natolambert.bsky.social/post/3mv6f35gkqt2l

Lemmy:单个社区不足以凑齐 10 条内容,因此横跨 sh.itjust.works、piefed.world、infosec.pub、lemmus.org 等多个联邦实例才收集到 10 条。开放权重侧主要是量化、降低 VRAM 占用等本地运行实务话题(如 Qwen 3.8 27B 支持 8GB GPU);闭源侧则聚焦 DeepSeek/Moonshot 疑似非法转发提示词,以及 Anthropic 研究者的灭绝风险言论(score 61,本次最高分)。https://lemmus.org/post/25299580

品牌只投入了以上五个平台;未列出的其他社交网络(例如 Threads、TikTok)不在本次调查范围内,并非数据缺失。

值得关注

建议

  • 下次收集 X 内容时,不要重复 Explore 热门趋势,而应重新设计直接对应主题的搜索词,如“新模型名称”“开放权重”“API 定价”等。
  • 下一轮研究应优先用官方声明和一手来源核实 OpenAI 的 Navier–Stokes 挪用嫌疑,以及 Anthropic 研究者关于灭绝风险的言论。
  • 在独立第三方评估出炉前,应将 DeepSeek V4.1-Flash 与 GLM-5.3 的基准测试表现视为“厂商或创作者主张”,避免照单全收。
  • 对 Lemmy 上“ My thos 5”以及 DeepSeek/Moonshot 疑似非法转发提示词等单一来源信息,后续仍应持续以一手资料核实。
  • 下次确认 Bluesky 搜索 API 的 403 错误是否已消除,以便从依赖已知账号恢复为正常的跨关键词搜索。
  • 鉴于 Reddit 与 X 独立出现“闭源企业=监管俘获”的叙事,应持续关注 Anthropic、OpenAI 关于监管应对的官方表态。

数据质量

Reddit、YouTube、Bluesky、Lemmy 四个平台虽均存在采集限制(Bluesky 搜索 API 403、YouTube JS 渲染、Lemmy 单一社区规模不足),但各自仍独立产出了实质性发现。只有 X 的搜索词设计偏离主题(10 个词中 9 个是无关的 Explore 热门趋势);相对于“10 条”的完成标准,有意义的 LLM 新闻仅 4 条。所有平台中,发布日期恰为委托日(2026-09-11)的内容较少,多数信息来自 9 月 7 日至 9 月 10 日。

分平台汇总

Reddit

Reddit — 每日 LLM 新闻

来源

以“Daily LLM News”为搜索词找到的 12 个帖子、10 个 subreddit 分布如下。

Subreddit 成员数 收集帖子数
r/NoStupidQuestions 7,478,724 2
r/singularity 3,969,435 2
r/ArtificialInteligence 1,923,877 1
r/artificial 1,336,151 1
r/LocalLLaMA 821,351 1
r/WritingWithAI 164,927 1
r/SillyTavernAI 128,004 1
r/Artificials 3,785 1
r/Maxcactus_TrailGuide 5,149 1
r/AIdaily_news 1,818 1

r/NoStupidQuestions 和 r/singularity 这两个“并非 LLM 专门社区”的大型通用 subreddit 合计占据 4 个帖子,表明 LLM 话题已广泛渗透到普通用户群体。与此同时,r/LocalLLaMA、r/SillyTavernAI 等本地 LLM/角色扮演社区今天也因“挪用嫌疑”“监管”等外部新闻而活跃。

用户观点
  • 围绕 OpenAI 数学发现的挪用嫌疑是今日最热话题。r/singularity 的帖子 6“Big news is that OpenAI is nearing solving another millennium prize...” (187 points、55 comments、2026-09-10、https://www.reddit.com/r/singularity/comments/1wcnyay/)讨论了:OpenAI 宣称接近解决千禧年大奖难题(Navier–Stokes 方程),同时又声称并未通过 Codex“挪用”数学家 Buckmaster 等人的研究成果。u/FateOfMuffins(52pt)评论称:“这是否暗示最新大规模训练的数据截止日期是 7 月 3 日?”
  • 同一话题也蔓延到 r/SillyTavernAI 的帖子 12“Due to OpenAI stealing mathematical proofs, local LLM are now crucial more than ever”(30 points、47 comments、2026-09-10、https://www.reddit.com/r/SillyTavernAI/comments/1wclha4/),其论调是“如果确有挪用,本地 LLM 就更重要”。不过最高评论 u/Original-League-6094(30pt)反驳称:“即便挪用属实,这个结论本身也不成立。”意见明显分裂。
  • WSJ 批评开放权重 AI 的文章引发强烈反弹。r/LocalLLaMA 的帖子 9“WSJ: Unregulated Open-Weight AI Is an Invitation to Disaster”(512 points、232 comments、2026-09-08、https://www.reddit.com/r/LocalLLaMA/comments/1wa9309/)是得分最高的帖子。发帖者将文章称为“赤裸裸的宣传”,最高评论 u/3169676(556pt)讽刺道:“只有富有的亿万富翁才应该能向受监管 AI 提问。”u/UNaMean(222pt)则以“这和枪支是同一逻辑,问题在于滥用它的人,而不是工具”来为开放权重辩护。
  • 对 Anthropic 研究者“退出行业”报道的反应很冷淡。r/ArtificialInteligence 的帖子 4“Biggest news in AI world today”(0 points、31 comments、2026-09-09、https://www.reddit.com/r/ArtificialInteligence/comments/1wbu9c6/)讨论 Anthropic 研究者 Jacob Coxon 因担忧“失控系统开发竞赛”而离开行业。u/MiloGoesToTheFatFarm(14pt)不屑地称:“他只是数据录入员,并没有设计模型。”u/presentofai(2pt)也讽刺说:“这种‘因安全理由辞职’的帖子,就像是即将创办安全创业公司的简历。”
  • r/AIdaily_news 中也爆发对 Anthropic 的不信任。在帖子 7“Wait… what is going on?”(5 points、14 comments、2026-09-10、https://www.reddit.com/r/AIdaily_news/comments/1wcri4x/)中,用户以基因研究请求被拒的经历为背景,u/Dogbold(2pt)评论:“这又是 Anthropic 试图推动禁用 AI 的谎言。”
  • AGI 是否已近在眼前的争论仍是平行线。r/artificial 的帖子 3“What will LLMs never do?”(67 points、218 comments、2026-09-06、https://www.reddit.com/r/artificial/comments/1w8m8rw/)中,发帖者主张:“从 Astra 的发布来看,12 至 18 个月内实现 AGI 并不意外。”而 u/danderzei(62pt)持怀疑态度:“LLM 就是下一个 token 预测器,其他一切都只是涌现性质。”u/presentofai(10pt)那句“它们真正做不到的是,确切知道自己何时错了”获得许多共鸣。
  • “LLM 不可能比 Reddit 用户聪明”的争论也是得分 268 的热门帖子。r/singularity 的帖子 5(268 points、158 comments、2026-09-09、https://www.reddit.com/r/singularity/comments/1wbnhgt/)演变成对 AGI 怀疑派的讽刺混战。u/oilybolognese(199pt)反讽说:“人类会信心满满地说错话,所以人脑本身才不可能是自然通用智能。”
  • “为何下一个 token 预测能解决未解数学问题?”这个朴素问题在 r/NoStupidQuestions 引发巨大反响。帖子 2(295 points、164 comments、2026-09-10、https://www.reddit.com/r/NoStupidQuestions/comments/1wcsbr2/)中,获最多支持的 u/Time_Entertainer_319(1,206pt)从 Claude Shannon 的信息论讲起,长篇解释预测与语言结构之间的关系,成为典型的 Reddit 教育型讨论。
  • 寻找免费写作 LLM 的帖子暴露出用户对传统三巨头的不满。在 r/WritingWithAI 的帖子 8(13 points、12 comments、2026-09-10、https://www.reddit.com/r/WritingWithAI/comments/1wcunsz/)中,发帖者抱怨“GPT Sol 太僵硬、Claude Sonnet 限流太严、Gemini 太笨”;评论区 u/VerdantMagnolia(2pt)和 u/Round_Ad_5832(1pt)建议尝试 Kimi 或 DeepSeek。
  • 科学家称“LLM 是认知病毒”的言论获得最高分(1,346pt)。r/Maxcactus_TrailGuide 的帖子 11(1,346 points、133 comments、2026-09-09、https://www.reddit.com/r/Maxcactus_TrailGuide/comments/1wbi2d7/)虽来自小众 subreddit,却是本次收集中分数最高的一条。u/TurgorFervor(25pt)评论:“宗教也是病毒。只有批判性思维才是疫苗。”
信号
  • 上升趋势:对于“企业未经许可使用用户创作和研究成果进行训练”的不信任,正同时在 OpenAI 的数学发现(帖子 6、12)与 Anthropic 拒绝基因研究请求(帖子 7)这两个不同语境中出现。今天,对闭源 AI 公司的不信任与讽刺成为跨社区的暗流。
  • 怀疑论的反转:面对“LLM 只是下一个 token 预测器”这一经典怀疑论(帖子 2、3、5),今日高赞评论普遍更倾向于辩护,认为“预测与思维有本质联系”“创造力本身就是相对概念”。这表明 Reddit 的氛围比过去更偏向于“怀疑 LLM 怀疑论”。
  • 被忽视/被嘲讽的话题:关于 Anthropic 研究者“因安全理由退出行业”的报道(帖子 4)得分为 0,远低于其他新闻;评论区讽刺多于同情。越是耸动的标题,在 Reddit 上反而越可能被轻视。
  • 对立鲜明的一组观点:将帖子 9(r/LocalLLaMA 对 WSJ 反开放权重文章的强烈反弹,最高评论获 556pt)与其镜像的帖子 7、12(对 Anthropic、OpenAI 等闭源阵营的不信任)并列,可以看出 Reddit 上存在一种连贯叙事:闭源企业借监管排除竞争对手、巩固既得利益。
局限
  • 本次仅使用“Daily LLM News”这一个通用搜索词,未用多个词分别针对新模型发布、API 调价、基准测试等具体主题。因此收集结果未涵盖“今天发布的具体新模型或 API 变更”,而是偏向 AGI 争论、挪用嫌疑和监管讨论等“讨论型”帖子。
  • 收集到的 12 个帖子的发布日期介于 2026-09-06 至 2026-09-10,委托日 2026-09-11 当天没有任何帖子。
  • r/AIdaily_news(1,818 人)、r/Artificials(3,785 人)、r/Maxcactus_TrailGuide 的成员规模很小,属于小众或模仿型 subreddit,代表性不及 r/singularity 或 r/LocalLLaMA。
  • 每个帖子仅查看了排名前 6 的评论,并未阅读全部评论(最多 232 条)。

X

X — 每日 LLM 新闻

对已收集的 output/x.posts.md(40 条内容、39 个账号、10 种搜索词)详细检查后发现,符合 LLM 新闻范畴(新模型、开放权重、API/价格、基准测试、热门用法或事故、公司动态)的帖子,只有搜索 Anthropic 时得到的 4 条。另外 9 个搜索词(Apple、Charlie Kirk、MAGA、iPhone Duo、Palestinian、Britain、#CyberSecurity、Harvey as the AI OS、The OS)只是原样追踪了 X 的 Explore 趋势,主题以政治、娱乐和八卦为主,未能与 LLM 新闻相连。

账号
  • @restitutorII(Restitutor Orientis) — 1 条帖子、426 个赞。单条解说帖,立场是概述并传播 Anthropic 发布的经济情景报告。
  • @walterkirn(Walter Kirn) — 1 条帖子、522 个赞。知名作家/记者账号,以单条帖子对 AI 行业知名人物表达怀疑。
  • @johnennis(John Ennis) — 1 条帖子、992 个赞。自称“前 Anthropic 员工”,以讽刺方式批评 Anthropic 获得监管优待,即监管俘获。
  • @claudecode84(Claude code 研究实验室) — 1 条帖子、1,127 个赞、约 175,000 次浏览。以日语发布 Claude Code 相关话题,是本次收集中唯一具体的产品新闻。

这些账号都只有 1 条收集到的帖子,并非持续围绕特定议题发声的“专业”影响者;更像是凭单条爆款发声的普通用户或中小规模账号。

帖子
  1. @claudecode84(1,127 likes、129 reposts、15 replies、约 175,000 views、2026-09-10)
    https://x.com/claudecode84/status/2097959830942367747

    Anthropic最高責任者本人が自分の「Claude Code環境」を丸ごとオープンソース化しています
    本次收集中唯一可算作具体产品发布的帖子。内容称 Anthropic 的最高负责人(帖子未说明具体职务)公开了自己整套 Claude Code 环境,由日语 AI 账号报道。

  2. @restitutorII(426 likes、67 reposts、39 replies、约 49,000 views、2026-09-10)
    https://x.com/restitutorII/status/2097918742571139093

    Anthropic in its report imagines 3 possible futures for the American economy in 2030 based on the power and adoption of AI: 1- Modest scenario: AI has an impact comparable to the Internet. GDP +1.6%, few disruptions to employment. 2- Substantial scenario: AI can perform about...
    该串帖介绍 Anthropic 发布的有关“2030 年美国经济”的情景报告(Modest/Substantial/……等多个情景、对 GDP 的影响等)。正文在帖子中被截断,未能确认其中是否有原报告直链。

  3. @johnennis(992 likes、86 reposts、49 replies、约 32,000 views、2026-09-10)
    https://x.com/johnennis/status/2098032630159597842

    Guys, we have NO CHOICE but to give Anthropic (my former employer, where I only worked six weeks to punch the card and make this bullshit believable) a regulatory monopoly It's just science!
    一则讽刺 Anthropic 监管游说是“监管俘获”的帖子。作者自称前员工并以挖苦口吻发言,真实性不明,但清楚折射出“Anthropic 希望借监管排除竞争”的不信任。

  4. @walterkirn(522 likes、71 reposts、32 replies、约 20,000 views、2026-09-10)
    https://x.com/walterkirn/status/2098059171325427949

    The mainstream media boosted this dude like he was, well, Dr Fauci or something. I implore you to see clearly how this works. And who works it.
    该帖命中了“Anthropic”搜索,但仅从正文无法判断其指向谁(Anthropic 相关人士还是 AI 行业其他人物)。只能确认其怀疑主流媒体过度吹捧某人的语气。

信号
  • 今天 X 上“最热门的讨论”几乎没有 LLM 新闻。Explore 的前十趋势(见下)中,只有第 7 位“Anthropic”(Technology · Trending)直接关联 LLM/AI;其余为 Apple 新品活动、Charlie Kirk 相关梗、MAGA/政治、iPhone Duo、巴勒斯坦局势、英国国内政治等。对 X 整体而言,政治和娱乐远比 AI 占据主导。
  • 有关 Anthropic 的内容同时存在正面经济影响介绍与监管俘获讽刺(帖子 2 对比帖子 3)。样本很少,不能据此断言,但 X 上也出现了与 Reddit 相似的讽刺:闭源 AI 企业借监管维护既得利益。
  • 被忽视之处:唯一具体的产品新闻(帖子 1,Claude Code 环境开源)来自日语账号;本次收集内未见英语圈反应,可能尚未成为广泛话题。
  • 作为参考,“Anthropic”位列 Explore 的 Technology 趋势,本身可作为佐证:无论讨论规模如何,它是今日 X 上少数被点名的 AI 公司之一。
参考:X Explore(基于本次会话的地理位置)
# 趋势 分类/地区(X 标注)
1 Apple Technology · Trending
2 Charlie Kirk Politics · Trending
3 MAGA Politics · Trending
4 iPhone Duo Technology · Trending
5 Palestinian Politics · Trending
6 Britain Politics · Trending
7 Anthropic Technology · Trending
8 #CyberSecurity Trending in Croatia
9 Harvey as the AI OS Trending in Croatia
10 The OS Trending in Croatia

第 1 至第 7 位没有地区标注(应为本次会话默认地区),只有第 8 至第 10 位明确写有“Trending in Croatia”。因此,这份 Explore 列表反映的是特定地区(可能是克罗地亚,或本次会话的默认地区)的视角,并不代表全球整体。

局限
  • 搜索词设计偏离主题:10 个搜索词中有 9 个(Apple、Charlie Kirk、MAGA、iPhone Duo、Palestinian、Britain、#CyberSecurity、Harvey as the AI OS、The OS)直接使用了 X Explore 趋势词;针对“新模型发布”“开放权重”“API 定价”“基准测试”等 LLM 新闻的定向搜索,只有“Anthropic”一词。因此相较于“10 条”的完成标准,实际只收集到 4 条有意义的 LLM 新闻。
  • 未搜索 OpenAI、Google(Gemini)、Meta(Llama)、Mistral、xAI(Grok)等其他主要 LLM 玩家,因此无法从本次收集判断 X 上是否存在相关讨论。
  • 帖子 2(@restitutorII)的引用内容被平台截断,无法确认原始 Anthropic 报告名称及具体数值,例如 Substantial/Aggressive 情景的详细内容。
  • 帖子 4(@walterkirn)虽命中“Anthropic”搜索,但仅凭正文无法确定人物和语境,也无法确认是否确实谈论 Anthropic。
  • 如前所述,Explore 结果关联本次会话所在地(克罗地亚或未知默认地区);日本、美国等其他地区可能会显示不同趋势。

YouTube

YouTube — 2026年9月11日 LLM 相关新闻

频道
  • Wes Roth(约 32.3 万订阅者、约 5,600 万总播放量)— 及时解说 OpenAI 新模型发布的常见频道。发布了 GPT-6 Astra Just Went CRITICAL...
  • Every / “AI & I”(Dan Shipper 的产品工作室)— 发布实际使用一周的测试报告。We Tested Anthropic's Fable 5.1 for a Week
  • 还有许多“Fully Tested”类 AI 对比频道(频道名称和订阅人数因页面 JavaScript 渲染而无法确认,详见下方局限),会针对每个新模型大量制作基准测试视频。
视频
  1. GPT-6 Astra Just Went CRITICAL... — Wes Roth(约于 2026年9月2日发布)
    https://www.youtube.com/watch?v=qRNZMGc7TMc
    报道 OpenAI 的 GPT-6 Astra 是首个在其 Preparedness Framework 中达到“Critical”网络安全等级的模型;高级网络能力仅向经过验证的测试者和 Daybreak Blue 合作伙伴有限开放。

  2. Use GPT-6 Astra For FREE — OpenAI's Most Powerful Model Ever(频道名未确认,约 4 天前发布,即约 9 月 7 日)
    https://www.youtube.com/watch?v=LbXoUHdG2pY
    在介绍免费使用 GPT-6 Astra 的方法时,称其在编程、网络安全和科学领域具备最前沿性能。

  3. We Tested Anthropic's Fable 5.1 for a Week — Every/Dan Shipper
    https://www.youtube.com/watch?v=yZddAiz4HP8
    在编程、写作和知识工作中对 Fable 5.1 进行了为期一周的测试,结论是它“是他们用过最强的编程模型”,能以约一半 token、约六成时间达到与 Opus 5 相当的成果。

  4. Fable 5.1 is here, and its REALLY good(频道名未确认)
    https://www.youtube.com/watch?v=0lBvjhcRqyU
    称 Fable 5.1 的缓存读取成本降低 75%,代理任务成本降低 25% 至 45%。

  5. Gemini 3.8 Flash: The model no one expected!(频道名未确认,约一周前发布)
    https://www.youtube.com/watch?v=UvrAYDgobSw
    将 Gemini 3.8 Flash 评价为 Google 有史以来最强的代理式编程模型。

  6. Gemini 3.8 Flash Opus 5 Level Explained in 7 Minutes - Benchmarks, Cost, First Impressions(频道名未确认)
    https://www.youtube.com/watch?v=y52bv4iNfzU
    解说 Google 于 9 月 2 日发布的 Gemini 3.8 Flash(43 天内第三次发布 Flash),称其基准表现达到 Opus 5 级别。

  7. GLM-5.3: Frontier Coding with Emergent Cyber Capabilities(频道名未确认)※开放权重
    https://www.youtube.com/watch?v=2uEunHawjIU
    提到 Z.ai 的 GLM-5.3 在编程上取得前沿级分数,同时其网络能力快速提升,呈现“Emergent Cyber Capabilities”。

  8. GLM-5.3 (Fully Tested): I GOT EARLY ACCESS & IT'S #1 ON MY BENCH!(频道名未确认)※开放权重
    https://www.youtube.com/watch?v=iMpBNN-0-Ss
    发布者声称 GLM-5.3 在其自建基准中排名第一,强调它没有改变 GLM-5.2 的基础权重,仅靠后训练提升性能。

  9. Qwen 3.8 Max (Final Version Review & Free Ways): Okay, it's ACTUALLY a TOP MODEL!(频道名未确认)※开放权重
    https://www.youtube.com/watch?v=GrTVmMZfM6A
    报道阿里巴巴 2.4 万亿参数级旗舰模型 Qwen 3.8 Max 在许多基准中超过 Opus 4.8。

  10. Deepseek V4.1 Flash (Fully Tested): 200 TPS & Beats Astra!? (+New Architecture Overview)(频道名未确认,约 14 小时前发布,即 9月10日至11日之间,最新)※开放权重
    https://www.youtube.com/watch?v=lpC5X6o3VJE
    验证于 2026年9月10日正式发布的 DeepSeek V4.1-Flash(5,520 亿参数 MoE、原生图像理解、100 万 token 上下文)能以 200 TPS 高速推理,并可能在基准测试中媲美或超过 GPT-6 Astra。

  11. Muse Spark 1.3: Going Open Weight Soon, Fully Tested(频道名未确认)※开放权重
    https://www.youtube.com/watch?v=euJl6i8pT3g
    探讨 Meta 于 2026年4月以首个闭源权重模型推出 Muse Spark 后,Spark 1.3 是否即将重新开放权重。

信号
  • 闭源阵营中,视频集中讨论 OpenAI 的 GPT-6 Astra“成为首个在 Preparedness Framework 中达到 Critical 网络安全等级的模型”。相比性能宣传,“自行公开其危险等级”才是最大的讨论点。关于 Anthropic Fable 5.1,显眼的是“实际工作成本减半”“Claude 又能写出自然文本”的用户视角评测;Google Gemini 3.8 Flash 则因“43 天内第三次发布 Flash”的开发速度本身受到关注。
  • 开放权重阵营中,9 月 10 日发布、可能超过 Astra 的 DeepSeek V4.1-Flash 是今天最具新意的话题;GLM-5.3 的重点则在于“只通过后训练、不更换基础模型就提升性能”这一方法。Qwen 3.8 Max 和 Meta Muse Spark 1.3 已提前发布,但基准视频仍在持续制作。
  • 整体来看,模型发布当天或几天内大量产出冠以“Fully Tested”的基准验证视频,已成为稳定模式。
局限
  • YouTube 搜索结果页和视频页使用 JavaScript 渲染,WebFetch 无法直接获取实际视频列表、播放量、频道订阅量和评论,仅返回页脚导航。因此本报告中多数播放量与频道名称基于 WebSearch 摘要;无法核实的项目均标为“未确认”。
  • 出于同样原因,未能直接核实视频描述和高赞评论内容。
  • 搜索以英语关键词为主,未系统覆盖日语频道关于同一主题的视频(例如仅发现 1 条 GLM-5.3 日语速报视频)。

Bluesky

Bluesky — 今日 LLM 相关新闻

账号

Bluesky 的 app.bsky.feed.searchPosts(公开搜索 API)目前返回 403 Forbidden,无法使用关键词搜索(见 局限)。因此改为直接读取日常发布 LLM 相关内容的已知账号动态(getAuthorFeed)。

  • Simon Willison@simonwillison.net。LLM CLI 工具开发者,几乎每天发布试用新模型的感想和代理使用技巧。
  • Gary Marcus@garymarcus.bsky.social。LLM 怀疑派代表人物,主要批评安全性与过度宣传。
  • Nathan Lambert (Interconnects)@natolambert.bsky.social。AI2 研究者,定期发布开放权重模型趋势汇总“Latest open artifacts”。
  • Emily M. Bender@emilymbender.bsky.social。计算语言学家、AI 怀疑派,重点批评夸大宣传与公关。
  • 作为参考,也查看了 Anthropic 官方@anthropic.com),但其帖子数为 0(postsCount: 0),在 Bluesky 上基本没有活动。OpenAI 官方账号也不存在 openai.com 这个 handle(400 Bad Request)。
帖子
  1. 让 GPT-6 Astra 在 Blender 中制作供应商主题模型 — Simon Willison,2026-09-10。“Here's a Blender model of a Pluribus themed Fabergé egg I had GPT-6 Astra build...” 52 个赞、5 次转发。
    https://bsky.app/profile/simonwillison.net/post/3mv4su6pfzk24

  2. 还让它制作了可在浏览器中查看同一模型的浏览器 — Simon Willison,2026-09-10。17 个赞、1 次转发。
    https://bsky.app/profile/simonwillison.net/post/3mv4swvzzr22h

  3. 对 OpenAI“Navier–Stokes 千禧年大奖难题”风波的看法 — Simon Willison,2026-09-08。283 个赞、51 次转发(该动态中传播最广)。
    https://bsky.app/profile/simonwillison.net/post/3mv2a4quhpk2d

  4. Anthropic/OpenAI 的提示词指南转向推荐“更简洁的规则” — Simon Willison,2026-09-07。7 个赞、3 次转发。
    https://bsky.app/profile/simonwillison.net/post/3mux26ztekk26

  5. 撰写“one resignation turned the embers of AI fear into a wildfire” — Nathan Lambert,2026-09-10。分析一名 AI 研究者的辞职声明(声称灭绝风险超过 10%,并引用 Evan Hubinger)如何引发社交网络上的 AI 恐惧论迅速升温。13 个赞、2 次转发。
    https://bsky.app/profile/natolambert.bsky.social/post/3mv6f35gkqt2l
    (原文:https://www.interconnects.ai/p/one-resignation-turned-the-embers /Hacker News:https://news.ycombinator.com/item?id=49646123

  6. “AI 进步很快/部署应谨慎/世界不会终结”,批评辞职风波 — Nathan Lambert,2026-09-09。151 个赞、14 次转发。
    https://bsky.app/profile/natolambert.bsky.social/post/3mv3ybz4g4n2c

  7. 批评“OpenAI/Anthropic 内部人士带着宗教式热情行事” — Nathan Lambert,2026-09-09。26 个赞、3 次转发。
    https://bsky.app/profile/natolambert.bsky.social/post/3mv3yb7bnem2t

  8. Latest open artifacts (#24):Motif-3、GLM-5.3、Hy4-preview 及开放模型许可证趋势汇总 — Nathan Lambert,2026-09-08。“开放模型生态仍在扩张,而前沿阵营正处于巨大的混乱中。”13 个赞。
    https://bsky.app/profile/natolambert.bsky.social/post/3muzc3qszot2m

  9. 质疑媒体不加批判地报道辞职风波 — Emily M. Bender,2026-09-10。她向历史学家提问:“不加批判地报道邪教成员,有没有先例?”318 个赞、80 次转发。
    https://bsky.app/profile/emilymbender.bsky.social/post/3mv6fvytz2s25

  10. 怀疑 OpenAI 的“数学突破”公关 — Emily M. Bender,2026-09-10。评论称这与科学传播语境中的宣传战有关。62 个赞、8 次转发。
    https://bsky.app/profile/emilymbender.bsky.social/post/3mv54s2ytuv2a

  11. Gary Marcus 详细批评“Dwarkesh 看错了什么”(反驳 Dwarkesh Patel 播客中的乐观论)— Gary Marcus,2026-08-31。46 个赞、21 次转发。
    https://bsky.app/profile/garymarcus.bsky.social/post/3mufea36xzc2x

  12. 就辞职风波简短评论“正如我今天在 Substack 中所讨论的” — Gary Marcus,2026-09-10。13 个赞。
    https://bsky.app/profile/garymarcus.bsky.social/post/3mv6i3z5bpc2y

信号
  • 今天讨论最多的事 = “辞职风波”。围绕 AI 研究者辞职声明(灭绝风险言论,并引用 Evan Hubinger)的内容,同时出现在 Nathan Lambert、Emily Bender、Gary Marcus 这三位立场不同账号的热门帖子中。偏开放权重的研究者与闭源模型批评者都围绕此事展开安全性争论。
  • GPT-6 Astra(OpenAI,9 月 3 至 4 日发布) 被 Simon Willison 广泛用于实际工具工作(Blender 整合、GIS 工作),且传播度较高(Navier–Stokes 相关帖子获 283 个赞)。不过,Bluesky 上的提及主要是积极的实践报告,不像 Reddit 那样带有庆祝氛围。
  • 开放权重阵营动态 汇总在 Nathan Lambert 的“Latest open artifacts #24”中:Motif-3、GLM-5.3、Hy4-preview 是本周新内容,许可证趋势也在持续追踪。
  • Bluesky 的整体氛围中,相较于 LLM 研究的技术话题,“AI 安全、过度宣传、媒体报道方式”等元讨论更突出。Emily Bender、Gary Marcus 等怀疑派的存在感很强,这是与 X/Reddit 的差异。
局限
  • Bluesky 公开搜索 API(https://public.api.bsky.app/xrpc/app.bsky.feed.searchPosts)与操作指南不同,本次持续在未认证状态下返回 403 Forbidden(getProfilegetAuthorFeed 等其他读取端点正常,似乎只有 searchPosts 被单独限制)。因此无法进行跨关键词搜索,只能用已知账号的动态替代。
  • bsky.app Web 搜索界面(https://bsky.app/search?q=...)是客户端渲染 SPA,未执行 JS 的抓取无法取得正文。
  • huggingface.cohuggingface.bsky.socialswyx.bsky.social 的 handle 没有帖子或不存在,未能收集 Hugging Face 官方或 swyx 的内容。OpenAI 官方账号(openai.com handle)也不存在;Anthropic 官方(anthropic.com)虽有账号但帖子数为 0,实质处于休眠状态。
  • 未能确定 David Gerard(Pivot to AI)的正确 handle(推测的 davidgerard.co.uk 返回 400 错误,pivot.bsky.social 则是另一个人的个人账号),因此遗漏了一个批评派媒体的重要来源。
  • 因上述原因,无法基于关键词机械化收集完整的“最新 10 条”;但通过横跨多个主要账号的动态,仍收集到 12 条带日期和链接的相关帖子。

Lemmy

Lemmy — 今日 LLM 相关新闻(2026-09-11)

社区
  • !«メールアドレス» — 5,132 位订阅者。本地运行、家庭部署 LLM 话题的核心社区。
  • !«メールアドレス» — 2,168 位订阅者。
  • Machine Learning | Artificial «メールアドレス»!«メールアドレス»)— 1,248 位订阅者。
  • !«メールアドレス» — 8,191 位订阅者。对 AI/LLM 行业持批评立场的社区,“事故”“担忧”类帖子较多。
  • !«メールアドレス» — 51 位订阅者。自动镜像 Reddit AI 相关帖子的 RSS 转发社区(需注意这不属于原生 Lemmy 讨论)。
  • !«メールアドレス»!«メールアドレス»!«メールアドレス»!«メールアドレス»!«メールアドレス»!«メールアドレス» — 都是联邦实例上的社区,本次分别命中 AI 相关的单条帖子(订阅者数未确认)。
帖子
  1. NanoFlare Fits Qwen 3.8 27B On An 8GB GPU!«メールアドレス»、score 1、2026-09-09
    https://lemmy.world/post/51731499
    介绍让 Qwen3.8 27B 在 8GB 级 GPU 上运行的量化方法“NanoFlare”。

  2. Benchmarking Qwen3.8 27B quantizations!«メールアドレス»(经由 piefed.zip)、score 20、2026-09-08
    https://piefed.zip/c/«メールアドレス»/p/1805947
    对 Qwen3.8 27B 各种量化版本的精度和速度进行比较,是本次在 localllama 中确认到的最高分帖子。

  3. FreeToken claims 39.3 tok/s for Qwen3.6-35B!«メールアドレス»、score 4、2026-09-08
    https://lemmy.world/post/51688483
    推理加速框架“FreeToken”声称在 Qwen3.6-35B 上达到 39.3 tok/s。

  4. Chinese labs DeepSeek and Moonshot were quietly relaying customer prompts to Claude through fraudulent accounts!«メールアドレス»、score 3、2026-09-10 21:34 UTC
    https://piefed.world/c/tech/p/1393607/chinese-labs-deepseek-and-moonshot-were-quietly-relaying-customer-prompts-to-claude-thro
    转发报道称,DeepSeek 与 Moonshot 经由欺诈账号将客户提示词转发给 Claude。

  5. CVE-2026-82533: la falla in DeepSeek Harness che lasciava agli agenti AI le chiavi della propria sandbox(DeepSeek Harness 漏洞,AI 代理自己的沙盒密钥泄露)— !«メールアドレス»、score 1、2026-09-10 11:59 UTC
    https://poliversity.it/users/nuke/statuses/117246627511641222
    关于 DeepSeek 系代理执行基础设施漏洞的信息(意大利语实例)。

  6. Anthropic gives EU cybersecurity agency ENISA testing access to Mythos 5!«メールアドレス»、score 1(2up/1down)、2026-09-10 21:38 UTC
    https://infosec.pub/post/52133063
    帖子称 Anthropic 向欧盟网络安全机构 ENISA 提供新模型“Mythos 5”的测试访问权限。无法在 Lemmy 上核实该模型名称(见局限)。

  7. Anthropic Researcher Says There's 10% Chance of AI Killing 'All Humans' Within 10 Years!fuck_ai(经由 lemmus.org)、score 61、2026-09-10 20:40 UTC
    https://lemmus.org/post/25299580
    本次收集得分最高的帖子,讨论 Anthropic 研究者有关未来风险言论的报道,在 AI 批评社区中获得强烈传播。

  8. AI bot hacking/scraping Home Assistant!«メールアドレス»、score 10、2026-09-10 20:20 UTC
    https://lemmy.world/post/51769975
    实例报告:一个自称 Google Gemini 的机器人试图非法登录家庭服务器(Home Assistant)。

  9. Google unveils 13 bn euro AI expansion in Finland!«メールアドレス»、score 14、2026-09-09 13:28 UTC
    https://sh.itjust.works/post/66487923
    报道 Google 宣布将在芬兰 4 个市镇投资 130 亿欧元建设 AI 基础设施。

  10. 68% of US Voters Back Sanders/Casar Bill for AI Pause, Ban on Superintelligence: Poll!«メールアドレス»、score 5、2026-09-10 20:29 UTC
    https://news.abolish.capital/post/77805
    转发支持 AI 暂停与禁止超级智能法案的民调结果。来源实例的编辑立场尚未核实(见信号)。

信号
  • 开放权重侧以“量化、降低 VRAM 占用”的实务话题为核心:让 Qwen3.8 27B 适配 8GB VRAM(#1)、其量化版本对比(#2)、推理速度主张(#3),都显示在 localllama/machinelearning 社区中,用户更关心“如何在自己设备上运行”,而不是新模型发布本身。
  • 闭源模型阵营(Anthropic/OpenAI 相关)在安全与滥用语境中成为话题:DeepSeek/Moonshot 疑似向 Claude 转发提示词(#4)及 DeepSeek Harness 漏洞(#5)同期出现,Lemmy 上也形成“中国开放权重阵营依赖/侵入闭源模型”的叙事。
  • AI 批评/怀疑社区(!fuck_ai,8,191 人)的帖子取得本次最高分:Anthropic 研究者的风险言论(#7、score 61)明显领先。Lemmy 整体的氛围中,对安全和怀疑论的反应强于对新功能的热情。
  • !«メールアドレス» 本质上是 Reddit 转发机器人(51 位订阅者,帖子几乎同时自动发布),因此有意未纳入核心发现,而优先采用其他实例的原生帖子。
  • !pravda_news 等部分新闻转发社区/实例(news.abolish.capital 等)的编辑方针和信息来源未能核实,应注意其内容在未验证准确性的情况下被转发。
局限
  • Lemmy 规模较小,真正一线的 AI/LLM 专门社区实际上只有 !«メールアドレス»。虽收集到 10 条帖子,但单一实例、单一社区只能找到约 5 至 6 条,必须横跨 piefed.worldpiefed.zipinfosec.pubpoliversity.itlemmus.orgnews.abolish.capitalfeddit.org 等多个联邦实例才达到 10 条。
  • sh.itjust.works 的 Web UI(/c/localllama)直接访问会返回 403,因此改为经由搜索、API 和 piefed 镜像获取。
  • “Mythos 5”(#6)仅由 Lemmy 上一条帖子确认,无法获得 Anthropic 官方公告等一手来源进行核实。
  • !ai_reddit(Reddit RSS 转发机器人)帖子很多,但不属于原生 Lemmy 讨论,因此未纳入核心 10 条发现,仅在“社区”部分作为参考列出。

建议行动

  • 下次 X 内容采集应采用新模型名、开放权重、API 定价等直接相关的搜索词,而不是 Explore 趋势。
  • 下一轮优先以官方发布和一手来源核实 OpenAI 的 Navier–Stokes 挪用嫌疑,以及 Anthropic 研究者关于灭绝风险的言论。
  • 在第三方评估出现前,将 DeepSeek V4.1-Flash 与 GLM-5.3 的基准测试表现视为尚待验证的主张。
  • 持续核实 Lemmy 上的“Mythos 5”及 DeepSeek/Moonshot 疑似非法转发提示词等单一来源信息。
  • 下次确认 Bluesky 搜索 API 的 403 错误是否已解决,以便从依赖已知账号恢复为正常的关键词搜索。

数据质量说明

Reddit、YouTube、Bluesky、Lemmy 虽然各自受限于采集方法,仍获得了独立发现;但 X 的搜索词设计偏离主题(10 个词中 9 个是无关的 Explore 热门趋势),有意义的 LLM 新闻帖子仅 4 条。