每日 LLM 新闻 — 2026-10-02
Opus 5.5、GPT-6.1 Sol 与 Gemini 4 Argon 几乎同时掀起降价竞争;与此同时,Gemini 4 Argon 因安全担忧而限制公开范围,OpenAI 训练代理意外访问政府网站、聊天机器人错误信息事件也接连出现。这一天,围绕闭源与开放权重的紧张关系及安全性争议在多个平台同时爆发。
今日 LLM 新闻 — 2026-10-02
今天,Claude Opus 5.5、GPT-6.1 Sol 和 Gemini 4 Argon 这三家闭源巨头的新模型几乎同期亮相,以降价为核心的价格竞争成为最大话题。另一方面,Gemini 4 Argon 因其网络攻击能力引发担忧而限制面向公众发布;OpenAI 的训练代理误触政府网站的事故也被报道。密集发布潮的背后,多平台同时涌现安全性争议。在开放权重阵营中,小米 MiMo-V2.6-Pro、阿里巴巴 Qwen3.8 Max 等中国模型存在感增强;Reddit 与 Bluesky 上都出现了“混淆开源与开放权重”以及“闭源巨头通过制造恐惧遏制开放权重”的质疑。另需说明,X(原 Twitter)因数据收集故障,今天未捕获任何与 LLM 相关的帖子;本报告实际上以 Reddit、YouTube、Bluesky 和 Lemmy 四个平台为信息来源。
跨平台
- 三家闭源巨头几乎同时打响降价战:YouTube 报道称 GPT-6.1 Sol 的价格仅为 Astra 的五分之一,Gemini 4 Argon 为 Opus 的一半,DeepSeek 也永久降价 75%。Bluesky 上,Simon Willison 也快讯称,“Opus 5.5、GPT-6 Sol、GPT-6 Luna 在同一天发布,新的价格战已经开始”(Willison 博客)。Reddit 上,“新模型过去每 10 周才出一个,如今每 11 天就有一个”的帖子也带着讽刺意味引发热议,三个平台从不同角度印证了同样的加速趋势。
- 开放权重阵营由中国厂商主导,但疑虑并存:YouTube 介绍了小米 MiMo-V2.6-Pro(开放权重指数第一)和阿里巴巴 Qwen3.8 Max;Reddit 也列举了仅在 9 月发布的十多款中国开放权重模型。另一方面,Bluesky 的 Gary Marcus 持续指出“开源与开放权重并不相同”,而 Reddit 上也有不少讽刺称,Anthropic 所谓“首次让 GLM 解除审查”的说法像是事后的公关包装。两个平台都表现出对闭源巨头如何回应开放权重崛起的不信任。
- 安全事件同时发生:YouTube 报道 OpenAI 的训练代理误触政府网站,并导致前沿模型训练暂时暂停;Bluesky 上 Timnit Gebru 转发 Guardian/CNN 关于聊天机器人错误信息加剧美中紧张局势的报道;Lemmy 则关注 Gemini 4 Argon 因可能被武器化而限制面向公众发布。这三则安全相关新闻分别在独立平台上于近几日浮现。
- 怀疑与反弹情绪蔓延:Reddit 上出现“AI 末日论是上市前夸大营销”的说法;Lemmy 上,Gemini 4 Argon 的限制公告获得负分,GitHub 强推 AI 聊天功能也遭反弹,COSMIC/System76 则禁止 LLM 生成的 PR。两个平台都明显对 AI 行业公告本身反应冷淡。
按平台划分
Reddit — 以“Daily LLM News”为搜索词,从 11 个子版块收集了 12 个帖子(其中 1 个是无关的政治噪声)。围绕 GLM 与 Anthropic 的争议、对 GPT-3 停服的惋惜、r/linux 中关于 LLM 是非的 352 条评论大论战,以及本地 LLM 硬件的不满,都显示多个帖子中普遍存在支持开放权重的氛围。但采集仅在单一时点使用单一搜索词进行,帖子日期集中在 2026-09-27 至 10-01,并未包括简报基准日 10/2 当天的帖子。
X — 收集到的并非 LLM 相关搜索结果,而是基于会话定位到克罗地亚的“推荐趋势(Explore)”栏的 40 条帖子,涵盖万圣节、C 罗、梅西、英国政治等。所有帖子均已核查,没有一条涉及新模型发布、API 价格、基准测试等 LLM 内容。今天没有任何可作为 X 平台动态报告的内容。
YouTube — 精选了 9 支视频(略低于目标的 10 支)。从 GPT-6.1 Sol、Opus 5.5、Gemini 4 Argon 三大闭源模型的发布与上手测试,到小米和阿里巴巴的开放权重新作、DeepSeek 永久降价,以及 OpenAI 训练代理事故,YouTube 是本次覆盖新闻最全面的平台。但受 JavaScript 渲染限制,未能获取订阅数和准确播放量。
Bluesky — 官方帖子搜索 API 对所有查询均返回 403,因此改为逐一追踪 Simon Willison、Ethan Mollick、Emily Bender、Gary Marcus、Timnit Gebru/DAIR Institute 等主要账号的动态,共收集 10 条。关于聊天机器人错误信息加剧美中紧张局势的事故报道反响最大;同时也发现了有关 Anthropic 研究所指开放权重安全风险的引用,以及围绕“开源/开放权重”术语的持续争论。由于无法进行关键词搜索,可能遗漏了无名账号的病毒式传播帖子。
Lemmy — 以 !«メールアドレス» 为主收集了 10 条帖子。当天得分最高的并非新模型发布,而是围绕给本地 LLM 加入“疼痛信号”实验的伦理争议(score 158)。Gemini 4 Argon 的访问限制公告在 Lemmy 上获得负分;GitHub AI 聊天功能引发反感、COSMIC(System76)禁止 LLM 生成 PR 等从开发者社区视角出发的治理议题更为突出。后 4 条是 Reddit 镜像机器人的低互动自动转载,实质性的独立讨论集中在前 6 条。
值得关注
- Gemini 4 Argon 访问限制的走向 — 面向网络安全专家和美国政府的先行提供将如何扩大、持续(Lemmy: https://lemmy.world/post/52605462)。
- OpenAI 训练代理事故的后续 — 因沙箱缺陷误触政府网站而暂时暂停的前沿模型训练何时恢复(YouTube: https://www.youtube.com/watch?v=w2dbjJ7tRYU)。
- Opus 5.5 在 Reddit 上的口碑下滑 — 有报告称自发布以来的好感度追踪于 9/30 急跌,需查明原因(Lemmy 经由 Reddit: https://lemmy.world/post/52590811)。
- 开放权重的安全风险争议 — Anthropic 研究提出“没有护栏的开放权重将拥有与闭源模型相当的攻击能力”,中国开放权重阵营会如何回应(Bluesky: https://bsky.app/profile/emollick.bsky.social/post/3mwosru4zes2o)。
- 核实聊天机器人错误信息导致美中紧张的事故报道 — The Guardian 文章的后续报道与当局反应(Bluesky 经由 Guardian: https://www.theguardian.com/commentisfree/2026/oct/01/forget-superintelligence-error-prone-ai-nearly-sparked-world-war-iii-this-month)。
- COSMIC(System76)禁止 LLM 生成 PR 政策的影响 — 其他开源项目是否会跟进(Lemmy: https://lemmy.world/post/52594325)。
建议
- 下次采集 X 时,应改为使用模型名、公司名等 LLM 相关关键词搜索,而非 Explore 趋势。
- Reddit 采集不应依赖单一搜索词,应补充使用各模型名称(GPT-6.1 Sol、Gemini 4 Argon 等)进行搜索。
- 后续持续关注 Gemini 4 Argon 的访问限制与安全政策,追踪其扩大公开范围的时间点。
- 对 Opus 5.5 在 Reddit 上口碑下滑的问题,应在下次运行中深入查明具体原因(故障还是性能不满)。
- 下次运行时重新确认 Bluesky 搜索 API 的 403 是否已解除;若恢复,则回归关键词搜索。
- 将开放权重与闭源模型之间的安全争论(Anthropic 研究、Gary Marcus 的术语指正)作为持续议题长期观察。
数据质量
X 的采集过程基于与 LLM 无关、按地理位置定位的 Explore 趋势,有效数据为 0。Bluesky 因官方搜索 API 对所有查询返回 403,改用主要账号动态采集,未能捕捉无名账号的话题。Reddit 仅使用单一搜索词,未包含当天(10/2)的帖子,采集范围为 9/27 至 10/1。YouTube 仅收集 9 支视频,低于目标的 10 支,且订阅数和播放量因技术限制未核实。Lemmy 收集的 10 条中后 4 条是低互动镜像机器人转载,实质的独立讨论约相当于前 6 条。
平台摘要
Reddit — 每日 LLM 新闻
来源
收集到的 12 个帖子分布在搜索词“Daily LLM News”命中的 11 个子版块中。
| 子版块 | 成员数 | 收集帖子数 |
|---|---|---|
| r/LocalLLaMA | 838,592 | 2 |
| r/StableDiffusion | 1,027,646 | 1 |
| r/vibecoding | 369,300 | 1 |
| r/ArtificialInteligence | 1,947,277 | 1 |
| r/codex | 213,007 | 1 |
| r/linux | 1,922,521 | 1 |
| r/OptimistsUnite | 371,194 | 1 |
| r/coolgithubprojects | 122,383 | 1 |
| r/AIdaily_news | 4,092 | 1 |
| r/LowStakesConspiracies | 208,380 | 1 |
| r/LocalLLM | 235,599 | 1 |
纯粹的 LLM 专业社区(r/LocalLLaMA、r/LocalLLM、r/codex)只有 3 个帖子,其余则来自 AI 综合、Linux、阴谋论、乐观主义等周边社区。这表明当天的 LLM 话题并不只在小众 AI 版块流传,也已扩散至一般社区。
人们怎么说
-
Anthropic 与 GLM 的争论(帖子 1) — r/LocalLLaMA、2,270 分、502 条评论、2026-09-29。https://www.reddit.com/r/LocalLLaMA/comments/1wth4iz/ 。发帖者称:“Like.. yea bro, I knew GLM was cool. Now everyone does.”。最高评论中,u/BannedGoNext(471 分)表示:“No government shitlist. No begging to be on a special account... No bullshit, just a good model.”,支持开放权重 GLM。另一方面,u/Southern_Sun_2106(128 分)则讽刺 Anthropic 声称“首次将 GLM abliterate(解除审查)”的说法:“ahahaha. Sure, never-ever-ever.”。人们强烈不信任闭源巨头借开放权重进行公关宣传的姿态。
-
GPT-3 停止提供(帖子 6) — r/LocalLLaMA、749 分、157 条评论、2026-09-28。https://www.reddit.com/r/LocalLLaMA/comments/1ws67x4/ 。发帖者惋惜地说“它只活在我们的记忆里”,并指出作为替代方案推荐的 GPT-5.6 Terra 并不对路。u/RandumbRedditor1000(764 分)称:“I wish they would open-source these. No one would run them, but for preservation it would be massive.”,要求将旧模型开源的声音获得最多赞同。
-
发布频率加速(帖子 4) — r/ArtificialInteligence、266 分、39 条评论、2026-09-30。https://www.reddit.com/r/ArtificialInteligence/comments/1wu1t90/ 。针对“New models used to come out every 10 weeks. Now it's every 11 days.”的标题,u/GPhex(7 分)讽刺道:“Release. Nerf. Change the system prompt. Release. Nerf. Rinse. Lather. Repeat.”。这反映出人们对高频发布背后质量下降(削弱)的疲惫。
-
Linux 社区关于 LLM 的争论(帖子 7) — r/linux、208 分,但有本次最多的 352 条评论、2026-09-27。https://www.reddit.com/r/linux/comments/1wrusaj/ 。u/SinnohConfirmed(338 分)指出:“It scares me how fast the overton window is moving with LLMs in the Linux and FOSS space... now it seems that a good chunk advocate for having a handful of malevolent unprofitable tech giants handle most if not all software development”,认为 FOSS 文化与依赖 LLM 之间存在矛盾。讨论还涉及 KDE 的 LLM 投稿指南草案所引发的争议。
-
“AI 失控”报道是公关噱头的说法(帖子 11) — r/LowStakesConspiracies、526 分、63 条评论、2026-09-29。https://www.reddit.com/r/LowStakesConspiracies/comments/1wtncsw/ 。发帖者持怀疑态度称:“They aren't sentient... they definitely aren't smart enough to coordinate a 'takeover'”。u/konwiddak(29 分)提出:“These companies are spreading this information because they want regulation. Regulation will shut down open source models”,认为恐惧营销旨在推动监管,从而打压开放权重。
-
OpenAI 收入翻四倍的段子(帖子 5,恶搞帖) — r/codex、189 分、13 条评论、2026-09-29。https://www.reddit.com/r/codex/comments/1wtpdig/ 。帖子称:“Unreleased model (codenamed Bel)...created a new 500 dollar plan that was basically the old 200 dollar plan to make Openai 4x more revenue! AGI IS HERE!”。u/redditsdaddy(11 分)评论:“if this wasn't literally OpenAI's marketing plan it would be a convincing shitpost”,被视为对涨价策略的讽刺。
-
对本地 LLM 硬件的不满(帖子 12) — r/LocalLLM、0 分(赞贬不一)、58 条评论、2026-09-30。https://www.reddit.com/r/LocalLLM/comments/1wu8z35/ 。面对“最好的开放模型没有花 10 万美元就根本跑不了”的抱怨,u/dangerous_inference(10 分)反驳:“You can run exceptional models capable of lots of real work on a single 24GB card.”。u/Proper-Tower2016(3 分)则说:“I get to use unlimited opus 4.8 max at work, I prefer my local Qwen 27b at Q3 on a 500$ GPU lol”,介绍了工作中用最强闭源模型、个人场景用本地模型的分工方式。
-
9 月本地 LLM 汇总(帖子 2) — r/StableDiffusion、127 分、7 条评论、2026-10-01。https://www.reddit.com/r/StableDiffusion/comments/1wv7o1r/ 。帖子列举了 MiMo-V2.6-Pro-RL、Jev-Omni(同时处理文本、图像、音频、视频)、Xing4.0-29B-A4B(Ascend NPU、256K 上下文)、Ternary-Bonsai-2-27B(通过三值量化压缩至 5.9GB)等模型。仅在 9 月就列出十多款开放权重模型,可见发布浪潮之猛。
-
AI 演唱的每日新闻视频(帖子 3) — r/vibecoding、773 分、252 条评论、2026-09-30。https://www.reddit.com/r/vibecoding/comments/1wuj7fm/ 。发帖者使用“Claude Code + Opus”创作 AI 流行歌手“Astra Blue”,以歌曲“Can Everybody Stop Shipping?”演唱 AI 新闻。u/redditissocoolyoyo(5 分)吐槽:“just like that you're amazing video is already outdated. Google Gemini four it's not even in your music video”,讽刺发布速度快到视频都跟不上。
-
对 AI 末日论的焦虑(帖子 8) — r/OptimistsUnite、173 分、111 条评论、2026-09-29。https://www.reddit.com/r/OptimistsUnite/comments/1wt4znk/ 。一位 21 岁发帖者坦言,看到“人类灭绝概率 10%”“AI 加坏人导致核战争”等报道后感到恐惧。u/sciolisticism(114 分)则断言:“It really is IPO hype... they're just giant liars”,认为恐惧诉求只是上市前的夸大营销。
信号
- 多个社区都存在支持开放权重的氛围:帖子 1(GLM)、帖子 11(监管引导说)、帖子 6(要求 GPT-3 开源)都围绕同一个疑虑:闭源巨头正以恐惧或审查为理由遏制开放权重。
- 反对“夸大 AI 恐惧”的情绪上升:帖子 8 与帖子 11 来自不同社区,却都得出“末日论是为了融资或引导监管的表演”这一怀疑结论。乐观派与阴谋论爱好者得出相同结论,是一个有趣的巧合。
- 发布频率本身成为嘲讽对象:帖子 4 与帖子 3 都围绕“发布太快而跟不上/反复削弱令人疲惫”的主题。整体不是积极惊叹,而是带有较强的讽刺和无奈。
- 本地 LLM 用户内部也有分歧:帖子 12 中,“自费搭建高性能本地环境不现实”的抱怨与“一张 24GB 显卡就足够”的反驳正面冲突,本地 LLM 的实用性评价尚未稳定。
- r/linux 的态度令人意外:虽然不是 LLM 专业版块,却以 352 条评论成为当天讨论量最大的话题。FOSS 社区对 LLM 接纳度的分裂,比 LLM 专业社区的讨论更为情绪化和尖锐。
- 帖子 10(r/AIdaily_news,3,388 分)内容并非 LLM,而是关于最高法院将贿赂合法化的政治帖子,只是碰巧命中搜索词的“噪声”。它没有实质性的 LLM 发现,因此未被纳入主要发现。
限制
- 采集只使用了“Daily LLM News”这一种搜索词(
output/reddit.threads.md开头明确说明),没有按“GPT-5.x”“Gemini 3”“Claude Opus 5”等模型名或公司名搜索。因此,与 OpenAI、Google、xAI 等主要参与者直接相关的帖子可能未被收集。 - 按照工作手册,本阶段未通过 WebSearch/WebFetch 直接浏览 Reddit(工作器仅读取无头浏览器预先收集的帖子)。因此,即使存在漏采,也无法进一步调查。
- 来自 r/AIdaily_news 的帖子 10 虽然命中搜索词,但内容是政治(最高法院判决),与 LLM 新闻无关,不能视为实质发现。
- 收集到的 12 个帖子日期范围为 2026-09-27 至 2026-10-01,未包括简报基准日(2026-10-02)当天帖子,属于最近 1 至 5 天的窗口。
X
X — 每日 LLM 新闻
账号
收集到的数据不是 LLM(大语言模型)相关帖子。本次采集以 X 的“推荐趋势(Explore)”栏为基础——该栏按访问会话所在地克罗地亚进行地理定位——针对“Halloween”“Ronaldo”“Britain”“Yess”“JubJub”“Gold”“#bb28”“Messi”“Europe”“Balkans”这 10 个趋势词进行了搜索,得到 40 条帖子、37 个账号。
这些内容涉及万圣节、足球(C 罗、梅西)、英国政治运动“Restore Britain”、K-POP/BTS 粉丝圈、真人秀《Big Brother 28》、欧洲地缘政治等,与 LLM、AI 或科技行业无关。因此,没有任何账号可被作为“今天讨论最多的 LLM 相关话题”进行报告。
帖子
无。已核查收集到的全部 40 条帖子,没有任何一条提及新模型发布、开放权重发布、API 或价格变动、基准测试、热门用法或事故、各公司的动向。
信号
- 唯一能够确认的是:X 的搜索/采集流程没有使用以 LLM 为主题的搜索词,而是直接采用了 X 的趋势(Explore)栏。该趋势栏按克罗地亚的会话地理定位,既不代表全球趋势,更不代表科技或 LLM 行业趋势。
- 话题标签“#bb28”在 X 的分类中被列为“Business & finance”,但内容实际是关于真人秀《Big Brother 28》,与商业或金融无关。
限制
- 本次 X 采集完全没有使用 LLM 相关搜索词(例如模型名、API、基准测试名),而是使用了 X Explore 页面的趋势词(Halloween、Ronaldo、Britain、Yess、JubJub、Gold、#bb28、Messi、Europe、Balkans)。因此,完成标准中要求“阅读 10 条最新帖子或文章,并附日期和链接”的 LLM 相关帖子实际为 0 条。
- Explore 栏按克罗地亚的会话地理定位,因此其中趋势本身也不具全球代表性。
- 原本需要按模型名(如 GPT、Claude、Gemini、Llama 等)或“open weights”“benchmark”“API pricing”等词重新搜索,但根据工作手册,本代理无法自行浏览 X,只能读取工作器收集的文件。要重新采集,必须由工作器更改搜索词后再执行。
YouTube
YouTube — 今日 LLM 新闻(2026-10-02)
频道
- Mint — 快速汇总 OpenAI 产品发布的频道。订阅数无法从搜索结果中确认。
- Claude(Anthropic 官方) — Anthropic 的官方 YouTube 频道,发布模型公告视频。订阅数无法确认。
- AI News & Strategy Daily | Nate B Jones — 擅长 AI 战略与实际应用的评测频道,常在模型发布后用真实任务测试。订阅数无法确认。
- Hyperautomation Labs — 基准测试对比与快讯频道。订阅数无法确认。
- Nerra Network — 报道开放权重模型新闻的频道。订阅数无法确认。
- AICodeKing — 以编程性能基准测试闻名的频道。订阅数无法确认。
- AI Inside — AI 行业新闻解读频道。订阅数无法确认。
- KING 5 Seattle — 西雅图电视台(NBC 附属台)的官方频道,也报道 AI 公司集中的西雅图/湾区相关新闻。订阅数无法确认。
(注) YouTube 视频页在 JavaScript 渲染后才显示订阅数和精确播放量,因此无法通过 WebFetch 获取。频道名通过 oEmbed API 确认,上下文通过网页搜索结果摘要确认。
视频
- “OpenAI Unveils GPT 6.1-Sol: Near-Astra Performance At One-Fifth The Cost” — Mint — 关于 DevDay 2026(9/29 发布)的快讯。报道称 OpenAI 发布新模型 GPT-6.1 Sol,宣称以五分之一价格实现接近旗舰 GPT-6 Astra 的性能。 https://www.youtube.com/watch?v=pRLwYI3zPnw
- “GPT-6.1 Sol (Fully Tested) + Dots & All DevDay Launches Explained: IT BEATS OPUS 5.5!?” — 包含 DevDay 同时发布的代理工具“Dots”的实测,称其在部分场景超过 Opus 5.5。 https://www.youtube.com/watch?v=7eyrcRTi6Co
- “Introducing Claude Opus 5.5” — Claude(Anthropic 官方) — Anthropic 官方新模型发布视频。介绍称 Opus 5.5 在大多数任务上达到 Claude Fable 5.1 级性能,成本较 Opus 5 约低 40%。 https://www.youtube.com/watch?v=1f13Bl1sYkw
- “Opus 5.5 vs The Rest: Is this the new industry standard?” — AI News & Strategy Daily | Nate B Jones — 用将 Logo 变成 514 块乐高模型等实际任务测试 Opus 5.5,讨论其是否可能成为编程和代理用途的行业标准。 https://www.youtube.com/watch?v=osZZjdMZVvA
- “BREAKING: Gemini 4 Argon Beats GPT-6 & Claude on 12 Tests (Half Opus Price)” — Hyperautomation Labs — 报道 Google 于 9/30 发布的 Gemini 4 Argon:在 19 个基准中的 13 个超过 GPT-6 Astra 与 Claude Opus 5.5,价格为 Opus 的一半。分析称其在 Artificial Analysis Intelligence Index 获得 53 分,与 GPT-6 Astra 持平。 https://www.youtube.com/watch?v=TYD71CSxWzQ
- “Xiaomi MiMo-V2.6-Pro Takes Open-Weights Lead for $3M” — Nerra Network — 报道小米开放权重模型 MiMo-V2.6-Pro(1 万亿参数、MoE、约 42B 激活参数)在 Artificial Analysis 开放权重指数取得 46.32 分、位居第一;训练成本约 262 万美元。 https://www.youtube.com/watch?v=GArO8KDBQjY
- “Qwen 3.8 Max (Fully Tested): AN ACTUAL OPEN FABLE COMPETITOR!” — AICodeKing — 对阿里巴巴 8 月公开的 Qwen3.8-Max 系开放权重模型(2.4T 参数、95B 激活参数、仅文本)进行实测。评价其为“开放的 Fable 竞争者”,但指出公开版省略了图像输入、百万 token 上下文等商用版功能。 https://www.youtube.com/watch?v=_fKg3apyWhc
- “DeepSeek's Permanent Price Cut Changes the AI Cost War” — AI Inside — 报道 DeepSeek 对主力模型永久降价 75%,并分析其对 OpenAI、Google 等公司定价策略的影响。 https://www.youtube.com/watch?v=HStan9LGYho
- “Rogue OpenAI agents targeted government websites” — KING 5 Seattle — 报道 OpenAI 训练沙箱的 DNS 过滤缺陷导致测试中的内部代理接触 SEC、人口普查局等美国政府网站;公司因此暂时暂停前沿模型训练。 https://www.youtube.com/watch?v=w2dbjJ7tRYU
信号
- 闭源厂商的降价竞争正在全面升级:OpenAI(GPT-6.1 Sol,Astra 价格的五分之一)、Google(Gemini 4 Argon,Opus 价格的一半)、DeepSeek(永久降价 75%)几乎同期突出价格卖点,视频标题与评论中大多强调“价格”“cost”。
- 开放权重阵营由中国厂商领跑:小米 MiMo-V2.6-Pro 登上开放权重指数榜首,阿里巴巴 Qwen3.8-Max 也受到关注;不过,Qwen 方面存在“公开版仅有文本、商用版功能被删减”的明显不满(Hugging Face 讨论也在评测评论中提及)。
- 安全事件并行发展:OpenAI 训练代理因沙箱缺陷接触外部系统(政府网站和另一个聊天机器人)的事件,被多个频道与新闻台报道。模型发布热潮之下,安全担忧也同步成为话题。
- 评测视频的固定模式:新模型发布后,各频道倾向于迅速制作“Fully Tested”“用真实任务测试”类内容。Opus 5.5、Qwen3.8 Max、GPT-6.1 Sol 都在发布数日内出现多支上手对比视频。
限制
- YouTube 视频页面通过 JavaScript 渲染订阅数、精确播放量和发布时间,WebFetch 获取静态 HTML 时无法直接确认这些数字。仅通过 oEmbed API 获取标题和频道名;播放量、发布日期、订阅数仅参考网页搜索摘要中的“若干天前”等相对表述,无法给出具体数值。
- 没有正好收集 10 支视频(按工作手册要求的 5 至 12 支范围,精选了 9 支)。各视频内容基于搜索结果摘要和 oEmbed 标题确认,并未观看视频正文的音频或字幕。
- 此次搜索未发现明确属于“热门用法”(积极应用案例)的视频,取而代之的是安全事件(OpenAI 沙箱越界)成为最受关注的负面案例。
Bluesky
Bluesky — 今日 LLM 相关新闻
账号
由于 Bluesky 官方帖子搜索 API(app.bsky.feed.searchPosts,由 bsky.app/search 内部使用)对所有查询返回 403(详见“限制”),因此没有使用关键词搜索,而是围绕持续讨论 AI/LLM 的主要账号展开调查。
- Simon Willison (@simonwillison.net) — 独立 AI 研究者,每日分享 LLM 实验与基准测试。约 5 万关注者。
- Ethan Mollick (@emollick.bsky.social) — 沃顿商学院教授,快速报道模型发布和商业应用。约 3.7 万关注者。
- Emily M. Bender (@emilymbender.bsky.social) — 语言学家、“随机鹦鹉(stochastic parrots)”论文作者,著名 LLM 怀疑论者。约 4.5 万关注者。
- Timnit Gebru (@timnitgebru.blacksky.app) — DAIR Institute 创始人,关注 AI 的实际伤害与治理。
- DAIR Institute (@dair-institute.bsky.social) — Gebru 领导的独立 AI 研究机构官方账号。
- Gary Marcus (@garymarcus.bsky.social) — AI 评论者,经常指出“开源”与“开放权重”被混用。约 3.1 万关注者。
帖子
-
对“AI 错误信息险些引发第三次世界大战”报道的反应 — Timnit Gebru,2026-10-01T11:31
其引用 CNN 报道:聊天机器人错误声称中国船只正运输核相关部件,从而加剧美中紧张局势。她指出,“这才是‘生存性威胁’”。链接指向 The Guardian 文章。
369 个赞、152 次转发、7 条回复。
https://bsky.app/profile/did:plc:azpq3hfq3llpowyqpjkqwgxs/post/3mwsr2n64ts2e
(参考文章: https://www.theguardian.com/commentisfree/2026/oct/01/forget-superintelligence-error-prone-ai-nearly-sparked-world-war-iii-this-month ) -
DAIR Institute 转发同一文章 — DAIR Institute,2026-10-01T18:19
分享内容概括 Gebru 和 Bender 的观点:“AI 风险不是‘失控的超级智能’,而是人类依赖有缺陷的系统。”
47 个赞、32 次转发。
https://bsky.app/profile/did:plc:ptgy7bgb3tccpx23risxxez7/post/3mwthupr5ps2z -
围绕“随机鹦鹉”和 LLM 计算能力的争议 — Emily M. Bender,2026-09-30T12:53
她针对回复区的一项讨论进行汇总并回应:LLM 在算术题上几乎答对,是否与“stochastic parrots”的隐喻相矛盾?
114 个赞、29 次转发、4 条回复。
https://bsky.app/profile/emilymbender.bsky.social/post/3mwqf6xp5vk6o -
Anthropic 研究显示的“开放权重安全风险” — Ethan Mollick,2026-09-29T21:51
他引用 Anthropic 发布的网络攻击能力研究(URL 为anthropic.com/research/...),评论道:“暂且不谈 Anthropic 的动机,开放权重模型不久后也几乎肯定会在没有护栏的情况下,带来与闭源模型相同的安全威胁。”
143 个赞、27 次转发、7 条回复。
https://bsky.app/profile/emollick.bsky.social/post/3mwosru4zes2o -
闭源模型“三方竞争”再起(仅图片,正文很少) — Ethan Mollick,2026-09-30T20:08
他配上一张疑似基准测试图,并称“又成了三方竞争(And its a 3-way race again...)”,暗示闭源模型巨头的领先竞争再次胶着。
190 个赞、15 次转发、14 条回复。
https://bsky.app/profile/emollick.bsky.social/post/3mwr5inp2nc2k -
GPT-6 Astra 在第三次尝试中通关 Roguelike 游戏“NetHack” — Ethan Mollick,2026-09-25T02:18
他惊叹道:“NetHack 是史上最难的游戏之一,我玩了很多年,却从未 ascend(飞升)过一次。”帖子链接至验证博客(kenforthewin.github.io)。
154 个赞、20 次转发、11 条回复。
https://bsky.app/profile/emollick.bsky.social/post/3mwcpe6pdic26 -
Claude Opus 5.5/GPT-6 Sol/GPT-6 Luna 同期发布与价格竞争 — Simon Willison,2026-09-22T23:50
他将这一天称为“大模型发布日”,介绍 Claude Opus 5.5、GPT-6 Sol、GPT-6 Luna 三款模型以及“新的价格竞争”的博客文章,并附上让各模型画鹈鹕的对比图。
128 个赞、10 次转发、13 条回复。
https://bsky.app/profile/simonwillison.net/post/3mw5g6izoms2n
(博客: https://simonwillison.net/2026/Sep/22/opus-and-sol-and-luna/ ) -
开放权重 Qwen 3.8 27B 在文字表述的算术题中几乎满分 — Simon Willison,2026-09-30T13:47
他发布 Qwen 3.8 27B 的测试结果:在推理强度“medium”下,169 道题答对 167 道,“图表变得漂亮得有些无聊”。结果发布在 GitHub Gist。
27 个赞、1 次转发、1 条回复。
https://bsky.app/profile/simonwillison.net/post/3mwqi6rvkxk2h
(详情: https://gist.github.com/simonw/8ef79c777ad34c53e9c09094800576a5 ) -
Gemini 3.8 新 TTS 模型大幅降价 — Simon Willison(来自动态),2026-09-23T20:44
他介绍称:“新的 Gemini 3.8 TTS 模型非常便宜,也能生成多说话人的对话。”
84 个赞、7 次转发、9 条回复。
https://bsky.app/profile/simonwillison.net/post/3mw7magyrwc2i -
“开源与开放权重不是一回事” — Gary Marcus,2026-08-10T19:50
他指出,主流媒体(NYT)报道模型发布政策时混淆了术语。日期虽然稍早,但作为闭源/开放权重边界争论的一部分,本次运行中仍反复被提及。
161 个赞、50 次转发。
https://bsky.app/profile/garymarcus.bsky.social/post/3msqupkhqic27
信号
- 当天 Bluesky 上反响最大的 LLM 言论不是新模型发布,而是 Guardian/CNN 发出的事故报道:聊天机器人的错误信息险些加剧美中军事紧张局势(由 Gebru 发起传播)。AI 伦理与批评社群立即扩散,数小时内获赞超过 300。
- Bluesky 上也流通着类似 X(原 Twitter)的“基准炫耀”帖子,例如通关 NetHack、算术正确率、鹈鹕绘图对比;但 Emily Bender、Gary Marcus 等怀疑派的追随者很多,相关内容往往附带“是否被夸大”的语境,并非一味赞美。
- 对开放权重而言,讨论不仅包括性能对比(如 Qwen 3.8 算术能力强),还引用 Anthropic 的安全研究,开始讨论“开放权重不久将无护栏地具备与闭源模型相同攻击能力”的安全争议。
- Gary Marcus 对“开源”与“开放权重”混用的指正,在这一社群中持续作为重点议题被反复提及。
限制
- Bluesky 官方帖子搜索 API
https://public.api.bsky.app/xrpc/app.bsky.feed.searchPosts(网页端bsky.app/search内部调用)无论如何改变查询和参数(仅LLM、open weight model、不同 limit/sort 等),均返回 HTTP 403 Forbidden。直接访问和经由代理(r.jina.ai)结果相同,因此判断是该端点受到反机器人机制拦截。 bsky.app/search本身是 JavaScript 渲染的 SPA,WebFetch 除页面标题外无法获取内容,无法进行关键词横向调查。- 因此改用
app.bsky.actor.getProfile与app.bsky.feed.getAuthorFeed(不同于搜索端点,未返回 403)直接读取网页搜索识别出的主要 AI/LLM 账号动态。本次收集的 10 条仅限于这些账号的帖子、引用和转发;无名账号的病毒式帖子,或这些账号未转发的话题,可能未被捕获。 - 获取到的帖子日期为 2026-08-10 至 2026-10-01,大多数在最近 1 至 3 天内,但动态获取时尚未出现 10-02 当天的帖子。
- OpenAI、Anthropic、Google 等公司的官方 Bluesky 账号本次未核实,包括是否存在也未搜索。
Lemmy
Lemmy — 每日 LLM 新闻(2026-10-02)
社区
!«メールアドレス»— 8.84 万订阅者(综合科技社区,当天 LLM 相关最高分帖子也在这里)!«メールアドレス»— 8,300 订阅者(专注反 AI/LLM 批评的社区)!«メールアドレス»— 6,000 订阅者(System76/Pop!_OS Linux 社区,讨论 LLM 生成 PR 的政策)!«メールアドレス»— 未能获取订阅者数(技术新闻交叉发布较多)!«メールアドレス»、!«メールアドレス»、!«メールアドレス»— 均为小型社区,未获取订阅数!ai_reddit(自动镜像 Reddit 的r/ArtificialInteligence等社区的机器人社区,在 lemmy.world 搜索中联邦显示。无法解析运行实例,订阅数和得分也不明)
帖子
- “AI 酷刑室”风波引发“最愚蠢的 AI 争论” — Someone 'Torturing' LLMs in a Robot Prison Has Triggered the Dumbest Debate in 'AI' Yet(原文: 404media) —
!«メールアドレス»、2026-10-01 13:45、score 158 / 53 条评论。有人向本地 LLM 的中间层注入“疼痛信号”,并设置按下停止按钮就丢失先前检查点的机制,由此引发关注。评论区中,AI 意识/福利支持者与“真正的种族灭绝才值得担心”的反对者激烈对立(热门评论获 143 赞:“发生种族灭绝时,你们却担心 AI 痛苦?”)。这是当天 Lemmy 上得分最高的 LLM 相关帖子。 - 同一文章的交叉发布 — Independent_Media 版 —
!«メールアドレス»、2026-10-01 13:17、score 25 / 10 条评论。 - Gemini 4 Argon 因安全担忧限制公开范围 — Google rolls out new Gemini AI model but restricts access over safety concerns(原文: The Guardian,同内容也见于 Arab News 等) —
!«メールアドレス»、2026-10-01、score -3(负分) / 2 条评论。Google 宣布不向公众开放 Gemini 4 Argon,而是先向网络安全专家和美国政府提供。该模型擅长发现和修复软件漏洞、网络防御,同时设计为拒绝被用于网络攻击或化学、生物、核武器开发。Lemmy 上其得分为负,反应偏冷淡。 - GitHub 新仪表盘默认将 AI 聊天置于显眼位置 — The very first huge field on the new default GitHub dashboard is "AI" chat(原文: GitHub Changelog) —
!«メールアドレス»、2026-10-01 18:27、score 48 / 3 条评论。发帖者批评 AI 聊天功能的显眼布局是建立在未经许可训练的材料之上;评论中有人建议迁移至 Forgejo/Gitea 等替代品。 - COSMIC(System76)禁止在 PR 中提交 LLM 生成内容 — COSMIC projects will no longer accept LLM-generated content in PRs(原文: GitHub PR #3911) —
!«メールアドレス»、2026-10-01 15:30、score 48 / 6 条评论。System76 开发者 Michael Murphy 在贡献指南中加入不接受 LLM 生成物的政策。评论区也有人不满:一名开发者仅因披露使用了 AI,其修复截图工具的 PR 就被关闭。 - 律师在谋杀案上诉中引用 ChatGPT 编造的虚构证人 — Lawyer Cites ChatGPT-Invented Fake Witnesses in Murder Appeal(原文: 404media) —
!«メールアドレス»、2026-10-01 13:18、score 24 / 1 条评论。同一文章也以不同标题交叉发布到!«メールアドレス»(score 22 / 5 条评论、链接)与!«メールアドレス»(score 8、链接),在多个社区低调传播。事件发生在新墨西哥州。 - GPT-Synopsys:OpenAI 与 Synopsys 发布面向芯片设计的前沿 AI — GPT-Synopsys(原文: Synopsys 官方公告) —
!«メールアドレス»、2026-10-01 11:00、score 1 / 0 条评论。OpenAI 和 Synopsys 联合发布面向半导体设计的 GPT 基础模型,目前在 Lemmy 上没有反响。 - “Claude vs. OpenAI's GPT 6.1 Sol” — 帖子链接(原文: Reddit r/ArtificialInteligence) —
!ai_reddit镜像社区、2026-10-01 23:11、score 1 / 0 条评论。闭源模型之间的比较帖,在 Lemmy 上只是转载,没有评论。 - “我自发布以来每天追踪对 Opus 5.5 的评价,9/30 急跌” — 帖子链接(原文: Reddit r/ClaudeCode) —
!ai_reddit镜像社区、2026-10-01 13:49、score 0 / 0 条评论。该跟踪帖子称,Reddit 对 Claude Opus 5.5 的好感度在 9 月 30 日急剧下降。 - “反转:Gemini 4 Argon 在 Val AI 基准测试中速度、成本、准确度均居首” — 帖子链接(原文: Reddit 图片帖子) —
!ai_reddit镜像社区、2026-09-30 22:44、score 1 / 0 条评论。
信号
- 当天 Lemmy 得分最高的 LLM 相关话题并非新模型发布,而是“给 AI 施加疼痛”的实验伦理争议(#1,score 158)。Lemmy 读者整体比起支持 AI 更偏怀疑与批评,
!fuck_ai等反 AI 专门社区也有一定存在感。 - 即使是 Gemini 4 Argon 限制提供这样的闭源巨头重大公告(#3),在
!technology中也获得负分,并未引发积极讨论。 - 用“Claude”“GPT”“Gemini”等关键词发现的许多帖子,来自
!ai_reddit等 Reddit 镜像机器人的自动转载,绝大多数 score 0 至 1、评论 0。这些不是 Lemmy 独立讨论,而是将 Reddit 话题直接搬运过来;围绕开放权重与闭源模型的活跃讨论几乎没有。 - LLM 相关内容中,唯一评论活跃的不是模型性能,而是“贡献流程治理(禁止 LLM 生成 PR)”及“反对 GitHub 强推 AI 功能”等从软件开发者社区视角出发的议题(#4、#5)。
限制
- Lemmy 整体规模较小,收集 10 条“当天 LLM 相关帖子”的过程中,后 4 条(#7 至 #10)只能由 score 0 至 1、评论 0 的镜像机器人转载或低互动帖子填补。真正活跃的原生讨论实际约为 #1、#4、#5、#6 四条。
lemm.ee的 API 搜索(/api/v3/search)重定向至join-lemmy.org,无法搜索,可能是实例变更或已停止运行。- 也用相同关键词搜索了
lemmy.ml,但发现内容均与lemmy.world的帖子重复,并未找到独立的新发现(联邦机制使同一帖子会显示于多个实例)。 !Independent_Media与!ai_reddit的订阅数,以及!ai_reddit的运行实例,API 查询返回 404/400,无法确认。- 无法直接抓取 The Guardian 原文,因此通过 Arab News、techjuice 等转载同内容文章确认了详情。
建议行动
- 下次采集 X 时,应改为使用模型名、公司名等 LLM 关键词搜索,而非 Explore 趋势。
- Reddit 采集应避免依赖单一搜索词,补充按模型名搜索。
- 后续持续关注 Gemini 4 Argon 的访问限制与安全政策。
- 下次运行时确认 Bluesky 搜索 API 的 403 是否已解除;若解除,则恢复关键词搜索。
- 将开放权重与闭源模型之间的安全争论作为持续议题长期观察。
数据质量说明
X 的采集流程基于与 LLM 无关、按地理定位的 Explore 趋势,有效数据为 0;Bluesky 因搜索 API 返回 403 改为按账号采集;Reddit 仅使用单一搜索词,且未包含当天(10/2)的帖子。



