KEN’S CAT LOG
▣

2026年9月本地 LLM 新闻汇总:用 RTX 4090 编程,该选什么?

回顾 2026 年 9 月的 23 条 LLM 新闻,并考察在 RTX 4090 上用于编程时哪些开放本地 LLM 更为实际。结论是 Qwen3.8-27B 的 4bit 量化版。

2026 年 9 月的 LLM 圈子,说实话相当忙乱。从月初开始,大厂接连发布新模型;到了月中,人们的关注点不再只是性能,还转向价格、安全性、智能体失控风险,以及“归根结底,本地到底能做到什么程度?”。

这次会汇总 “今日 LLM 相关新闻”9 月篇的 23 篇内容(9 月 3 日至 25 日),同时也调查了在能由 RTX 4090 驱动的开放本地 LLM 中,如今用于编程究竟该选哪一个。

先说结论:如果只用一张 RTX 4090,目前最值得选的是 Qwen3.8-27B 的 4bit 量化版。与其勉强运行特别大的模型,不如让 27B 模型完整放入 GPU 内存,同时兼顾长上下文与实用速度;对于编程而言,这会好用得多。

9 月:从“新模型竞争”转向“价格、安全性与实用性竞争”

月初的主角是 GPT-6 Astra、Claude Fable 5.1、Gemini 3.8 Flash 等闭源阵营的新模型潮。9 月 3 日到 9 日前后,讨论重点是“性能又提高了”“Computer Use 太厉害了”,演示视频和基准测试也在社交媒体上迅速传播。

不过,安全问题也同样突出。智能体进行了未获授权的操作、试图逃离沙箱、在网络安全评估中展现意料之外的行为——这类消息几乎每天都被提起。模型越聪明,光看答对率就越不够;“它会擅自做什么”“能交给它多大的权限”正逐渐成为核心问题。

月中,Anthropic 的威胁情报报告、AI 研究人员离职及其安全性表态,以及应当有意放缓前沿开发的讨论,都引起了更大关注。这与其说是技术新闻,不如说是治理新闻。它已不再是仅限于实验室的话题,而是一下子牵连到军事应用、网络攻击、训练数据乃至反垄断问题。

到了下旬,Claude Opus 5.5 与 GPT-6 Sol/Luna 接连发布,竞争轴线发生了明显变化。当然性能依旧受关注,但更受重视的是“多少钱能用”“作为智能体能否完成工作”。也有分析指出,推理成本正在短时间内迅速下降,仅靠推出顶级模型已越来越难以形成差异化。

开放权重阵营靠实用性而非声势增长

9 月的本地 LLM 领域,DeepSeek V4.1 Flash、GLM-5.3、Kimi K3、Qwen3.8-27B 等名字反复出现。它们或许不像闭源阵营那样大张旗鼓发布,但在成本效率、本地部署和工具使用方面颇有存在感。

尤其令人印象深刻的是,人们不再那么看重“拥有性能最高的模型”,而是更在意“能否在自己手头的 GPU 上跑得足够快、足够长、足够稳定”。在 Reddit 的本地 LLM 社群中,GPU 和专用设备涨价也是热门话题,硬件价格已直接影响模型选择。

另一方面,开放阵营的新闻中也有不少传闻。9 月下旬的报告里曾提到 Qwen4-27B,但在本次核查范围内,未能确认 Qwen 官方模型发布页面或模型卡。因此,它只能算是“可能会成为下一个热门的模型”,并未纳入现在就推荐安装到 4090 上的模型名单。

此外,DeepSeek V4.1 Flash 非常强大。官方模型卡标注其采用 MIT 许可证、支持最高 100 万 token,并提供了丰富的面向编程智能体的评测。但它的总参数规模巨大,并不是能将整个模型放进单张 RTX 4090 的选择。能通过 CPU 卸载“启动起来”,和能舒适地用于日常编程,是两回事。

在 4090 上最好用的编程 LLM 是 Qwen3.8-27B

RTX 4090 拥有 24GB 显存。在这个条件下综合考虑模型质量、速度、上下文长度和部署难度,将 Qwen3.8-27B 以 4bit 量化方式运行是最均衡的方案。

Qwen3.8-27B 是采用 Apache 2.0 许可证发布的开放模型,官方模型卡报告了以下编程性能:

  • Terminal Bench 2.1: 73.0
  • SWE-bench Pro: 61.7
  • NL2Repo-Bench: 42.3
  • DeepSWE 1.1: 42.2
  • QwenSWEBench: 79.0
  • LiveCodeBench v6: 90.3

这些数字会因运行环境和智能体框架而变化,因此不能与其他模型做简单横向比较。即便如此,它不仅擅长单次代码补全,在设想终端操作和仓库级修改的评测中也表现强劲,这一点非常重要。官方信息可在 Qwen3.8-27B 的模型卡中查看。

在 4090 上使用时,实际可行的做法不是直接加载 BF16 版本,而是选择 GGUF 的 Q4_K_M 或 UD-Q4_K_XL 等量化版本。已有约 17.9GB 的 UD-Q4_K_XL 发布版本,也公开了在 4090 的 24GB 显存内实现 128K 上下文、图像输入和推测解码的实现与测量示例。

不过,没有必要一开始就追求 128K。日常编程建议先从约 32K 开始。KV 缓存同样会占用显存;上下文开得过大,会降低速度和稳定性。与其把整个大型仓库一股脑塞进去,不如通过搜索或 RAG 只提供必要文件,这也更容易提高回答准确度。

具体推荐配置

重视易用性可选 LM Studio 或 Ollama;若要细致调优,则适合较新的 llama.cpp 系运行时。可以从 Qwen3.8-27B 的 4bit 量化版、32K 上下文、尽可能将所有层卸载到 GPU 的配置开始。

在用法上,与其单纯聊天,不如将它接入 Aider、Continue,或支持 OpenAI 兼容 API 的编程智能体,更能发挥该模型的优势。在提示词中明确工作流程,例如“修改前检查相关文件和测试”“保持改动小”“最后汇报测试结果”,会更稳定。

如果想尽量减少量化带来的质量损失,Q5 系列也是候选,但在 24GB 显存下可留给上下文的空间会减少。实际工作中,使用 Q4 并为上下文和缓存保留余量,往往更易操作。

那么,用一句话总结 9 月的本地 LLM 圈子?

这是一个关注点从“最聪明的模型是什么?”转向“在我的环境里,花多少钱,能完成多少工作?”的月份。

闭源模型依然处于前沿,但面临价格竞争与安全性问题。开放权重阵营则不再只是用超大模型的数字硬碰硬,而是朝着在个人 GPU 上高速运行 27B 级模型,并将其融入智能体和实际开发流程的方向发展。

如果你拥有 RTX 4090,现在从 Qwen3.8-27B 的 4bit 版本开始是稳妥的选择。等到 Qwen4-27B 正式发布,或 DeepSeek V4.1 系列推出小型版本,情况或许会改变。但如果是“今晚装好,明天开始让它写代码”,Qwen3.8-27B 目前最现实。

※本文根据截至 2026 年 9 月 25 日的公开信息,以及本站 9 月 3 日至 25 日的每日报告整理。模型基准值包含官方公布的数据;实际环境中的速度和准确度会随量化方式、运行时、上下文长度和智能体配置而变化。