Brave
@47c132035ed7a1105a867946b99d67af 人工智能研究 公开
讨论 AI模型选择:从付费闭源到开源本地,本质是选择你的依赖关系

AI模型选择:从付费闭源到开源本地,本质是选择你的依赖关系

本文数据截至 2026 年 8 月中旬。AI 模型格局以月为单位变动,阅读时请注意文中模型代际(Fable 5 / GPT-5.6 / Gemini 3.1 / GLM-5.2 / DeepSeek V4)是否已被更新版本取代——这本身就是本文要讲的依赖关系问题。

一、三种模型的图谱(2026 年 8 月版)

讨论"哪个模型更好"之前,必须先澄清一个经常被混淆的事实:当前市场上并不存在两种对等的模型类别,而是至少三层、在技术路径、成本结构和使用约束上完全不可通约的体系。

第一层是付费闭源模型(Paid API Models):Claude Fable 5 / Opus 4.8 / Sonnet 4.6、GPT-5.6 Sol / Terra / Luna、Gemini 3.1 Pro / 3.6 Flash。它们由 Anthropic、OpenAI、Google 三家分别维护,通过 API 或订阅服务交付,核心特征是性能天花板最高、系统集成度最深、但你完全没有任何控制权。2026 年这一层出现了一个此前不存在的结构性新特征:安全分级(safety-gated tiers)——Anthropic 的 Fable 5 本质是 Mythos 5(只对美国政府授权的 Project Glasswing 伙伴开放)加上安全护栏后的公开版本,命中毒理学、网络安全等敏感请求时自动降级到 Opus 4.8(第三方评测中约 8-9% 的任务触发降级)。你付费调用的"旗舰",可能不是完整形态的旗舰。

第二层是免费/托管开源模型(Free / Hosted Open Models):Qwen、GLM-5.2、DeepSeek V4 Flash / Pro、Kimi K2.6 / K3、Llama 4、MiniMax M3 等通过 Together AI、Groq、Fireworks、Baseten、OpenRouter、Hugging Face Inference API 等平台公共端点低费或免费提供的开源权重。它们的成本结构是"用数据隐私换计算资源"——但 2026 年这个层次的性价比发生了质变:GLM-5.2(MIT 许可,\(1.4/\)4.4 per MTOK)在 SWE-bench Pro 上以 62.1 首次超过了 OpenAI 旗舰 GPT-5.5 的 58.6——这是开源模型第一次在 agentic coding 的旗舰基准上正面击败闭源旗舰,而不再只是"接近"。

第三层是本地私有模型(Local Self-Hosted Models):在个人机器或自有服务器上以 Ollama、llama.cpp、vLLM、SGLang 等框架直接运行的开源权重。2026 年的本地格局被 MoE(混合专家)架构彻底改写:消费级硬件甜点从"8-14B 稠密模型"跃升为"30-35B-A3B 的 MoE 模型"(Qwen3.6-35B-A3B 在 24GB 显卡上可达 120 tok/s);但真正的前沿开源权重(DeepSeek V4 Flash 284B、GLM-5.2 753B)的本地门槛反而更高——V4 Flash 最激进的 Q2_K 量化也要 103GB VRAM,远超个人机器范围。

这三者之间不存在一个单一的排序维度。模型的选择本质上是在不同约束空间里做 trade-off:性能上限 vs. 数据主权 vs. 经济成本 vs. 工程责任——这四个变量的权重在不同场景下完全不同。而 2026 年新增了一个第五维度:依赖关系的稳定性(dependency stability)——你的供应商是否可能明天就下架你正在用的模型版本(Claude Fable 5 于 2026 年 6 月 23 日被移出所有订阅计划、转为按量计费;OpenAI 在三个月内淘汰 GPT-5.1;Gemini 3 Pro 发布三个月后即被 3.1 Pro 取代)。


二、付费闭源模型:买确定性,不是买算力

2.1 你真正在支付的是什么

API 模型的定价表上列出的每百万 tokens 的价格确实很低(Claude Fable 5 \(10/MTOK input /\)50 output、GPT-5.6 Sol \(5/\)30、Gemini 3.1 Pro \(2/\)12),而且 DeepSeek 的价格战已把整个市场的价格基准拉低了一两个数量级。但这只是冰山上的可见部分。你真正购买的是三个层面的交付物:

性能本身。闭源旗舰模型在推理链长度、多模态理解深度、领域知识覆盖广度上仍是当前所有开源模型的领先者,但领先幅度正在快速收窄。以 agentic coding 为例:Claude Fable 5 在 SWE-bench Verified 上报 95.0%、SWE-bench Pro 约 80%(厂商自报,待独立复现);Gemini 3.1 Pro 在 ARC-AGI-2 上达到 77.1% 验证分数(是 3 Pro 的两倍多);GPT-5.6 Sol 在 max reasoning 下据 OpenAI 称以不到 Fable 5 一半的成本在 Artificial Analysis Coding Agent Index 上超过 Fable 5。闭源依然领先,但"开源在两年内追平"已经从猜测变成了被多次独立评测验证的事实——tessl.io 的 1000 个真实编码场景评测中,开源 GLM-5.2(91.9 分)综合得分高于闭源 Claude Sonnet 4.6(90.8 分),且每任务成本更低(\(0.289 vs\)0.296)。

工具的确定性交付。Claude Agent SDK / Claude Code、OpenAI Agents SDK(Responses API)、Google Antigravity / Gemini CLI——这些仍是模型原生集成的一等公民(first-class citizen)。AGENCYBENCH(ACL 2026,138 个真实长程任务、平均 90 次工具调用、100 万 token)揭示了一个此前未被量化的现象:生态协同效应(ecosystem synergy)——Claude Opus 4.5 在自家 Claude Code SDK 中比在通用评测框架里得分高 20.5%,GPT-5.2 在 OpenAI Agents SDK 中也更优。这意味着闭源的护城河已经从"模型权重本身"扩展到了"模型 + 原生工具链的耦合系统"——你支付的不只是推理能力,还有整套经过调优的 agent harness。

安全和责任兜底。内容安全护栏、有害输出过滤、数据泄露防护——仍是 API 调用的固有部分而非 optional add-on。2026 年的新形态是"安全降级":Fable 5 在敏感领域直接不回答问题,fallback 到 Opus 4.8(这意味着一部分调用实际上计费的是 Opus 4.8,但成本按 Fable 5 计算)。OpenAI 的 GPT-5.6 发布甚至先于美国政府协调(limited preview)后才会全面放开。你购买的"确定性"如今包含了一层此前不存在的含义:模型会主动拒绝执行它认为危险的请求,且这种拒绝的频率和边界由供应商单方面决定。

2.2 付费闭源的隐性成本

持续订阅的经济负担。对于个人开发者和小型团队,Claude Pro \(20/月、Max\)100-200/月、ChatGPT Plus \(20/月看起来不多;但当请求量达到每天数万条 agent 调用,或使用 Fable 5 级别的输出定价(\)50/MTOK),月费会迅速突破 \(500。成本结构仍然是非线性的——但 2026 年的新趋势是闭源 API 价格本身在下降(Opus 4.1 的\)15/\(75 降到 Opus 4.5 的\)5/\(25,再降到 Opus 4.8 的\)5/\(25 不变但能力跃升;GPT-5.6 系列的 Luna 定价低至\)1/$6),降价的驱动力恰恰来自开源侧的竞争压力

供应商锁定(Vendor Lock-in)。Claude 的 Anthropic Messages API、GPT 的 Responses API、Gemini 的 Google AI SDK——三个协议互不兼容。一旦你把 agent workflow 深度嵌套进某一个平台的 SDK(比如 Claude Code 或 OpenAI Agents SDK),切换成本远高于表面认知——它不只是模型权重的替换,而是整个 system prompt architecture、tool calling pipeline 和 harness 的重构。GLM-5.2 刻意兼容 Anthropic Messages API 格式以承接这部分迁移需求,这本身就是锁定存在的证据。

数据出域风险。不变。任何外部化的 API 调用都意味着"将私有 codebase / 业务逻辑 / 用户隐私信息暴露给自己无法完全控制的第三方基础设施"。对处理客户源代码、商业机密文档、敏感个人信息的场景,这个代价不可接受——无论对方承诺多么动听。

新风险维度:可用性风险(Availability Risk)。2026 年的闭源生态出现了一个 2025 年还不明显的现象:模型版本的生命周期在急剧缩短,而供应商的决策不可预测。Claude Fable 5 于 6 月 9 日发布、6 月 23 日即从订阅计划撤出(转按量计费);OpenAI 明确公告 GPT-5.1 三个月后 sunset;DeepSeek 的 V4-Pro-0813 在 8 月 12 日以"无发布公告"的方式替换了端点背后的模型。你在 2026 年 6 月构建的生产系统所依赖的模型,可能在 9 月就不存在了——"闭源 = 确定性"这个等式,如今需要加上时间戳


三、免费/托管开源模型:用数据换算力

3.1 什么是"免费"模型的交付物

通过 Together AI、Groq、Fireworks、Baseten、OpenRouter、Hugging Face Inference API 等平台公共端点运行的开源模型——2026 年的形态已经多样化到需要重新描述:既有真正免费的 tier(Groq、HF free tier),也有按 token 计费但价格低到接近免费的 API(DeepSeek V4 Flash \(0.14/\)0.28 per MTOK、MiniMax M3 \(0.30/\)1.20、Qwen3.7-Plus \(0.40/\)1.60)。

你支付的是隐式数据和行为反馈。 几乎所有免费托管平台都会在 terms of service 中加入"数据可能用于模型改进 / 服务质量提升"的条款。按量计费的平台(DeepSeek、OpenRouter)数据条款更接近专业 API 供应商,但免费 tier 的数据交换属性不变。对绝大多数个人用户来说可以忽略不计;对敏感业务场景,这是一个需要认真对待的风险边界。

性能折抵(Performance Tradeoff)已大幅缩小。 2025 年的旧文中"免费模型的质量基准是静态的、正在被闭源超越"的论断,在 2026 年被证伪了。LangChain 的 Deep Agents 评测(138 个 agent 任务):GLM-5 在文件操作、工具调用、指令遵循上与 Claude Opus 4.6、GPT-5.4 打平甚至略优,而成本仅为后者的 1/10-1/20。tessl.io 的评测更是给出 GLM-5.2 > Sonnet 4.6 的结论。托管开源的质量追赶已经完成,剩下的差距集中在可靠性(reliability)而非能力(capability)——tessl 的原始数据同样显示,开源模型(尤其是便宜的开源模型如 Qwen3.7-Plus)在"严格遵循指令"上的失败率仍然明显更高,且长尾任务(web research、scraping)对所有模型一视同仁地难。

质量衰减(Version Drift)与新风险:开源承诺落空。 免费端点的版本滞后问题依然存在。但 2026 年出现了一个更值得注意的新现象——"开源但没开源"(open-washing):Qwen 3.8-Max(2.4T 参数)于 8 月 2 日 GA,官方反复承诺"下周发布权重",截至 8 月中旬仍未兑现;与之对照,DeepSeek V4 Flash 于 7 月 31 日发布当天即放出 MIT 许可的完整权重(含 DSpark 投机解码模块),GLM-5.2 也在发布后 4 天兑现了权重。在托管开源这一层,你要评估的除了模型质量,还有发布方兑现开源承诺的历史记录——声称开源的模型如果不能自托管,它本质上就是一个披着开源外衣的闭源 API。

3.2 免费托管的适用边界

适合的场景:快速实验、low-stakes reasoning tasks、RAG pipeline 前置逻辑、benchmark 复现、以及2026 年新增的最大用途——生产环境的日常推理负载。当 DeepSeek V4 Flash 以 \(0.14/\)0.28 的价格提供接近前沿的 coding 能力、GLM-5.2 以 \(1.4/\)4.4 提供超过 GPT-5.5 的 SWE-bench Pro 分数时,"按量付费的开源托管"在绝大多数非敏感场景中已经是闭源 API 的完全替代品,且便宜 1-2 个数量级。

不适合的场景:agent workflow 中的高价值任务(长程可靠性仍有差距,AGENCYBENCH 中开源 32.1% vs 闭源 48.4%)、任何对模型版本有确定性要求的合规 / 审计 pipeline(端点背后的 checkpoint 可能像 DeepSeek V4-Pro-0813 那样无声更换)、需要强数据主权的场景。


四、本地私有模型:控制权的完整谱系与全部代价

4.1 你获得的是什么

数据主权(Data Sovereignty)。不变,依然是本地模型最本质的交付物:你的请求永远不会离开你的机器。对隐私敏感用户——处理客户代码库、审查自身业务逻辑、分析私有邮件或文档——本地模型是唯一在"安全边界之内"运行的 AI 推理系统。2026 年 DeepSeek V4 系列(MIT 许可、无门控权重)和 GLM-5.2(MIT 许可、无地域限制)的发布,让"主权级开源"第一次覆盖到了接近前沿的模型——此前 MIT 许可的本地最强模型与闭源旗舰之间有一条肉眼可见的鸿沟,现在这条鸿沟只剩几个基准点。

成本结构的彻底翻转。一旦在自有硬件上完成量化部署(GGUF via llama.cpp / Ollama,或 FP8 via vLLM / SGLang),后续每个 token 的推理边际成本是零。但 2026 年这个论点的经济前提被 DeepSeek 的价格战削弱了:当托管 API 的边际成本低至 \(0.14/\)0.28 per MTOK,本地模型"省钱"的论点只在极高频场景成立(详见 4.3)。

质量自定义(Customization Autonomy)。你可以量化到任何 bitsize(Q4_K_M、Q8_0、FP16/FP8、甚至 1.78-bit 的激进压缩),修改 system prompt 和 sampling 参数,添加 LoRA 微调,合并权重做 ensemble。2026 年 MoE 时代新增了此前没有的自由度:speculative decoding(DeepSeek 的 DSpark 模块随权重一起发布,vLLM 一个配置开关即可启用)、KV cache 量化、MoE expert routing 的底层控制——这些在闭源模型上全部严格禁止。

4.2 你需要承担什么

显存 / 算力的绝对约束(2026 版)。这是本地生态变化最大的一层。三条硬件分界线:

硬件档位2025 年现实2026 年现实
16GB 统一内存 / 12-16GB GPU只能跑 7-14B 稠密模型Qwen3.6-27B Q3/Q4(16GB)、35B-A3B IQ3 短上下文;勉强可用的边缘
24GB GPU(RTX 3090/4090,个人甜点)32B Q4 上限Qwen3.6-35B-A3B UD-Q4_K_M(~22GB,120 tok/s)——MoE 让 35B 模型的推理速度接近 3B 稠密模型;Llama 4 Scout 1.78-bit 可跑(质量折损严重)
96-192GB(多卡 / Mac Studio)70B Q4 可行DeepSeek V4 Flash Q2_K ~103GB(4×24GB 或 Mac Studio 192GB,8-12 tok/s 属可用下限);Llama 4 Scout Q4 ~55GB 舒服运行
企业集群(4×80GB+)670B+ 不可行DeepSeek V4 Flash Q4/FP8 完整运行(~111 tok/s on dual RTX PRO 6000);GLM-5.2(753B)与 V4 Pro(1.6T)仍需 16×H100 级集群

推理延迟的工程现实。不变,甚至更尖锐:MoE 模型是带宽受限(bandwidth-bound)而非算力受限——所有 expert 权重都必须常驻内存,速度瓶颈是内存带宽。24GB 显卡上的 Qwen3.6-35B-A3B 可达 120 tok/s(因为只激活 3B),但同样的模型在 CPU-only 上会因为内存总线瓶颈跌到 <2 tok/s。"免费"在时间成本上的体现不变:你从 API endpoint 的 200-500ms 延迟退行到本地推理的秒级延迟,MoE 没有改变这一点,只改变了单位延迟能买到的模型质量。

维护责任的完全内化。不变。安全护栏要自己部署,模型更新需要自行 download / quantize / replace checkpoint,版本迁移需要手动验证。2026 年新增一个负担:权重体积爆炸——V4 Flash 的 8-bit 量化约 162GB、FP8 官方权重约 160GB、GLM-5.2 FP8 约 750GB,下载、校验、存储本身就是工程任务。

4.3 本地模型的隐藏经济账(2026 重算)

2025 年的旧结论"开源模型的真正经济价值在于控制权而非便宜"在 2026 年变得更加极端——因为托管侧的价格塌方让"本地省钱"这个论点几乎全面破产

  • DeepSeek V4 Flash API:\(0.14/M input +\)0.28/M output。月均 100M tokens 的推理负载,全走 API 约 $14-30/月。
  • 同样的 V4 Flash 本地运行:最低门槛 4×24GB GPU(硬件 \(6,000+)或 192GB Mac Studio(\)8,000+),且只能跑 Q2_K 量化、8-12 tok/s、单用户。
  • 本地 V4 Flash 的硬件摊销(月 $200-400)+ 维护时间成本,超过了 API 在几乎所有真实使用量下的费用。硬件回本周期在月均 1B+ tokens 的重度负载下依然成立,但那是 24 小时满负荷跑批处理的场景。

新结论分两层:

  1. "本地模型省钱"已死,"本地模型保主权"是唯一成立的经济理由。 托管开源 API 的价格已经低到边际成本可以忽略,本地部署的每一分钱买到的都是数据主权、可用性独立和定制自由——不是便宜。
  2. 真正的经济价值缺口出现在"本地可跑的模型质量"与"前沿质量"之间。 个人硬件(≤24GB)能跑的最好模型(Qwen3.6-35B-A3B,SWE-bench Verified ~73%)与前沿闭源(Fable 5,95%)之间有约 20 个点的差距——如果你的任务需要这 20 个点,本地模型无论多便宜都是错误选择;如果不需要,托管开源(GLM-5.2 62.1 分 SWE-bench Pro)已经覆盖。本地模型在 2026 年的合理位置是:高频、低价值、隐私敏感的日常负载。

五、三种模型的维度化对比(2026 年 8 月数据)

不应当用单一维度(如 benchmark score)比较三类模型。以下是从七个互相正交的维度展开的比较:

5.1 推理与代码生成 (Reasoning & Coding)

维度付费闭源免费/托管开源本地私有
推理链长度 (multi-step reasoning)SOTA (Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro)接近前沿 (GLM-5.2, DeepSeek V4 Flash, Kimi K3)取决于硬件;MoE 时代上限 = 你能装进显存的权重
SWE-bench Pro(真实仓库 bug 修复)~80% (Fable 5,厂商自报)62.1 (GLM-5.2) > 58.6 (GPT-5.5)——开源首次超越闭源旗舰与托管分数一致(权重相同),受量化档位影响
Terminal-Bench 2.1(真实终端 agent)85.0 (Opus 4.8) / 84.0 (GPT-5.5)81.0 (GLM-5.2),距闭源仅 4 分同上
工具调用稳定性原生 level,多步 chain 完成率领先MCP-Atlas 上与闭源打平(GLM-5.2 76.8 vs Opus 4.8 77.8)依赖 harness 质量(Claude Code 兼容层 / OpenCode 等)

关键事实:2025 年"开源质量边界由 checkpoint 决定、稳定性低于闭源"的论断仍然正确,但差距已从"鸿沟"缩为"可测量但非决定性的差距"。tessl.io 的第三方评测(~1000 场景)给出 GLM-5.2 91.9 vs Sonnet 4.6 90.8;但同一评测显示 Sonnet 在 54% 的任务上仍是单任务最优——闭源的优势从"全面压制"变成了"中位数优势"。

5.2 响应延迟与吞吐 (Latency & Throughput)

维度付费闭源免费/托管开源本地私有
平均 p50 latency200-500ms(全球边缘路由)0.65-3s(Baseten 上 GLM-5 平均 0.65s;免费 tier 排队更高)1-5s(硬件受限;MoE 的带宽瓶颈是主因)
Concurrent request capacity数百万级(云自动扩展)免费 tier 1-5 QPS;按量付费可达数千并发(V4 Flash 官方 2,500)单机物理上限
Burst handling云 GPU 弹性吸收付费 tier 有保障,免费 tier 排队超时硬件热限制,持续负载下降频

2026 年新现实:速度本身已经成为开源托管平台的武器——Gemini 3.5 Flash-Lite 达 350 tok/s、Groq 上的开源模型以推理加速芯片著称、GPT-5.6 Sol 在 Cerebras 上提供 750 tok/s。延迟维度的"闭源有 CDN、开源有排队"的旧框架,在按量付费的托管开源面前已经不成立了;仍然成立的是免费 tier 的排队问题和本地模型的物理下限。

5.3 数据主权与安全 (Data Sovereignty & Security)

维度付费闭源免费/托管开源本地私有
Data out-of-domain riskMedium(vendor ToS 允许部分保留)免费 tier High;按量付费平台接近付费 APIZero(数据从不离开机器)
Audit-ability of training dataNone(黑盒权重 + 专有语料)权重开放但预训练黑盒Full(你控制 checkpoint 与 LoRA)
Regulatory compliance (GDPR / HIPAA / SOC2)Partially covered(vendor DPA 可用)视平台 ToS 而定Fully covered(数据不离开现场)

闭源模型的 data-out-of-domain risk 仍是概率性风险,本地模型是零概率风险。2026 年新增的微妙变量:开源权重的发布者可能位于你无法评估的司法管辖区——DeepSeek 权重虽为 MIT 许可,但发布者受中国法律约束;Fable 5/Mythos 5 的分级机制则说明即使是美国公司,其"安全"判断标准也在随政府协调框架演进。"本地 = 完全安全"的等式,如今需要加上一层对权重供应链本身的信任审计。

5.4 经济成本 (Total Economic Cost,2026 重算)

月均 token 量付费闭源托管开源(按量付费)本地私有
<1M tokens\(3-20(订阅覆盖) |\)0.1-0.5(V4 Flash 级)N/A(零边际,但有硬件成本) 
10M tokens\(25-150 |\)1.4-15硬件摊销($200-400/月等值) 
100M tokens\(250-1,500 |\)14-150硬件摊销($200-400/月等值) 
1B+ tokens\(2,500-15,000 |\)140-1,500硬件摊销可开始回本(24h 满负荷时) 

2025 年的旧结论"本地模型在月均 10M tokens 以上显示经济优势"已被 DeepSeek 价格战推翻。 2026 年的真实 break-even 图景是:托管开源在几乎所有量级下都是经济最优;付费闭源溢价购买的是前沿性能与生态协同;本地部署的唯一经济论据是"主权价值"——当数据不能出域时,它是唯一选项,价格无关紧要。

5.5 质量演进速度 (Evolutionary Velocity)

维度付费闭源免费/托管开源本地私有
New model release cadence季度级(Anthropic 三代并进:Fable 5 / Opus 4.8 / Sonnet 4.6;OpenAI 从 GPT-5.2 到 5.6 仅 7 个月;Google 3 Pro→3.1 Pro→3.5/3.6 Flash)月级(2026 年反而更快:GLM-5.1→5.2 一个月、DeepSeek V4 系列两个多月三连发)异步(社区量化版滞后数周)
Fine-tuning flexibilityNone(黑盒 API-only)Low(少数平台提供 LoRA 端点)Full(任意 checkpoint + 任意 LoRA)
权重可获得性(2026 新维度)N/A(闭源)视发布方而定:GLM/DeepSeek 兑现,Qwen 3.8-Max 承诺落空Full(必须可获得才能本地化)

2025 年的旧文认为"开源演进速度永远滞后于商业团队(数据、算力、人力结构性匮乏)"。2026 年这个论断被证伪了:中国开源阵营(DeepSeek、Z.ai、Qwen、Moonshot、MiniMax)在 agentic coding 上的迭代速度已经超过任何一家美国闭源实验室,且发布即开源(MIT)。演进速度的优势不再是单边的——闭源靠研发投入,开源靠竞争密度与资本军团,二者现在是均势。

5.6 Agent / Tool Use 可靠性 (Agent Workflow Readiness)

维度付费闭源免费/托管开源本地私有
Native tool callingHigh(生态协同效应 +20%:Claude Code SDK / Agents SDK)High(GLM-5.2 MCP-Atlas 76.8 接近 Opus 4.8 的 77.8)依赖 harness;Claude Code 兼容层(GLM)或 OpenCode 均可
Structured output guaranteeHigh(JSON schema 严格模式)High(同等级)中(本地无平台强制,靠采样参数)
长程任务可靠性(1M-token horizon)48.4%(AGENCYBENCH 闭源均值)32.1%(开源均值)权重同托管,差距在 harness 与硬件时延

这是 2025 年旧文中"Agent workflow 是付费闭源绝对护城河"论断需要重写的地方。2026 年的准确图景:

  1. 短程 tool use 的护城河已崩塌。LangChain、tessl.io、Faros.ai 三家独立评测均显示开源模型(GLM-5.2、Kimi K2.6、MiniMax M3)在短程 agent 任务上与闭源旗舰持平甚至反超。
  2. 长程(long-horizon)agent 任务仍存在真实差距。AGENCYBENCH(ACL 2026 学术评审)给出闭源 48.4% vs 开源 32.1% 的显著差距——这些任务平均 90 次工具调用、100 万 token 上下文、数小时执行时间。开源模型在超长程中的规划与自我纠错能力仍有系统性缺口。
  3. 护城河的形式发生了变化:不再只是模型质量,而是"模型 + 原生 harness 的耦合"(生态协同 +20.5%)和"安全/责任体系"(Fable 5 的 guardrail 与 fallback)。开源模型可以复制前者(GLM-5.2 兼容 Claude Code),无法复制后者。

5.7 使用门槛 (Barrier to Entry)

维度付费闭源免费/托管开源本地私有
Onboarding time <30min OK?Yes(API key + 一个请求)Yes(OpenRouter 一个 key 全平台)No(下载、量化、配置,首跑 1-2h+;V4 Flash 级需要数天)
Hardware requirementNoneNone2026 标准:16GB 内存起步(27B Q3),24GB GPU 甜点(35B-A3B Q4),103GB 才是前沿(V4 Flash Q2)
Technical expertise neededLowLowModerate to High(量化选择、KV cache 调优、MoE offload 策略)

六、个体选择的决策框架(2026 版)

抽象维度的比较最终要回到一个实际问题:作为个体(个人开发者、独立研究者、小团队),我该如何在三种模型之间分配我的使用预算?

6.1 三个必须回答的问题(不变)

问题一:我在哪个场景中运行这些请求? — 处理敏感数据(客户代码、商业机密)→ 只有本地开源。执行高价值推理链(架构设计、安全审计、长程 agent)→ 付费闭源。日常辅助性工作 → 托管开源已经超过质量下限。

问题二:我每月能承担的隐含成本是多少? — 2026 年的答案与 2025 年不同:托管开源(DeepSeek V4 Flash、GLM-5.2)已经便宜到"价格不再是决策变量",绝大多数个人用户的预算约束只剩"要不要为最后几个点的质量和长程可靠性付费"。对月均预算低于 \(50 的用户,正确配置是托管开源为主 + 付费闭源订阅(Claude Pro\)20 或 ChatGPT Plus $20)作为高价值任务的闸门。

问题三:我对"完全控制权"的需求强度是多大? — 不变。强数据主权需求下,本地开源是"only"选择而非"better"选择。

新增问题四:我的工作流能承受多大的依赖不稳定性? — 这是 2026 年才值得问的问题:你的模型供应商是否可能下架版本(Fable 5 移出订阅、GPT-5.1 sunset)?是否可能无声更换端点背后的 checkpoint(V4-Pro-0813)?是否可能因安全分级拒绝你的合法请求(Fable 5 的 9% fallback)?如果你的答案是"不能承受",本地或可自托管的开源权重是唯一解。

6.2 基于场景的最优配置矩阵(2026 更新)

使用场景第一选择(Primary)第二选择(Secondary / Fallback)绝对不推荐
复杂长程 agent workflow(multi-hour, 1M-token)付费闭源(Fable 5 / GPT-5.6 Sol)托管开源 GLM-5.2(AGENCYBENCH 差距尚存)本地(硬件时延 + 上下文受限)
短程 agent / tool use pipeline托管开源(GLM-5.2 / Kimi K2.6)付费闭源(Sonnet 4.6 / GPT-5.6 Terra)免费 tier(可靠性 + 版本漂移)
High-value reasoning(架构设计、法务分析)付费闭源(Fable 5 / Gemini 3.1 Pro)托管开源(GLM-5.2 HLE 40.5 分)免费 tier
Daily coding assist(code gen / refactor / docs)本地开源(Qwen3.6-35B-A3B on Ollama,24GB 显卡)托管开源(DeepSeek V4 Flash \(0.14/\)0.28)付费闭源(为简单任务超额付费)
Sensitive PI-data processing(客户代码、商业机密)本地开源(self-hosted,MIT 权重:V4 Flash / GLM-5.2)N/A任何 cloud-based 方案
Quick prototyping / one-shot experiment托管开源(OpenRouter 一个 key)免费 tier本地(下载开销 > 任务价值)
Compliance / Regulated pipeline(audit, SOC2)本地开源 + on-premise hosting付费闭源 with signed DPA免费 tier(ToS 通常不合规)
长期 AI-native app(production ML pipeline)混合:本地/托管开源跑日常推理,闭源旗舰做高价值闸门全闭源全本地(除非 GPU 集群在手)

6.3 一个务实的混合架构(2026 修订)

2025 年的三层金字塔(本地高频 / 闭源低频高价值 / 免费托管边缘)在 2026 年需要修订——因为托管开源的质量已经超过了"边缘"定位

第一层级(高频 / 日常任务):托管开源或本地开源二选一,取决于数据敏感性。非敏感负载直接走 DeepSeek V4 Flash / GLM-5.2 API($0.14-1.4/M input,几乎免费);敏感负载跑本地 Qwen3.6-35B-A3B(24GB 显卡,120 tok/s)。daily driver 已从 2025 年的"量化开源权重"变成"低价托管开源 API 或本地 MoE"

第二层级(中频 / 中等价值任务):托管开源的前沿档——GLM-5.2(SWE-bench Pro 62.1,已超 GPT-5.5)或 Kimi K3。这些模型在短程 agent、代码审查、结构化输出上与闭源旗舰打平,成本低一个数量级。

第三层级(低频 / 高价值任务):付费闭源旗舰。长程 agent(数小时持续推理)、架构决策、安全审计——这些是"必须正确"的场景,AGENCYBENCH 的 16 个百分点差距和 Fable 5 的 95% SWE-bench Verified 在这里兑现。你的 Claude Pro / ChatGPT Plus 订阅是这条层级的闸门,不再是日常主力。


七、选择模型的真相:你在决定自己与世界的关系边界

讨论模型强弱、benchmark leaderboard、推理链长度——所有这些争论建立在一个隐含的假设之上:模型是可供比较的商品 (interchangeable commodities)

这个假设在技术上是部分正确的,在经济学上是不成立的。因为当你选择一个模型时,你不是在做一个"性能对比"的决策——你是在决定你的数据和计算逻辑与外部世界之间的边界在哪里

选择你和世界的关系
付费闭源你把自己的推理过程委托给一个你不控制的第三方。你支付费用购买确定性,但让渡了数据主权和部分控制权。关系本质:信任(trust-based dependency)——且这份信任如今包含"供应商可随时改变模型版本、价格结构、安全护栏甚至模型可用性"的条款。
免费/托管开源你和第三方共享计算资源。2026 年这个层级的性价比已经使其成为大多数非敏感场景的事实默认选项,但关系本质不变:不对等的交换(asymmetric information trade)——平台获得数据或至少行为统计,你获得便宜的算力。
本地开源你把自己和世界隔开一条物理边界。数据永远不出境,但你独自承担所有维护成本、硬件成本和责任。关系本质:绝对主权下的完全责任(sovereign independence with total liability)。2026 年的新注解:主权只到"边界"为止,权重本身来自哪家实验室、受哪国法律约束,仍是你必须自行审计的供应链问题。

这三种关系没有优劣之分——它们分别对应不同的风险偏好、经济约束和工程成熟度。个体在模型选择上的真正困境不是"哪个更强",而是"我准备在哪些维度上承担不确定性,又在哪些维度上拒绝让渡控制权"

2026 年的格局变化没有改变这个框架,反而强化了它。开源模型在一年内从"接近闭源"走到"在 SWE-bench Pro 上超越闭源旗舰"(GLM-5.2 vs GPT-5.5),DeepSeek 把 token 价格打到了 $0.14——性能维度和价格维度上的争论正在快速失去意义,剩下来的问题全是关系维度的:你愿意把自己的生产系统绑定在一个随时可能更换 checkpoint 的 API 端点上吗?愿意把敏感数据交给一个发布安全分级模型的供应商吗?愿意把主权押在一家承诺开源却迟迟不发布权重的公司身上吗?

对个体而言最务实的答案从来不是"哪个模型更强",而是"在哪些具体场景中我应该为确定性付费、在哪些场景中我宁愿自己承担风险也不交出控制权"。2025 年的旧结论在 2026 年依然成立,且多了一层紧迫性:模型更迭的速度本身已经成了风险源,理解这一点比记住任何一个 benchmark 数字都更重要——因为它定义的不是模型,而是你自己。


附:2026 年 8 月模型与价格速查表(数据来源:各厂商公告、Artificial Analysis、tessl.io、LangChain、AGENCYBENCH/ACL 2026)

模型类别许可定价 ($/1M in-out)上下文备注
Claude Fable 5闭源旗舰N/A10 / 501M2026-06 发布;Mythos 5 的安全分级版;SWE-bench Verified 95%(自报);9% 任务 fallback 到 Opus 4.8
Claude Opus 4.8闭源N/A5 / 251MTerminal-Bench 2.1 85.0;SWE-bench Pro 69.2
Claude Sonnet 4.6闭源N/A3 / 15短程 agent 性价比档
GPT-5.6 Sol / Terra / Luna闭源N/A5/30 · 2.5/15 · 1/61M2026-06/07;Sol max reasoning 据称成本减半超 Fable 5
Gemini 3.1 Pro闭源N/A2 / 121M2026-02;ARC-AGI-2 77.1%
Gemini 3.6 Flash / 3.5 Flash-Lite闭源N/A0.5/3 · 0.3/2.51MFlash-Lite 350 tok/s
DeepSeek V4 Flash托管+开源MIT0.14 / 0.281M284B/13B MoE;2026-07-31 发布即开源;Q2_K 本地需 103GB
DeepSeek V4 Pro托管+开源MIT0.435 / 0.871M1.6T/49B;2026-08-12 无声升级 0813 checkpoint
GLM-5.2托管+开源MIT1.4 / 4.41M753B/40B;SWE-bench Pro 62.1 > GPT-5.5 58.6;兼容 Claude Code
Qwen3.8-Max托管(权重未发布)承诺开源2 / 61M2.4T/95B;"下周发布权重"已拖延两周+
Qwen3.6-35B-A3B开源本地Apache 2.0本地免费262K-1M24GB 显卡甜点,Q4 ~22GB,120 tok/s
Kimi K2.6 / K3托管+开源Modified MIT0.95/4256K-1MK2.6 SWE-bench Pro 58.6%;K3 为开源 agent 领先者之一
MiniMax M3托管+开源0.30 / 1.20tessl 评测 91.4 分,价格仅为 Sonnet 1/10
Llama 4 Scout / Maverick开源本地Llama Community本地免费10M / 1MMoE 17B active;Scout Q4 ~55GB;Behemoth 暂停
gpt-oss-20b / 120b开源本地Apache 2.0本地免费128KOpenAI 的开放权重系列,20B 可 16GB 内存运行

注:厂商自报基准与第三方评测存在系统性差异(例如 DeepSeek V4 Pro 的 SWE-bench 自报 62.7 vs 独立 DeepSWE 8%),引用时注意来源。