0先建立共识:什么是「大模型」
大模型(Large / Foundation Model)指以 Transformer 为骨架、在海量数据上做自监督预训练、参数量达到十亿到万亿级的深度神经网络。它的几个本质特征:
- 规模即能力:参数和数据量跨过某个阈值后,会涌现出小模型没有的「推理、代码、多步规划」能力(涌现能力 / Emergence)。
- 通用底座:同一个基座模型,靠少量示例(few-shot)或微调就能适配翻译、问答、编码、写作等无数下游任务,不必为每个任务单独建模。
- 不止文本:已从纯文本 LLM 演进到多模态(文 / 图 / 音 / 视频统一建模),以及Agent 化(能调用工具、长程自主执行)。
一句话:大模型 = 在超大数据上预训练出的通用「世界模型底座」,是当下一切 AI 应用的发动机。token 是它运算的最小单位(详见另一篇《Token 的产生与消耗》)。
1发展历程:从 Transformer 到百万上下文
大模型并非一夜出现,而是近十年架构与数据积累的结果。下面这张时间线标出了决定走向的几个关键节点:
- 2017 · Transformer:Google《Attention Is All You Need》提出自注意力机制,取代 RNN/CNN,成为此后所有大模型的统一骨架。
- 2018 · 预训练范式:GPT-1(Decoder-only 生成式)与 BERT(Encoder 理解式)证明「先预训练、后微调」可行。
- 2020 · GPT-3:1750 亿参数,首次展示 few-shot 能力——不微调、只给示例就能完成任务。
- 2022 · ChatGPT + LLaMA:GPT-3.5 + RLHF 让对话式 AI 走向全民;同年 Meta 开源 LLaMA,开启开源浪潮。
- 2023 · 群雄并起:GPT-4(多模态)、Gemini、Claude、Mistral 登场,MoE(混合专家)普及。
- 2024 · 多模态 + 推理:原生多模态(GPT-4o)、推理模型(OpenAI o1、DeepSeek-R1)引入「慢思考」。
- 2025–2026 · Agent 化与开源逼近:长上下文(1M–10M token)、MoE 成主流、Agent 自主执行;DeepSeek / Qwen / Kimi 等开源权重在多项基准逼近闭源。
2当前主流模型版图:闭源 vs 开源
2026 年的格局可清晰切成两大阵营——闭源 API(按 token 付费、免运维)与开源权重(可自托管、可微调)。代表厂商如下:
闭源 / API 阵营(2026-08 实测格局)
- Claude(Anthropic,Opus 5 / Fable 5 / Sonnet 5):编码(Arena WebDev 榜首)、写作、多模态理解最强;支持「努力档位」按需换速度与深度。缺点:贵($5/$25 每百万 token)、数据出域、不开放权重。
- GPT-5.6(OpenAI,Sol/Terra/Luna):ChatGPT 默认模型、生态最成熟(Codex、Agent SDK)、通用均衡。缺点:推理档 Sol 被评测指出有「投机行为」倾向、单价偏高。
- Gemini 3.x(Google):上下文最长(2M token)、唯一原生统一多模态(文/图/音/视频一次调用)、准确率高。缺点:纯推理指数略低于前沿组。
- Grok 4.x(xAI):实时接入 X 数据、内容限制最少。缺点:通用能力略逊、绑定 X 生态。
- Kimi K3(Moonshot):开放权重中综合第一、WebDev 强、2.8T MoE。缺点:生态与工具链弱于头部闭源。
开源 / 开放权重阵营
- DeepSeek V4 / V4-Flash(MIT):性价比之王($0.14/$0.28,每 token 仅激活 13B/284B),自托管门槛低。缺点:需自己运维、英文外多语略弱。
- Qwen3.8(阿里):亚洲语言最强开源、Agent 能力突出。缺点:超长推理稳定性待验证。
- Llama 4(Meta):生态最大、宣称 10M 上下文(有效长度待独立验证)。
- Mistral Large 3 / GLM-5.2(智谱)/ Gemma 4(Google 端侧):分别主打欧盟合规、中文综合、端侧轻量。
3两大阵营的核心优缺点
选闭源还是开源,本质是「能力 / 便利」与「控制 / 成本」的取舍:
| 维度 | 闭源 API | 开源权重 |
| 能力上限 | 顶尖、持续更新 | 略逊前沿,但差距快速缩小 |
| 成本 | 按 token 付费,量大则贵 | 仅算力成本,可自托管 |
| 数据 | 出域(需信任厂商) | 完全私有、可 air-gapped |
| 运维 | 零 DevOps、有 SLA | 需自己部署、无官方 SLA |
| 可控性 | 厂商锁定、黑盒 | 可微调、无速率限制、无锁定 |
没有「最好」的模型,只有「最合适」的模型。下面是按场景的落地建议。
4按场景选型:该用哪个
把「场景 → 推荐模型」落到实处,避免选择困难: