Skip to content

第一章 基础认知

1.1 大模型全景图谱

承前:你翻开这本书,可能带着各种各样的疑问——"AI 到底能帮我做什么?""大模型是不是就是那种聊天机器人?""我想用 AI 做产品,到底该从哪里下手?"在本书的序言中,我们讨论了为什么 AI 大模型正在重塑软件开发的方式,为什么每个技术人都应该了解它。从这一节开始,我们正式踏上旅途。本章不会深入底层原理(那是第二章的事),而是先帮你建立一个宏观的"地图"——当你面对几十个模型名称、铺天盖地的新闻时,能分清谁是谁、各自擅长什么、该怎么选。地图在手,才不会迷路。


1.1.1 大模型时代是怎么来的

要理解今天的格局,我们需要先把时间线拉回 2022 年 11 月 30 日。那天,OpenAI 发布了 ChatGPT。表面上看,这只是一个网页聊天工具,但它背后的技术——大语言模型(Large Language Model,简称 LLM)——第一次让普通人直观感受到"机器能像人一样理解语言"。

ChatGPT 上线后五天,用户突破一百万;两个月后,月活过亿。这个增长速度在人类互联网史上是空前的——Instagram 用了两年半才达到一亿用户,TikTok 用了九个月,而 ChatGPT 只用了两个月。

这种爆发并非偶然。它背后是三个要素的汇聚:

第一,算力。 过去十年,GPU(图形处理器)的算力增长了数百倍。英伟达的 A100、H100 芯片让训练千亿参数的模型成为可能。打个比方:如果 2012 年的 AI 模型训练像是在用自行车送货,那今天就是用重型卡车在跑高速——载货量和速度都不是一个量级。

第二,数据。 互联网积累了三十年的文本数据,维基百科、GitHub、学术论文、网页爬取……这些人类知识的数字化沉淀,为模型提供了海量的"学习教材"。就好比一个学生,以前只能读课本,现在可以同时翻遍全世界的图书馆。

第三,算法。 2017 年,Google 发表了论文《Attention Is All You Need》,提出了 Transformer 架构。这个架构是大模型的"骨架"——在它之前,AI 处理语言的方式像一个一个字读(RNN/LSTM),容易忘记前面的内容;Transformer 让模型能同时"看到"整句话的关系,就像你能一眼看清整页书的结构,而不是逐字逐行地啃。

三者交汇,大模型的诞生几乎是必然。

仅仅两年时间,LLM 领域就从"OpenAI 一家独大"演变为"群雄逐鹿"。截至 2025 年 7 月,全球已有数十款具有竞争力的大模型产品,形成了闭源与开源两大阵营并立的局面。你今天看到的所有 AI 新闻——GPT 升级、Claude 出新版本、国产模型刷榜——都是这场竞争的片段。

下面这张图帮你建立全局印象:

大模型生态全景(截至 2025 年 7 月)

┌─────────────────────────────────────────────────────┐
│                    闭源模型阵营                        │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐           │
│  │  OpenAI  │  │Anthropic │  │  Google  │           │
│  │ GPT-4o   │  │Claude 4  │  │Gemini 2.5│           │
│  │ GPT-4.5  │  │Claude 3.5│  │Gemini 3  │           │
│  └──────────┘  └──────────┘  └──────────┘           │
├─────────────────────────────────────────────────────┤
│                    开源模型阵营                        │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐           │
│  │   Meta   │  │ 阿里云    │  │深度求索   │           │
│  │ Llama 3  │  │ Qwen 2.5  │  │DeepSeek  │           │
│  │ Llama 4  │  │ Qwen3     │  │   R1/V3   │           │
│  └──────────┘  └──────────┘  └──────────┘           │
│  ┌──────────┐  ┌──────────┐  ┌──────────┐           │
│  │ 智谱AI   │  │月之暗面   │  │ Mistral  │           │
│  │ GLM-4    │  │ Kimi K2   │  │Large/8x22│           │
│  └──────────┘  └──────────┘  └──────────┘           │
└─────────────────────────────────────────────────────┘

"闭源"和"开源"是什么意思?你可能对软件界的这个概念不陌生——闭源软件的代码不公开,你只能通过官方提供的接口(API)使用,就像你使用微信但看不到它的源代码;开源软件的代码完全公开,你可以下载、修改、甚至重新分发,就像 Linux 操作系统。大模型领域同理:闭源模型你只能调 API,开源模型可以下载权重文件,部署在自己的服务器上。

这两条路线各有代价。闭源模型技术最前沿,但你受制于厂商;开源模型可控性强,但最尖端的能力往往稍逊一筹。这种张力贯穿整个大模型产业。


1.1.2 国际主流模型深度解析

接下来,我们逐一拆解几个最重要的模型家族。注意,模型迭代极快——以下信息截至 2025 年 7 月,你读到这本书时可能已有新版本,但各家厂商的"性格"和"特长"往往延续数代,框架性的认知不会过时。

GPT 系列(OpenAI)——通用能力标杆

OpenAI 的 GPT 系列是当前大模型领域的"参照系"。当你听到某个模型"性能接近 GPT-4"或"在某项测试上超过 GPT-4",你能感受到它的行业地位——GPT 系列就是那个被反复对标的对象。

GPT-4 于 2023 年 3 月发布,参数规模约 1.8 万亿。什么是"参数"?你可以把参数理解为模型大脑中神经元之间的"突触连接强度"。参数越多,模型的"记忆容量"和"表达能力"通常越强——就像一个学生读过的书越多,能调用的知识就越丰富。1.8 万亿这个数字,意味着模型内部的连接关系达到了天文级。

GPT-4 支持图像与文本输入,上下文窗口最高 128K tokens。这里的"上下文窗口"是一个关键概念——它决定了模型一次能"记住"多少内容。128K tokens 大约相当于 9 万字左右的中文,足够装下一本中等篇幅的书。你可以想象模型在和你对话时,有一块固定大小的"黑板",窗口越大,黑板上能写的内容越多,模型越不容易"忘掉"你前面说的话。

2024 年 5 月,OpenAI 推出 GPT-4o。"o"代表 omni(全能),它实现了原生多模态——文本、图像、音频在同一个模型里统一处理。这不同于早期"拼接式"的多模态方案(比如一个文字模型加一个语音识别模块),而是模型本身从底层就同时理解多种模态。打个比方:拼接式方案像雇佣了一个翻译和一个速记员配合工作,而原生多模态是一个人同时会说、会听、会看。

2025 年 2 月,OpenAI 发布 GPT-4.5(代号 Orion),进一步增强了推理能力和多模态表现,同时降低了 API 价格。随后在 2025 年中,GPT-5 系列陆续发布,推理和多模态能力再上台阶。

GPT 系列的核心优势:

  • 综合能力无明显短板。 逻辑推理、代码生成、创意写作、知识问答——每一项都处于第一梯队。如果你不知道选什么模型,选 GPT 系列通常不会犯大错。
  • 开发者生态极其完善。 支持 Function Calling(让模型调用外部函数)、插件扩展、GPTs 自定义助手、Assistants API 等。这意味着你不仅可以让它"说话",还能让它"动手"——查询数据库、调用接口、执行代码。
  • 基准测试顶尖。 截至 2025 年 7 月,GPT-4o 在 MMLU(综合知识,88.7 分)、HumanEval(编程,90.2%)等基准测试中表现名列前茅。

GPT 系列的主要局限:

  • API 调用成本较高。 对于中文场景的大规模应用,成本大约是国产主流模型的 5 到 10 倍。如果你的产品每天要处理百万级请求,这个差距会非常显著。
  • 中文语义理解精度略逊。 虽然表现已经很好,但在涉及成语、典故、行业黑话等深层次中文语境时,国产头部模型往往更"地道"。
  • 未开源。 你无法看到它的内部结构,也无法私有化部署——所有数据都要经过 OpenAI 的服务器。对于金融、医疗等对数据隐私要求极高的行业,这是一个硬伤。
Claude 系列(Anthropic)——安全合规与长文本专家

Anthropic 是一家特别的公司。它的创始团队 Dario Amodei 和 Daniela Amodei 曾是 OpenAI 的核心成员,因为对 AI 安全理念产生分歧而离开,于 2021 年创立了 Anthropic。这种"出身"决定了 Claude 系列的鲜明特点——对安全的极致追求。

Claude 3 系列于 2024 年 3 月发布,包含三个版本:Haiku(快速版,适合简单高频任务)、Sonnet(均衡版,性价比最高)、Opus(最强版,能力上限最高)。这种分级策略本身就是一个值得学习的商业设计——不同用户有不同需求,不是所有人都需要最贵的模型。

Claude 3 系列支持 200K tokens 的上下文窗口。200K tokens 大约相当于 15 万英文单词——约一本 400 页的英文小说。这意味着你可以把整本合同、整份论文甚至整个代码仓库丢给它分析。

2024 年 6 月,Claude 3.5 Sonnet 发布,在多个基准上超越了体积更大的 Claude 3 Opus。这在行业里引发了重要讨论:它证明了"训练方法比参数规模更重要"。一个更聪明的训练流程,可以让中等参数的模型打败更大参数的模型——就像一个会学习方法的学生,可能比一个只会死记硬背的"大块头"考得更好。

2025 年,Anthropic 推出 Claude 4 系列(包括 Sonnet 4 和 Opus 4),进一步增强了自主工具调用和编程能力。Claude Opus 4.5 在 SWE-bench(软件工程评测)中达到了 80.9% 的准确率——这意味着它能独立解决接近八成来自真实 GitHub 仓库的编程任务,这个能力令人惊叹。

Claude 系列的核心优势:

  • 长文本处理能力顶尖。 200K tokens 的窗口让它成为处理长文档的首选。律师审查合同、分析师阅读财报、开发者理解大型代码库——Claude 在这些场景中几乎不可替代。
  • 安全合规性突出。 Anthropic 独创的 Constitutional AI(宪法 AI)训练方法,通过一套"宪法原则"约束模型行为。简单说:模型在训练过程中会反复问自己"这样做符合原则吗?",从而内化安全规范。对于银行、保险、政务等合规要求严格的场景,Claude 是更稳妥的选择。
  • 代码工程能力强。 截至 2025 年 7 月,Claude 在 SWE-bench 等编程评测中表现优异,尤其擅长理解和修改已有代码库——这一点对实际开发工作非常实用。

Claude 系列的主要局限:

  • 多模态能力有限。 目前仅支持图像输入 + 文本输出,不像 GPT-4o 或 Gemini 那样能直接处理音频和视频。
  • 中文支持相对较弱。 虽然一直在改进,但与国产模型相比,Claude 在中文文化语境下的表达仍不够"地道"。
Gemini 系列(Google)——原生多模态先锋

Google 是 Transformer 架构的发明者(2017 年那篇《Attention Is All You Need》就出自 Google 研究员之手),但有意思的是,在大模型竞赛的前半程,Google 反而落后了。直到 2023 年底推出 Gemini 系列,Google 才真正追上节奏。

Gemini 系列最大的标签是"原生多模态"。与 GPT-4o 类似,Gemini 从底层架构上就同时处理文本、图像、音频、视频和代码,而不是把多个专用模型拼在一起。

Gemini 1.5 Pro 于 2024 年 2 月发布,支持高达 100 万 tokens 的上下文窗口。100 万 tokens 是什么概念?大约相当于 70 万字——你能把整个《三国演义》(约 60 万字)放进去,模型还能告诉你第 73 回里某个人物的对话细节。这个能力在所有商业模型中目前是最强的。

2025 年,Google 推出 Gemini 2.5 Pro 和 Gemini 3 系列,进一步提升了推理和 Agent(智能体)能力。

Gemini 系列的核心优势:

  • 原生多模态能力最强。 尤其擅长视频理解——你可以上传一段会议录像,让它提取关键信息、生成会议纪要。这种能力在内容审核、媒体分析、教育培训等场景中极具价值。
  • 超长上下文窗口。 100 万 tokens 意味着可以处理大规模文档分析任务,比如一次性读取整个代码仓库或数百份法律文书。
  • 与 Google 生态深度整合。 搜索引擎、云服务、Google Workspace(Docs、Sheets、Slides)——Gemini 能够触达 Google 庞大的产品矩阵,形成协同效应。

Gemini 系列的主要局限:

  • 中文文化语境理解相对较弱。 Google 在中国大陆没有业务基础,中文语料的积累不如国内厂商。
  • API 开放节奏较慢。 部分功能需要绑定 Google Cloud 账号,使用门槛相对高一些。
Llama 系列(Meta)——开源王者

Meta(前 Facebook)在大模型领域走了一条与众不同的路——全面开源。CEO 马克·扎克伯格认为,AI 不应该被少数几家公司垄断,开源才能推动整个行业快速进步。这个战略决策深刻影响了整个大模型生态格局。

Llama 3 系列于 2024 年发布,包含 8B(80 亿参数)、70B、405B 三个规模。其中 405B 模型在多项评测中逼近 GPT-4,证明了开源模型有能力挑战闭源前沿。

2025 年,Llama 4 发布,引入了原生多模态能力。所有 Llama 模型均以宽松许可证开源,允许商业使用——这意味着你可以合法地把 Llama 部署在自己的服务器上,对外提供商业服务,而无需向 Meta 付费。

Llama 系列的核心优势:

  • 完全开源,数据隐私可控。 模型权重可以下载到你自己的服务器上运行,数据不出内网。对于医疗、金融、军工等数据安全要求极高的行业,这是不可替代的优势。
  • 社区生态极其繁荣。 Hugging Face 上有数万个基于 Llama 的衍生项目,涵盖微调、量化、部署工具链等方方面面。当遇到问题时,你几乎总能找到社区解决方案。
  • 支持轻量化微调。 LoRA(Low-Rank Adaptation)等技术让你只需训练极少量参数就能让模型适配特定任务,部署成本大幅降低。

Llama 系列的主要局限:

  • 前沿能力略逊于顶级闭源模型。 在极端长上下文、复杂多步推理等场景下,与 GPT-4o 或 Gemini 2.5 Pro 相比仍有差距。
  • 小参数模型的复杂推理能力不足。 8B 模型虽然部署成本低,但在数学推理、复杂代码等任务上表现有限,通常需要微调才能实用。

1.1.3 国产模型的崛起

上面讲的四个家族都是国际大厂的产品。但如果你在中国做 AI 应用开发,国产模型是你绕不开的选择——不仅仅因为成本更低,更因为它们在中文场景下的表现常常优于国际同行。

DeepSeek 系列(深度求索)——极致性价比

DeepSeek(深度求索)是这场大模型竞赛中最引人注目的"黑马"。这家公司原本是量化基金幻方量化的 AI 研究部门,2023 年独立运作。2025 年初,DeepSeek-R1 的发布在全球引发了巨大震动——它以极低的训练成本实现了接近顶级闭源模型的推理能力,一度导致英伟达股价大幅下跌。

DeepSeek-V3 采用了混合专家模型(MoE,Mixture of Experts)架构。这个概念值得详细解释:传统模型在处理每个输入时,所有参数都会参与计算——就像一个公司里,不管什么任务都全员上阵;MoE 架构则不同,它把模型分成多个"专家子网络",每次只激活最相关的几个——就像一个公司有不同部门,接收到不同任务时,只调度相关部门处理。DeepSeek-V3 总参数 6710 亿,但每次推理只激活约 370 亿参数(约 5%),这意味着计算量大幅减少,成本急剧下降,而效果几乎不受影响。

DeepSeek-R1 是专注于推理的模型。它通过大规模强化学习(Reinforcement Learning)训练,让模型学会"先思考再回答"——就像训练一个人在考试时先打草稿、列步骤,而不是直接写答案。在数学和代码任务上,R1 的表现对标甚至超越了顶尖闭源模型。

DeepSeek 系列的核心优势:

  • API 成本极低。 调用价格仅为 GPT-4 的 1/7 到 1/10,是目前性价比最高的选择之一。
  • 数学和代码推理能力世界一流。 在数学竞赛题、编程竞赛等高难度任务上,R1 表现出色。
  • 完全开源。 模型权重在 Hugging Face 上公开,可在消费级 GPU 上运行(当然,完整 671B 模型需要多卡,但量化后的版本可以在 8 卡 A100 上跑起来)。

DeepSeek 系列的主要局限:

  • 创意生成相对薄弱。 R1 的结构化思维很强(就像一个理科尖子生),但在诗歌、小说、营销文案等需要发散思维的场景下,表现不如通用模型。
  • R1 的函数调用和多轮对话能力不如 V3。 R1 是"偏科生",如果你需要的是通用对话能力,V3 可能更合适。
Qwen 系列(阿里云)——全能选手

阿里云的通义千问(Qwen)系列发展速度极快。Qwen 2.5 系列覆盖从 0.5B 到 72B 的多个规模——这种"全家桶"策略让用户可以根据自身算力和需求灵活选择。

Qwen3-235B 于 2025 年发布,在 AIME(美国数学邀请赛)测试中以 70.3 分的成绩大幅领先 GPT-4o 的 26.7 分。这个差距是惊人的——说明在数学推理这一特定维度上,国产模型已经实现了对国际巨头的反超。

Qwen 系列在中文场景下表现突出,且 API 价格极具竞争力。如果你的产品主要面向中文用户,Qwen 是一个值得认真考虑的选择。

除了 DeepSeek 和 Qwen,国产阵营还有许多值得关注的选手:智谱 AI 的 GLM-4 系列在中文 NLP 任务上表现出色;月之暗面的 Kimi K2 以超长上下文窗口著称;Mistral(法国)则是欧洲开源模型的代表。


1.1.4 多维度横向对比

讲了这么多模型,你可能感觉信息有点散。下面这张表把它们放在同一坐标系下,让你直观看到各自的强项(截至 2025 年 7 月):

维度第一名第二名第三名
通用能力GPT-4o / GPT-5Gemini 2.5Claude 4
编程能力Claude Opus 4.5GPT-4o / GPT-5DeepSeek-R1
长上下文Gemini 2.5 Pro (1M+)Kimi K2Claude 4 (200K)
多模态Gemini 2.5GPT-4oGPT-4.5
中文能力Qwen3 / 文心一言Kimi K2GPT-4o
成本优势Llama 3(开源)DeepSeek-V3Qwen API
Agent 能力Claude Opus 4.5GPT-5Gemini 3 Pro

需要强调的是,这张表反映的是"截至 2025 年 7 月"的情况。大模型领域的竞争日新月异——今天的第一名,下个月可能就被超越。因此,这张表的价值不在于记住具体排名,而在于帮你理解"不同模型在不同维度上的相对强弱"。当你面临选型决策时,先想清楚你最看重哪个维度,然后找到该维度上的领先者。


1.1.5 如何选择适合你的模型

讲完模型,最实际的问题来了:面对这么多选择,我到底该用哪个?

这里提供一个简化的决策树,帮你快速缩小范围:

选型决策树

你的需求是什么?
├── 追求综合能力最强 → GPT-4o / GPT-5
├── 处理长文档/法律/金融 → Claude 4 / Claude 3.5
├── 多模态/视频理解 → Gemini 2.5 Pro
├── 私有化部署/数据安全 → Llama 3 / Qwen / DeepSeek
├── 极低成本/高性价比 → DeepSeek-V3 / Qwen3
├── 中文场景优化 → Kimi K2 / 通义千问 / 文心一言
└── Agent 开发 → Claude Opus 4.5 / GPT-5 / Gemini 3 Pro

但决策树只是起点。真实场景中,你还需要考虑几个关键因素:

预算。 这是最直接的约束。如果你的预算是每月几百元,闭源模型的 API 费用可能很快超标;开源模型虽然免费,但你需要自己承担服务器成本。算一笔账:一台 8 卡 A100 服务器每月成本约 5-8 万元,如果你的调用量足够大(比如日均百万 token 级别),自建部署反而更划算。

数据隐私。 这不仅是一个技术问题,更是一个合规问题。如果你的应用处理的是医疗病历、金融交易数据、企业内部文档,数据出内网可能违反法规或合同条款。这种情况下,开源模型是唯一的选择。

中文支持。 中文不是英文的简单翻译。成语、典故、网络流行语、行业术语——这些深层次的语言现象,决定了用户对 AI 的"信任感"。国产模型在这些方面有天然优势。

团队能力。 开源模型需要你的团队具备模型部署、运维、微调的能力。如果你的团队以应用开发为主,缺乏 AI 基础设施经验,先从闭源 API 开始,快速验证业务价值,是更务实的选择。

下面这段代码演示了一个实际场景:你写了一个函数,根据不同需求自动选择调用合适的模型 API。虽然只是示意,但思路可以直接用到实际项目中。

python
import os  # 导入操作系统接口模块,用于读取环境变量中的 API 密钥

def select_model(task_type: str, budget: str = "medium", privacy: str = "public"):
    """
    根据任务类型、预算和隐私要求,推荐合适的大语言模型。

    参数:
        task_type (str): 任务类型,可选值:
            "general"  - 通用对话
            "coding"   - 代码生成
            "long_doc" - 长文档处理
            "multimodal" - 多模态(图像/视频)
            "agent"    - Agent 智能体开发
        budget (str): 预算等级,"low" / "medium" / "high"
        privacy (str): 数据隐私要求,"public"(可上云)/ "private"(必须本地)

    返回:
        str: 推荐的模型名称
    """

    # ---- 第一步:隐私要求为最高优先级 ----
    # 如果数据必须留在内网,闭源模型直接排除,只能选开源模型
    if privacy == "private":
        if task_type == "general":
            return "Qwen3-72B"          # 通义千问,中文通用能力强,72B 参数平衡性能与成本
        elif task_type == "coding":
            return "DeepSeek-Coder-V3"   # DeepSeek 编程专用模型,代码能力一流
        elif task_type == "long_doc":
            return "Qwen3-32B"            # 32B 参数量,支持 128K 上下文,部署成本适中
        else:
            return "Llama-3-70B"          # Meta 开源旗舰,综合能力最强的开源模型之一

    # ---- 第二步:非隐私场景,按预算分层 ----
    if budget == "low":
        # 预算紧张:优先国产模型,成本极低
        return "DeepSeek-V3"              # API 成本仅为 GPT-4 的 1/7~1/10

    if budget == "high":
        # 预算充裕:追求能力上限,用最顶尖的模型
        if task_type == "agent":
            return "Claude Opus 4.5"      # Agent 场景下,Claude 的工具调用能力最强
        elif task_type == "multimodal":
            return "Gemini 2.5 Pro"       # 多模态首选,原生支持视频理解
        else:
            return "GPT-5"                 # 通用场景,GPT-5 综合能力最强

    # ---- 第三步:中等预算的精细选择 ----
    if task_type == "long_doc":
        return "Claude Sonnet 4"          # 200K 上下文 + 适中价格,长文档性价比之王
    elif task_type == "coding":
        return "DeepSeek-V3"             # 编程能力强且便宜
    elif task_type == "multimodal":
        return "GPT-4o"                   # 原生多模态,能力均衡
    elif task_type == "general":
        return "Qwen3-72B (API)"          # 中文通用场景,国产模型更懂中文
    else:
        return "GPT-4o"                   # 默认回退:能力均衡,不会出错


# ---- 使用示例 ----
# 场景:创业公司,预算有限,做中文智能客服
recommendation = select_model(
    task_type="general",    # 通用对话任务
    budget="low",           # 预算紧张
    privacy="public"        # 数据可以上云
)
print(f"推荐模型:{recommendation}")
# 输出:推荐模型:DeepSeek-V3

# 场景:金融机构,处理合同文档,数据不能出内网
recommendation = select_model(
    task_type="long_doc",   # 长文档处理
    budget="high",          # 预算充足
    privacy="private"       # 必须本地部署
)
print(f"推荐模型:{recommendation}")
# 输出:推荐模型:Qwen3-32B

这段代码的核心思想是分优先级决策:先看硬约束(隐私),再看资源约束(预算),最后在剩余选项中按任务类型匹配。这个思路同样适用于更复杂的选型场景——只是维度更多、权重计算更精细。

有一个核心原则值得反复强调:没有"最好的模型",只有"最合适的模型"。 选择取决于你的具体场景、预算、数据隐私要求和对中文支持的需求。很多团队在初期会犯一个错误——盲目追求"最强模型",结果发现成本爆炸、延迟太高、或者数据合规出问题。先想清楚约束条件,再选模型,这才是工程思维。


1.1.6 常见误区

初学者在接触大模型时,容易陷入几个思维陷阱。下面列出最常见的几个,帮你在起步阶段少走弯路。

误区一:"参数越多,模型越强。"

这是一个非常自然的想法——参数多不就等于"脑子大"吗?但实际情况复杂得多。模型能力取决于训练数据质量、训练方法、架构设计等多个因素。前面我们提到,Claude 3.5 Sonnet(参数未公开,推测远小于 405B)在多项评测中超越了 Llama 3-405B。打个比方:一个读了 10 万本书但学会高效学习方法的人,可能比一个读了 50 万本书但不善总结的人更"聪明"。参数规模是重要因素,但不是唯一决定因素。

误区二:"开源模型免费,所以一定比闭源便宜。"

模型本身免费,但"使用"不是免费的。你需要服务器、GPU、电力、运维人力。一台 8 卡 A100 服务器每月的运营成本可能高达数万元。如果你的调用量不大,闭源 API 按量计费反而更经济。反之,如果调用量巨大(日均数亿 token),自建部署的边际成本趋近于零,长期反而更便宜。关键在于做一次 TCO(总拥有成本)分析,而不是看表面价格。

误区三:"大模型什么都会,不需要微调。"

大模型的通用能力确实很强,但在特定垂直领域(比如医疗诊断、法律条文引用、企业内部知识库问答),通用模型的表现往往不如经过微调的专用模型。这就像一个全科医生什么病都能看,但你得了疑难杂症,还是需要专科医生。微调的本质就是让通用模型变成"专科医生"——这也是本书第四章要讲的内容。

误区四:"API 调用很简单,随便写就行。"

API 调用本身确实简单,但要在生产环境中用好,需要考虑很多工程问题:请求重试、限流、超时处理、成本监控、响应缓存、Prompt 优化……一个健壮的 LLM 应用系统远比"调一下 API 拿到结果"复杂。这也是本书后半部分(系统设计、评估优化)要讨论的话题。

误区五:"用了一个模型就要一直用下去。"

大模型领域迭代极快,今天的最优选择,三个月后可能就不是了。明智的做法是设计你的系统时做好"模型抽象层"——让模型选择变成一个可配置项,而不是硬编码在代码里。这样当更好的模型出现时,你可以快速切换,而不需要重写整个系统。本书第九章会详细讨论这种架构设计。


1.1.7 本节小结

回顾这一节,我们建立了一张"大模型全景地图"。几个关键认知值得你带走:

大模型领域形成了闭源与开源两大阵营。闭源阵营以 OpenAI(GPT 系列)、Anthropic(Claude 系列)、Google(Gemini 系列)为代表,技术最前沿但成本较高且不可私有化;开源阵营以 Meta(Llama 系列)、阿里云(Qwen 系列)、深度求索(DeepSeek 系列)为代表,可控性强、成本可控、社区活跃,但前沿能力略逊。

每个模型家族都有自己的"性格":GPT 系列是通用标杆,能力均衡且生态完善;Claude 系列是安全合规与长文本的专家,适合金融、法律等敏感场景;Gemini 系列是多模态先锋,超长上下文窗口是杀手锏;Llama 系列是开源之王,私有化部署的首选;DeepSeek 是性价比之王,数学和代码推理能力世界一流。

选型的核心法则是"没有最好的模型,只有最合适的模型"。先确定硬约束(隐私、合规),再考虑软约束(预算、团队能力),最后在剩余选项中按任务类型匹配。记住,模型选择不是一次性决策——大模型领域迭代极快,保持灵活、定期重新评估,是务实的工程态度。

如果你现在还记不住所有模型名称,不必焦虑。这张地图的意义不在于让你背下来,而在于当你在工作中遇到选型问题时,知道去哪里查、按什么维度对比。真正的理解来自后续章节的深入学习和实际动手实践。


启后:这一节我们看清了"有哪些模型"和"各自擅长什么",但还有一个更基础的问题没回答——这些模型到底是怎么被用起来的?从最早的网页聊天框,到今天的 API 调用、嵌入式助手、自主 Agent,大模型的应用形态经历了几次重大演进。理解这个演进过程,你才能把握"大模型到底能做什么"的边界,也才能判断自己的应用应该采用哪种形态。下一节,我们就来梳理这条演进之路。


参考资料

  1. 2025大模型技术全景:GPT、Claude、Gemini、文心一言等主流模型深度对比 - CSDN 博客,全面对比各大模型的技术特点和应用场景

  2. 2025全球大语言模型巅峰对决:ChatGPT-4.5、Gemini Ultra、Llama3等全维度解析 - InfoQ,深度解析10大模型的优劣

  3. 2025大模型选型指南:GPT/Claude/Gemini与国产模型深度对比 - 博客园,从多维度给出选型建议

  4. DeepSeek模型技术原理、成本优势与选型指南 - 阿里云开发者社区,详细介绍 DeepSeek 的技术架构

  5. Generative AI in Academic Writing: A Comparison of DeepSeek, Qwen, ChatGPT, Gemini, Llama - arXiv 学术论文,多模型学术写作能力对比研究

  6. 国内外大语言模型(LLM)全景对比与选型指南 - 51CTO博客,2026年最新国内外模型对比

  7. Vaswani, A. et al. (2017). Attention Is All You Need. - Transformer 架构的奠基论文,理解大模型底层原理的必读文献

  8. OpenAI 官方文档 / Anthropic 官方文档 / Google Gemini 文档 - 三家厂商的官方 API 文档,获取最新模型信息的第一手来源

  9. Hugging Face Open LLM Leaderboard - 开源模型排行榜,实时更新的开源模型评测数据