一、AI 不是魔法——它只是一个”下一个词预测器”
ChatGPT 刚出来的时候,很多人觉得它像魔法。你跟它聊天,它不仅能回答,还能写代码、翻译、总结、写诗,甚至能跟你开玩笑。
但如果你剥开所有的包装,它本质上只做一件事:预测下一个词。
比如你输入”今天天气真”,它预测下一个词是”好”(概率 78%),再下一个是”啊”(概率 62%),再下一个是”。”(概率 91%)。就这样一个一个词地预测,连起来就是一句话:”今天天气真好啊。”
问题来了——如果只是预测下一个词,它怎么做到像真的在思考一样?答案藏在两个东西里:海量训练数据和极其庞大的参数规模。

二、参数是什么——AI 的”经验”
一个 AI 模型本质上是一个巨大的数学公式。参数就是这个公式里的可调权重。
GPT-4 的参数规模大约在 1.76 万亿个。这个数字大到什么程度?如果你每秒钟数一个数,从 1 数到 1 万亿,大约需要 3 万年。
这些参数不是人手工设置的,而是通过一个叫做”训练”的过程自动学出来的。你可以把参数理解为 AI 的”经验”——它读过的所有文字,都被压缩成了这些数学权重。

三、训练——让 AI 学会”语言”
训练 AI 的过程,和教一个小孩认识世界有几分相似,但规模大得多。
第一阶段:预训练(Pre-training)
研究人员把互联网上几乎所有的公开文本——维基百科、书籍、论文、论坛帖子、代码仓库——收集起来,喂给模型。数据量大约是 15 万亿个 token(一个 token 大约相当于 0.75 个中文词语)。
训练的过程很像一个填字游戏:给模型看一句话,把最后一个词遮住,让它猜。猜对了加分,猜错了扣分,然后调整参数。重复、重复、再重复。
GPT-4 的训练用了大约 25000 块 A100 GPU,耗时 90 到 100 天,电费就花了数千万美元。
这个阶段结束后的模型,已经有了”语言能力”——它知道语法、逻辑、常识、事实知识。但它还不适合直接跟人类对话。
第二阶段:指令微调(Instruction Tuning)
预训练后的模型有一个问题:你问它”怎么做红烧肉”,它可能给你续写一段菜谱,也可能给你来一段”怎么做红烧肉?这个问题问得好,首先……”的废话。它不知道你是在提问。
所以需要用人工标注的”问题-答案”对来教它。成百上千的标注员写了各种问题,然后由专家写出高质量的回答,把这些数据喂给模型:”看到这种问题,应该这样回答。”
第三阶段:RLHF(基于人类反馈的强化学习)
这是让 ChatGPT 真正”好用”的关键一步。研究人员的做法是:
- 让模型对同一个问题生成多个回答
- 人工标注员给这些回答打分(这个回答好,那个回答差)
- 训练一个”奖励模型”来模拟人类的评分标准
- 用奖励模型来自动训练 AI,让它学会生成”人类更喜欢”的回答
这个阶段让 AI 从一个”什么都会说但不知道什么该说”的模型,变成了一个”懂得分寸、尊重用户、拒绝有害请求”的助手。

四、Transformer——AI 真正的”发动机”
2017 年,Google 的研究人员发表了一篇论文《Attention Is All You Need》,提出了 Transformer 架构。在此之前的 AI 模型处理文本是一个词一个词地按顺序读,读到后面忘了前面,就像一个人读书只能记住最近三页。
Transformer 引入了一个叫做”自注意力”(Self-Attention)的机制,让模型在阅读每一个词时,都能同时”看到”这句话里的所有其他词,并判断哪些词跟当前词最相关。
举个例子。处理这句话:”猫吃了鱼,它很满足。”
当模型读到”它”这个字时,自注意力机制会回头看,发现”猫”和”它”的关联度最高(0.81),”鱼”次之(0.12),”满足”最低(0.03)。于是模型知道”它”指的是”猫”。
这个机制让模型能够理解长距离的依赖关系——即使两个词隔了 200 个词,只要它们语义相关,注意力机制就能捕捉到。
为什么 Transformer 这么成功
三个原因:
- 并行计算:不像 RNN 那样必须一个词一个词处理,Transformer 可以同时处理所有词,GPU 利用率极高,训练速度大幅提升。
- 长距离依赖:自注意力机制让模型能关联任意距离的两个词,不管它们隔多远。
- 可扩展性:Transformer 的架构让它天然适合”大力出奇迹”——更多数据、更多参数、更多算力,性能就会持续提升。这就是 Scaling Law(规模定律)。

五、Token——AI 的”基本单位”
AI 不直接处理文字,它处理的是 token。一个 token 大致相当于:
- 英文中,1 个 token ≈ 0.75 个单词
- 中文中,1 个 token ≈ 0.5 到 1 个汉字
比如”人工智能”在中文里是 4 个字,但可能被切成 2 个 token(”人工”+”智能”)。
Token 的数量决定了 AI 能”记住”多长的对话,这就是上下文窗口。GPT-4 的上下文窗口是 128K token,相当于能一次性处理大约 300 页的书。Claude 的上下文窗口是 200K token,甚至还支持 1M(百万 token)。

六、推理——AI 是怎么”想”出答案的
当你问 ChatGPT 一个问题,它并不是在数据库中搜索答案,而是真正地”计算”出答案。
过程是这样的:
- 你的输入被切成 token 序列
- 每个 token 经过嵌入层,变成一个高维向量(比如 12288 维)
- 向量经过几十层 Transformer,每一层都做自注意力计算和前馈网络处理
- 最后一层输出一个概率分布,预测下一个最可能的 token
- 把这个 token 追加到输入后面,重复步骤 1-4
- 直到预测出”结束”标记,或者达到最大输出长度
整个过程是确定的——同样的输入,同样的参数,输出一定相同。看起来”有创造力”,是因为把概率分布中不那么靠前的 token 也纳入考虑(这就是 temperature 参数的作用)。
Temperature 参数
temperature = 0 → 总是选概率最高的 token,回答稳定但可能重复
temperature = 0.7 → 适中的随机性,大多数对话的默认值
temperature = 1.0 → 较高的随机性,更有创意但可能胡说
temperature = 2.0 → 几乎随机,会输出乱码
这就是为什么同一个问题问 AI 两次,可能得到不同的回答——不是 AI 在”思考”,而是它每次在概率分布中随机采样。

七、幻觉——AI 为什么有时候”胡说八道”
AI 最让人头疼的问题就是”幻觉”——它会一本正经地编造不存在的事实、引用不存在的论文、甚至编出不存在的 API。
理解幻觉的根源,要从 AI 的工作原理出发:它不是一个数据库,不存储事实;它是一个概率模型,预测”什么词最可能接在现在这句话后面”。
当它被问到一个它训练数据中没有确切答案的问题时,它不会说”我不知道”,而是会生成一个”看起来很合理”的答案。这个答案语法正确、逻辑通顺,但事实可能是错的。
减少幻觉的几种方法:
- RAG(检索增强生成):先搜索相关文档,让 AI 基于文档回答,而不是凭”记忆”回答
- 要求引用来源:在 prompt 中要求 AI 标注信息来源,没有来源的不要编
- 让 AI 说”我不知道”:在 prompt 中明确告诉 AI,如果不确定就说不知道
- 用更低的 temperature:减少随机性,让 AI 输出更保守的回答
八、多模态——AI 正在长出眼睛和耳朵
2025 年的 AI 已经不只是处理文字了。GPT-4o 和 Claude 都能理解图片,一些模型还能处理音频和视频。
多模态的原理并不复杂:把图片、音频、视频也转换成向量(和文字 token 一样的形式),然后扔进同一个 Transformer 处理。这样,模型就可以”看懂”一张图片里的内容,然后在回答中引用它。
比如你拍一张冰箱内部的照片发给 AI,问”根据这些食材,能做什么菜?”AI 会先识别图片中的食材(鸡蛋、西红柿、青椒),然后结合它的烹饪知识,给你推荐菜谱。

九、AI 的未来——它正在走向哪里
Agent 智能体
2025 年最大的趋势是 AI Agent——不是被动回答问题,而是主动去执行任务。AI 可以自己写计划、调用工具、搜索信息、执行代码,然后根据结果调整策略,循环往复直到完成任务。
比如你说”帮我搭建一个博客”,Agent 会自己分析需求 → 创建项目 → 写代码 → 配置服务器 → 部署上线 → 告诉你网址。全程不需要你插手。
更长的上下文
上下文窗口从 4K 到 128K 到 1M 再到无限,每一次扩展都打开了新的应用场景。当 AI 能一次性读完你公司的全部文档,它就不再是一个工具,而是一个真正了解你业务全貌的伙伴。
更小的模型
不是所有 AI 都需要万亿参数。在手机上跑的 AI 正在变得越来越多——Apple Intelligence、三星 Galaxy AI,以及各种 7B、13B 参数的开源模型。它们不如 GPT-4 聪明,但在特定任务上已经够用,而且完全离线运行,数据不出手机。
总结
AI 的核心原理可以浓缩为一段话:
Transformer 架构让模型能同时关注一段文本中的所有词,通过海量数据训练出千亿级别的参数,这些参数捕获了语言的模式和世界的知识。推理时,模型根据上文逐词预测下一个最可能的 token,直到生成完整回答。
它不是魔法,不是意识,不是”理解”——它是一个极其复杂的数学函数,输入一串 token,输出下一串 token。但正是这个简单的原理,在足够大的规模下,涌现出了看起来像”智能”的行为。
理解原理不是为了成为 AI 研究员,而是为了更好用它——知道它为什么强,也知道它为什么出错,你就从”盲目崇拜”和”盲目怀疑”两个极端中走了出来,站在了真正驾驭它的起点。