大模型到底是如何学会说话的?一文看懂预训练
预训练到底在做什么?
想象一下,你把一个人关进图书馆,让他没日没夜地读书。没人给他出题、没人批改作业,他只是顺着文字往下看,自己猜下一个词应该是什么。
几年之后,他自然学会了语法、常识、逻辑,甚至能写出像模像样的文章。
大模型的预训练,本质上就是这件事。
关键点:不需要人工标注,模型从海量文本中自己学习规律。
为什么不需要标注?因为文本本身就是答案。让模型“猜下一个词”或者“填被遮住的词”,猜对了就是学到了,猜错了就调整参数。这种让数据自己当老师的训练方式,就叫自监督学习。
预训练、微调、推理分别是什么?
很多人把这三个阶段混在一起,其实它们分工非常清晰:
简单记:
- 预训练:埋头苦读,学会语言和世界知识。
- 微调:老师带着做真题,学会听指令。
- 推理:用户提问,模型作答。
我们平时用的 ChatGPT,是经历了“预训练 + 微调 + 人类反馈强化学习”之后才变成对话机器人的,不是一开始就会聊天的。
预训练方式
目前主流预训练方式有两种:
| 流派 | 代表作 | 核心玩法 | 擅长什么 |
|---|---|---|---|
| 自回归 | GPT 系列 | 预测下一个词 | 文本生成、对话、代码续写 |
| 掩码语言模型 | BERT 系列 | 预测被遮住的词 | 文本理解、分类、抽取 |
GPT 像写作文接龙,BERT 像做完形填空。今天我们见到的 ChatGPT、Claude、DeepSeek,走的都是 GPT 这条“接龙”路线。
GPT 是怎么训练的?
别被万亿 token 吓到,原理其实非常朴素。
BERT 又是怎么训练的?
BERT 的方式更像学生时代老师出的完形填空题:
训练数据从哪来?
一句话:几乎一切能读的文字。
预训练到底要多大算力?
规模大致是什么概念?
- 数据量级:万亿 token 起步
- 模型参数:几十亿到上万亿
- GPU 数量:数千到数万张 A100/H100
- 训练时间:数周到数月
所以预训练基本是大厂的牌桌,普通团队更多是在开源基座模型上做微调。
Scaling Law:越大越强,而且有规律
大模型领域有一个著名的发现,叫 Scaling Law(缩放定律):
Loss ≈ A / N^α + B / D^β + CN = 参数量D = 数据量α ≈ 0.076, β ≈ 0.095结论:模型扩大 10 倍 → 数据也要扩大约 10 倍→ 计算量扩大约 100 倍→ Loss 持续下降
通俗理解:只要你敢堆参数、堆数据、堆算力,模型能力就会稳定提升。这也是 OpenAI 当年敢于把 GPT-3 做到 1750 亿参数的理论底气。
预训练的工程流程
这不是写几行 Python 就能跑通的事,而是一个完整系统工程:
预训练有多烧钱?
- GPT-3 大约用了 355 GPU·年
- GPT-4 据传是 数万 GPU·年
- 电费 + 硬件 + 人力,整体成本 百万到亿美元
所以预训练这件事,拼的不仅是算法,更是工程、资源和资金。
预训练完,模型到底学会了什么?
预训练结束后的模型,通常叫 Base Model(基座模型)。它已经很强,但还“不会聊天”。
它能续写、能翻译、能写代码,但你问它“你好”,它可能回你一段 Wikipedia 式的定义,而不是自然打招呼。要让它变得“会聊天”,还得靠后面的 SFT 微调 和 RLHF 人类对齐。
整个技术栈里的预训练
LLM训练全流程
普通人能参与预训练吗?
看到前面动辄几千张 GPU、几个月训练、几百万美元,很多人可能会想:这事跟我有关系吗?
答案是:有,而且门槛比你想象的低。
你确实很难从头预训练一个 GPT-4,但并不意味着你只能当旁观者。普通人参与大模型赛道,至少有三条路:
1. 走微调路线,站在巨人肩膀上
开源基座模型已经非常多:Llama、Qwen、Mistral、DeepSeek-MoE……这些模型已经完成过昂贵的预训练,你可以直接拿来做微调。
- 数据:准备几千到几万条领域问答对
- 硬件:几张 3090 / A100 就能跑
- 工具:LLaMA-Factory、Axolotl、Unsloth 等框架已经把流程封装得很简单
花上几天时间,你就能做出一个“懂自己业务”的专属模型。
2. 做数据工程,这是被低估的入口
预训练质量很大程度上取决于数据。而清洗数据、构建高质量语料、设计指令数据集,恰恰是普通人最能发力的环节。
- 爬虫 + 清洗管道
- 去重、过滤、隐私脱敏
- 设计提示词模板、人工标注、质量评估
未来“AI 训练师”“数据工程师”这类岗位只会越来越吃香。
3. 用模型,而不是训模型
对大多数人来说,最有价值的参与方式是:把大模型用到自己的工作流里。
写代码、做文案、处理表格、做知识库、自动化客服……真正拉开差距的,不是你会不会训练模型,而是你能不能把它用得比别人更好。
预训练是大厂的战场,但应用和微调是每个人的机会。你不需要从头造一辆跑车,学会驾驶、改装、保养,已经足够让你跑在前面。
总结
一句话总结:
预训练,就是让模型在海量文本里做“完形填空”或“预测下一个词”的自监督学习。它学会了语言规律和世界知识,产出基座模型;基座模型再经过微调和人类对齐,才变成我们能对话的 ChatGPT、Claude、DeepSeek。
-
08.24
《龙魂旅人》玉藻前技能说明
-
08.24
《龙魂旅人》绝代妖狐·玉藻前上线时间说明
-
08.24
库洛澄清:刘慈欣未为《鸣潮》撰写大纲,网传合作系虚假信息
-
08.24
《洛克王国世界》PVP上分平衡队搭配推荐
-
08.24
Capcom在Steam平台推出前三款生化危机4:重制版游戏
-
08.24
Weibo Gaming携mindfreak领衔阵容回归
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏