大模型术语人话版:把LLM当成一个打工人
前言
大模型一年之内名词井喷:预训练、SFT、RAG、多模态、Agent……每个词都认识,连起来就看不懂。这篇用一个人话版的比喻把它们串起来——把大模型当成一个打工人,你会发现所有概念都顺理成章。
一、模型本体:这是个什么样的打工人
大模型:一个替代人来打工的打工人。知识工作者他基本都能替代——设计师、客服、文员,顶多缺点创意;体力活也能干,但需要一副好身体(机器人硬件)。
从头训练 / 自训练:他爸他妈自己在家教出来的小孩,没上过正经大学,学得好不好全看命(家里的经济水平和智力水平)。上限有限,顶天初中毕业。
预训练基座模型:正经大学毕业,三四年正统教育,全面素质培养过。不管后面干什么,起码学起来快。
开源大模型:大学毕业后自己找工作,简历上写会啥,懂行的老员工也知道怎么带。以后干什么,全看老板(部署方)安排。
闭源 / 商用大模型:自认为很强、不需要人带的员工。不找工作,只接项目。
二、参数量:他要多少工资
2.7B、7B、32B:参数量,数字乘以 10 亿。可以理解为工资要求——2.7B 是月薪 2700 的员工,有些天赋好的 2.7B 能干到 7B 员工的活,但没这个待遇(算力)他就不干活。比如 32B,最少得一台 32000 价位的电脑才跑得起来。
Llama、Qwen 这些名字:哪个学校毕业的——谷歌大学、阿里大学还是百度大学。学校有光环加成,但真正干活还得看「工作经验」(参数量),也就是职级。
三、能力进阶:毕业之后的深造
FT / SFT 微调(监督微调):大学毕业后又读了两年研究生,有导师带着系统学了某个领域,甚至做过项目——在这个领域可以发挥出比应届生更强的水平。
RAG(检索增强知识库):入职后单位老师傅手把手带了一段时间,把师傅会的能力都教给他。能力上限就在师傅附近上下浮动——除非这个毕业生天赋更高(参数更多,工资也更高)、名校毕业(预训练底子更好)。
垂直训练大模型:定向培养的大专生,自己领域有点基础,但天赋(参数量)一般,能力只在自己培养的方向上有积累,指望他干别的基本没戏。
四、部署形态:全职员工还是外包
本地大模型:公司雇佣的全职员工,用公司的电脑办公,基本上不会外泄公司机密(除非被网络攻击)。
云端大模型:公司请的咨询顾问或外包,自带电脑办公。外不外泄公司机密,全凭良心(其实是他所属公司的意愿)。
五、技能与协作
多模态大模型:一个模态就是一个技能——读写文档、画图、做视频、翻译。会多一个技能就叫多模态,比如能输入文字生成图片(文生图),就是个二模态大模型。
Agent 智能体:好几个员工组成的小团队或小部门。一个大模型当 leader,下面几个打杂的小弟,一个 agent 就是一个小弟。通过多个员工的分工协作完成一个具体项目。
Prompt 提示词:他拿到的员工手册和岗位职责。他基本按手册干活——手册写得越清楚,活干得越好。
推理:上级交代了一个任务,他根据自己的知识和领导的要求去做。领导的要求越有逻辑、越明确,他干得越好。
幻觉:他虽然不会,但是可以编,反正把事情糊弄过去就行。被发现了他就道歉。
术语速查表
| 术语 | 人话版 |
|---|---|
| 从头训练 | 在家教出来的,上限看命 |
| 预训练 | 正经大学毕业,底子好 |
| 开源模型 | 自己找工作,老板好带 |
| 闭源模型 | 不找工作,只接项目 |
| 7B / 32B | 月薪 7000 / 32000,待遇不够不干活 |
| SFT 微调 | 读了研究生,某个领域更强 |
| RAG | 老师傅带教,上限看师傅 |
| 垂直模型 | 定向培养的大专生 |
| 本地部署 | 全职员工,不泄密 |
| 云端 API | 外包顾问,全凭良心 |
| 多模态 | 多会几个技能 |
| Agent | 小团队,大模型当 leader |
| Prompt | 员工手册,写得越细越好 |
| 幻觉 | 不会就编,被拆穿就道歉 |
总结
这套比喻的精髓在于「按劳分配」:参数量对应工资(算力成本),预训练对应学历,微调和 RAG 对应入职后两种培养方式(上课 vs 师傅带)。选型时先问自己:这个岗位(场景)需要什么学历、什么工资的员工,要不要深造(微调),还是找个老师傅带一带(RAG)就够——答案自然就出来了。
- 原文作者:Anttu
- 原文链接:https://anTtutu.github.io/post/2024-04-19-llm-terms-plain-words/
- 版权声明:本作品采用知识共享署名-非商业性使用-禁止演绎 4.0 国际许可协议进行许可,非商业转载请注明出处(作者,原文链接),商业转载请联系作者获得授权。