What is Transformer?

本场45分钟的入门讲座,我们用直观、幽默、工程化的方式,带你看懂今天几乎所有主流大语言模型背后的核心架构。

Start

September 4, 2026 - 7:00 pm

End

September 4, 2026 - 8:00 pm

Address

Online Webinar   View map

Categories

中文公开课

Live 线上讲座

大语言模型入门:什么是 Transformer


数据应用学院(Data Application Lab)专注于数据科学,人工智能和大数据的职业教育, 每年向全球各地,包括硅谷和华尔街的知名企业输送数百 Data Scientists更有大量的 Data AnalystsBusiness Analysts,Machine Learning Engineers,Software Engineers 以及 Data Engineers。多年的钻研积累和专一打造了独一无二教学方法和求职经验。被多家北美英文科技媒体列为 Top 10 North American Data Bootcamp。学员遍布美国加拿大,还有来自欧洲, 澳洲和亚太等地的慕名者报名参加。


你每天都在听人说:大语言模型、ChatGPT、Agent、RAG、多模态、AI Coding……听起来好像 AI 已经进入了神仙打架的阶段。可是,如果有人突然问你:Transformer到底是什么? 你会不会瞬间 Transformer成为一个沉默的人?

别担心,这场45分钟的入门讲座,就是专门来解决这个问题的。我们不准备把Transformer讲成一场数学博士资格考试,而是希望用直观、幽默、工程化的方式,带你看懂今天几乎所有主流大语言模型背后的核心架构。

为什么Transformer这么重要?

因为今天GPT、Claude、Gemini、Llama等大语言模型,虽然性格不同、参数不同、训练方法不同,但它们背后的关键技术路线都与Transformer 密切相关。如果LLM是一辆超级跑车,那么Transformer就是你必须认识的发动机。很多人学习大模型时,一上来就研究Prompt、RAG、Agent,结果就像:已经开始研究自动驾驶了,但还不知道发动机为什么会转。这场讲座,我们就来打开引擎盖看看。

45分钟我们会聊什么?

1. 从一句话开始:LLM到底在干什么?
为什么大语言模型最核心的训练任务,可以简单理解为不断预测下一个 Token?模型到底是在思考,还是在做一个极其复杂的概率预测?
2. Transformer出现之前,AI是怎么处理语言的?
简单回顾 RNN、LSTM 的思路,以及为什么长文本、并行训练和长期依赖让传统方法越来越累。
3. Transformer 最关键的魔法:Attention
为什么一句话里的每个词都可以去“关注”其他词?Query、Key、Value 到底是什么?放心,我们不会让Q、K、V变成三个突然出现的陌生亲戚。
4. Self-Attention是怎么计算的
从Token → Embedding → Q/K/V → Attention Score → Softmax → 加权求和,用直观例子理解信息是怎样在Token之间流动的
5. 为什么要Multi-Head Attention?
一个Attention Head不够怎么办?那就多来几个。不同Head可以学习不同关系:语法、语义、指代、位置……有点像开会时终于允许大家从不同角度发言
6. Transformer 里面还有哪些关键零件
Positional Encoding、Feed Forward Network、Residual Connection、Layer Normalization,以及它们分别解决什么问题
7. Encoder、Decoder 和 GPT 有什么关系
为什么 BERT 更像“阅读理解高手”,GPT 更像“接着往下写高手”?Decoder-only 架构为什么成为现代生成式大模型的重要路线?
8. 从Transformer到今天的LLM
把Transformer和Prompt、RAG、Fine-tuning、Agent串起来,建立一张完整的大模型技术地图。

不需要先读完 Transformer原论文;不需要背矩阵求导;不需要拥有8张 H100;更不需要假装自己已经懂了。你只需要带着一个问题来:为什么 Transformer能让机器理解并生成语言

45分钟后希望你能做到
✓ 用自己的话解释Transformer是什么
✓ 理解Self-Attention、Q/K/V 和Multi-Head Attention的基本逻辑
✓ 看懂一张标准 Transformer 架构图,而不是看到图就开始寻找“关闭窗口”按钮
✓ 理解BERT、GPT与Encoder/Decoder的关系
✓ 为继续学习LLM、RAG、Agent、Fine-tuning 打下真正有用的基础

Transformer 并不神秘。它最精彩的地方,不是名字听起来像电影里的机器人,而是它改变了机器处理语言的方式,也直接推动了今天的大语言模型革命。

————————————-

主办方:数据应用学院

数据应用学院是北美首家集培训、项目实习和内推于一体的机构,我们的项目导向课程专注学员成果,并提供职业发展指导。感兴趣的小伙伴可以点击下面的链接,解锁更多专业技能:

在售录播课程列表:https://study.dataapplab.com/pages/home

数据科学家求职训练营精华课:https://study.dataapplab.com/course?courseid=dstraining

商业分析师求职训练营精华课:https://study.dataapplab.com/course?courseid=ba-training

MORE DETAIL

Phone

1-800-485-7918

Email

info@DataAppLab.com