学科详解:数据科学 Data Science
0. 速览 Quick Facts
| 项目 | 内容 |
|---|---|
| 学位类型 | BS(理科) / BA(文理) |
| 常见学制 | 4 年 |
| 学科本质 | 统计学 + 计算机科学 + 领域知识的交叉学科 |
| 适合学生 | 数学 + 编程双强、关心”数据如何落地成业务”、希望本科直接高薪就业 |
| 本科毕业直接就业 | 极多(科技公司、金融、咨询、零售都抢 DS 本科生) |
| 研究生方向宽度 | ⭐⭐⭐⭐(覆盖 CS / 统计 / 商业分析 / AI) |
| 国际学校推荐课程 | AP Calculus BC、AP Statistics、AP Computer Science A |
| 代表性强校(美) | MIT、Stanford、Berkeley、CMU、Harvard、NYU |
| 代表职业 | 数据科学家、数据工程师、ML 工程师、商业分析师 |
| 美本起薪(BS DS) | 约 130K(PayScale) |
| 研究生后起薪(MS DS) | 约 180K(科技公司) |
1. 专业定义与本质
1.1 数据科学是什么?
数据科学是研究如何从大规模、复杂、多源数据中提取价值的交叉学科,核心方法来自统计学与计算机科学,并紧密结合业务/科学领域知识。
数据科学可看作三大支柱的交集:
| 支柱 | 内容 | 占比(本科) |
|---|---|---|
| 统计学 / 数学 | 概率、推断、回归、贝叶斯、统计学习 | 约 35% |
| 计算机科学 | 编程、数据结构、算法、数据库、分布式系统 | 约 40% |
| 领域知识 / 业务 | 商业、健康、社会、金融等具体场景 | 约 25% |
1.2 数据科学不是什么?
| 误解 | 实际 |
|---|---|
| ❌ “数据科学 = 统计学的换汤” | ✅ DS 比统计重工程:大数据栈(Spark、Hadoop)、MLOps、数据管道都是统计不教的 |
| ❌ “DS = 调包侠,不用懂数学” | ✅ 顶级 DS 需要懂线性代数、概率、优化——否则只能做”调参工” |
| ❌ “DS = CS” | ✅ CS 关注计算本身,DS 关注用数据回答业务问题 |
| ❌ “AI 让 DS 失业” | ✅ AI 让 DS 生产力提升,但业务问题定义、数据管道、因果推断仍要人做 |
1.3 学科本质
数据科学培养的核心能力是:
- 数据工程:从乱七八糟的数据源中抽取、清洗、整合数据(ETL)
- 建模能力:选择合适的统计 / ML 模型,并知道何时不用模型
- 规模化思维:把分析扩展到 TB / PB 级数据(分布式计算)
- 业务沟通:把数据洞察翻译成业务决策
- 产品思维:把模型变成可上线的产品(API、应用)
DS vs 统计学的本质差异:统计学重方法严谨性(估计、推断、置信),DS 重工程能力 + 大规模数据 + 业务落地。统计学家关心”模型对不对”,数据科学家关心”模型上线后业务是否变好”。
2. 学科发展简史
| 时期 | 事件 |
|---|---|
| 1962 | John Tukey 提出”数据分析(Data Analysis)“这一独立领域 |
| 1974 | Peter Norgren 首次使用”Data Science”一词 |
| 1990s | 数据挖掘兴起;数据仓库(Kimball、Inmon)理论成熟 |
| 2001 | William S. Cleveland 发表《Data Science: An Action Plan》,提出 DS 作为独立学科 |
| 2008-2009 | DJ Patil(LinkedIn)、Jeff Hammerbacher(Facebook)正式使用 “Data Scientist” 作为职位 |
| 2010s | Hadoop / Spark 大数据生态爆发;深度学习革命(AlexNet 2012);Kaggle 成为 DS 竞赛中心 |
| 2013 | McKinsey 报告:美国面临 14-19 万数据分析人才缺口 |
| 2015 | 美国高校首批 DS 本科专业开设(MIT、NYU、Berkeley) |
| 2018-2020 | MLOps 兴起(mlflow、kubeflow);大模型(GPT-3)出现 |
| 2023-至今 | 大语言模型 + 数据科学融合:LLM 驱动的分析自动化、RAG、AI Agent |
当下的特殊机遇:数据科学正处于第二次革命——LLM 让”对话式数据分析”成为可能,DS 工程师正在把 LLM 集成到数据产品、AI Agent、企业 BI 中。这是未来 10 年最大的赛道。
3. 课程体系
3.1 本科核心课程(典型 DS 专业必修)
| 课程 | 难度 | 内容 |
|---|---|---|
| 微积分序列 Calculus I-III | ★★ | 单变量→多变量→向量微积分 |
| 线性代数 Linear Algebra | ★★★★ | 矩阵、SVD、PCA、神经网络的基础 |
| 概率论 Probability | ★★★★ | 随机变量、分布、极限定理 |
| 数理统计 Mathematical Statistics | ★★★★ | 估计、假设检验 |
| 编程入门 Programming(Python / R) | ★★ | 工作语言 |
| 数据结构 / 算法 Data Structures & Algorithms | ★★★★ | CS 基础(招聘硬门槛) |
| 数据库 Database / SQL | ★★★ | 关系型、NoSQL、数据仓库 |
| 机器学习 Machine Learning | ★★★★★ | 监督、无监督、深度学习 |
| 数据可视化 Data Visualization | ★★★ | Tableau / D3.js / Matplotlib |
| 大数据 / 分布式系统 Big Data | ★★★★ | Spark、Hadoop、云(AWS / GCP) |
| 数据伦理 / 公平性 Data Ethics | ★★ | 隐私、偏差、可解释性 |
3.2 选修方向(决定就业走向)
方向 A:机器学习 / AI
- 深度学习 Deep Learning
- 自然语言处理 NLP
- 计算机视觉 CV
- 强化学习 Reinforcement Learning
方向 B:大数据工程
- 分布式系统 Distributed Systems
- 数据管道 Data Pipelines(Airflow、Kafka)
- 云计算 Cloud Computing
- MLOps
方向 C:商业分析
- 商业智能 BI
- A/B 测试与实验设计
- 营销分析 Marketing Analytics
- 财务建模
方向 D:可视化 / 数据故事
- 交互式可视化 Interactive Visualization(D3.js、Observable)
- 数据新闻 Data Journalism
- 信息设计 Information Design
方向 E:领域数据科学
- 健康数据科学 Health Data Science
- 金融数据科学 Financial Data Science
- 社交媒体分析 Social Media Analytics
3.3 先修要求(高中阶段建议)
| 课程 | 必要性 | 备注 |
|---|---|---|
| AP Calculus BC | ⭐⭐⭐⭐⭐ | 必修 |
| AP Computer Science A | ⭐⭐⭐⭐⭐ | DS 第一道门槛是编程——Java / Python 入门 |
| AP Statistics | ⭐⭐⭐⭐⭐ | 统计思维提前训练 |
| AP Physics C | ⭐⭐⭐ | 培养建模能力 |
3.4 课程难度特征
- 大二数据结构 / 算法 是 CS 方向的”滤网”——LeetCode 中等题做不出来会影响招聘
- 大三机器学习 是 DS 方向的”滤网”——作业涉及数学 + 编程 + 调参
- DS 专业的 GPA 通常比 CS 略高、比统计略低
- 项目作品集(Portfolio) 是找工作的关键——GPA 3.5 + 3 个优质项目 > GPA 4.0 + 0 个项目
- 大量小组项目——培养协作、Git、Code Review 等工程能力
4. 主要分支方向
| 分支 | 简介 | 典型研究生方向 |
|---|---|---|
| 机器学习 | 监督 / 无监督 / 深度学习 / 强化学习 | CS / DS / AI MS / PhD |
| 商业分析 | A/B 测试、营销、运营分析 | MSBA(商业分析硕士) |
| 大数据工程 | 分布式系统、数据管道、MLOps | Data Engineering / CS MS |
| 可视化 / 数据故事 | 可视化设计、交互、信息呈现 | Information Science / 设计 |
| AI 研究 | 大模型、多模态、生成式 AI | AI / ML PhD → 科技公司 |
| 健康数据科学 | 电子病历、医学影像、生物信息 | Health Data Science MS / PhD |
| 金融数据科学 | 量化、风控、另类数据 | MFE / FinMath MS |
5. 适合什么样的学生?
5.1 兴趣特质
✅ 数据科学适合你,如果:
- 同时喜欢数学和编程——两者在 DS 里各占一半
- 关心”数据能解决什么业务问题”,而不只是”模型有多漂亮”
- 看到 Excel 表格会想”如果用 Python 处理这 100 万行能挖出什么”
- 看过《点球成金》《枪炮、病菌与钢铁》等用数据解释世界的作品
- 愿意持续学习——DS 工具栈每 2-3 年迭代一次
❌ 数据科学可能不适合你,如果:
- 只喜欢纯数学、讨厌写代码——考虑数学 / 统计更合适
- 只喜欢纯工程、不想学概率统计——考虑 CS 更合适
- 希望有”确定的答案”——DS 结论永远是概率性的
- 不愿意做数据清洗——真实工作 80% 时间在清洗数据
- 抗拒持续学习新技术——LLM / MLOps 等新栈会持续出现
5.2 能力要求
| 能力 | 重要程度 | 说明 |
|---|---|---|
| 编程能力 | ⭐⭐⭐⭐⭐ | Python / SQL / Scala,第一道招聘门槛 |
| 概率与统计 | ⭐⭐⭐⭐⭐ | 模型选择、评估的理论基础 |
| 线性代数 / 优化 | ⭐⭐⭐⭐ | 神经网络、PCA、推荐系统的底层 |
| 数据结构 / 算法 | ⭐⭐⭐⭐ | 大厂面试硬门槛 |
| 业务 / 沟通 | ⭐⭐⭐⭐⭐ | 把数据翻译成决策 |
| 工程能力 | ⭐⭐⭐⭐ | Git、Docker、云、CI/CD、MLOps |
| 好奇心 | ⭐⭐⭐⭐⭐ | 持续学习新工具、新方法 |
5.3 性格匹配
适合:INTJ、INTP、ENTJ、ISTJ(MBTI)——逻辑导向 + 工程导向,且有沟通能力 也适合:ENTP、INFJ——把数据用于解决社会问题、产品决策 不太适合:ISFP、ESFP——偏好即时反馈、对抽象 + 工程任务都缺乏耐心
6. 强校推荐
6.1 美国(DS / DS 相关方向强校)
| 排名(参考) | 学校 | 特色 | 适合方向 |
|---|---|---|---|
| 1 | MIT | IDSS(数据科学研究所)、EECS + ORC 顶级 | ML / 大数据 / AI 研究 |
| 2 | Stanford | 统计系 + CS 系双强,data.science.stanford.edu | ML / 统计学习 |
| 3 | UC Berkeley | CDSS(数据科学学院,全美第一个)、BIDS | 大数据 / DS 工程 |
| 4 | CMU | MCDS(MS in Computational DS)、PracML 顶级 | 应用 / 工程 |
| 5 | Harvard | 数据科学研究所(DSI)、与 MIT 联合 | 应用 / 健康 |
| 6 | NYU | Center for Data Science(CDS)全美最大 DS 中心之一 | ML / 大模型 |
| 7 | Columbia | Data Science Institute(DSI) | 应用 / 金融 DS |
| 8 | University of Washington | Allen School、eScience Institute | 大数据 / ML |
| 9 | UC San Diego | HDSI(Halıcıoğlu Data Science Institute)本科 DS 先驱 | 应用 |
| 10 | UMich | SI(信息学院)+ 数据科学本科 | 应用 / 信息 |
| 11 | UPenn | Wharton 的商务分析、MSE in DS | 商业分析 |
| 12 | Cornell | 信息科学 + 统计 | 信息科学 |
| 13 | Georgia Tech | OMSA(在线分析硕士)、计算 DS | 应用 / 在线 |
| 14 | UC Berkeley 另:Berkeley School of Information | MIDS 项目 | 应用 |
| 15 | Duke | 统计 + 历史 + 商业分析交叉 | 商业分析 |
本科申请提示:MIT、Stanford、Berkeley、CMU、Harvard、NYU 是 DS 本科”前六神校”。
6.2 英国
| 学校 | 特色 |
|---|---|
| Cambridge | 通过数学 Tripos / CS 路径接触 DS |
| Oxford | 统计系 + CS 系,有专门 DS 项目 |
| UCL | DS 中心、Gatsby 计算神经科学 |
| Imperial College | DS + 商业分析、金融 DS |
| Edinburgh | DS 本科专业、信息学院 |
本科申请提示:英国 DS 本科通常以 CS / 数学 / 统计名义招生,研究生阶段才有专门 DS 学位。
6.3 加拿大
| 学校 | 特色 |
|---|---|
| University of Toronto | Vector Institute、统计 + CS 联合 |
| Waterloo | DS 实习体系(Coop)全北美最强 |
| UBC | 数据科学硕士(MDS)项目 |
| McGill | 信息研究 + 统计 |
6.4 香港 / 新加坡
| 学校 | 特色 |
|---|---|
| HKUST | 商业分析 + DS |
| HKU | 数据科学本科专业 |
| CUHK | 数据科学本科 + 精算 |
| NUS | 数据科学与机器学习系(DSML) |
| NTU | 计算机科学中的 DS 方向 |
6.5 强校硕士项目(研究生参考)
| 项目 | 学校 | 学制 |
|---|---|---|
| MS in Data Science | NYU (CDS)、Stanford、Harvard、Columbia (DSI)、UC Berkeley (MIDS) | 1-2 年 |
| MS in Computational Data Science (MCDS) | CMU | 1.5 年 |
| MEng in Data Science | Cornell、Berkeley | 1 年 |
| MSBA(商业分析) | MIT (MBAn)、Wharton、Tepper (CMU)、UT Austin | 1 年 |
| MSE in Data Science | UPenn (MSE-DS) | 1.5-2 年 |
7. 高中阶段准备(9-12 年级)
7.1 推荐课程
| 年级 | 数学课程 | 编程 / CS | 其他 |
|---|---|---|---|
| 9 年级 | Algebra II / Pre-Calculus | Python 入门(Codecademy、自学) | AP 物理 1 |
| 10 年级 | AP Calculus BC(争取 5 分) | AP Computer Science A / 自学 Python 项目 | AP Statistics |
| 11 年级 | AP Statistics、多变量微积分 | 数据结构自学、USACO Bronze/Silver | AP Physics C |
| 12 年级 | 线性代数(社区大学或在线) | 机器学习入门(Coursera - 吴恩达 ML 课) | AP 经济学 |
7.2 推荐竞赛(按重要性)
| 竞赛 | 难度 | 含金量 |
|---|---|---|
| Kaggle 竞赛 | ★★★ | DS 方向最对口的竞赛——真实数据、真实问题、全球排名 |
| USACO(USA Computing Olympiad) | ★★★★ | 编程算法竞赛,DS / CS 通用硬通货 |
| HiMCM(高中生数学建模) | ★★★★ | 用数据建模解决真实问题 |
| AMC 10/12 | ★★ | 数学基础证明 |
| AIME | ★★★★ | AMC 顶尖选手的下一关 |
| ** Conrad Challenge**(创新 + 创业) | ★★★ | 可做数据驱动的项目 |
| Microsoft Imagine Cup / Google Code Jam(已停) | ★★★★ | 工程 + 算法 |
7.3 推荐夏校
| 夏校 | 主办 | 时长 | 录取难度 |
|---|---|---|---|
| Stanford AI4ALL | Stanford | 3 周 | ⭐⭐⭐⭐⭐ |
| MIT Beaver Works Summer Institute | MIT | 4 周 | ⭐⭐⭐⭐⭐ |
| COSMOS | UC 系统 | 4 周 | ⭐⭐⭐⭐ |
| NYU CSI(Cyber Security)/ DS Camps | NYU | 2-4 周 | ⭐⭐⭐ |
| Berkeley Data Science Summer | Berkeley | 4-6 周 | ⭐⭐⭐⭐ |
| Pioneer Academics | 在线科研(可做 DS / ML 方向) | 12 周 | ⭐⭐⭐⭐ |
7.4 推荐科研方向(11-12 年级)
- 社会数据:Twitter / Reddit 情感分析、舆论挖掘
- 健康数据:COVID-19 公开数据建模、医院就医模式
- 体育数据:NBA 球员效率、足球战术分析(Moneyball 方向)
- 商业数据:电商用户行为预测、价格弹性建模
- 环境 / 气候:极端天气预测、能源消耗优化
- NLP / 大模型:用 LLM API 做问答系统、文本分类
- 计算机视觉:图像分类、人脸识别(注意伦理)
可发表 / 可写入申请的成果:
- 个人项目作品集(GitHub + 个人网站)——比 GPA 更重要
- Kaggle 竞赛铜牌以上
- 在 arXiv / 学生期刊发表论文
- 开发一个数据驱动的 Web 应用(Streamlit、Hugging Face Space)
- 给学校 / 社区做的数据咨询报告
7.5 推荐阅读
- 《Python 数据科学手册》Jake VanderPlas —— DS 入门技术书
- 《统计学习导论》James, Witten, Hastie, Tibshirani(ISLR)—— ML 入门圣经
- 《数据科学实战》O’Neil & Schutt
- 《大数据时代》Viktor Mayer-Schönberger
- 《点球成金》Michael Lewis —— 用数据颠覆行业的故事
- 《人类简史》Yuval Noah Harari —— 不是 DS 书,但训练”用证据看世界”
8. 研究生方向
8.1 直接对口
- 数据科学 MS —— 1-2 年,就业导向(NYU CDS、Berkeley MIDS、Columbia DSI)
- 计算机科学 MS(AI/ML 方向) —— 1.5-2 年
- 商业分析 MSBA —— 1 年,就业导向
8.2 跨学科(DS 本科的优势地带)
| 研究生方向 | 为什么 DS 背景吃香 |
|---|---|
| 计算机科学 MS | DS 本科已修大量 CS 课,转型容易 |
| 统计学 MS | 数学 + 统计基础扎实 |
| AI / ML PhD | 已有 ML 基础 + 工程能力 |
| MBA | 业务理解 + 数据能力 = 数据产品经理 |
| 生物信息学 MS | 数据 + 生物学(需补生物课) |
| 运筹学 / Industrial Engineering | 优化、模拟、供应链 |
| Health Data Science MS | 医疗数据、临床试验 |
| 公共政策 MS | 政策评估、因果推断 |
⭐ DS 本科最大的优势:直接就业最容易(科技公司、金融、咨询、零售都招),起薪高于统计、接近 CS。研究生是”加分项”而非”必需品”。
9. 就业前景
9.1 主要职业方向
| 职业 | 起薪(美) | 路径 |
|---|---|---|
| 数据科学家 Data Scientist | 170K | DS BS → 科技公司(最直接路径) |
| 数据工程师 Data Engineer | 180K | DS BS + 强工程 → 科技公司 |
| 机器学习工程师 ML Engineer | 220K | DS BS → MS / 直接工作 → 科技公司 |
| AI 研究员 AI Researcher | 300K+ | DS BS → PhD → OpenAI / DeepMind / Anthropic |
| 商业分析师 Business Analyst | 120K | DS BS → 咨询 / 零售 / 快消 |
| 数据产品经理 Data PM | 200K | DS BS → MBA / 直接晋升 |
| 大数据架构师 Big Data Architect | 250K | DS BS + 多年工程经验 |
| 数据科学经理 DS Manager | 300K+ | DS BS + 5-10 年经验 |
9.2 代表雇主
- 科技公司:Google, Microsoft, Apple, Meta, Amazon, Netflix, LinkedIn, Uber, Airbnb, Spotify, TikTok
- AI 公司:OpenAI, Anthropic, DeepMind, Hugging Face, Cohere, Mistral
- 金融:Goldman Sachs, JPMorgan, Two Sigma, Citadel, Jane Street, DE Shaw
- 咨询:McKinsey, BCG, Bain, Deloitte(数据咨询)、Palantir
- 零售 / 电商:Walmart, Target, Shopify
- 医疗 / 健康:IQVIA, Flatiron Health, Tempus
- 政府 / 非营利:USA Data Services、UN、World Bank
9.3 薪资水平
| 阶段 | 年薪(美元) |
|---|---|
| DS BS 毕业(直接工作) | 130K |
| DS BS + MS(科技公司) | 200K |
| DS BS + 5 年经验(科技公司) | 350K |
| 顶级 AI 公司研究员(5 年经验) | 1M+ |
| 顶级量化基金数据科学家 | 800K+ |
关键洞察:DS 本科是起薪最高、就业最广的几个本科专业之一。AI 大爆发让 ML 工程师 / AI 研究员需求激增,LLM + 数据科学是未来 10 年最大的赛道。
9.4 行业趋势
- LLM + DS 融合:用大模型做对话式分析、RAG 系统、AI Agent
- MLOps 兴起:模型部署、监控、版本管理成为独立岗位
- 数据工程需求上升:模型依赖高质量数据管道
- 数据伦理 / 公平性:算法偏见、可解释性、隐私
- AI for Science:用 DS 加速药物发现、材料科学、气候研究
10. 本专业 vs 相关专业
| 维度 | 数据科学 | 统计学 | 计算机科学 | 数学 |
|---|---|---|---|---|
| 核心 | 数据 + 工程 | 数据推断 | 计算、算法 | 抽象、证明 |
| 思维 | 工程 + 统计 + 业务 | 经验 + 不确定性 | 工程 + 数学 | 公理化 |
| 本科就业 | 强(⭐⭐⭐⭐⭐) | 强(⭐⭐⭐⭐) | 最强(⭐⭐⭐⭐⭐) | 较少(⭐⭐) |
| 起薪 | 130K | 95K | 140K | 90K |
| 研究生选择 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| AI / ML 友好度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ |
| 商业落地友好度 | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ |
决策提示:如果你”数学 + 编程双强 + 想本科直接就业”——DS 是最佳选择。 如果你”更重方法严谨性 + 想读博”——统计 / 数学更合适。 如果你”想做大规模系统、不关心业务”——CS 更合适。 如果你”想保留最多研究生选择”——数学最宽。
11. 常见误区
误区 1:DS = 调包侠,不需要懂数学
❌ 只会 import sklearn 的 DS 是”调参工”,可替代性高。
✅ 顶级 DS 需要懂线性代数、概率、优化——否则无法选择模型、诊断问题、设计实验。OpenAI、DeepMind 的研究员中数学 / 统计 / CS PhD 比例极高。
误区 2:DS = CS 的一个分支
❌ CS 关注计算本身(算法、系统、理论),DS 关注用数据回答业务问题。
✅ DS 多了统计、可视化、业务、领域知识——CS 出身的人做 DS 往往需要补统计和业务理解。
误区 3:DS 本科不需要读研
❌ 部分对——DS 本科直接就业最容易,但AI 研究、ML 工程师高级岗位通常需要 MS / PhD。
✅ 决策逻辑:进科技公司做 DS / DE → 本科够用;做 ML 研究、AI 研究员 → 至少 MS,最好 PhD。
误区 4:AI / 大模型让 DS 失业
❌ AI 让”低端 DS”(基础报表、调参)面临压力,但业务问题定义、数据管道、因果推断、MLOps 仍需要人。
✅ 顶级 DS 正在用 LLM 把自己生产力放大 10 倍——AI 时代,懂 LLM 的 DS 是最稀缺的人才,而不是被淘汰的人才。
误区 5:AP Computer Science A 5 分 = 大学 DS 很简单
❌ AP CS A 只覆盖 Java 基础 + 简单数据结构。
✅ 大学 DS 还要学算法分析、分布式系统、机器学习、统计推断——这些课的难度远超 AP CS A。
12. 延伸阅读
推荐书目
| 类型 | 书目 |
|---|---|
| 技术入门 | 《Python 数据科学手册》Jake VanderPlas |
| ML 入门 | 《统计学习导论》James, Witten, Hastie, Tibshirani(ISLR) |
| 实战 | 《数据科学实战》O’Neil & Schutt |
| 思想 | 《点球成眼》Michael Lewis |
| 大数据 | 《大数据时代》Mayer-Schönberger |
| 伦理 | 《算法霸权》Cathy O’Neil |
| 因果 | 《The Book of Why》Judea Pearl |
推荐网站 / 频道
- StatQuest with Josh Starmer(YouTube)—— 统计 / ML 概念可视化
- 3Blue1Brown(YouTube)—— 线性代数、神经网络视觉化
- Andrej Karpathy(YouTube)—— 从零构建 GPT、神经网络
- Kaggle Learn —— 实战 DS / ML 免费课程
- Fast.ai —— 实用深度学习课程
- Hugging Face Course —— 大模型 / Transformers 课程
- Towards Data Science(Medium)—— DS 博客
推荐公众号 / 博客
- Simply Statistics(Rafa Irizarry 等)
- Analytics Vidhya
- KDnuggets
- Hugging Face Blog
- OpenAI Blog / Anthropic Blog
13. 给国际学校学生的建议
9-10 年级
- 把 AP Calculus BC 修完,争取 5 分
- 修 AP Computer Science A——这是 DS 的第一道门槛
- 学 Python(Codecademy、DataCamp、自学)
- 参加 HiMCM / Kaggle 入门竞赛(Titanic 等)
- 读《点球成金》《人类简史》——培养”用证据看世界”
11 年级
- AP Statistics + 多变量微积分 / 线性代数
- 上吴恩达的 ML 课(Coursera)或 Fast.ai
- 参加美国计算机奥林匹克(USACO)—— Bronze → Silver
- 在 Kaggle 上做 2-3 个项目,争取铜牌
- 申请 MIT BWSI / Stanford AI4ALL / Berkeley DS Summer 夏校
- 开始一个有业务价值的个人项目(Web App + 数据 + ML 模型)
12 年级
- 写好”为什么选 DS”的申请文书
- 强调用数据解决具体问题的经历(项目、Kaggle、竞赛)
- 准备一个个人作品集网站(GitHub + 链接到 3 个项目)
- 选校:1-2 所冲刺(MIT / Stanford / Berkeley / CMU)、2-3 所匹配、1-2 所保底
- 考虑双学位或辅修:DS + 统计、DS + 商业、DS + 健康科学
⭐ 关键提醒:DS 专业申请,个人项目作品集 + Kaggle 竞赛 + GitHub 活跃度比 SAT 数学满分重要 10 倍。一个有 100 stars 的 GitHub 项目,胜过 SAT 1600。