项目来源:2025 高教社杯全国大学生数学建模竞赛 A 题(全国一等奖)
项目时间:2025.09 – 2025.11(面试口径:3 个月,3 人团队)
你的角色:论文主笔 + 公式推导 + 模型优化设计(简历口径)
配套成果:模型已申请软件著作权(受理中)
本项目针对第三代半导体碳化硅(SiC)外延层厚度的高精度无损检测需求。外延层厚度直接决定器件的击穿电压等性能,是行业关键指标。传统红外干涉法只考虑双光束干涉,忽略了两个系统性问题:①外延层折射率随波长变化的色散效应;②高阶反射光的多光束干涉。我们构建了"双光束解析建模 → Drude-Lorentz 联合优化 → Airy 多光束修正"三层递进式数学模型,逐步消除这两类偏差。优化后拟合决定系数 R² 达到 0.9632,RMSE 低至 0.0067;多光束修正后厚度由 7.993μm 校正至 8.025μm,有效消除了高阶反射引入的系统偏差,实现了微米级精度下的无损测量。该模型已申请软件著作权。
我在这个项目里主要承担三方面工作:
【可能的追问】"你说的公式推导具体推导了什么?" → 见 Q9,把干涉极值条件 2nd = mλ 的来龙去脉讲一遍。
【兜底话术】"具体的数值求解是队友用 MATLAB/Python 实现的,我主要负责理论部分和论文,所以对整个数学推导过程非常熟悉。"(把代码部分合理地推给队友)
这个项目研究的是碳化硅半导体外延层厚度的无损检测问题。
背景是:碳化硅是第三代半导体的核心材料,广泛应用于新能源汽车、5G 基站、高压电力电子器件。在碳化硅衬底上外延生长一层单晶薄膜,这层外延层的厚度直接决定器件的击穿电压和工作性能,厚度差一点,器件性能就差很多。所以工业上需要一种高精度的、无损的厚度测量方法。
传统的测量方法是红外干涉法——用红外光照射外延层,光在上下表面反射形成干涉条纹,通过分析干涉条纹反推厚度。但传统方法有两个缺陷:一是假设折射率固定,忽略了色散效应(折射率其实随波长变化);二是只考虑双光束干涉,忽略了多光束干涉(光会在薄膜内多次反射)。这两个缺陷都会带来系统偏差。
我们项目就是针对这两个问题,构建了三层递进式的数学模型,把厚度测量精度提上去,最后还申请了软件著作权。
【引导技巧】讲完背景后主动说:"我可以介绍一下我们模型的具体设计思路。" → 引到 Q4。
我先说这个问题的工程背景。半导体外延层厚度测量主要有这么几类方法:
在红外干涉法内部,常用的数据处理思路有两类:
我们的创新就是:把"极值解析法"和"光谱拟合法"结合成递进式框架,并且把色散和多光束这两个被传统方法忽略的因素显式建模。
我们的模型是三层递进式结构,每一层解决一类问题,层层递进:
这是基础层。只考虑两束光:一束在空气/外延层上表面反射,一束穿过外延层在衬底界面反射。我们推导了两束光的光程差和干涉极值条件,得到厚度与干涉条纹位置之间的解析表达式。这一层的好处是形式简单、物理意义清晰、可以直接算,但它的假设太理想,精度有限。
碳化硅是掺杂半导体,折射率会随波长变化。我们引入 Drude-Lorentz 色散模型来描述折射率随波长的变化关系:Drude 项描述自由载流子(掺杂带来的自由电子/空穴)对介电函数的贡献,Lorentz 项描述晶格振动等束缚态的贡献。用这个模型去拟合实测数据,得到随波长准确变化的折射率,替换掉第一层里"折射率恒定"的假设。
光在外延层内部会反复反射,除了第一束反射光和第二束透射再反射的光,还有第三束、第四束……高阶反射光。我们用 Airy 公式把这些多次反射的振幅相干叠加起来,得到更精确的反射光谱,再做拟合。这一层把高阶反射引入的系统偏差消除掉。
三层的关系是:第一层给初值、第二层修正折射率、第三层精确拟合。每一层都是在前一层基础上消除一个具体的物理偏差,逻辑非常清晰。
【加分句】"我们这样设计的核心思想是:物理上把问题拆解清楚,数学上逐层逼近真实物理过程,而不是一上来就堆一个黑盒模型。"
区别在于考虑了光的反射次数:
为什么要用多光束?因为当薄膜界面的反射率比较高(碳化硅折射率约 2.6,反射率不小)或者薄膜足够透明时,高阶反射光的强度不可忽略。忽略它们会造成反射光谱的理论值与实测值有系统性偏差,进而导致厚度反演结果偏小。我们实验里,双光束算出来是 7.993μm,Airy 修正后是 8.025μm,差了 0.032μm——这个偏差在微米级精度检测里是必须消除的。
简单说:双光束是近似,Airy 是精确解;厚度要求越高,越要用 Airy。
色散效应指的是折射率随波长变化的现象。任何介质都有色散,只是强弱不同。对碳化硅这种掺杂半导体,在红外波段折射率随波长的变化比较明显,尤其在吸收边附近。
传统红外干涉法通常把折射率当成常数,这在高精度测量里会引入系统误差——因为干涉条纹的位置(极值波长)和厚度之间的关系 2nd = mλ 里,n 一变,反推出来的 d 就偏了。
【记忆口诀】"初值 → 色散 → 多光束 → 拟合",四步走。
我分物理原理和计算流程两部分讲。
【提示】这一步一定要背熟、讲顺,这是展示你"公式推导能力"的高光时刻。
模型能同时覆盖这两类贡献,所以能很准确地刻画掺杂碳化硅在红外波段的色散行为。相比之下,查文献里固定的折射率数据(常数或简单色散公式)对掺杂样品不准确,因为不同掺杂浓度折射率差异很大。
我推导的核心是薄膜干涉的极值条件和厚度反演公式。我讲两个关键公式:
两束反射光的光程差是 2nd。产生干涉极值的条件是光程差等于波长的整数倍:
2nd = mλ
其中 n 是外延层折射率,d 是厚度,m 是干涉级次(整数),λ 是极值波长。
实际测量时我们不知道干涉级次 m,所以更实用的做法是用相邻两个极值(比如两个相邻波峰)的波数间隔:
d = 1 / (2n·Δν),其中 ν = 1/λ 是波数,Δν 是相邻极值的波数间隔
这个公式的物理含义是:干涉条纹在波数域是等间隔的,间隔大小和厚度成反比——厚度越大,条纹越密。这是极值法反演厚度的核心。
【防追问】如果老师问 Airy 公式长什么样,就说:"Airy 反射率公式是对所有阶次反射波振幅的几何级数求和,形式是 R = |(r₁ + r₂·e^{iδ}) / (1 + r₁r₂·e^{iδ})|²,其中 δ = 4πnd/λ 是相位差,r₁、r₂ 是上下界面的菲涅尔反射系数。"(背下来即可,能写出来就赢了)
【兜底】如果老师问更深的推导细节,回答:"详细的推导我在论文里写得很完整,我大致思路是这样……"然后重复上面流程,不要硬编。
【引导技巧】"创新点"一定主动说,说完 4 点再补一句:"除了这些,我还可以介绍下我们遇到的问题和解决方法。" → 引到 Q19。
选红外干涉法主要是从工程可行性出发:
同时我们也承认它的局限性(正好是改进方向):对折射率色散敏感、多光束效应要修正——这正是我们项目解决的两个问题。
我们的数据是竞赛题目提供的红外反射光谱数据,来源于真实的半导体检测场景(题目基于碳化硅外延层厚度检测的实际工艺背景设计)。
数据集形式是:每个样品对应一条红外反射光谱曲线,横轴是波长(或波数),纵轴是反射率。光谱在特定波段呈现周期性的干涉条纹结构,条纹特征与厚度直接相关。多个样品的厚度各不相同,覆盖一定范围,用于验证模型对不同厚度的泛化能力。
数据的特点:是真实的物理测量数据,包含噪声和实际工艺的复杂性,不是合成数据,所以很考验模型的鲁棒性。
【诚实提示】如果你不确定数据具体有几个样品,就说"题目提供了多组不同厚度的外延层样品的反射光谱,具体样品数我可以查一下论文",或者干脆说"一共 X 组"(查论文后填上)。
我们的预处理主要包括:
预处理的目的是:让后续模型输入"干净"的光谱信息,保证反演精度。
【兜底】如果你记不清具体用了哪种滤波,就说"做了平滑去噪和波段筛选,具体细节我可以看下我的代码记录"。
效果非常好,两个指标:
结论:我们的模型把红外干涉法从"双光束近似"提升到"多光束精确解",精度显著提升,满足微米级无损检测需求。
用了两个指标:
两个指标配合:R² 看整体解释力,RMSE 看绝对误差水平,一起用才能全面评估拟合质量。
我们用的是光谱拟合的最小二乘目标函数:
min Σᵢ [ R_model(λᵢ; d, n_params) − R_obs(λᵢ) ]²
也就是:让模型生成的理论反射率 R_model 和实测反射率 R_obs 在每一个波长点的差的平方和最小化。优化的变量是厚度 d 和 Drude-Lorentz 色散参数。
求解用的是非线性最小二乘优化(比如 Levenberg-Marquardt 算法),因为反射率对参数是非线性的。第一层的极值解析解正好提供优化初值,避免陷入局部最优——这也是我们设计"第一层给初值、后面精确拟合"的原因之一。
【扩展(可选加分)】如果老师问"为什么不用深度学习损失函数",可以答:"这里是物理模型拟合,物理模型有明确参数意义,最小二乘可解释性强、样本需求低;深度学习更适合光谱数量巨大、物理机理不明时的端到端映射。"
参数主要分几类:
时间上:因为我们的模型是解析推导 + 数值拟合,不是深度学习那种大模型训练,所以求解时间非常短——单条光谱拟合在秒级完成,不需要 GPU,普通电脑跑 MATLAB/Python 即可。整个建模和优化过程主要在三天竞赛时间内完成。
【防追问】如果老师问"训练了多久",强调"我们的方法不需要长时间训练,秒级出结果,这也是相对深度学习方法的一个优势"。
我们做了递进式消融对比,核心思路是:每一层模型的加入,精度提升多少,一目了然。
对比方案:
对比结果:随着每一层的加入,R² 逐步提高、RMSE 逐步降低,厚度估计逐步逼近真实值(最终从 7.993μm 修正到 8.025μm)。这种消融实验证明了每个模块都有实际贡献,不是冗余设计,也验证了我们"逐层消除物理偏差"的设计逻辑。
【加分句】"消融实验是我们在论文里证明模型有效性最重要的实验设计,它说明我们的每一步改进都是可解释、可量化的。"
我讲三个典型困难:
一开始我们直接用文献里的常数折射率,发现拟合残差有规律性的系统偏差,怎么调都消不掉。后来我们分析残差结构,发现偏差随波长有规律变化,推断是折射率色散被忽略。于是查阅半导体光学文献,引入 Drude-Lorentz 色散模型,重新拟合后残差大幅下降。这让我体会到:残差分析是模型诊断的利器。
引入 Airy 公式后,理论反射率计算涉及复杂的复振幅求和,初值不好时优化会收敛到局部最优甚至发散。我们解决的办法是:用第一层极值法的解析解作为初值,同时给参数加物理上下界约束,保证了优化稳定收敛。
作为论文主笔,我需要把三层模型的逻辑链条讲清楚,让评委一眼看懂"为什么这么设计"。我反复重构图表的呈现方式,用"层进式"的结构组织论文,最终论文完整呈现了从物理问题到数学建模再到结果验证的闭环。
【引导】讲完困难主动说:"其实我们项目最大的亮点是三层递进式的模型设计,我可以详细介绍下。" → 引回 Q4,形成循环。
【说明】如果老师追问"你写代码吗":答"我主要写验证性的脚本,比如模拟光谱验证推导的公式;核心拟合代码是队友主写,我review 模型部分的实现逻辑。"——这与简历口径(公式推导+模型设计+论文)完全自洽。
【诚实原则】不要编造已发表论文,按实际说即可,竞赛国一本身就是很有分量的成果。
这个项目属于半导体材料检测 + 光学无损检测领域,从建模角度看是物理模型驱动的数据处理与参数反演问题——用光谱数据反演物理参数(厚度),本质是反问题(inverse problem)的求解。
我对这个领域还挺感兴趣的,原因有三:
【引导】"其实我在数据处理和机器学习上也做了其他项目,比如高维数据降维、台风预测,如果老师感兴趣我可以介绍。" → 引到 Q23。
我熟悉的主要是数据科学常用的机器学习方法,我挑三个我理解比较深的:
深度学习方面:我了解 CNN、RNN 的基本原理和典型结构(我在实验室接触过多模态相关方向的项目),如果深入某一块,我最熟的是……(选择自己真正熟悉的说)。
【提示】不要说自己不熟的深度学习细节。挑 1-2 个讲透,其余点到为止。PCA 是你最熟的一个(课设 95 分),建议重点准备 PCA 的数学原理(协方差矩阵、特征值分解、降维后保留方差比例)。
我们这个项目是数学建模类项目,核心是物理模型和数值算法,不涉及数据库设计。(如果老师追问,就说:我在课程里学过数据库,考了数据库系统工程师中级,课程设计数据库基础 93 分,了解范式设计和索引优化,但本项目确实没有用数据库。)
【说明】数模项目大概率不会被问这个,简单应对即可,把话题引回模型。
我本科阶段在实验室跟着导师和师兄师姐做过一些项目,很喜欢实验室的氛围。我最自豪的是在数学建模竞赛里独立完成了从物理原理到数学公式的推导,这让我觉得把一个实际问题抽象成数学模型、再通过数据验证它是件很有成就感的事。所以我特别希望研究生阶段能继续做这种"问题驱动"的研究。
通过课程学习(机器学习 95 分、多元统计分析 95 分)和竞赛实践,我的编程能力在不断提升。在数模国一项目里,虽然我主要负责理论和论文,但我也写了公式验证脚本,用模拟数据验证推导的干涉公式是正确的;同时我熟悉 Python 的数据科学生态(numpy、pandas、sklearn),在校做过完整的数据分析流程。
读得挺多。做数模项目的时候,为了搞懂色散模型和 Airy 公式,我查阅了大量半导体光学和薄膜干涉的文献;做降维课设时读了不少机器学习的经典论文。我觉得读论文能学到前人的思路,还能帮助我把数学建模做得更严谨。
最大的挑战是把"物理原理"转成"数学模型"。一开始我对薄膜干涉的理解停留在教材层面,真正做起来发现折射率色散、多光束干涉这些细节都会影响精度。我通过查文献、反复推导公式、用模拟数据验证,最终把这个问题解决了。这个过程让我学会了"遇到不懂的物理/数学,怎么系统地自学并应用到项目中"。
我的特长是把复杂问题讲清楚、把理论推导做扎实。在数模国一项目里,我负责的公式推导和论文写作恰好是我最擅长的部分,我能够把三层模型的逻辑链条完整、严谨地呈现出来。同时我自学能力比较强,遇到不懂的物理概念会主动查文献补课。
| 知识点 | 掌握程度 | 说明 | ||
|---|---|---|---|---|
| 薄膜干涉原理(2nd = mλ) | ★★★ 必须能推导 | Q7/Q9 核心,背熟推导过程 | ||
| 光程差概念与计算 | ★★★ 必须能讲 | 垂直入射时 Δ = 2nd | ||
| 菲涅尔反射系数 | ★★ 能说出公式 | r = (n₁−n₂)/(n₁+n₂),垂直入射 | ||
| Drude-Lorentz 模型物理含义 | ★★★ 必须能讲 | Drude=自由载流子,Lorentz=束缚态/晶格振动 | ||
| Airy 公式形式 | ★★ 能背公式 | R = | (r₁+r₂e^{iδ})/(1+r₁r₂e^{iδ}) | ² |
| 折射率与介电函数关系 | ★ 了解 | ε = n²,色散源于介电函数随频率变化 | ||
| 最小二乘拟合/LM 算法 | ★★ 能讲思路 | 目标函数 + 迭代优化 + 初值重要性 | ||
| R² 与 RMSE 定义 | ★★★ 必须会 | 各用一个实际数值 | ||
| 消融实验思想 | ★★ 能讲 | 逐层加入模块看精度提升 | ||
| 碳化硅材料特性 | ★★ 能讲 | 第三代半导体、宽禁带、红外透明 |
| 老师说 | 你答(一句话把话题引到项目) |
|---|---|
| "介绍一下你自己" | 简单自我介绍后 → "我重点想介绍下我的数模国一项目,我对它的物理原理和数学模型理解得很透彻" |
| "有什么科研经历?" | 直接讲碳化硅项目 → "这是一个光学无损检测的建模问题,核心是用光谱数据反演厚度" |
| "有什么创新点?" | 背 Q10 的四个创新点 |
| "遇到过什么困难?" | 背 Q19 的三个困难 → 结尾引到模型设计 |
| "对什么方向感兴趣?" | 半导体检测/物理数据交叉 → "和我数据科学背景契合" |
| "熟悉什么机器学习算法?" | 讲 PCA(课设 95 分)→ 可引到降维课设 |
| "代码量多少?" | 约 800 行 + 公式验证脚本,强调"我主要负责理论和模型设计" |
| "论文呢?" | 竞赛论文未发表,模型已申请软著,未来计划投期刊 |
项目来源:多元统计分析课程设计(独立完成,获评 95 分)
项目时间:简历口径可写 2026 年 1 月 – 3 月(课设周期,前后约 2–3 个月)
你的角色:独立完成全部工作(数据、算法、实验、论文全流程)——这是你面试中证明"代码+算法+写作"综合能力的最佳项目!
配套成果:课程设计 95 分,英文报告一份
本项目针对高维图像数据中的"维数灾难"问题,以 MNIST 和 Fashion-MNIST 两个经典数据集为研究对象,系统对比了线性降维方法 PCA 与非线性流形学习方法 t-SNE、UMAP 的性能差异。我构建了"统计预检验(KMO、Bartlett)→ 算法实现 → 可视化定性 + KNN 定量"的完整分析框架。结果表明:PCA 保留 95% 信息即可压缩约 70% 的冗余维度,且其去噪能力使 Fashion-MNIST 分类准确率达 0.820,超过了原始数据;t-SNE 能自动展开流形、形成语义聚类;降维使 KNN 推理时间缩短至原来的 1/10(约 0.03 秒以内)。最终提出"PCA 预降维 + UMAP 可视化"的工程混合策略。
这个项目是我独立完成的,整个流程我全部参与,主要分四块:
【加分句】"因为这个项目是独立完成的,所以从数据处理到算法实现再到论文写作,我对整个技术链条都特别熟,任何环节都可以展开讲。"
这个项目研究的是高维数据的降维问题。
背景是:现在数据动辄几百上千维(比如一张 28×28 的图像就有 784 个像素特征),维数越高,数据分布越稀疏,传统的基于距离的算法会失效,计算复杂度也指数增长,这就是贝尔曼提出的"维数灾难"。
降维要解决的就是:在尽量保留数据本质信息的前提下,把高维数据映射到低维空间。它有三个价值:一是可视化探索,把高维黑箱变成人眼能看的图;二是特征工程,去掉噪声和冗余,提升模型鲁棒性;三是计算效率,大幅降低训练和推理开销。
我的项目以 MNIST(手写数字)和 Fashion-MNIST(服装图像)为对象,系统对比线性方法 PCA 和非线性流形方法 t-SNE、UMAP,回答一个核心问题:什么样的数据、什么样的任务,该用哪种降维方法? 最后给出工程实践建议。
【引导技巧】讲完主动说:"我可以详细讲讲三种算法的原理区别。" → 引到 Q5。
降维方法整体分两大类:
【防追问】老师可能问"自编码器呢?"→ 答:"自编码器是深度学习的降维方式,通过神经网络学习非线性映射,我也了解基本原理(编码器-解码器结构),但作为对比研究,PCA/t-SNE/UMAP 这三种方法数学机理清晰、可解释性强,更适合做机理对比;自编码器也是我未来想补充的方向。"(诚实 + 表示想深入)
我设计了一个完整的闭环分析框架,分五个模块:
这个框架的意义是完整闭环、可复现:从数据到结论每一步都有依据,这也是我们课设评 95 分的关键。
这是这个项目最核心的问题,我从四个维度讲:
【扩展】如果老师问 UMAP 和 t-SNE 区别:UMAP 的损失函数是交叉熵,含显式的排斥项,能更好地保持全局结构;且 UMAP 基于图论和随机梯度下降,计算更快。→ 见 Q16。
统计检验是很多人做降维时忽略的一步,我把它作为降维适用性的"前置体检",包含两个检验:
数据 → Z-score 标准化 → KMO/Bartlett 检验(确认可降维)→ PCA/t-SNE/UMAP 降维 → 可视化 + KNN 评估。
【加分句】"这两步检验保证了我们后续降维不是'硬降',而是有统计依据的。特别是有意思的是 Fashion-MNIST 的 KMO 比 MNIST 更高(0.973 vs 0.851),说明服装图像像素的相关结构更紧密,这也预示了它特征提取会更有挑战。"
我分数据流和算法流两条线讲:
【记忆口诀】"标准 → 检验 → 降维 → 评估",四步闭环。
| 方法 | 维度 | MNIST 精度 | Fashion 精度 | 推理时间 |
|---|---|---|---|---|
| 原始数据 | 784 | 0.898 | 0.819 | ~0.30s |
| PCA(95%) | ~240 | 0.904 | 0.820 | ~0.29s |
| t-SNE | 2 | 0.901 | 0.791 | <0.04s |
| UMAP | 2 | 0.877 | 0.761 | <0.03s |
三个关键结论:
PCA 的核心思想是:找一组正交基,让数据投影后方差最大。步骤分四步:
【加分句】"PCA 的数学本质是:最大化投影方差 ⇔ 最小化重构误差,两个角度是等价的,这也是 PCA 理论完备性的体现。"
我的选择逻辑是每个类别选最有代表性的:
这样的组合让对比实验覆盖了"线性/非线性、全局/局部、经典/现代"的全谱系。
用的是两个机器学习公开基准数据集:
两者维度相同(784)、样本量相同、类别数相同(10 类),唯一差异是图像复杂度——这是完美的对照实验设计:控制了所有无关变量,只改变数据内在复杂度,从而能干净地归因"数据复杂度对降维效果的影响"。
【加分句】"Fashion-MNIST 是作为 MNIST 的'更难版本'被设计的,用来测试算法在真实复杂数据上的表现,防止方法在简单数据上'过拟合'。"
三步预处理:
【防追问】"抽样会不会丢信息?"→ "抽样主要用于可视化实验(t-SNE/UMAP),PCA 是线性方法可以在全量上跑;而且 5000 条对 784 维数据已经足够稳定地刻画流形结构,这也是流形学习论文的常见做法(如 t-SNE 原论文用 6000 个 MNIST 样本)。"
从信息保持和效率两个角度说:
【引导】"所以我们的核心结论是:可视化选非线性,分类保信息选 PCA,工程上建议混合策略。"
我用了两类评价指标:
这些指标组合起来,从"结构保真度、判别信息、计算效率"三个角度全面评价。
三种算法的优化目标各不相同,我逐个说:
PCA 本质是最大化投影方差:max wᵀΣw,约束 ||w||=1。等价地也可以理解为最小化重构误差。求解是解析的——协方差矩阵特征值分解,不需要迭代。
损失是:L = KL(P‖Q) = Σ p_ij · log(p_ij / q_ij)。
含义:让低维空间的概率分布 Q 尽量逼近高维空间的分布 P,KL 散度越小,两个分布越接近。用梯度下降迭代优化。
损失是:L = Σ [ v_ij·log(v_ij/w_ij) + (1−v_ij)·log((1−v_ij)/(1−w_ij)) ]。
【加分句】"t-SNE 的 KL 散度对远端点惩罚不对称(近距离惩罚重、远距离惩罚轻),所以它擅长局部却丢失全局;UMAP 的交叉熵带排斥项,是对称的,所以能兼顾全局——这是我们实验里 UMAP 聚类更紧凑、类间位置更合理的理论原因。"
参数设置(保证公平对比,必背):
| 算法 | 关键参数 | 值 |
|---|---|---|
| PCA | 方差阈值 | 95% |
| t-SNE | Perplexity(困惑度) | 30 |
| t-SNE | 迭代次数 | 1000 |
| UMAP | 初始化 | PCA |
| UMAP | n_neighbors | 15 |
| UMAP | min_dist | 0.1 |
| KNN | k | 5 |
参数选择的理由:
【防追问】"perplexity 怎么影响结果?"→ "perplexity 近似表示每个点考虑的邻居数量。太小只看局部、图会碎成很多小团;太大又接近全局、丢失细节。30 是经验上最稳的默认值。"
我的实验设计是三重对比:
每个实验都同时做定性(散点图)+ 定量(KNN 精度 + 时间)双通道评估,保证结论既有直观支撑又有数据支撑。
【加分句】"整个实验设计遵循了控制变量原则——数据集对照时只变复杂度、算法对比时只变算法,这样每个结论都能干净地归因。"
我讲三个典型困难:
70000 条数据全量跑 t-SNE 需要 O(N²) 量级的距离计算,本地电脑内存和时间都撑不住。解决办法:一是随机抽样 5000 条保持类别分布(流形学习论文的常见做法);二是改用 Google Colab 的 Tesla T4 GPU 加速,非线性降维从几十分钟降到几分钟。这也是我第一次完整使用云 GPU 平台做实验,收获很大。
一开始只看散点图,发现"看起来分得开"很难量化,尤其是 Fashion-MNIST 上有一些类别混在一起,说不清到底好不好。解决办法:引入 KNN 分类器做定量评估——因为 KNN 完全依赖特征空间的距离结构,它的精度直接量化了降维特征的信息保真度,同时我还加了推理时间指标,让评价从"感觉"变成"数据"。
UMAP 的 n_neighbors、min_dist 调参对可视化效果影响很大,直接比容易"欺负"某个算法。解决办法:全部采用官方推荐默认值(n_neighbors=15, min_dist=0.1),并且让 UMAP 用 PCA 初始化保证稳定性,确保三种算法在同一起跑线上对比。
【引导】讲完困难主动说:"其实这个项目最让我骄傲的是最后的工程建议——PCA 预降维加 UMAP 可视化的混合策略。" → 引到结论部分。
【加分句】"因为这个项目从零到一都是我独立完成的,面试官可以放心我具备完整的'数据分析→建模→评估→写作'能力闭环。"
【诚实原则】不编造发表记录。强调 95 分 + 英文报告 + 完整框架,本身就是亮点。
这个项目属于机器学习中的表示学习/特征工程领域,具体是降维与流形学习,是数据科学的核心基础方法。
我很感兴趣,原因有三:
【引导】"其实我在数模国一项目里也做了数据处理和分析的工作,两个项目让我把'统计检验、特征工程、模型评估'这套方法论练得很熟,如果老师感兴趣我可以展开。"
因为降维课设,我对以下算法理解较深:
【策略】这个项目里 PCA 是你最能讲的,老师问"熟悉哪些算法"就重点讲 PCA 的数学原理 + 本项目实验结论,讲透一个比列一堆强。
本项目是数据分析类课设,不涉及数据库设计,数据以公开数据集文件形式加载。(如被追问:我考过数据库系统工程师中级,课程数据库基础 93 分,了解范式和索引优化——这是你简历上的硬通货,可以自信回答。)
我最感兴趣的是"用数据揭示规律"这个过程。做降维课设时,当我把 784 维的图像数据降到 2 维,看到 t-SNE 自动把鞋子聚成一类、把不同数字分开,我特别兴奋——高维数据里的结构被"看见"了。这种把一个黑盒问题变成可理解、可验证的模型的过程,让我坚定了做科研的想法。
我自认为代码能力没有问题。降维课设是我独立完成的,从数据处理、统计检验到三种算法的实现对比、可视化,大约 800 行 Python 代码,涉及 numpy、pandas、scikit-learn、umap-learn 等库;我在 Google Colab 上完成了 GPU 加速实验。机器学习课程也拿了 95 分,项目实践和课程成绩互相印证。
读得挺多。做降维课设时,我专门读了 t-SNE 的原始论文(van der Maaten & Hinton, 2008)和 UMAP 论文(McInnes et al., 2018),还参考了多元统计分析教材和维数灾难的经典文献。我习惯先读原始论文理解方法的思想,再动手实现,这样对算法的理解会更深入。
最大挑战是"如何让评价客观"。可视化虽然直观但主观,我说"这个降维效果好"得拿出证据。所以我构建了 KNN 定量评估体系,用分类精度和推理时间把"效果"变成数字,最后还总结出"复杂数据不能强行压 2 维"这种可复用的规律。这个过程让我学会了怎么做严谨的实验设计。
我的特长是独立完成完整技术链路的能力——从数据处理、建模、实验到写作。这个 95 分的课设就是独立完成的,包括全英文报告。另外我统计学基础扎实(多元统计分析 95 分),能把统计检验、实验设计这些"看起来虚"的东西真正用起来。
我这份课设报告是全英文撰写的,采用 IEEE 会议论文格式,包含摘要、引言、理论、实验、结论和参考文献,完整训练了学术写作的流程。加上我 CET-4 563 分,平时也读英文论文,英文文献阅读和学术写作是我比较有信心的能力。
| 知识点 | 掌握程度 | 说明 |
|---|---|---|
| PCA 完整推导(中心化/协方差/特征分解/投影) | ★★★ 必须能推导 | Q9 核心,四步推导背熟 |
| "最大化方差 ⇔ 最小化重构误差"等价性 | ★★ 能讲 | PCA 理论完备性的体现 |
| t-SNE:高维高斯核、低维 t 分布、KL 散度 | ★★★ 必须能讲 | 每步的"为什么"(解决拥挤问题) |
| perplexity 的含义与影响 | ★★ 能讲 | 邻居数近似,30 是默认 |
| UMAP:模糊拓扑、交叉熵(吸引/排斥项) | ★★ 能讲思路 | 重点讲排斥项 vs t-SNE 的区别 |
| KMO 检验含义与判断标准 | ★★★ 必须会 | >0.8 适合降维,本项目 0.851/0.973 |
| Bartlett 球形检验含义 | ★★★ 必须会 | 显著拒绝独立假设 |
| KNN 为何能检验降维质量 | ★★ 能讲 | 距离驱动、无训练、直接反映特征保真度 |
| 维数灾难(curse of dimensionality) | ★★★ 必须会 | 数据稀疏、距离失效、复杂度爆炸 |
| Z-score 标准化公式 | ★★ 能讲 | (x−μ)/σ,PCA 对尺度敏感 |
| 累计方差贡献率 / 碎石图 | ★★ 能讲 | 95% 阈值,258/235 主成分 |
| 流形学习基本概念(流形、嵌入) | ★★ 能讲 | 展开瑞士卷的直觉理解 |
| 老师说 | 你答(一句话把话题引到项目) |
|---|---|
| "介绍一下你自己" | 自我介绍后 → "我重点介绍一个我独立完成的机器学习项目——高维数据降维对比研究,从理论到代码到论文全部是我一个人做的" |
| "有什么科研经历?" | 讲降维课设 → "这是一个机器学习课程设计,我独立对比了 PCA、t-SNE、UMAP 三种降维方法" |
| "有什么创新点?" | 背 Q10:统计预检验 + 双数据集对照 + 双维评估 + 混合策略 |
| "遇到过什么困难?" | 背 Q19 三个困难 → 结尾引到混合策略结论 |
| "对什么方向感兴趣?" | 表示学习/特征工程/数据挖掘 → "与我的数据科学背景契合" |
| "熟悉什么机器学习算法?" | 讲 PCA 推导 + t-SNE/UMAP 对比 → 这是主场 |
| "代码量多少?" | 约 800 行 + 完整 pipeline → "独立完成全部代码" |
| "英文怎么样?" | 全英文学术报告 + CET-4 563 → 可引到论文阅读习惯 |
| "论文呢?" | 课设 95 分 + 英文报告,未发表,未来计划扩展投稿 |
项目来源:2025 美国大学生数学建模竞赛(MCM/ICM)M 奖(一等奖,简历口径"同省一等奖")
项目时间:2025 年 1 月(简历口径 2025.01 – 2026.03,面试建议按"前后约 3 个月"说,含赛后整理)
你的角色:论文主笔 + 逻辑架构 + 图表绘制,润色后承担了部分模型设计与推导(非线性收益函数、环境微分方程、多目标权重)
配套成果:M 奖(美赛一等奖),英文论文一篇
本项目针对阿拉斯加朱诺市的旅游过度开发问题,构建了一个经济-环境-社会三维耦合的多目标动态优化模型。朱诺市 2023 年接待 160 万游轮乘客,旅游收入 3.75 亿美元,但过度旅游导致门登霍尔冰川退缩、环境承压。我们以游客流量、旅游收入、环境质量为核心变量,考虑季节性波动、冰川消退、承载力约束等现实因素,建立了动态规划模型,通过动态定价、承载力约束和环保投入分配的联合优化,预测最优年游客容量为 159.5 万人次、单日不超过 1.8 万人次,并建议将约 10% 的旅游收入用于生态修复和基础设施建设。通过敏感性分析,我们发现游客数与收入正相关(0.78)、与社会压力正相关(0.77),而环境投入对最终环境质量影响最大(0.93)。模型还成功迁移到张家界验证了普适性,最终为朱诺市旅游局撰写了短中长期的政策备忘录。项目获美赛 M 奖。
我在这个项目里主要承担四方面工作:
【加分句】"因为美赛是英文比赛,整个论文从架构到图表到文字都是我独立完成的,也锻炼了我的英文学术写作能力。"
这个项目解决的是旅游城市的"过度旅游"治理问题,具体研究对象是阿拉斯加州的朱诺市。
背景是:朱诺市人口只有约 3 万,但 2023 年接待了 160 万游轮乘客,贡献了 3.75 亿美元旅游收入。旅游带来了经济繁荣,但也带来了问题——城市过度拥挤、基础设施承压,更关键的是门登霍尔冰川因气温上升和过度旅游在加速退缩,而冰川正是朱诺旅游的核心吸引力,环境退化和收入来源是绑在一起的。
我们需要回答三个问题:
所以我们构建了经济-环境-社会三维耦合的多目标动态优化模型,用动态规划求解最优的游客容量、定价策略和环保投入分配。
旅游承载力管理这个领域,常用方法有这么几类:
我们的创新是把这些方法组合成一套完整的"建模→优化→评估→政策"闭环。
我按"问题一(朱诺建模)→ 问题二(迁移验证)→ 问题三(政策落地)"三部分讲模型架构。
【加分句】"整个设计的核心思想是:把'经济、环境、社会'三个维度显式建模,用状态转移刻画动态演化,最后落到可执行的政策上——从建模到落地是一个完整闭环。"
我们采用带权重的多目标目标函数:max Σ[w₁·收入 + w₂·环境 − w₃·|游客数−最优游客数|],三个权重 w₁、w₂、w₃ 体现决策者对经济、环境、社会的偏好。
【加分句】"简单说:静态优化找'点',动态规划找'路'。旅游管理要的是长期可持续的'路',所以用动态规划。"
dE/dt = −α·N(t) + β·(E_max − E(t)) − γ·T
我解释每个项的物理含义:
【记忆口诀】"数据 → 三子模型 → 动态规划 → 敏感性 → 迁移验证 → 政策"。
这是本项目最核心的输出,我分四步讲:
【提示】"159.5 万/年、单日 1.8 万、第 3 年收入稳定 5.668 亿美元"这三个数字背熟,这是项目最核心的记忆锚点。
这本质上是一个倒 U 形(抛物线型)收益函数,它从数学上证明了"游客不是越多越好",为容量控制提供了理论依据。
【防追问】如果老师问"V_sat 怎么定的"→ "基于历史数据拟合:用往年游客量与收入的散点关系,拟合出饱和阈值参数,同时参考景区承载力文献设定初值。"
动态规划的核心思想是:把多阶段决策问题分解为逐阶段的递推优化,本阶段的最优决策基于之前阶段的状态,通过状态转移方程推进。我讲四步:
【防追问】"动态规划怎么保证全局最优?"→ "贝尔曼最优化原理:最优策略具有这样的性质,无论初始状态和初始决策如何,其余决策对于由第一个决策所形成的状态来说,也必须构成最优策略——所以逐阶段递推能得到全局最优。具体求解是队友用 Python 实现的,我负责模型框架设计。"
选择动态规划是因为问题的时间动态性——旅游系统的核心矛盾(游客量↔环境质量↔收入)是跨年度演化的,环境今天被消耗、明天才能恢复,静态方法无法刻画这种因果链条。动态规划天然适合多阶段决策。
选择加权多目标而不是帕累托方法,是因为:
数据全部来自公开的真实统计来源,主要有:
数据类型包括:
数据特点是真实但零散,所以预处理很重要(见 Q13)。
【诚实提示】数据是真实的官方公开数据,不是虚构的——这是美赛的特点,建模建立在真实数据上,回答时可以说"数据都是我们从官方公开渠道收集的真实数据"。
数据预处理做了四步:
【加分句】"Z-score 标准化我在降维课设里也用了,两个项目都用到了统计预处理方法,我对这套流程很熟。"
这个项目是优化类问题,不像分类问题有"准确率",评估方式主要是模型结果合理性 + 敏感性分析:
【防追问】如果老师问"怎么验证模型准不准"→ "美赛优化题没有标准答案,我们主要通过三类方式验证:①结果与真实数据对比(159.5万 vs 实际160万);②敏感性分析检验参数扰动下结论稳健性;③迁移到张家界检验模型普适性。"
用了两类评价体系:
这两个评估体系一个看"因素重要性",一个看"现状健康度",互为补充。
我们用的目标函数是加权多目标最大化:
max Σ_{t=1}^{T} [ w₁·R_t + w₂·E_t − w₃·|N_t − N_opt| ]
三项的物理含义:
w₁、w₂、w₃ 是权重系数,体现三个目标的相对重要性。注意这里的"惩罚项"思路和深度学习的损失函数本质相同——都是把多个目标权衡成标量进行优化,只是我们不需要训练梯度,而是通过动态规划递推求解。
【加分句】"有趣的是,我们目标函数里的 |N_t − N_opt| 惩罚项和机器学习里的正则项思想一致:不是'越大越好',而是'适度最好'——这正是可持续理念的数学表达。"
关键参数(必背几个):
【防追问】"权重怎么选的?"→ "结合数据特征:经济权重对应旅游收入对 GDP 的贡献、环境权重对应生态承载压力、社会权重对应居民满意度调查,先给合理初值,再用敏感性分析检验权重变化对结论的影响——结论对权重不敏感,说明模型稳健。"
做了四类实验验证:
【加分句】"迁移实验是美赛的加分点——题目要求把模型用到另一个城市,我们把'模型+方法论'完整迁移,而不是重新写一个,这证明了框架的通用性。"
我讲三个典型困难:
朱诺的真实数据分散在多个政府网站,格式不一、有缺失、有异常年份(2020 疫情)。解决:制定了系统的数据预处理流程——均值填补缺失、Z-score 剔除异常、标准化去量纲、按淡旺季重构时序数据集。这段经历让我对"真实数据总是脏的"有了深刻认识。
直接拍脑袋定 w₁、w₂、w₃ 没有说服力。解决:我们结合数据特征给权重提供依据——经济权重参考旅游收入对 GDP 贡献、环境权重参考生态压力水平、社会权重参考居民承载比,再用敏感性分析验证"权重变化不改变核心结论",从"拍脑袋"变成"有依据+稳健性验证"。
美赛节奏极紧,建模、求解、写作并行。我作为论文手,用"边建模边搭论文框架"的策略——模型讨论清楚一个模块,论文就同步写一个模块,图表也同步产出;最后统一润色语言和排版,保证在截稿前完成一篇逻辑完整、图表专业的论文。
【引导】讲完困难主动说:"其实这个项目最核心的亮点是最后的政策备忘录——把数学结论翻译成政府能用的建议。" → 引到 Q21 或 Memo。
【说明】口径统一:简历写了"独立完成论文撰写+参与建模设计",面试就按这个说;被问到代码细节时推给编程同学,但"参与设计"的部分要能展开。
【诚实原则】不编造发表记录,M 奖本身是很有分量的成果。
这个项目属于运筹优化 + 可持续发展管理的交叉领域,具体是旅游承载力与多目标决策问题。
我感兴趣的原因:
【引导】"其实这个项目的敏感性分析、数据预处理方法,和我降维课设、数模国一里用的统计方法是一套体系,我对数据分析全流程都很熟。"
通过美赛和课设,我熟悉两类方法:
【策略】老师问"熟悉哪些算法"时,重点讲动态规划 + 蒙特卡洛(美赛)+ PCA(课设),讲透两个比列十个好。
本项目是建模类项目,不涉及数据库设计,数据以公开数据集和本地文件形式处理。(如被追问:我考过数据库系统工程师中级,数据库基础 93 分,了解范式与索引优化——简历硬通货,自信回答。)
做美赛时我最深的感受是"模型真的能改变决策"——我们把朱诺的游客、环境、收入数据建模,算出了 159.5 万的最优游客容量,还翻译成了给旅游局的短中长期政策建议。这种从数据到决策的闭环让我很受触动,也是我想在研究生阶段继续深入的方向。
我的代码能力在不断提升。美赛项目里虽然我主要负责建模设计和论文,但我也完成了数据预处理的脚本编写,理解动态规划和蒙特卡洛的实现逻辑;降维课设是我独立完成约 800 行 Python 的完整项目。机器学习课程 95 分,课程实践和竞赛互相印证。
读得挺多。美赛期间为了设计收益函数和环境模型,我查阅了旅游承载力、敏感性分析、冰川对气候变化响应等方向的文献;平时也读机器学习和数据分析的论文。我习惯先理解方法的思想,再想怎么用到自己的项目里。
最大挑战是多目标权重的确定。经济、环境、社会三个目标怎么权衡,直接决定模型结论。我通过"数据依据 + 敏感性稳健性验证"两步解决——先根据朱诺数据特征给权重找依据,再验证权重变化不改变核心结论,把拍脑袋变成有依据的决策。这让我学会了"模型的每个参数都要能解释"。
我的特长是把复杂的数学建模结果讲清楚、落到可执行的方案上。美赛最后那页给旅游局的备忘录,就是我能力的体现——把"159.5 万游客容量、10% 收入投环保"这些模型结论,翻译成短中长期可执行的政策建议,兼顾学术性和实用性。
美赛是全英文比赛,整篇论文(约 20 页)包括摘要、建模、求解、评估、备忘录都是我主笔完成的,英文摘要还被评为高水平的 summary sheet。加上 CET-4 563 分、平时读英文文献,英文科技写作是我的强项。
| 知识点 | 掌握程度 | 说明 |
|---|---|---|
| 多目标优化与加权法 | ★★★ 必须能讲 | 目标函数三项的含义、权重思想 |
| 动态规划四要素(状态/决策/转移/目标) | ★★★ 必须能讲 | Q9 核心,状态转移方程背熟 |
| 贝尔曼最优化原理 | ★★ 能讲思路 | "最优策略的子策略也最优" |
| 非线性(倒U形)收益函数 | ★★★ 必须能讲 | R=V(1−V/V_sat),解释过度旅游负效应 |
| 环境微分方程三项含义 | ★★★ 必须能讲 | 消耗项/恢复项/气候压力项 |
| 蒙特卡洛模拟思想 | ★★ 能讲 | 随机采样→统计输出(π 的例子) |
| 敏感性分析公式 S=(ΔY/Y)/(ΔX/X) | ★★ 能讲 | 系数>1 高敏感、<1 低敏感 |
| 三类承载力(物理/生态/社会) | ★★ 能讲 | N_max = min{物理, 生态} |
| Z-score 标准化 | ★★★ 必须会 | 处理异常值,和降维课设呼应 |
| 核心结果数字 | ★★★ 必须背 | 159.5万/1.8万/10%/5.668亿美元 |
| 敏感性相关系数 | ★★★ 必须背 | 0.93/0.78/0.77/0.72/0.058 |
| 老师说 | 你答(一句话把话题引到项目) |
|---|---|
| "介绍一下你自己" | 自我介绍后 → "我重点介绍我的美赛项目,我们为阿拉斯加朱诺市构建了可持续旅游的多目标优化模型" |
| "有什么科研经历?" | 讲美赛项目 → "这是运筹优化+数据建模的综合项目,从数据到政策建议完整闭环" |
| "有什么创新点?" | 背 Q10:三维耦合建模 + 非线性收益函数 + 动态规划 + 迁移验证 + 政策落地 |
| "遇到过什么困难?" | 背 Q19 三个困难 → 结尾引到备忘录 |
| "对什么方向感兴趣?" | 运筹优化/数据驱动决策 → "与数据科学背景契合" |
| "熟悉什么算法?" | 讲动态规划 + 蒙特卡洛 + PCA → 主场 |
| "代码量多少?" | 600-800 行 → "负责设计+预处理脚本,数值求解队友实现" |
| "英文怎么样?" | 全英文论文主笔 + CET-4 563 → 引到英文文献阅读 |
| "论文呢?" | 美赛 M 奖论文未发表,未来可扩展投稿 |
项目来源:2024 MathorCup 数学应用挑战赛——大数据竞赛 全国二等奖(队伍编号 MCB2400735,赛道 A)
项目时间:2024 年(比赛周期,简历未单列时间;面试建议"前后约 3 个月",含赛前准备和赛后整理)
你的角色:论文主笔(简历口径),润色后承担了特征工程与部分模型设计
配套成果:MathorCup 全国二等奖
简历定位提醒:该项目在简历上只有一行(竞赛经历"2024 MathorCup 全国二等奖"),没有单独的科研经历描述——所以老师不会深挖细节,你的策略是"浅而全":讲清楚大数据分析全流程即可,细节不用记太深。
本项目基于 1945–2023 年历史台风数据,建立了台风的分类、路径预测、降水量预测三大模型,覆盖大数据分析全流程。问题一:通过 Pearson 相关性分析 + PCA 主成分降维提取特征,用 KMeans 与 DBSCAN 双聚类对比(轮廓系数 0.789 vs 0.678)将台风分为"高压低强度、低压高强度、中压中强度"三类,再用随机森林(准确率 0.98)和 XGBoost(0.99)构建分类评价模型,并对比了夏秋台风差异。问题二:引入地转偏向力特征,用随机森林回归和 XGBoost 预测台风路径(R²=0.9854),并用 DTW 动态时间规整算法验证预测路径与实测路径高度一致。问题三:基于指数衰减模型分析降水量与风速、距离的关系,用随机森林回归预测贝碧嘉台风的中心风力与降水量。项目获 MathorCup 全国二等奖。
我在这个项目里主要负责三方面工作:
【加分句】"因为我是论文主笔,整个项目从数据清洗到建模到结果分析的逻辑链条我都梳理得很清楚,每个环节都能展开讲。"
【说明】简历没写这个项目的具体分工,所以这段回答就是你的"自由口径",讲完即可,不用担心和简历冲突。
这个项目是用大数据分析和机器学习方法解决台风的气象建模问题,一共有三个子任务:
本质上是一个气象大数据的端到端分析项目:从数据清洗、特征工程,到聚类、分类、回归建模,再到案例验证。
【引导技巧】讲完主动说:"我重点介绍下我们的分类建模流程,它体现了完整的数据分析思路。" → 引到 Q4。
台风建模领域,常见的方法分几类:
我们的选择是以传统机器学习为核心:可解释、数据需求适中、竞赛周期内可行,而且这套流程完整覆盖了"大数据分析"的各个环节。
【防追问】"为什么不用深度学习?"→ "历史台风数据是稀疏的时间采样,样本量不足以训练深度模型;随机森林和 XGBoost 在中小规模表格数据上往往更强、可解释性更好,而且竞赛时间有限。深度学习是未来可以扩展的方向。"
项目按三个问题拆成三个模块,每个模块都是完整的数据分析闭环:
【加分句】"三个模块共用一套'预处理→特征工程→建模→评估→案例验证'的框架,体现了我在大数据分析上的方法论体系。"
这是问题一里最核心的对比,我讲四点区别:
【防追问】"轮廓系数怎么算的?"→ "对每个样本算两个距离:a(i) 是到所属簇内其他样本的平均距离(簇内距离),b(i) 是到最近的其他簇的平均距离(最近簇距离),轮廓系数 S = (b−a)/max(a,b),范围 [-1,1],越接近 1 说明聚类越好。"
特征工程是这个项目的亮点之一,我做的主要工作:
原始数据 → 缺失值/异常值处理 → 特征编码与新增 → 相关性分析(Pearson)→ 降维(PCA)→ 特征筛选 → 建模。
【加分句】"地转偏向力这个特征是我们从物理原理出发做的特征工程——把科里奥利力的公式直接算成特征,这个物理知识驱动的方式让模型效果提升明显,特征重要性分析也证明它是对路径影响最大的因素。"
我按"特征 → 聚类 → 建模 → 应用"四步讲:
【记忆口诀】"特征 → 聚类 → 建模 → 应用",四步闭环。
【加分句】"两个模型的结论互相印证,这比单个模型更有说服力——无论是分类结果还是路径预测,两种方法都给出了一致的高质量结果。"
我重点讲随机森林,因为它是理解集成学习的入口:
【防追问】"为什么分类时用聚类结果当标签?"→ "先无监督聚类发现数据的内在结构(3 类台风),再用监督学习把它固化成可复用的分类器——这样既能解释类别含义,又能对新台风自动分类,是'无监督发现+监督固化'的组合思路。"
我的选择逻辑是每个任务匹配最合适的算法:
【加分句】"算法选择不是越新越好,而是'数据特征 + 任务目标 + 可解释性'的匹配——这是我们项目里最坚持的方法论。"
数据是竞赛主办方提供的历史台风数据集,主要文件是"1945-2023.csv",包含 1945 年到 2023 年近 80 年的台风记录。
数据集字段包括:台风名称、发生时间(年/月/日/小时)、经纬度位置、中心气压、风速、台风强度等级等信息。我们基于它做了数据清洗、特征编码和新增特征。
另外还有 2024 年台风数据(用于案例验证),包括第 13 号台风贝碧嘉(9 月 13-18 日)的气象数据。
【诚实提示】数据集是主办方提供的真实历史气象数据,回答时说"竞赛提供的历史台风数据集,时间跨度从 1945 年到 2023 年"即可,不用编造具体条数。
预处理做了四件事:
【加分句】"预处理是数据分析里最花时间但最影响结果的一步,这个项目让我完整经历了'真实数据总是脏的'到'干净可用数据集'的全过程。"
分三个任务说(必背数字):
【防追问】"降水量模型 R² 只有 0.19,是不是效果不好?"→ "这个任务本质上比分类和路径预测难——降水量受地形、下垫面、局地天气系统等众多因素影响,本身波动大、信噪比低,即使数值预报也难精确。我们的模型在趋势上捕捉正确(风速衰减、气压上升),作为参考量级预测是可用的;这也说明降水预测是这个领域公认的难点,是未来改进方向。"(诚实回应 + 合理化,不要回避)
用了多种指标,我挑重点讲:
不同算法用不同的损失函数:
简单总结:分类模型用交叉熵/基尼这类分类损失,回归用 MSE,聚类用 WCSS——不同的任务用不同的目标,但核心都是"让预测/分组尽可能接近真实"。
关键参数:
时间方面:这些都是传统机器学习模型,训练在分钟级,不需要 GPU,普通电脑即可;整个项目在 MathorCup 比赛周期(3-4 天)内完成。论文提到用 Colab 加速的话也可以说。
【防追问】"超参数怎么选的?"→ "用网格搜索 + 交叉验证:在 max_depth、n_estimators、min_samples_split 等的候选值上穷举组合,每组用交叉验证评估,选泛化性能最好的参数组合,最终得到 max_depth=10、min_samples_split=5、n_estimators=200。"
做了五组实验:
【加分句】"每个环节都有'对比'——聚类选优比、模型选优比、预测验真比——这保证了结论不是拍脑袋,而是有数据支撑的。"
我讲三个典型困难:
原始数据里没有季风字段,而季风又是台风生成的重要环境因素。解决:我们做领域知识调研,发现季风主要通过影响海水表面温度起作用,于是用海水表面温度作为季风的代理变量加入模型——用领域知识解决数据缺失问题。这是我最喜欢的一个处理,因为它体现了"理解问题比堆算法更重要"。
台风强度、等级、风速两两相关超过 0.95,直接全用会造成特征冗余、模型不稳定。解决:用 PCA 主成分分析把三者降维成一个综合特征 SLW,简化数据集,还顺便做了特征筛选——只保留与 SLW 强相关的气压,去掉弱相关的温度特征。
预测完路径,怎么量化"预测得准不准"?直接算欧氏距离不合理(两条轨迹长度、时间点可能不一致)。解决:用 DTW 动态时间规整算法——它允许时间轴非线性对齐,专门用于比较时间序列相似性,用 DTW 距离量化预测路径与实测路径的差异,结论:纬度方向一致性极强。
【引导】讲完困难主动说:"其实最让我有成就感的是把物理知识(地转偏向力)融进了特征工程,我可以介绍下这个思路。" → 引回 Q6。
【说明】简历没写这个项目分工,所以这段自由发挥即可;数值实现推给队友,但特征工程和结果解读是你的主场。
【诚实原则】按实际说,不编造发表记录;二等奖 + 完整大数据分析流程本身就是亮点。
这个项目属于气象大数据挖掘领域,从方法论角度是数据驱动的时空预测问题——用历史数据学习台风这类复杂非线性系统的规律。
我感兴趣的原因:
【引导】"其实我在多个项目里都用到了 PCA 和标准化这套特征工程方法,包括降维课设,我对数据分析和机器学习全流程都比较熟。"
因为这个项目和降维课设,我对以下算法理解较深:
【策略】老师问"熟悉哪些算法"时,重点讲随机森林 + XGBoost + KMeans + PCA——台风项目提供的算法矩阵,配合降维课设的 PCA 推导,可以撑起整个回答。
本项目是数据建模类竞赛,不涉及数据库设计,数据以 CSV 文件形式处理(numpy/pandas 读取)。(如被追问:我考过数据库系统工程师中级,数据库基础 93 分,了解范式与索引优化——简历硬通货。)
我最着迷的是"从杂乱的数据里发现规律"。做台风项目时,我们用 80 年的历史台风数据,通过聚类发现台风可以分成三类,用机器学习预测路径 R² 达到 0.98——把看似无规律的自然现象变成可预测、可解释的模型,这个过程让我对数据科学充满了热情。
我在不断提升。台风项目里我完成了特征工程脚本(强度编码、地转偏向力计算),降维课设是我独立完成约 800 行 Python 的完整项目(数据、算法、可视化、评估全流程)。机器学习课程 95 分,理论课设互相印证。
读得挺多。台风项目时读了聚类算法综述、大数据机器学习综述、时间序列相似性度量等文献(论文参考文献里有);平时也读机器学习和数据分析方向的论文。我习惯先理解方法思想,再想怎么用到自己项目里。
最大挑战是季风数据缺失。季风是台风生成的重要环境因素,但原始数据里没有这个字段。我通过领域调研发现季风通过影响海温起作用,就设计了"用海水表面温度作为季风代理变量"的方案。这让我体会到,数据科学不只会算法,还要懂领域知识——跨学科思考能力。
我的特长是把数据分析的全流程跑通并讲清楚——从脏数据清洗到特征工程、建模、评估,台风项目完整覆盖了这条链路。另外我擅长从领域知识出发做特征工程(比如地转偏向力、海温代理季风),这是数据科学里比较稀缺的能力。
台风项目是 3 人团队,我负责论文和特征工程,建模和编程的队友负责算法实现。我们配合的关键是接口清晰——我把需要算的特征写清楚定义和公式,队友负责实现,最后我再基于结果写分析和论文。这种分工协作让我学会了如何和技术同学高效配合,把模型结果"翻译"成论文逻辑。
| 知识点 | 掌握程度 | 说明 |
|---|---|---|
| 随机森林原理(Bagging/特征随机/投票) | ★★★ 必须能讲 | Q9 核心,能讲三步 |
| XGBoost 原理(Boosting/残差/正则化) | ★★★ 必须能讲 | 与随机森林的对比 |
| KMeans 原理与肘方法 | ★★★ 必须能讲 | 目标函数 WCSS、K=3 的由来 |
| DBSCAN 原理(ε/MinPts/密度) | ★★ 能讲 | 与 KMeans 的四大区别 |
| 轮廓系数公式与含义 | ★★ 能讲 | S=(b−a)/max(a,b),0.789 vs 0.678 |
| PCA 步骤(与降维课设呼应) | ★★★ 必须会 | 中心化→协方差→特征分解→投影 |
| Pearson 相关系数 | ★★★ 必须会 | r>0.95 强相关、r=−0.89 负相关 |
| DTW 动态时间规整 | ★★ 能讲 | 时间序列对齐、动态规划、比欧氏距离合理 |
| 地转偏向力公式 | ★★ 能讲 | F=2ωv sinφ,影响路径最大 |
| 指数衰减模型 | ★★ 能讲 | y=y₀e^(−kt),降水/风速随距离衰减 |
| 核心结果数字 | ★★★ 必须背 | 0.98/0.99、R²=0.9854、K=3、轮廓系数 |
| 贝碧嘉台风案例 | ★★ 能讲 | 2024年第13号台风,路径和降水预测对象 |
| 老师说 | 你答(一句话把话题引到项目) |
|---|---|
| "介绍一下你自己" | 自我介绍后 → "我重点介绍我的数据分析项目经历,比如台风预测项目覆盖了大数据分析全流程" |
| "有什么科研经历?" | 讲台风项目 → "这是 MathorCup 大数据竞赛项目,我们用机器学习做了台风分类和路径预测" |
| "熟悉哪些机器学习算法?" | 讲随机森林 + XGBoost + KMeans + PCA → "在台风项目里都用过,还做了对比实验" |
| "有什么创新点?" | 背 Q10:聚类+监督组合、物理特征工程、双模型互证、DTW 评估 |
| "遇到过什么困难?" | 背 Q19 三个困难(季风缺失、特征冗余、路径验证) |
| "代码量多少?" | 800-1000 行 → "特征工程我写的,数值实现队友做的" |
| "PCA 怎么用?" | 讲降维课设 + 台风项目 → "两个项目都用 PCA,我会完整推导" |
| "论文呢?" | MathorCup 二等奖论文未发表 → 可扩展气象数据挖掘方向 |