返回博客
Galen Guan

AI 工程师面试新风向:深度拆解 35 家前沿公司题库与系统考察图谱

在过去的软件工程招聘中,LeetCode 算法刷题是通往大厂的标准门票。但在 AI 浪潮演进至今的当下,以 LLM 架构、RAG、AI Agent、推理加速与量化部署为核心的“AI 工程师”(AI Engineer / Applied AI / FDE)正在重塑整个技术招聘标准。

开源项目 pallavi-shekhar/ai-engineering-interview-questions-company-wise 汇聚了来自全球 35 家顶尖 AI 实验室、科技巨头及 AI 原生初创团队的真实面试考查点。

从这份题库可以清晰地看出一个趋势:业界对 AI 工程师的考察,早已脱离了单纯的“调 API”或“八股文背诵”,全面转向了对底层架构数学机理、GPU 硬件瓶颈、确定性系统工程与真实场景评估(Evals)的综合考核。


一、跨公司通识考点:AI 工程师的十维技能树

35 家前沿公司 AI 工程师面试考查矩阵

题库首先提炼了所有前沿团队在高频复现的十个核心能力模块:

1. LLM 底层架构与数学原理(Internals & Architecture)

  • Attention 缩放机制:推导 Scaled Dot-Product Attention 中 $1/\sqrt{d_k}$ 缩放因子的数学必要性(防止点积过大导致 Softmax 梯度饱和进入极小导数区)。
  • 显存瓶颈剖析:手写推导 KV Cache 在推理过程中的显存占用公式,解析长上下文下的显存爆炸机理。
  • 注意力架构演进:MQA(Multi-Query)与 GQA(Grouped-Query)的显存访存与模型表达权衡;DeepSeek 引入 MLA(Multi-head Latent Attention)进行低秩压缩的核心动机。
  • 位置编码进阶:从 Sinusoidal 到 Learned,再到 RoPE(旋转位置编码)以及 YaRN / NTK-aware 长度插值外推机制。
  • 基础组件细节:为什么 Modern Transformers 普遍采用 Pre-LayerNorm / RMSNorm;为什么 SwiGLU 替代了经典的 ReLU/GELU。

2. 推理、Serving 与 GPU 性能工程(Inference & GPU Performance)

  • Prefill 与 Decode 阶段解耦:为什么 Prefill 阶段受算力限制(Compute-bound),而 Decode 单步自回归受显存带宽限制(Memory-bandwidth-bound)。
  • 批处理技术:连续批处理(Continuous / In-flight Batching)对比静态批处理的调度优势。
  • 内存分页与缓存:PagedAttention 解决显存碎片的逻辑;Prefix Caching(Prompt 缓存)命中机制与失效场景。
  • 加速技术:推测解码(Speculative Decoding)的数学保真度边界;FlashAttention 的分块计算与 SRAM 访存优化(FLOPs 不减但速度倍增)。
  • 硬件级 Roofline 模型推算:给出硬件显存带宽(如 H100 3.35TB/s),手算 70B 模型在 Batch Size = 1 时的极限推导速度(Tokens/s)。

3. 检索增强生成(RAG & Retrieval)

  • 文档切分陷阱:长篇技术文档、法律条款与合同的语义切分策略(避免切断关键定义与语义单元)。
  • 混合检索与重排:BM25(稀疏)与向量检索(稠密)的结合条件;Cross-Encoder Reranker 的精度收益与时延代价。
  • 向量索引选型:HNSW、IVF-PQ 与 Flat 索引在召回率(Recall@k)、构建耗时与查询时延上的权衡。
  • 企业级权限感知:如何在检索阶段严格执行租户隔离与 ACL 权限过滤,杜绝未授权内容泄露。

4. 智能体与工具调用(Agents & Tool Use)

  • 经典模式:ReAct 对比单次 CoT 提示词的核心演进,ReAct 循环的单步故障处理。
  • 协议与模式:结构化输出(Structured Outputs)与函数调用(Function Calling)的本质区别;Model Context Protocol (MCP) 的架构意义。
  • 生产级防御:长程 Agent 循环的终止条件设定、Token 成本预算、无限死循环规避、可逆操作(Reversibility)与操作审计。
  • 人机协同:关键决策节点(如转账、删库、发邮件)的 Human-in-the-Loop 审批链路设计。

5. 微调、后训练与对齐(Fine-Tuning & Alignment)

  • 对齐演进史:全流程拆解经典 RLHF(Reward Model + PPO + KL Penalty)$\rightarrow$ DPO(直接偏好优化)$\rightarrow$ GRPO(Group Relative Policy Optimization,DeepSeek-R1 核心)。
  • 参数高效微调:LoRA 的低秩矩阵分解推导与 Rank 选取策略;QLoRA 的 4-bit NormalFloat 量化与双重反量化。
  • 决策框架:遇到业务场景时,Prompt vs RAG vs 微调的选择矩阵(附带成本与延迟指标)。
  • 强化学习新路径:RLVR(基于可验证奖励的强化学习)在代码与数学推理场景中的落地。

6. 评测与可观测性(Evaluation & Observability)

  • LLM-as-a-Judge 偏差修正:自选倾向、位置偏见(Position Bias)、长度偏见(Verbosity Bias)的校准策略。
  • 无真实标签下的评估体系:在专家成本高昂、缺少 Ground Truth 时如何构建高质量评测集(Eval Set)。
  • 生产断言与门控:如何构建 Prompt 或模型升级时的回归发布门控(Regression Gate)。
  • Agent 评估:单一回答准确率无法代表 Agent 能力,如何针对多轮工具调用、计划制定与任务完成度建立基准。

7. 安全、防御与责任 AI(Safety & Security)

  • 提示注入攻防:直接注入与间接注入(如读取带毒网页)的纵深防御体系。
  • 护栏架构设计:输入过滤(Input Filter)与输出过滤(Output Filter)的部署边界;Decoding 阶段干预 vs 生成后拦截。
  • 隐私与合规:在日志、Prompt 与微调语料中对 PII(敏感个人信息)的动态脱敏与治理。

8. 多模态与语音 AI(Multimodal & Voice AI)

  • 视觉语言集成:Projector 线性投影、Cross-Attention 交叉注意力与原生 Token 化的优劣比较。
  • 实时端到端语音 Agent 时延预算:VAD(静音检测)+ ASR(语音识别)+ LLM 生成 + TTS(语音合成)+ 网络往返的时延拆解(TTFA,Time-To-First-Audio)。
  • 语音打断机制(Barge-in):用户随时插话时的状态清空与音频推流重置。

9. AI 系统架构设计(AI System Design)

  • 代码补全助理系统设计:毫秒级上下文拼接、流式代码补全与无冲突局部 Diff 应用。
  • 统一 LLM 网关系统:支持多 Provider 动态路由、故障转移(Failover)、语义缓存(Semantic Caching)与配额限流。
  • 百万级 QPS 消费级 Chat 服务架构设计

10. 硬核算法与工程代码实现(Coding & Data Structures)

  • 从零实现带 Causal Mask 的 Scaled Dot-Product Attention。
  • 手写 KV Cache 与单步自回归解码(Single-Step Decode)。
  • 实现 BPE(Byte Pair Encoding)的分词训练与编码过程。
  • 编写并发受限、带随机抖动重试(Jittered Backoff)与错误隔离的异步 API 批量调度器。
  • 编写容忍任意网络分片边界的流式 SSE / JSON 解析器。
  • 实现一个具备工具分发、异常捕获与步数预算控制的最小 Agent 运行循环。

二、四大梯队公司的考查风格对比

题库覆盖了 35 家全球公司,依据技术路径与业务模式,呈现出鲜明的梯队特征:

  1. 前沿模型实验室(Anthropic, OpenAI, DeepSeek, Google DeepMind)
    • 极其硬核的底层实现与数学推导。深入考察张量维度、FlashAttention 分块、MLA 低秩投影、Prefill/Decode 物理集群拆分及 Constitutional AI 形式化验证。
  2. 科技巨头(NVIDIA, Meta, Tesla, Microsoft, AWS)
    • 关注超大规模工程极限与硬件亲和力。深入 CUDA Kernel、TensorRT-LLM 编译优化、TP/PP/EP 分布式并行、端到端自动驾驶(E2E)闭环与企业级多租户安全。
  3. AI 基础设施与平台商(Groq, Databricks, Perplexity, Hugging Face)
    • 关注硬件调度特性、秒级网络索引更新、多源引用精确度(Claim Attribution)与主流开源库源码级别的 PR 修改能力。
  4. AI 原生应用独角兽(Cursor, Cognition, Sierra, Harvey)
    • 极度贴近生产代码。包含真仓 Onsite 编程、从零手写轻量 Agent 循环、确定性商业规则护栏(如绝对禁止越权退款)与长程任务状态自愈。

三、2026 AI 面试三大底层趋势

  1. 允许(甚至强制)使用 AI 编程工具:考官直接评估候选人如何给 AI 提需求、如何验证生成代码、如何在发现逻辑漏洞时有效纠偏。
  2. Harness(工程框架底盘)比模型本身更重要:在实际业务中,决定 Agent 上限的是环境隔离、版本控制、状态记忆与自愈策略。
  3. 告别玄学,回归量化系统指标:拒绝空泛的提示词技巧,考察参数量/激活值显存占用、TTFT/TPOT 延迟指标与离线 Eval 回归测试门控。

延伸阅读与相关链接