面试表达
面试时怎么讲
一句话:我围绕「模型服务化与推理优化(vLLM 等)」做过从问题拆解、方案设计、工程落地到效果验证的闭环。
追问重点:为什么这么设计、指标怎么验证、失败案例如何定位、上线后怎么观测和回滚。
证据建议:准备 README、架构图、关键代码片段、评测表和 2 个坏例复盘。
从“能调用模型”到“能跑服务”:吞吐、延迟、显存、并发、成本与回滚策略。
本地学习进度
只保存在当前浏览器,不上传服务器。
学习产出
实战交付,P2。阅读时尽量把知识点转成可演示项目、面试回答和简历证据。
能回答
课程目标 / 指标小抄 / 10 天学习路径
能交付
整理一页项目笔记,记录问题、方案、指标和取舍
下一步
把本篇总结成 90 秒面试讲述
面试表达
一句话:我围绕「模型服务化与推理优化(vLLM 等)」做过从问题拆解、方案设计、工程落地到效果验证的闭环。
追问重点:为什么这么设计、指标怎么验证、失败案例如何定位、上线后怎么观测和回滚。
证据建议:准备 README、架构图、关键代码片段、评测表和 2 个坏例复盘。
简历表达
围绕 模型服务化与推理优化(vLLM 等) 场景,完成「从“能调用模型”到“能跑服务”:吞吐、延迟、显存、并发、成本与回滚策略。」相关能力建设,沉淀可复用工程方案、测试样本和面试表达材料。
| 指标 | 含义 | 优化方向 |
|---|---|---|
| TTFT | 首 token 时间 | 预填充、缓存、小模型预热 |
| TPOT | 每输出 token 时间 | 解码并行、量化 |
| 吞吐 | tokens/s | batch、连续批处理 |
| OOM | 显存溢出 | max_len、batch、量化、模型并行 |
inference-benchmark.md 初稿。model-calling-and-prompt-engineering 联动讲述。inference-benchmark.md:至少 3 组并发对比