同一个 Agent 项目,投阿里“智多星”的两份大模型评测实习时不能只换职位名。评测工程岗明确要求熟悉自动评测方法论,并具备基础服务或任务流开发能力;Agent/应用岗负责评测方案、Rubric、质检与归因,大模型评测、人评/自动评测经验属于加分项。两岗都面向本科及以上在读生。[1][2]
选岗可以从责任终点判断:评测工程岗要让任务稳定执行、能够重放和追溯;Agent/应用岗要让评测标准、问题归因和迭代结论值得相信。 这是从两份 JD 的职责边界提炼出的投递框架。[1][2]
先看你要对哪类错误负责
| 方向 | 主要防止什么出错 | JD 中的责任对象 | 最有说服力的项目证据 |
|---|---|---|---|
| 评测工程 | 同一任务换批次、并发或版本后跑不稳,失败无法恢复,结果不能复现 | 数据流水线、Bad Pattern、Rubric 合成、批量执行、并发、重试、Schema、版本与可观测性[1] | 一套能运行、回放和定位失败的评测系统 |
| Agent/应用评测 | 题目、Rubric 或标签测偏了,报告有数字却解释不了模型为什么失败 | 评测方案、评测集、标注规范、一致性与抽检、模型问题归因、指标追踪和项目协同;能看懂 API 调用链路日志和 Trace 为优先项[2] | 一份能校准标准、解释失败并推动迭代的评测报告 |
把两岗简化成“工程岗写代码、应用岗写报告”会漏掉关键职责。工程岗同样要从复杂案例中提炼规则和判断依据;应用岗明确要求大规模数据处理,并把能看懂 API 调用链路日志和 Trace 列为优先项。[1][2] 两份职位有明显交集,差别在于最后由你兜底的结果。
评测工程:先证明这次结果能被重新得到
评测工程岗把数据从采集、解析、清洗、标注一直跟到模型消费,还要维护 Bad Pattern、合成 Rubric,并参与 Rubric Judge 的开发与优化。[1] 工程门槛主要落在后半段:批量执行、并发控制、错误分类、重试恢复、Schema 校验、版本管理和运行可观测。[1]
因此,作品集不要只放一个总分和几张模型对比图。至少要让人看到:
- 输入可追溯:数据从哪里来,用了哪个版本,经过哪些清洗和筛选。
- 任务可恢复:批量任务在哪一步失败,如何分类、重试,哪些错误不能自动恢复。
- 规则可校准:Rubric 怎样拆成可验证的评分项,Judge 与人工判断不一致时如何处理。
- 结果可重放:换一个人、一次运行或一个模型版本,能否复现同一条结论。
如果你最强的经历是数据平台、自动化测试、Benchmark 或任务流开发,这个方向更容易把已有工程证据接上去。[1]
Agent/应用评测:先证明这份结论真的测到了目标能力
Agent/应用岗从方案设计、评测集构造一路做到执行、分析和报告,还要建立标注规范、Rubric、分类标签、一致性校验与抽检方案。[2] 发现问题后,职位要求进一步区分原因来自模型能力、评测标准还是任务定义,并追踪指标变化,指导后续迭代。[2]
“做过人评”还不够,你要能解释评测结论为什么可信。作品集可以保留:
- 场景矩阵:真实任务被拆成哪些场景,样本为什么这样抽取。
- 标准校准:Rubric 如何减少歧义,人评与自动评测如何检查一致性。
- 失败归因:从 Trace 中区分模型能力、工具调用、任务定义和评测标准问题。
- 决策闭环:哪条发现改变了数据、Prompt、工具或模型迭代,复测后发生了什么。
如果你是 Agent 或 AI 应用的重度用户,做过评测、用户研究或跨团队项目推进,并且更擅长把失败现象整理成可执行判断,这个方向更贴近你的优势。[2]
用同一个项目,也要交两种不同的首页
不必为了投递临时再做两个 Demo。选一个你最熟悉的 Agent 项目,先把共同底稿做扎实,再按主投方向调整第一页。
投评测工程,第一页先展示数据版本、任务拓扑、失败恢复和一次可重放记录;评测分数放在它们之后。投 Agent/应用评测,第一页先展示场景、Rubric、质量控制和一条完整归因;技术栈放在它们之后。
如果同一项目确实覆盖两类责任,也不要把材料拆成两个互不相干的故事。保留同一事实,只改变证据顺序和你承担的最终结果。这样比复制一份“熟悉 Prompt、会 Python、了解 Agent”的通用简历更容易被核对。
投递前做一次责任复盘
- 项目里最难的一次失败,是系统跑不稳,还是结论说不清?
- 你能拿出的最强证据,是运行记录、版本和恢复链路,还是场景、标准和归因报告?
- 面试官追问“为什么相信这个结果”时,你首先会解释执行过程,还是评测设计?
前一组选项更强,主投评测工程;后一组选项更强,主投 Agent/应用评测。两边都答不完整时,先补一条可复现的失败闭环,评测框架名称可以少写一些。
如果你的项目还停在产品流程、知识库和基础评测表,可以先看 B站 Agent 产品实习的项目证据怎么整理,再回来补工程可靠性或评测有效性这一层。
想继续看近期校园岗位,可以打开 JIA 校园岗位筛选;投递前仍应回到官方职位页核对最新状态。
边界
本文只比较两份在 2026-09-20 日内快照中新观察到的阿里校园职位;两份官方页面在 2026-09-22 晚间复核时仍可访问,页面均标注 2026-09-20 更新。[1][2] 这两份 JD 不能证明阿里全部评测岗位、招聘规模、录取难度、团队关系、薪酬、转正机会或公司整体 Agent 战略。
Sources
[1] https://campus-talent.alibaba.com/campus/position-detail?positionId=199909640003 — 阿里巴巴校园招聘:智多星-大模型评测(评测工程方向) [2] https://campus-talent.alibaba.com/campus/position-detail?positionId=199909680008 — 阿里巴巴校园招聘:智多星-模型评测(Agent / 应用方向)