返回招聘首页
目前应用它的产品
智信
为企业工作流开发评估能力:按任务要求检查产出、核实可观察的实际变化,在结果被采用之前发现失败。
智选
评估证据支撑、约束遵守与比较质量,覆盖相互矛盾的证据及没有合适选项的情况。
你将做的工作
- 把工作流要求转化为基准、评分标准与带版本的数据集,使用经授权、脱敏的案例和核实过的结果。
- 结合确定性检查、模型评判与人工复核,既验证可观察的任务结果,也评估智能体回答的质量。
- 依据独立人工标注校准评分器,衡量分歧、错误放行、不确定性,以及跨任务类型与语言的表现。
- 在实验表明确实优于简单基线时,通过提示词设计、微调或蒸馏构建专用评估模型。
- 研究评估偏差、提示注入、奖励投机与评估数据泄漏,保持留出的测试数据与开发、训练数据独立。
- 把评估接入回归检查与发布决策,提供可复现的运行记录及清晰的质量、延迟与成本报告。模型评分辅助复核,运行时权限仍由独立机制强制执行。
我们希望你能做到
- 扎实的 Python 工程能力、可复现实验与统计分析基础,能够表达不确定性,区分有效改进与实验噪声。
- 有大语言模型评估实践:数据集设计、评分标准、人工标注校准与任务执行轨迹分析。
- 使用过 PyTorch 或同类训练框架,有模型推理,以及现有模型微调或蒸馏经验。
- 能够区分可核实的事实或状态变化与主观判断,选择合适的验证方法。
- 重视企业敏感数据、标注质量、数据集版本管理,以及训练集与测试集的分离。
有帮助的经验
- 有偏好数据、奖励模型或步骤级验证经验,了解多语言与对抗性评估。
- 有参数高效微调、评估器校准或小型专用模型部署经验。
- 有评估流水线、可观测性工具、主动学习或人工复核界面经验。
为什么这份工作值得投入
- 定义智能体工作成功的标准,并用证据确认产品是否达到标准。
- 把模型研究与具体工作流失败、产品发布决策联系起来。
- 构建可以应用于企业自动化与选购研究的评估能力。
如何申请
请发送简短自我介绍,以及相关代码、项目或作品集的链接;简历可选。说说你做了什么、排查过什么失败,以及如何验证结果是否有效。我们看重可证明的能力,不设特定学历或工作年限门槛。
会打开你的邮件应用,并附上写给我们的预先准备的草稿。