返回招聘首页

评判模型、验证器与评估体系

研究工程师 — 智能体评估

使命: 让智能体质量可衡量:开发能够核查证据、评估工作成果,并指出何时需要人工复核的评估工具与模型。

我们按实际项目需求推进招聘。欢迎就这些职位表达意向,具体招聘时间与工作范围将结合当前重点确定。

目前应用它的产品

智信

为企业工作流开发评估能力:按任务要求检查产出、核实可观察的实际变化,在结果被采用之前发现失败。

智选

评估证据支撑、约束遵守与比较质量,覆盖相互矛盾的证据及没有合适选项的情况。

你将做的工作

  • 把工作流要求转化为基准、评分标准与带版本的数据集,使用经授权、脱敏的案例和核实过的结果。
  • 结合确定性检查、模型评判与人工复核,既验证可观察的任务结果,也评估智能体回答的质量。
  • 依据独立人工标注校准评分器,衡量分歧、错误放行、不确定性,以及跨任务类型与语言的表现。
  • 在实验表明确实优于简单基线时,通过提示词设计、微调或蒸馏构建专用评估模型。
  • 研究评估偏差、提示注入、奖励投机与评估数据泄漏,保持留出的测试数据与开发、训练数据独立。
  • 把评估接入回归检查与发布决策,提供可复现的运行记录及清晰的质量、延迟与成本报告。模型评分辅助复核,运行时权限仍由独立机制强制执行。

我们希望你能做到

  • 扎实的 Python 工程能力、可复现实验与统计分析基础,能够表达不确定性,区分有效改进与实验噪声。
  • 有大语言模型评估实践:数据集设计、评分标准、人工标注校准与任务执行轨迹分析。
  • 使用过 PyTorch 或同类训练框架,有模型推理,以及现有模型微调或蒸馏经验。
  • 能够区分可核实的事实或状态变化与主观判断,选择合适的验证方法。
  • 重视企业敏感数据、标注质量、数据集版本管理,以及训练集与测试集的分离。

有帮助的经验

  • 有偏好数据、奖励模型或步骤级验证经验,了解多语言与对抗性评估。
  • 有参数高效微调、评估器校准或小型专用模型部署经验。
  • 有评估流水线、可观测性工具、主动学习或人工复核界面经验。

为什么这份工作值得投入

  • 定义智能体工作成功的标准,并用证据确认产品是否达到标准。
  • 把模型研究与具体工作流失败、产品发布决策联系起来。
  • 构建可以应用于企业自动化与选购研究的评估能力。

如何申请

请发送简短自我介绍,以及相关代码、项目或作品集的链接;简历可选。说说你做了什么、排查过什么失败,以及如何验证结果是否有效。我们看重可证明的能力,不设特定学历或工作年限门槛。

邮件申请也可以直接写信至: contact@dpintelli.com

会打开你的邮件应用,并附上写给我们的预先准备的草稿。