返回招聘首页

模型微调、奖励模型与智能体学习

研究工程师 — 智能体学习与训练

使命: 用经核实的结果、经过设计的训练数据与独立评估中可衡量的提升,改进智能体与专用模型。

我们按实际项目需求推进招聘。欢迎就这些职位表达意向,具体招聘时间与工作范围将结合当前重点确定。

目前应用它的产品

智信

探索用于企业工作流决策、评分与验证的模型,使用获准的反馈,同时保留执行权限边界与人工复核。

智选

当独立评估表明优于现有模型基线时,探索用于证据评估与研究质量的专用模型。

你将做的工作

  • 从经授权、脱敏的工作流轨迹与人工核实结果中构建训练及偏好数据,记录来源,保持评估集独立。
  • 建立现有模型基线,在证据支持时通过监督微调、参数高效适配与蒸馏开发专用模型。
  • 在任务具有可靠反馈与受控评估环境时,研究用于智能体行为的奖励模型、偏好优化与强化学习。
  • 通过可复现实验与独立工作流测试比较训练方法,评估任务成功率、泛化能力、安全回归、推理延迟与成本。
  • 构建训练与推理流水线,维护数据版本、检查点与回滚路径;模型变更经审核与回归检查后再部署。
  • 与评估及系统工程师协作,把经核实的反馈变成经审核的改进。分离模型学习与实际执行,不把未经核实的智能体自评作为训练目标。

我们希望你能做到

  • 扎实的 Python 与 PyTorch 能力,有模型训练、调试与可复现实验管理经验。
  • 有语言模型微调或蒸馏实践,能够准备数据集,并相对基线衡量结果。
  • 理解优化、过拟合、数据污染与泛化,能够为声称的改进设计独立测试。
  • 能够构建与分析模型推理流水线,理解 GPU 显存限制,在模型质量、延迟与成本之间做出有效取舍。
  • 对授权、敏感数据、经核实反馈与自动评分的能力边界有良好判断。

有帮助的经验

  • 有奖励建模、DPO 等偏好优化,或基于可验证奖励的强化学习经验。
  • 有智能体训练环境、任务轨迹数据集、过程监督或从人工纠正中学习的经验。
  • 有分布式训练、参数高效适配、量化,或在受限算力预算内部署专用模型的经验。

为什么这份工作值得投入

  • 研究可靠反馈如何带来实用智能体行为的可衡量改进。
  • 选择最简单且有效的训练方法,并用实际工作流要求验证。
  • 与评估及系统工程师一起,从实验到经审核的发布,开发可复用模型能力。

如何申请

请发送简短自我介绍,以及相关代码、项目或作品集的链接;简历可选。说说你做了什么、排查过什么失败,以及如何验证结果是否有效。我们看重可证明的能力,不设特定学历或工作年限门槛。

邮件申请也可以直接写信至: contact@dpintelli.com

会打开你的邮件应用,并附上写给我们的预先准备的草稿。