温馨提示:
全部机会 / 新事业生态圈 / 卡奥斯平台 / 工业AI / 数据评测与性能提升高级工程师
机会编号:JD10231053
数据评测与性能提升高级工程师 薪资面议
北京市 · 硕士及以上 · 3年以上
2026-09-15
刘先生 | liubo.cosmo@haier.com
收藏 我要推荐
职责描述
1.评测体系构建与Benchmark基线制定:主导面向工业AI各方向(大模型、视觉、预测等)的评测体系设计与建设,覆盖模型效果、鲁棒性、泛化能力、响应延迟等多维度指标。制定统一的Benchmark基线标准,从公开数据集和工业实际场景收集、清洗、标准化测试数据集,构建3000+数据量级的高质量测评库。设计分层次评测方案(L1/L2/L3),覆盖基础能力、场景泛化、极限边界等不同级别的测试要求。
2.大规模自动化评测流程建设:构建大规模自动测评流程,支持多模型批量测试、指标自动计算、性能趋势分析与问题定位。设计自动化回归脚本体系,配合CI/CD流水线实现模型版本迭代的自动回归验证,确保模型质量不退化。建立标准化测试集维护机制,包括数据集版本管理、标注一致性核查、测试用例持续扩充。
3.模型效果分析与优化闭环:对模型评测结果进行深度分析,定位效果瓶颈(数据处理、模型选择、超参配置等环节),输出可执行的优化建议。建立Agent驱动的自动评测与实验反馈闭环,将任务理解、动作选择、确定性工具执行、实验反馈和自动评测组织为可迭代流程。跟踪模型在多任务、多场景下的性能分布,识别长尾失败模式,推动针对性优化。
4.模型质量管控与鲁棒性验收:制定工业场景模型上线前的质量验收流程,包含准确性、稳定性、对抗鲁棒性、边界条件等多维度验收标准。设计对抗测试、压力测试、异常输入测试等鲁棒性验证方案,确保模型在真实工业环境中稳定可靠。
5.异构GPU适配与性能监控(协同):协同团队完成模型在异构工业级GPU(NVIDIA/Ascend等)上的适配评测,输出各平台的性能基准报告。参与模型推理性能监控体系(K8s集群监控),持续跟踪线上模型推理延迟、吞吐与资源利用率。
2.大规模自动化评测流程建设:构建大规模自动测评流程,支持多模型批量测试、指标自动计算、性能趋势分析与问题定位。设计自动化回归脚本体系,配合CI/CD流水线实现模型版本迭代的自动回归验证,确保模型质量不退化。建立标准化测试集维护机制,包括数据集版本管理、标注一致性核查、测试用例持续扩充。
3.模型效果分析与优化闭环:对模型评测结果进行深度分析,定位效果瓶颈(数据处理、模型选择、超参配置等环节),输出可执行的优化建议。建立Agent驱动的自动评测与实验反馈闭环,将任务理解、动作选择、确定性工具执行、实验反馈和自动评测组织为可迭代流程。跟踪模型在多任务、多场景下的性能分布,识别长尾失败模式,推动针对性优化。
4.模型质量管控与鲁棒性验收:制定工业场景模型上线前的质量验收流程,包含准确性、稳定性、对抗鲁棒性、边界条件等多维度验收标准。设计对抗测试、压力测试、异常输入测试等鲁棒性验证方案,确保模型在真实工业环境中稳定可靠。
5.异构GPU适配与性能监控(协同):协同团队完成模型在异构工业级GPU(NVIDIA/Ascend等)上的适配评测,输出各平台的性能基准报告。参与模型推理性能监控体系(K8s集群监控),持续跟踪线上模型推理延迟、吞吐与资源利用率。
任职要求
学历 硕士及以上
工作经验 3年以上
任职资格 "1.硕士及以上学历,计算机、人工智能、软件工程、数学等相关专业,211/双一流院校优先。
2.3年以上AI算法或模型评测相关经验,有华为等头部企业AI研发经验者优先。
3.具备大规模Benchmark建设和评测流程设计经验,有1000+数据集量级自动测评实操经历;精通Python和PyTorch,熟练编写自动化训练、测试与回归脚本;熟悉LLM Agent评测方法,有Agent轨迹跟踪、自动评测、效果量化分析的实际经验;了解AutoML、模型推荐、集成学习等自动化建模方法,具备实验链路设计与数据分析能力。
4.熟悉CI/CD流水线、Linux开发环境,具备良好的代码规范与文档输出能力。
5.加分项:有OmniTableBench、GLUE、SuperGLUE、MMLU等大型Benchmark建设经验;在多模态、表格学习、时序预测等方向有模型评测和效果分析的实战经验;有跨团队协作推动评测标准落地的经验,能推动各算法团队统一评测规范;在ICLR/NeurIPS/ICML等顶会或ACM Computing Surveys级别期刊有论文发表。
工作经验 3年以上
任职资格 "1.硕士及以上学历,计算机、人工智能、软件工程、数学等相关专业,211/双一流院校优先。
2.3年以上AI算法或模型评测相关经验,有华为等头部企业AI研发经验者优先。
3.具备大规模Benchmark建设和评测流程设计经验,有1000+数据集量级自动测评实操经历;精通Python和PyTorch,熟练编写自动化训练、测试与回归脚本;熟悉LLM Agent评测方法,有Agent轨迹跟踪、自动评测、效果量化分析的实际经验;了解AutoML、模型推荐、集成学习等自动化建模方法,具备实验链路设计与数据分析能力。
4.熟悉CI/CD流水线、Linux开发环境,具备良好的代码规范与文档输出能力。
5.加分项:有OmniTableBench、GLUE、SuperGLUE、MMLU等大型Benchmark建设经验;在多模态、表格学习、时序预测等方向有模型评测和效果分析的实战经验;有跨团队协作推动评测标准落地的经验,能推动各算法团队统一评测规范;在ICLR/NeurIPS/ICML等顶会或ACM Computing Surveys级别期刊有论文发表。
工作地点
北京市 东湖国际中心、青岛