北京大学健康医疗大数据国家研究院AI算力运维工程师招聘启事
时间:2026-08-21 09:46:24来源:
点击数:
信息项目 | 信息内容 |
标 题 | 北京大学健康医疗大数据国家研究院AI算力运维工程师招聘启事 |
招聘单位 | 北京大学健康医疗大数据国家研究院 |
招聘岗位 | AI算力运维工程师 |
招聘范围 | 校内外公开招聘 |
岗位职责 | 1.负责健康医疗大数据平台GPU/CPU科研计算集群的建设、运行和维护; 2.负责基于Slurm等技术的算力资源统一调度、用户管理、任务管理和资源配额管理; 3.负责NVIDIA GPU、CUDA、cuDNN、NCCL及PyTorch等AI计算环境的部署和维护; 4.负责Docker/Apptainer等容器化科研计算环境建设; 5.建设GPU及服务器监控体系,实现GPU利用率、显存、任务和资源使用情况监测; 6.支持单机多卡、多机多卡及分布式AI训练任务,协助定位GPU、通信、存储及网络性能问题; 7.建立GPU-hour等算力使用统计和资源利用分析机制,提高平台整体算力利用效率; 8.为科研人员提供AI计算环境、集群任务及算力使用相关技术支持。 |
应聘条件 | 1.计算机、软件工程、电子信息等相关专业本科及以上学历,研究生学历者优先; 2.具有1年以上Linux服务器、GPU集群、HPC或AI计算平台相关经验; 3.熟悉Slurm、PBS、LSF等至少一种集群任务调度系统(具有Slurm实际经验者优先),具备大规模集群任务调度、配额管理、资源优化实战能力; 4.熟悉NVIDIA GPU、CUDA及常见AI计算环境,熟悉NVIDIA GPU硬件架构及NVLink多卡互联机制,熟练掌握CUDA、cuDNN、NCCL底层通信环境部署与调优,熟悉RDMA/InfiniBand高速网络配置、运维及故障排查,精通PyTorch等主流AI框架的集群适配与运行优化; 5.熟悉Docker等容器技术,能够独立完成容器镜像定制、批量部署与环境封装,具备Python/Shell脚本能力; 6.了解Prometheus、Grafana等监控体系,了解DCGM GPU监控工具,可独立搭建、调试、迭代算力集群监控体系; 7.具备较强的问题定位、系统学习和沟通协作能力。 优先考虑:具有NCCL、PyTorch Distributed、RDMA/InfiniBand、NVLink、MIG、Kubernetes、DCGM、JupyterHub或大型GPU集群实际运维经验。 |
岗位待遇 | 执行北京大学医学部合同制人员的有关规定 |
备注说明 | 此岗位系北京大学医学部合同制(劳务派遣)岗位,无事业编制,不解决北京户口。 |
应聘程序 | 请将个人简历及相关证明材料发送至邮箱:Nihds@bjmu.edu.cn 邮件主题请注明“AI算力运维工程师+姓名”。 |
应聘材料 | 1.PDF版个人简历(含照片及联系方式); 2.学历证明复印件; 3.能反映相关能力、经验、业绩的材料扫描件。 |
联系方式 | Nihds@bjmu.edu.cn |
发布日期 | 2026年8月21日 |
截止日期 | 2026年12月31日 |