职位描述
1.负责人工智能计算、高性能计算及云计算的整体架构设计。能够独立完成从底层基础设施、网络架构、算力集群到上层调度与应用平台的端到端解决方案编写。
2.深入理解客户业务需求,如大模型训练、自动驾驶、生物制药、科学计算等,进行精准的AI场景评估。
3.负责算力需求分析,根据模型参数量、数据量及训练/推理时效要求,科学评估算力规模(FLOPS)、显存、带宽及存储需求,提供最优性价比的硬件选型建议。
4.熟悉主流AI硬件生态,重点掌握各类国产GPU加速卡(如华为昇腾、寒武纪、海光DCU、摩尔线程等)的性能指标、互联拓扑及软件栈兼容性。
5.熟悉AI算力调度平台与AI开发平台方案,熟悉Kubernetes、Slurm、Docker等容器与调度技术。
6.了解智能体开发,模型训练、微调及部署的全流程工具链方案。
7.主导项目的招投标工作,包括撰写标书、技术建议书、进行POC测试及现场述标。
8.对智算中心IDC机房基础设施(供配电、液冷/风冷散热、机柜布局等)有一定了解。
9.了解数据采集、清洗、标注、存储(对象存储/并行文件系统)与AI计算的关联性