阿拉尔IT运维工程师
IT运维工程师是负责企业内部IT系统和网络设备的日常管理和维护的专业人员。他们需要监控和维护服务器、网络设备和软件应用,确保系统的稳定运行和安全性。此外,他们还需要负责故障排除、问题解决以及维护IT系统的日常运营,以保证员工能够有效地使用各种IT工具和应用。IT运维工程师还需要对新技术和系统进行调研和评估,并根据企业的需求进行部署和优化。他们还可能负责编写技术文档,培训员工以确保其正确使用IT系统。这个职位需要具备扎实的IT技术知识和问题解决能力,以及良好的沟通技巧和团队合作精神。
薪酬概览
平均月薪
¥5300
中位数 ¥5000 | 区间 ¥4400 - ¥6200
数据来源:样本数量过少,仅供参考;更新时间:2026年7月13日
月薪分布
100% 人群薪酬落在 0-8k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
2月新增岗位
11
对比上月:岗位新增7
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 1-3年 | 5 | 50% |
| 3-5年 | 5 | 50% |
热招职位
1.负责公司版本部署工作
2.负责 Linux 服务器、网络设备及云服务(AWS/阿里云/腾讯云等)的日常监控、维护与故障排查,保障系统稳定性。
3.负责 Docker 容器环境的构建、管理及 Kubernetes (K8s) 集群的部署、运维和性能调优。
4.维护和完善持续集成/持续部署流水线,支持研发团队的快速迭代交付。
5.搭建和优化监控系统,确保关键业务指标可观测,并及时响应告警。
1、负责公司办公环境的软硬件和桌面系统的日常维护,解决排除各种软硬件故障;
2、负责公司内部各部门常用办公软件的安装以及故障排除;
3、负责桌面计算机、显示器、电话、打印机、网络设施、视频会议终端安装、配置、升级、运行维护与管理,计算机终端各类操作系统的安装与维护保障桌面系统正常运行,满足日常工作的需要。
4、配合资产执行,申请、领用、更换、报废、敏感数据清理,设备标准化等操作;
5、负责配合网络工程师完成新环境网络搭建,公司办公内网络环境维护,配合完成信息系统安装升级卸载等工作相关系统运维;
6、完成上级领导交办的其他工作。
1. 负责内部运维基础设施(如 自动化运维、IaC、CMDB、服务树、应用中心、DNS、流量网关、VPN 接入)等推进和落地。
2. 负责 devops 平台的建设、负责 AI 时代下 AIOps 研发流程的建设。
3. 负责微服务体系能力建设,如多集群场景下 服务发现、微服务网关、服务治理、迭代及流量泳道等体系建设。
运维工程师(中间件方向)
工作职责:
1、负责中间件系统及大数据系统的维护及相关事项;
2、负责高并发下应用系统的稳定性以及高可用方案的规划与实施;
3、负责运维文档以及规范的制定编写;
4、关注开源社区动态,追踪前沿技术和应用;
5、完成公司交办的其他工作。
任职资格:
1、精通使用Hadoop生态圈(HDFS,Yarn、Kafka、Elasticsearch、Solr、Spark,Storm,HBase、Impala、Hive、Flink、Kudu、Ranger、Zookeeper)等组件;
2、熟练掌握Linux操作系统原理及常见服务配置:如rsync、ftp、nginx、ssh等;
3、熟练掌握python/golang至少一种语言,熟练各种监控插件编写;
4、熟练使用至少一种开源监控方案:n9e、open-falcon、Prometheus等;
5、熟练使用开源的自动化部署工具:puppet、ansible、saltstack;
6、熟练使用ELK日志收集与分析系统;
7、有良好的沟通协作能力,思维缜密,有进取心。
运维工程师(中间件方向)
工作职责:
1、负责中间件系统及大数据系统的维护及相关事项;
2、负责高并发下应用系统的稳定性以及高可用方案的规划与实施;
3、负责运维文档以及规范的制定编写;
4、关注开源社区动态,追踪前沿技术和应用;
5、完成公司交办的其他工作。
任职资格:
1、精通使用Hadoop生态圈(HDFS,Yarn、Kafka、Elasticsearch、Solr、Spark,Storm,HBase、Impala、Hive、Flink、Kudu、Ranger、Zookeeper)等组件;
2、熟练掌握Linux操作系统原理及常见服务配置:如rsync、ftp、nginx、ssh等;
3、熟练掌握python/golang至少一种语言,熟练各种监控插件编写;
4、熟练使用至少一种开源监控方案:n9e、open-falcon、Prometheus等;
5、熟练使用开源的自动化部署工具:puppet、ansible、saltstack;
6、熟练使用ELK日志收集与分析系统;
7、有良好的沟通协作能力,思维缜密,有进取心。
1、保障业务7×24高可用,快速响应闭环线上故障,梳理根因并落地优化方案,预防问题复发;
2、维护并优化监控系统,完善指标与告警规则,搭建全链路可观测体系;
3、践行SRE理念,推动运维自动化、标准化、规范化与平台化建设;
4、跟踪云原生与自动化运维新技术并持续优化,输出运维文档、调优方案与故障复盘;
5、完成公司交办的其他工作。
任职资格:
1、3年以上互联网应用运维/SRE实战经验,熟悉稳定性治理规范,有互联网头部公司同类岗位经验优先;
2、熟练掌握Nginx/IIS配置、Java应用调优与故障定位,熟悉Redis/Kafka集群部署、调优及高可用架构维护,有高并发大规模集群运维经验优先;
3、熟练使用主流监控工具,能独立完成部署、告警配置和监控大盘优化,具备全链路可观测体系搭建经验;
4、掌握SRE核心理念,熟悉服务稳定性保障、SLA管理及故障治理流程;
5、熟练使用Shell/Python编写自动化运维脚本,有运维平台搭建与自动化流程落地经验优先;
6、具备规范化运维思维与问题复盘能力,良好的团队协作、学习与抗压能力。
工作职责:
1、保障业务7×24高可用,快速响应闭环线上故障,梳理根因并落地优化方案,预防问题复发;
2、维护并优化监控系统,完善指标与告警规则,搭建全链路可观测体系;
3、践行SRE理念,推动运维自动化、标准化、规范化与平台化建设;
4、跟踪云原生与自动化运维新技术并持续优化,输出运维文档、调优方案与故障复盘;
5、完成公司交办的其他工作。
任职资格:
1、3年以上互联网应用运维/SRE实战经验,熟悉稳定性治理规范,有互联网头部公司同类岗位经验优先;
2、熟练掌握Nginx/IIS配置、Java应用调优与故障定位,熟悉Redis/Kafka集群部署、调优及高可用架构维护,有高并发大规模集群运维经验优先;
3、熟练使用主流监控工具,能独立完成部署、告警配置和监控大盘优化,具备全链路可观测体系搭建经验;
4、掌握SRE核心理念,熟悉服务稳定性保障、SLA管理及故障治理流程;
5、熟练使用Shell/Python编写自动化运维脚本,有运维平台搭建与自动化流程落地经验优先;
6、具备规范化运维思维与问题复盘能力,良好的团队协作、学习与抗压能力。
运维工程师(J12231)8000-10000元/月
1.负责数据中心网络设备、安全设备、服务器、存储、云平台等基础设施的日常运维管理。
2.负责数据中心监控平台维护、升级、优化以及自定义监控开发工作。
3.负责数据中心网络安全防护工作,包括安全策略配置优化、安全日志分析、安全告警处理等。
4.负责数据中心网络、云主机和存储等资源规划和分配。
5.负责数据中心系统、网络故障排查和处理。
6.负责运维开发相关工具部署和维护,包括不限于:Nexus、GitLab、Harbor、Jira、Confluence、Dify等工具。
7.负责运维项目的全流程实施工作,包括项目项目技术方案编写、投标、实施交付等。
8.完成领导交办其他技术支持及安排其他工作。
1.英语六级及以上,读写流利、可进行常规口语沟通,能看懂 / 编写基础英文技术文档;
2.具备良好文字功底,擅长文档整理、流程总结,逻辑清晰;
3.计算机 / 网信相关专业优先,懂电脑系统、办公软件安装,基础网络故障排查;
4.了解主流 AI 工具、办公协作软件者优先;
5.做事认真负责、有主动服务意识,服从安排,能接受基础岗位培训,有一定抗压能力。
1.负责智驾平台计算服务日常运维工作,包括健康巡检、发布变更、监控完善、SOP、OnCall响应、故障处理等
2.负责智驾平台计算服务生产保障工作,包括需求处理、集群建设、资源交付、资源管理、测试验证等
3.参与智驾平台计算服务整体建设工作,包括K8S混合云服务、计算应用、多种类GPU/CPU等资源服务的自动化能力建设、成本管控和稳定性保障等
任职要求
1.搭建公司配置管理体系,定Git分支、基线规范,保障配置可追溯;
2.运维蓝鲸 / GitLab/Jenkins等DevOps平台,高效处理故障,管理团队资源权限;
3.用 Python/Shell 写脚本实现研发自动化,优化 “开发-发布”流程;
4.对接供应商推进平台升级,提供团队培训与技术支持。
岗位核心价值
负责公司大算力 AI 集群(含 B/H 系列高端卡、国产算力卡)的架构设计、搭建部署、运维优化与国产化适配,支撑大模型训练、自动驾驶等核心业务的高效稳定运行,打造高可用、高性价比的算力基础设施。
核心工作职责
1. 大算力集群自建与架构设计:主导超大规模 AI 算力集群(数千 P 级)的自建规划,包括硬件选型(GPU/B/H 系列卡、国产卡等)、网络拓扑设计(InfiniBand/ROCE)、存储架构(分布式存储)、集群调度系统搭建,确保集群性能达标、扩展性强。
2. 高端 GPU 加速与优化:具备 NVIDIA B 系列、H 系列高端算力卡的实战经验,负责卡级性能调优、并行计算加速(TensorRT/MPI/NCCL)、显存优化,解决大模型训练 / 推理中的算力瓶颈问题。
3. 国产算力卡适配落地:主导国产算力卡(阿里PPU、华为昇腾等)的适配工作,包括驱动安装、框架适配(TensorFlow/PyTorch/MindSpore)、模型迁移与性能调优,实现国产算力与业务场景的深度融合。
4. 集群运维与稳定性保障:负责算力集群的日常运维,包括硬件故障排查、集群监控告警(GPU / 网络 / 存储状态)、资源调度优化、灾备方案设计,保障集群全年高可用性(99.9% 以上)。
5. 技术沉淀与迭代:跟进业界大算力集群技术趋势(如新型 GPU、网络协议、调度系统),输出技术方案与最佳实践;搭建集群运维自动化工具,提升运维效率。
1、对部署效率负责,对相关工具的建设负责,实现多产品组合一键部署,无人值守安装,落地基于不可变基础设施的部署方案;
2、负责运维体系建设,包括可观测性体系,北极星指标体系,CMDB,工单系统,作业平台等;
3、参与制定SRE相关的规范和流程,并负责推广落地;
4、负责SRE团队技能建设,团队技术分享、团队技术选型、团队技术培训等;
5、作为团队技术专家,负责解决重大疑难问题,团队知识库建设,故障复盘,常见问题沉淀,预案体系建设,混沌工程建设。





