平凉项目运维工程师
项目运维工程师是负责项目的运营和维护的专业人员。他们负责确保项目的稳定运行,包括监控系统状态、处理日常的技术问题、及时修复系统故障、优化系统性能、升级软件版本等。他们还负责制定和执行项目的运维策略,确保项目的安全性和可靠性。同时,他们与开发团队紧密合作,提供技术支持和解决方案,以满足项目的需求。项目运维工程师需要具备扎实的技术背景和问题解决能力,熟悉常见的运维工具和技术,对系统和网络有深入的理解,能够快速响应和解决各类技术问题,保证项目的持续稳定运行。
薪酬概览
平均月薪
¥8000
中位数 ¥8000 | 区间 ¥6300 - ¥9700
数据来源:样本数量过少,仅供参考;更新时间:2026年7月13日
月薪分布
50% 人群薪酬落在 8-15k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
5月新增岗位
20
对比上月:岗位新增17
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 3-5年 | 10 | 50% |
| 不限经验 | 10 | 50% |
热招职位
岗位描述
我们正在招聘智能运维开发工程师,负责阿里云大数据平台的智能运维体系建设,面向超大规模大数据平台、AI 平台及相关基础设施,持续提升系统稳定性、运维效率和平台自动化能力。
该岗位将深度参与大数据平台运维平台开发、稳定性治理、AI 化改造和智能运维 Agent 建设,围绕故障发现、问题诊断、容量水位、变更风险、发布管控、监控告警、自动化处置等核心场景,建设面向超大规模复杂系统的智能化运维能力。
你将与研发、SRE、平台工程、算法和产品团队协作,推动传统运维能力向平台化、自动化、智能化演进,支撑阿里云大数据平台及 AI 平台在大规模、高复杂度、高可用要求下稳定运行。
工作职责
1. 负责阿里云大数据平台智能运维体系建设,参与运维平台、稳定性平台、自动化工具、诊断系统等核心能力的设计与开发,提升平台化、自动化和智能化运维水平。
2. 参与智能运维 Agent 建设,结合大模型、RAG、工具调用、自动化编排和知识库能力,落地日志分析、指标分析、故障归因、异常检测、根因定位、SOP 执行和运维问答等 AI 化运维能力。
3. 负责超大规模大数据平台及 AI 平台的稳定性保障,围绕监控告警、故障诊断、容量水位、链路治理、变更风险、应急处置和复盘改进等场景,持续提升系统可靠性。
4. 参与大数据平台架构演进和稳定性治理,识别系统瓶颈与稳定性风险,推动容量规划、性能优化、资源治理、容灾高可用和架构改进。
阿里云智能-运维开发-AIOps Agent工程师(售后技术方向)
我们正在招聘运维开发工程师,负责阿里云大数据&AI平台的售后智能答疑体系和客户体感稳定性体系建设,从用户服务专家的视角来处理超大规模大数据平台承载的用户问题和重保需求,持续提升运维效率,为产品稳定性和服务口碑树立持续贡献力量
该岗位以大数据&AI产品售后答疑工作为业务基础,一方面深度参与共建Agent架构下的智能答疑能力,围绕问题自助答疑、自助诊断和产品改进项提炼等核心场景进行自动化能力建设;另一方面深度参与客户体感稳定性体系和重保能力建设,在对产品架构和稳定性场景深入掌握的基础上,提炼客户实例级稳定性指标,为客户提供更前置的主动隐患发现与重保服务能力
你将与TAM、研发、SRE、平台工程、算法和产品团队协作,推动传统答疑和排查能力向智能化演进,支撑阿里云大数据&AI平台业务高速发展,共建业界一流的智能服务专家团队
工作职责:
1. 负责阿里云大数据&AI产品的售后L3答疑和服务工作,承接前方服务团队的升级工单处理和用户疑难问题排查;组织和提供大客户钉群服务能力,对头部/重要客户进行业务保障;接收客户需求提供业务巡检、大促护航、产品改进推动等重保能力交付
2. 参与基于Agent的智能答疑体系建设,结合大模型、RAG、Skills、Harness engineer等技术能力,落地根因定位、异常检测、SOP执行和运维问答等AI化运维能力
3. 参与客户体感稳定性系统建设,协同产研SRE建立实例级可用率指标,定义客户级体感可用率标准,构建细粒度封网、变更后置、主动巡检和风险发现预防等重保能力,推动客户问题发现与主动服务链路落地,为产品提供更强的增值能力
4. 负责售后支持外包团队的管理,包括答疑提效、人员培养和成本管理等职责
1. 中间件运维与高可用保障:负责消息队列(Kafka/RocketMQ)、服务注册与配置中心(Zookeeper/Nacos)等核心中间件的稳定性维护、性能调优及高可用架构设计;基于Kubernetes完成容器化部署、弹性扩缩容、版本升级及日常运维,保障核心系统7x24小时稳定运行。
2. 故障排查与根因分析:通过日志分析、链路追踪及监控体系快速定位中间件相关故障(如消息堆积、服务注册异常等),主导问题修复与复盘;使用Java或Go开发调试工具,高效排查线上性能瓶颈及与业务系统的兼容性问题。
3. 性能优化与平台适配:测试并优化中间件在不同CPU架构、内核版本及容器环境下的性能表现,解决资源调度与性能瓶颈问题,持续提升中间件运行效率与资源利用率。
4. 负责搭建及使用SRE数字人实现线上运维智能化。
运维工程师面议
1.负责CentOS/国产麒麟系统的服务器与云资源的全生命周期管理(部署、监控、调优、安全),保障高可用。
2.负责基于Docker/Kubernetes的容器化平台与CI/CD流水线的建设、维护与优化。
3.负责MySQL、Redis、Kafka、Nginx等中间件与数据库的日常运维、性能优化与容灾备份。
4.建立并维护7x24小时监控告警体系,快速响应与处理线上故障,参与应急保障。
工作职责:
1、保证线上业务系统稳定运行,服务故障分析与性能调优;
2、进行应急故障和事件处理,确保服务可用性;
3、设计开发运维自动化工具,提升运维效率和系统稳定性;
4、解决运维相关的技术问题,制定运维风险清单和应急预案;
任职要求:
1、统招本科以上计算机相关专业,3年以上运维经验;
2、熟练掌握k8s 、docker相关技术;
3、熟练掌握elk、hdfs数据存储相关技术;
4、熟练掌握nginx、openresty、lvs等负载均衡技术;
5、熟练掌握zabbix、openfalcon、ansible等监控及自动化配置工具;
6、熟练掌握java项目的运维部署,熟悉maven、nexus、git等工具的使用和维护;
7、熟练掌握mysql, mongodb, redis、kafka、zookeeper等主流数据库及中间的高用性架构部署、性能调优及日常运维;
8、熟练掌握Shell/Python/go等至少一门编程语言。
工作职责:
1、保证线上业务系统稳定运行,服务故障分析与性能调优;
2、进行应急故障和事件处理,确保服务可用性;
3、设计开发运维自动化工具,提升运维效率和系统稳定性;
4、解决运维相关的技术问题,制定运维风险清单和应急预案;
任职要求:
1、统招本科以上计算机相关专业,3年以上运维经验;
2、熟练掌握k8s 、docker相关技术;
3、熟练掌握elk、hdfs数据存储相关技术;
4、熟练掌握nginx、openresty、lvs等负载均衡技术;
5、熟练掌握zabbix、openfalcon、ansible等监控及自动化配置工具;
6、熟练掌握java项目的运维部署,熟悉maven、nexus、git等工具的使用和维护;
7、熟练掌握mysql, mongodb, redis、kafka、zookeeper等主流数据库及中间的高用性架构部署、性能调优及日常运维;
8、熟练掌握Shell/Python/go等至少一门编程语言。
长驻客户单位,负责客户系统售后服务与支持,包括软件维护、软件应用培训与推广、相关产品安装和局域网维护等工作。任职要求:
1、计算机或相关专业;具备软件维护和技术支持能力,熟悉大型数据库系统,有一般主机和网络管理维护能力;
2、性格开朗,具备良好的客户意识、沟通协调能力和良好的人际关系能力;
3、具有良好的自我调节能力和心理承受能力。
1.负责数字化项目全流程统筹管理,制定项目计划、分配资源、管控进度与质量;
2.负责统筹产品开发工作,结合应用架构需求制定开发方案,审核技术选型、核心代码及测试方案;
3. 负责产品运营策略制定,统筹用户反馈收集与分析,主导产品功能优化迭代规划并推动落地;
4.负责运维体系搭建与统筹管理,建立系统监控、故障处理及版本更新机制;
5.承接应用架构落地需求,协调开发与运维资源匹配实施计划。
1.负责大数据组件的运维工作,包括部署,管理,优化等事项,保证平台稳定运行保障大数据服务SLA。
2.建设大数据产品运维基线,标准制定,并主动识别并解决瓶颈问题。
3.负责重大问题处理及快速恢复能力,预防及容灾能力,保障服务高可用目标达成;
4.优化自动化运维、监控报警、故障处理所需工具提升运维效率。
5.跟踪和分析技术趋势不断优化技术架构和运维效率
任职要求
1.精通大数据领域技能,如Hadoop、Flink、Doris、ES,HBase等,熟悉组件的应用场景和问题解决方案
2.熟练掌握一门以上编程语言(golang/python/shell等)
3.有强烈的求知欲和钻研技巧,具有良好的独立分析问题与迅速解决问题的能力;
4.具有较好的的抗压能力,团队合作精神
5.本科或以上学历,3年及以上运维经验或开发经验
AI运维工程师面议
1. AI基础设施稳定性运维:负责大规模GPU/NPU集群、高性能网络(RoCE/IB)、分布式存储的部署、监控、容量规划与日常保障,通过故障自愈、自动重调度、Checkpoint恢复等机制降低MTTR。
2. 性能优化与资源管理:定位并解决推理中的性能瓶颈(GPU利用率、通信带宽、数据加载),优化异构资源调度策略,减少碎片化,保障AI任务高效连续运行。
3. 运维AI化提效:开发智能运维场景(异常检测、根因分析、告警收敛、容量预测),利用AI实现自然语言查询、故障诊断与脚本生成,建设自动化运维平台(扩缩容、隔离修复、智能调度)。
4. 数据驱动与知识沉淀:分析历史监控与日志数据,输出优化报告;建立运维知识库及故障案例库,借助AI辅助问答持续提升团队效率。
1负责公司存量电站电量指标的达成;
2负责电站备品备件、消耗性材料的采购,出入库登记,使用及反馈;
3)负责电费回款的跟催;
4)开展季度安全检查、隐患排查,负责安全生产措施落实;
5)负责电站停送电申请及执行
6)完成领导交办的其他工作。
运维工程师-27届薪资:1~1
1、负责参与评估硬件平台的计算性能测试、分析与落地;
2、负责服务器可靠性及稳定性验证,OS兼容性验证;
3、负责服务器新产品的BMC、BIOS测试设计及验证工作;
4、负责服务器板卡的引入测试,含内存、网卡、GPU及HBA卡等;
5、负责服务器配套软件变更,driver/fw升级的测试及版本管理;
6、负责服务器OS、driver及FW的网上问题分析处理;
7、参与硬件搭载软件相关的应用测试模型设计开发;
8、参与配套厂家制造品质的管理、解决产品质量问题;
SRE运维工程师薪资:25~35
1、负责同程旅行核心服务的高可靠、稳定、高效运行,持续保障核心业务 SLA 达成;
2、主导服务架构设计与评审,推动 AI 辅助的容量规划、性能调优与智能配置治理;
3、推进系统稳定性与容灾方案设计及落地,结合混沌工程与 AI 预测能力构建自适应韧性架构;
4、主导重大故障应急响应,利用智能运维(AIOps)技术,基于多维度监控、日志、Trace数据进行智能告警、自动止损与根因定位;
5、参与日常值班与线上应急响应,并通过自动化与 AI 工具提升故障处理效率与精准性。


