商洛运维开发
运维开发是指负责开发和维护公司的软件和基础设施的专业人员。这种职位要求具备软件开发和运维方面的知识与技能。运维开发负责编写自动化脚本、创建工具和系统,以简化和提高系统管理、监控和维护的效率。他们需要深入了解网络、操作系统、数据库和云计算等技术,能够解决系统故障并优化系统性能。在持续集成和持续部署的环境下,运维开发还负责确保软件的高可用性和安全性。此外,他们需要与软件开发团队紧密合作,确保开发环境和生产环境之间的一致性。总的来说,运维开发是一个将软件开发和系统运维结合起来的综合性角色。
薪酬概览
平均月薪
¥7600
中位数 ¥7500 | 区间 ¥5700 - ¥9400
数据来源:样本数量过少,仅供参考;更新时间:2026年7月13日
月薪分布
66.7% 人群薪酬落在 0-8k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
5月新增岗位
20
对比上月:岗位新增13
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 1-3年 | 3 | 50% |
| 不限经验 | 3 | 50% |
热招职位
1.负责大数据组件的运维工作,包括部署,管理,优化等事项,保证平台稳定运行保障大数据服务SLA。
2.建设大数据产品运维基线,标准制定,并主动识别并解决瓶颈问题。
3.负责重大问题处理及快速恢复能力,预防及容灾能力,保障服务高可用目标达成;
4.优化自动化运维、监控报警、故障处理所需工具提升运维效率。
5.跟踪和分析技术趋势不断优化技术架构和运维效率
任职要求
1.精通大数据领域技能,如Hadoop、Flink、Doris、ES,HBase等,熟悉组件的应用场景和问题解决方案
2.熟练掌握一门以上编程语言(golang/python/shell等)
3.有强烈的求知欲和钻研技巧,具有良好的独立分析问题与迅速解决问题的能力;
4.具有较好的的抗压能力,团队合作精神
5.本科或以上学历,3年及以上运维经验或开发经验
AI运维工程师面议
1. AI基础设施稳定性运维:负责大规模GPU/NPU集群、高性能网络(RoCE/IB)、分布式存储的部署、监控、容量规划与日常保障,通过故障自愈、自动重调度、Checkpoint恢复等机制降低MTTR。
2. 性能优化与资源管理:定位并解决推理中的性能瓶颈(GPU利用率、通信带宽、数据加载),优化异构资源调度策略,减少碎片化,保障AI任务高效连续运行。
3. 运维AI化提效:开发智能运维场景(异常检测、根因分析、告警收敛、容量预测),利用AI实现自然语言查询、故障诊断与脚本生成,建设自动化运维平台(扩缩容、隔离修复、智能调度)。
4. 数据驱动与知识沉淀:分析历史监控与日志数据,输出优化报告;建立运维知识库及故障案例库,借助AI辅助问答持续提升团队效率。
1负责公司存量电站电量指标的达成;
2负责电站备品备件、消耗性材料的采购,出入库登记,使用及反馈;
3)负责电费回款的跟催;
4)开展季度安全检查、隐患排查,负责安全生产措施落实;
5)负责电站停送电申请及执行
6)完成领导交办的其他工作。
运维工程师-27届薪资:1~1
1、负责参与评估硬件平台的计算性能测试、分析与落地;
2、负责服务器可靠性及稳定性验证,OS兼容性验证;
3、负责服务器新产品的BMC、BIOS测试设计及验证工作;
4、负责服务器板卡的引入测试,含内存、网卡、GPU及HBA卡等;
5、负责服务器配套软件变更,driver/fw升级的测试及版本管理;
6、负责服务器OS、driver及FW的网上问题分析处理;
7、参与硬件搭载软件相关的应用测试模型设计开发;
8、参与配套厂家制造品质的管理、解决产品质量问题;
SRE运维工程师薪资:25~35
1、负责同程旅行核心服务的高可靠、稳定、高效运行,持续保障核心业务 SLA 达成;
2、主导服务架构设计与评审,推动 AI 辅助的容量规划、性能调优与智能配置治理;
3、推进系统稳定性与容灾方案设计及落地,结合混沌工程与 AI 预测能力构建自适应韧性架构;
4、主导重大故障应急响应,利用智能运维(AIOps)技术,基于多维度监控、日志、Trace数据进行智能告警、自动止损与根因定位;
5、参与日常值班与线上应急响应,并通过自动化与 AI 工具提升故障处理效率与精准性。
运维开发工程师(服务器运维平台背景优先)薪资:20000~35000
1. 负责成本运营平台、服务器工单交付平台、配件管理平台、故障工单平台等服务器运维管理系统的前后端开发与功能实现2. 负责现有运维平台的性能优化、功能迭代及线上部署工作,保障系统稳定高效运行3. 负责服务器运维操作的 API 封装与标准化开发,构建统一的运维自动化接口体系4. 参与服务器硬件管理相关核心功能设计与开发,包括 BMC/BIOS 远程管理、硬件状态实时监控、驱动固件批量升级、硬件故障智能诊断等模块5. 结合服务器硬件测试与验证经验,优化运维平台的硬件兼容性检测、性能指标采集和故障预警能力,可以开发自动化测试脚本6. 参与硬件搭载软件相关的应用测试模型设计,提升平台对不同硬件配置的适配性
岗位核心价值
负责公司大算力 AI 集群(含 B/H 系列高端卡、国产算力卡)的架构设计、搭建部署、运维优化与国产化适配,支撑大模型训练、自动驾驶等核心业务的高效稳定运行,打造高可用、高性价比的算力基础设施。
核心工作职责
1. 大算力集群自建与架构设计:主导超大规模 AI 算力集群(数千 P 级)的自建规划,包括硬件选型(GPU/B/H 系列卡、国产卡等)、网络拓扑设计(InfiniBand/ROCE)、存储架构(分布式存储)、集群调度系统搭建,确保集群性能达标、扩展性强。
2. 高端 GPU 加速与优化:具备 NVIDIA B 系列、H 系列高端算力卡的实战经验,负责卡级性能调优、并行计算加速(TensorRT/MPI/NCCL)、显存优化,解决大模型训练 / 推理中的算力瓶颈问题。
3. 国产算力卡适配落地:主导国产算力卡(阿里PPU、华为昇腾等)的适配工作,包括驱动安装、框架适配(TensorFlow/PyTorch/MindSpore)、模型迁移与性能调优,实现国产算力与业务场景的深度融合。
4. 集群运维与稳定性保障:负责算力集群的日常运维,包括硬件故障排查、集群监控告警(GPU / 网络 / 存储状态)、资源调度优化、灾备方案设计,保障集群全年高可用性(99.9% 以上)。
5. 技术沉淀与迭代:跟进业界大算力集群技术趋势(如新型 GPU、网络协议、调度系统),输出技术方案与最佳实践;搭建集群运维自动化工具,提升运维效率。
1、对部署效率负责,对相关工具的建设负责,实现多产品组合一键部署,无人值守安装,落地基于不可变基础设施的部署方案;
2、负责运维体系建设,包括可观测性体系,北极星指标体系,CMDB,工单系统,作业平台等;
3、参与制定SRE相关的规范和流程,并负责推广落地;
4、负责SRE团队技能建设,团队技术分享、团队技术选型、团队技术培训等;
5、作为团队技术专家,负责解决重大疑难问题,团队知识库建设,故障复盘,常见问题沉淀,预案体系建设,混沌工程建设。
1. 协助运维人员进行服务器、网络设备、存储设备等设备的日常运维工作,并及时处理出现的问题;
2. 协助运维人员编写文档,记录相应的操作流程、日常工作和服务器的维护情况等;
3. 参与服务器应用的安装、维护和升级工作,通过对生产环境进行技术测试和排查异常,为公司IT系统的稳定运行做好技术支持;
4. 参与公司IT系统的监控、数据备份等工作,及时处理并防止系统出现故障。
工作内容:
1、负责日常资源交付、变更、巡检、告警处置与故障恢复工作,沉淀输出标准化操作流程;
2、参与可观测体系、容量管理、混沌工程、流量调度等方向的平台与体系持续优化演进;
3、主导基于大语言模型(LLM)的运维智能体(AI Agent)、AI工作流方案设计,落地运维数字人、AI巡检、AI根因分析等AIOps业务场景。
任职资格:
1、本科及以上学历,拥有3年及以上AI开发或运维相关工作经验;
2、熟练掌握Python/Go至少一门编程语言者优先;
3、熟悉Linux操作系统,了解Kubernetes(K8s)基础概念;熟练使用Prometheus、DNS、CDN、CICD、Nginx等常用中间件与服务,具备传统运维故障排查、自动化脚本编写实操能力;
4、了解可观测、容量管理、高可用容灾架构、混沌工程、流量调度相关知识,拥有大规模集群稳定性保障实战经验优先;
5、熟悉LangChain、LangGraph、Dify等主流Agent开发框架,掌握MCP、技能插件(Skills)、Prompt&RAP、多智能体规划相关技术;
6、具备优秀的问题拆解、逻辑分析、跨团队沟通协作能力,学习主动性强、自驱力突出。
工作内容:
1、负责日常资源交付、变更、巡检、告警处置与故障恢复工作,沉淀输出标准化操作流程;
2、参与可观测体系、容量管理、混沌工程、流量调度等方向的平台与体系持续优化演进;
3、主导基于大语言模型(LLM)的运维智能体(AI Agent)、AI工作流方案设计,落地运维数字人、AI巡检、AI根因分析等AIOps业务场景。
任职资格:
1、本科及以上学历,拥有3年及以上AI开发或运维相关工作经验;
2、熟练掌握Python/Go至少一门编程语言者优先;
3、熟悉Linux操作系统,了解Kubernetes(K8s)基础概念;熟练使用Prometheus、DNS、CDN、CICD、Nginx等常用中间件与服务,具备传统运维故障排查、自动化脚本编写实操能力;
4、了解可观测、容量管理、高可用容灾架构、混沌工程、流量调度相关知识,拥有大规模集群稳定性保障实战经验优先;
5、熟悉LangChain、LangGraph、Dify等主流Agent开发框架,掌握MCP、技能插件(Skills)、Prompt&RAP、多智能体规划相关技术;
6、具备优秀的问题拆解、逻辑分析、跨团队沟通协作能力,学习主动性强、自驱力突出。
1、支持行业云平台和云产品在不同芯片架构和服务器下适配的技术方案,推动多部门协同,解决软硬件技术问题,向用户提供自主可控,安全可信的行业云平台。
2、推动行业云横向架构治理,支持特定云产品线的多芯架构升级,包括安全合规、资源共池等,以满足各类行业标准和规范。
3、推动云产品在不同芯片体系下的性能调优和应用迁移技术方案,实现行业云平台的平滑迁移。
1. 负责系统全流程实施,涵盖需求分析、方案设计、系统配置、测试、数据迁移及上线切换等核心环节;
2. 开展企业管理平台、SAP FICO等系统的用户培训,保障用户熟练掌握操作技能;
3. 负责企业一体化管理平台、SAP、司库系统、共享管理系统等系统的日常运维,及时响应并解决系统运行问题,保障系统稳定运行;
4. 深度理解业务场景,挖掘现有流程效率瓶颈与管理痛点,制定并推动优化方案落地;
5. 结合业务发展与用户反馈,持续优化负责模块的功能与流程,提升系统适配性和用户满意度。



