陇南项目运维工程师
项目运维工程师是负责项目的运营和维护的专业人员。他们负责确保项目的稳定运行,包括监控系统状态、处理日常的技术问题、及时修复系统故障、优化系统性能、升级软件版本等。他们还负责制定和执行项目的运维策略,确保项目的安全性和可靠性。同时,他们与开发团队紧密合作,提供技术支持和解决方案,以满足项目的需求。项目运维工程师需要具备扎实的技术背景和问题解决能力,熟悉常见的运维工具和技术,对系统和网络有深入的理解,能够快速响应和解决各类技术问题,保证项目的持续稳定运行。
薪酬概览
平均月薪
¥10600
中位数 ¥0 | 区间 ¥8200 - ¥13000
数据来源:样本数量过少,仅供参考;更新时间:2026年7月13日
月薪分布
80% 人群薪酬落在 8-15k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
8月新增岗位
15
对比上月:岗位新增7
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 1-3年 | 7 | 43.8% |
| 3-5年 | 3 | 18.8% |
| 5-10年 | 3 | 18.8% |
| 不限经验 | 3 | 18.8% |
热招职位
运维工程师面议
1、负责公司业务系统推广;
2、负责收集各部门使用需求;
3、负责IT运维相关流程的规划、设计、推行、实施和持续改进;
4、负责内部分系统部署,实施结果负责。
5、负责设计并部署相关应用平台,并提出平台的实施、运行报告。
6、负责配合开发搭建测试平台,协助开发设计、推行、实施和持续改进。
7、负责相关故障、疑难问题排查处理,编制汇总故障、问题,定期提交汇总报告。
8、负责系统服务器监控及应急反应,以确保网络系统有7*24小时的持续运作能力。
任职要求:
1、计算机专业,1年以上运维技术经验;
2、精通linux系统如Redhat、Gentoo、精通Apache、Tomcat、Nginx、FTP、DNS、Squid等常用服务的安装、配置和维护;
3、熟悉数据库,最少熟悉ORACLE、Mysql、Sqlserver中一种数据库的日常维护工作优先;
4、高度的责任感,较强的故障分析及排除能力,善于在工作中学习,能够承受工作压力;
5、能够独立进行大型复杂系统和数据库的部署、迁移和维护,以及监控体系的搭建;
6、具备一定的团队管理能力;为人正直、诚信,具有极强的责任心和职业精神;
7、具备ITIL资格的优先。
1.负责公司CI/CD系统维护工作并持续改进;
2.负责CI/CD开源工具的研究和应用;
3.通过开源工具整合CI/CD产品线,提升研发效率。
1)负责公司自有数据中心运维管理
2)负责机房服务器、存储、网络、自研设备的安装、调试、维护、故障处理
3)IT基础资源(软、硬件)的选型和优化,并负责资源运行状况的监控和分析
4)及时按要求撰写工作及技术文档;
5)领导安排的其它工作
运维工程师(J12231)8000-10000元/月
1.负责数据中心网络设备、安全设备、服务器、存储、云平台等基础设施的日常运维管理。
2.负责数据中心监控平台维护、升级、优化以及自定义监控开发工作。
3.负责数据中心网络安全防护工作,包括安全策略配置优化、安全日志分析、安全告警处理等。
4.负责数据中心网络、云主机和存储等资源规划和分配。
5.负责数据中心系统、网络故障排查和处理。
6.负责运维开发相关工具部署和维护,包括不限于:Nexus、GitLab、Harbor、Jira、Confluence、Dify等工具。
7.负责运维项目的全流程实施工作,包括项目项目技术方案编写、投标、实施交付等。
8.完成领导交办其他技术支持及安排其他工作。
1.英语六级及以上,读写流利、可进行常规口语沟通,能看懂 / 编写基础英文技术文档;
2.具备良好文字功底,擅长文档整理、流程总结,逻辑清晰;
3.计算机 / 网信相关专业优先,懂电脑系统、办公软件安装,基础网络故障排查;
4.了解主流 AI 工具、办公协作软件者优先;
5.做事认真负责、有主动服务意识,服从安排,能接受基础岗位培训,有一定抗压能力。
1.负责智驾平台计算服务日常运维工作,包括健康巡检、发布变更、监控完善、SOP、OnCall响应、故障处理等
2.负责智驾平台计算服务生产保障工作,包括需求处理、集群建设、资源交付、资源管理、测试验证等
3.参与智驾平台计算服务整体建设工作,包括K8S混合云服务、计算应用、多种类GPU/CPU等资源服务的自动化能力建设、成本管控和稳定性保障等
任职要求
1.搭建公司配置管理体系,定Git分支、基线规范,保障配置可追溯;
2.运维蓝鲸 / GitLab/Jenkins等DevOps平台,高效处理故障,管理团队资源权限;
3.用 Python/Shell 写脚本实现研发自动化,优化 “开发-发布”流程;
4.对接供应商推进平台升级,提供团队培训与技术支持。
岗位核心价值
负责公司大算力 AI 集群(含 B/H 系列高端卡、国产算力卡)的架构设计、搭建部署、运维优化与国产化适配,支撑大模型训练、自动驾驶等核心业务的高效稳定运行,打造高可用、高性价比的算力基础设施。
核心工作职责
1. 大算力集群自建与架构设计:主导超大规模 AI 算力集群(数千 P 级)的自建规划,包括硬件选型(GPU/B/H 系列卡、国产卡等)、网络拓扑设计(InfiniBand/ROCE)、存储架构(分布式存储)、集群调度系统搭建,确保集群性能达标、扩展性强。
2. 高端 GPU 加速与优化:具备 NVIDIA B 系列、H 系列高端算力卡的实战经验,负责卡级性能调优、并行计算加速(TensorRT/MPI/NCCL)、显存优化,解决大模型训练 / 推理中的算力瓶颈问题。
3. 国产算力卡适配落地:主导国产算力卡(阿里PPU、华为昇腾等)的适配工作,包括驱动安装、框架适配(TensorFlow/PyTorch/MindSpore)、模型迁移与性能调优,实现国产算力与业务场景的深度融合。
4. 集群运维与稳定性保障:负责算力集群的日常运维,包括硬件故障排查、集群监控告警(GPU / 网络 / 存储状态)、资源调度优化、灾备方案设计,保障集群全年高可用性(99.9% 以上)。
5. 技术沉淀与迭代:跟进业界大算力集群技术趋势(如新型 GPU、网络协议、调度系统),输出技术方案与最佳实践;搭建集群运维自动化工具,提升运维效率。
1、对部署效率负责,对相关工具的建设负责,实现多产品组合一键部署,无人值守安装,落地基于不可变基础设施的部署方案;
2、负责运维体系建设,包括可观测性体系,北极星指标体系,CMDB,工单系统,作业平台等;
3、参与制定SRE相关的规范和流程,并负责推广落地;
4、负责SRE团队技能建设,团队技术分享、团队技术选型、团队技术培训等;
5、作为团队技术专家,负责解决重大疑难问题,团队知识库建设,故障复盘,常见问题沉淀,预案体系建设,混沌工程建设。
1. 协助运维人员进行服务器、网络设备、存储设备等设备的日常运维工作,并及时处理出现的问题;
2. 协助运维人员编写文档,记录相应的操作流程、日常工作和服务器的维护情况等;
3. 参与服务器应用的安装、维护和升级工作,通过对生产环境进行技术测试和排查异常,为公司IT系统的稳定运行做好技术支持;
4. 参与公司IT系统的监控、数据备份等工作,及时处理并防止系统出现故障。
工作内容:
1、负责日常资源交付、变更、巡检、告警处置与故障恢复工作,沉淀输出标准化操作流程;
2、参与可观测体系、容量管理、混沌工程、流量调度等方向的平台与体系持续优化演进;
3、主导基于大语言模型(LLM)的运维智能体(AI Agent)、AI工作流方案设计,落地运维数字人、AI巡检、AI根因分析等AIOps业务场景。
任职资格:
1、本科及以上学历,拥有3年及以上AI开发或运维相关工作经验;
2、熟练掌握Python/Go至少一门编程语言者优先;
3、熟悉Linux操作系统,了解Kubernetes(K8s)基础概念;熟练使用Prometheus、DNS、CDN、CICD、Nginx等常用中间件与服务,具备传统运维故障排查、自动化脚本编写实操能力;
4、了解可观测、容量管理、高可用容灾架构、混沌工程、流量调度相关知识,拥有大规模集群稳定性保障实战经验优先;
5、熟悉LangChain、LangGraph、Dify等主流Agent开发框架,掌握MCP、技能插件(Skills)、Prompt&RAP、多智能体规划相关技术;
6、具备优秀的问题拆解、逻辑分析、跨团队沟通协作能力,学习主动性强、自驱力突出。
工作内容:
1、负责日常资源交付、变更、巡检、告警处置与故障恢复工作,沉淀输出标准化操作流程;
2、参与可观测体系、容量管理、混沌工程、流量调度等方向的平台与体系持续优化演进;
3、主导基于大语言模型(LLM)的运维智能体(AI Agent)、AI工作流方案设计,落地运维数字人、AI巡检、AI根因分析等AIOps业务场景。
任职资格:
1、本科及以上学历,拥有3年及以上AI开发或运维相关工作经验;
2、熟练掌握Python/Go至少一门编程语言者优先;
3、熟悉Linux操作系统,了解Kubernetes(K8s)基础概念;熟练使用Prometheus、DNS、CDN、CICD、Nginx等常用中间件与服务,具备传统运维故障排查、自动化脚本编写实操能力;
4、了解可观测、容量管理、高可用容灾架构、混沌工程、流量调度相关知识,拥有大规模集群稳定性保障实战经验优先;
5、熟悉LangChain、LangGraph、Dify等主流Agent开发框架,掌握MCP、技能插件(Skills)、Prompt&RAP、多智能体规划相关技术;
6、具备优秀的问题拆解、逻辑分析、跨团队沟通协作能力,学习主动性强、自驱力突出。
1、支持行业云平台和云产品在不同芯片架构和服务器下适配的技术方案,推动多部门协同,解决软硬件技术问题,向用户提供自主可控,安全可信的行业云平台。
2、推动行业云横向架构治理,支持特定云产品线的多芯架构升级,包括安全合规、资源共池等,以满足各类行业标准和规范。
3、推动云产品在不同芯片体系下的性能调优和应用迁移技术方案,实现行业云平台的平滑迁移。


