薪酬数据技术北京大数据开发
数据需求量小

北京大数据开发

大数据开发是指利用各种技术和工具来处理和分析大规模的数据集。大数据开发人员需要具备丰富的编程技能和对数据处理技术的深入了解。他们通常会使用编程语言如Java、Python或Scala,以及大数据处理框架和工具如Hadoop、Spark、Kafka等来处理和分析大规模数据。他们需要设计和开发数据处理流程,实现数据的提取、转换、加载(ETL),以及开发数据分析和计算的算法和模型。此外,大数据开发人员也需要与数据科学家和业务团队合作,理解业务需求并开发相应的数据处理解决方案。要成为一名优秀的大数据开发人员,需要对数据处理技术有深入的了解,具备良好的编程能力和解决问题的能力。

 
职业全景发展路线简历重点

薪酬概览

  • 北京
  • 上海
  • 广东省
  • 浙江省
  • 四川省
  • 江苏省
  • 重庆
  • 天津
  • 海南省
  • 福建省
  • 江西省
  • 山东省
  • 安徽省
  • 湖南省
  • 河南省
  • 湖北省
  • 辽宁省
  • 陕西省
  • 河北省
  • 吉林省
  • 黑龙江省
  • 新疆维吾尔自治区
  • 云南省
  • 广西壮族自治区
  • 贵州省
  • 甘肃省

平均月薪

¥20000

中位数 ¥16000 | 区间 ¥15500 - ¥24400

数据来源:谈职全网32份招聘数据;更新时间:2026年7月13日

月薪分布

46.9% 人群薪酬落在 15-30k

TANZHI AI

简历不只是罗列信息,更要形成一个清晰的职业判断

当招聘无法快速判断你是谁时,再完整的经历,也只是信息。智能重构会统一主线与角色表达,让整份简历真正成立。

查看简历重构

三大影响薪酬的核心维度

影响薪资的核心维度1:工作年限

应届
1-3年
3-5年
5-10年
不限经验

影响薪资的核心维度2:学历背景

专科
本科
硕士
不限学历

影响薪资的核心维度3:所在城市

城市职位数平均月薪城市平均月租
(两居室)
谈职薪资竞争力指数
41¥25300¥6800
88
18¥16900¥1800
79
32¥20000¥7100
79
41¥14500¥3200
77
23¥17100¥5700
70
32¥13500¥3900
70
18¥13000¥1500
66
10¥15200¥1200
66
16¥11900¥1700
61
28¥11200¥2600
61

市场需求

  • 北京
  • 上海
  • 广东省
  • 浙江省
  • 四川省
  • 江苏省
  • 重庆
  • 天津
  • 海南省
  • 福建省
  • 江西省
  • 山东省
  • 安徽省
  • 湖南省
  • 河南省
  • 湖北省
  • 辽宁省
  • 陕西省
  • 河北省
  • 吉林省
  • 黑龙江省
  • 新疆维吾尔自治区
  • 云南省
  • 广西壮族自治区
  • 贵州省
  • 甘肃省

6月新增岗位

29

对比上月:岗位减少2

数据由各大平台公开数据统计分析而来,仅供参考。

岗位需求趋势

不同经验岗位需求情况

工作年限月度新增职位数职位占比数
应届8
29.6%
3-5年14
51.9%
5-10年5
18.5%

岗位在变化,但招聘判断始终只看一件事:你是谁

赢得机会,你的简历需要更快被读懂

查看简历职业角色判断

不同城市的需求分析

大数据开发岗位在不同城市的需求分布如下,点击城市可查看当地大数据开发的招聘、薪资和就业数据。

#1 上海
8.1%41 个岗位
#2 南京
8.1%41 个岗位
#3 广州
6.3%32 个岗位
#4 北京
6.3%32 个岗位
#5 成都
5.5%28 个岗位
#6 深圳
4.6%23 个岗位
#7 东莞
3.6%18 个岗位
#8 郑州
3.6%18 个岗位
#9 重庆
3.2%16 个岗位
相似职位热门职位热招公司热招城市相似名称
陈晶晶重构后

个人总结

  • 前置职业定位
  • 去除泛化表达
  • 让内容直接服务判断
TANZHI AI

你的简历,会被判断成这个职位要找的人吗?

上传简历,看看当前表达会让招聘方形成怎样的职业角色判断

查看简历判断
推荐阅读

热招职位

数据开发工程师

北京本科及以上1年以下

1、深度参与集团数据解决方案规划和架构设计,利用大数据解决当前的业务痛点;

2、深度参与集团数据架构的设计与开发;

3、深度参与集团数据质量体系的建设,形成完善的数据监控和数据校验机制;

4、负责企业级数据平台的搭建与优化,包括数据采集、存储、计算、调度等核心模块(如基于Hadoop/Spark/Flink构建离线,实时数仓)。

5、设计高可靠的数据ETL流程,处理结构化/非结构化数据,保障数据质量与时效性。

6、开发实时数据管道,支持业务实时决策;解决流程处理。

数据研发工程师

北京学历不限1年以下

1、负责掌阅集团企业级数据建设(涵盖流量、内容、用户、商业化等业务方向),提供通用、稳定、丰富、高效的公共数据能力,提升
数据支持业务的效率,探索数据增量价值;

2、面向流量、内容、用户、商业化等业务方向,建设专题数据,提供丰富易用的数据服务,直接支持公司业务决策分析,赋能业务;

3、建设企业级数据治理和管理体系,结合业务+元数据+技术,推进资源成本的优化,提高数据服务质量,保障数据产出的稳定性和准确性;

4、参与公司级别商业化相关系统数据设计、研发以及保障。

广告/传媒/文化/体育

1.计算机相关专业本科及以上学历,硕士优先,具备1年以上Java开发经验,有互联网大厂背景或AI Agent项目开发经验者优先

2.精通Java技术栈,熟悉JVM原理、多线程、IO模型,具备扎实的分布式系统设计能力(如微服务架构、分库分表、高可用设计);熟悉AI Agent基础架构,掌握LLM(大语言模型)调用、工具集成、记忆系统与规划器设计原理,有主流Agent框架开发经验者优先

3.熟悉大数据技术体系(如实时计算框架、分布式数据库、消息队列),具备千万级数据量或高并发场景开发经验,有结合大数据系统构建AI Agent数据检索与推理能力的实践经验者优先

4.具有广告、支付、风控等核心业务系统开发经验,熟悉用户生命周期管理、结算对账等业务逻辑者优先

5.优秀的逻辑思维与沟通能力,能够跨团队协作推进项目落地,对技术趋势保持敏感并主动探索实践;对AI Agent前沿技术(如多Agent协作、基于记忆的持续学习)及Vibe Coding相关工具链有深入理解,能结合业务场景设计创新解决方案者优先

1.熟练掌握C++、多线程、网络通信、高性能优化,或者熟练掌握Java开发和调优、并发编程模式,有丰富Unix/Linux环境开发经验。

2.具备丰富的数据开发经验,熟悉Hadoop、Hive、Spark、flink等体系结构,并有实际开发经验。

3.熟悉Impala/Presto/GreenPlum/Clickhouse等MPP数据库,对各数据库的优劣和适用场景有深入理解,有实践经验者优先。

4.熟悉分布式技术并有实践经验(rpc框架, nosql存储),对kafka等消息中间件有深入了解。

5.大学本科及以上学历,三年以上计算机相关工作经验,有强烈的求知欲和较强的学习能力,对技术充满热情。

负责提升自动驾驶数据闭环能力,结合自动驾驶模型算法的设计与迭代流程,建设高效的数据分析系统与工具。具体职责包括数据分析与挖掘、数据检索与标签系统搭建、数据的修复与生产、从数据维度出发的模型效果闭环提升等。

1. 数据策略制定:涉及挖掘框架,开发挖掘算子,与模型训练团队深度协作,指导数采团队定向增补高价值数据;通过数据消融实验,科学确定预训练数据、微调数据、难例数据的配比,最大化有限数据的训练收益;建立数据质量评估体系(信息密度、场景分布、标注质量、多样性等);

2. 构建自动数据生产流水线:研发并维护自动化标注流水线,降低人工标注依赖;

3. 探索利用生成式AI(Diffusion model, NeRF/3D Gaussian)合成高价值训练数据,解决corner case数据稀疏问题;

4. 建立标注质量自动检测机制,确保训练数据的可靠性;

5. 构建数据处理平台:构建TB-PB级数据分布式处理流水线,实现高效去重、过滤、清洗、格式转换;

6. 建立数据版本管理和数据血缘系统,确保训练模型的可复现性和数据溯源;

7. 优化数据存储格式和访问效率,支持模型训练过程中高效数据加载和在线采样

骑行-数据开发工程师

北京学历不限1-3年

1.承担美团骑行业务线的数仓设计和开发工作。
2.负责骑行财务方向相关数据平台的架构设计与开发,支撑数据采集、清洗、存储与分析全流程。
3.负责数据质量、成本、安全等各方向数据治理工作。
4.构建高可用、可扩展的数据处理系统,优化数据模型与计算性能,提升数据服务效率。
5.负责数据Agent落地、迭代,推动AI自动化运维、端到端需求交付。
6.与产品、算法、业务团队协作,深入理解骑行场景需求,输出高质量的数据解决方案。

1、负责多模态数据处理链路的推理优化,分析性能瓶颈,软硬件结合优化,实现包括语言识别、计算机视觉等多方向的推理优化,达到极致性能;

2、负责多模态数据处理链路的可观测性工具建设,包括数据处理、模型推理的监控、告警等;

3、负责异构资源(GPU、CPU等硬件)的调度优化,实现潮汐资源、混部资源、多云资源的最优化调度

4、负责集群和业务服务的稳定性治理、资源利用率提升,通过系统化方式提高GPU、CPU等硬件资源的使用效率。

5、参与设计高吞吐、低延迟的数据处理 pipeline。针对大模型数据处理场景(如LLM、多模态),优化数据清洗、预取、缓存及异步加载策略,确保数据大规模产出。

负责搭建并管理面向多模态视频领域大模型的全链路数据体系,包括数据评测、加工、合成与标注。作为模型算法团队与数据采集团队的核心桥梁,确保高质量、多样化数据供给。主要工作包括以下:

1. 评测体系构建:主导多模态视频领域大模型的评测标准制定,建立涵盖理解、生成、对齐、安全四大维度的评估框架,设计人工评测与自动评测相结合的混合评估方案,搭建评测数据集、生产管线,建立与SOTA模型(GPT-4V、Claude、Gemini等)的对比评测机制,输出专业评测报告。

2. 数据链路架构:构建大规模多模态训练数据的全生命周期处理链路:采集→清洗→去重→质量筛选→格式标准化→安全过滤,搭建数据质量监控体系,建立数据价值评估模型,确保高信息密度数据的持续供给;

3. 标注规范与质量体系:制定细粒度多模态标注规范:图像详细描述、视频时序标注、跨模态对齐、复杂推理链标注等;建立分层质检机制:机器预检→人工抽检→专家终审,确保标注的质量;设计标注人员培训体系与能力认证标准,搭建领域专家标注团队。

数据挖掘工程师

北京学历不限1-3年

岗位职责:
1.使用各类数据挖掘技术及机器学习算法以及大模型等前沿技术,基于海量多模态行为数据,构建完整的用户画像与兴趣建模体系,精准刻画用户行为。
2.结合对业务理解,深入挖掘数据价值,将业务问题转化为可建模的算法问题并推动在业务场景下应用,拿到业务结果。
3.深入思考产品业务价值,参与制定及落实团队在技术、业务等多维度发展方向。
4.深入理解食杂零售餐饮供应链业务逻辑和运营模式,与业务、产品、工程、数据等团队紧密协同,完成从业务问题到算法问题的抽象与定义,设计指标体系,进行算法技术选型和方案设计实现,推动落地应用。

长城汽车-数据挖掘岗(048236)

北京学历不限1年以下

对自动驾驶数据闭环系统的数据挖掘及分析,包括

1. 基于自动驾驶大数据处理平台(例如Hadoop/Spark),利用数据挖掘、机器学习等相关算法,解决自动驾驶业务需求,为自动驾驶评测、功能迭代,运营决策提供数据分析依据

2. 与产品、系统等团队配合,分析和挖掘自动驾驶功能的体验痛点、表征原因、内在规律等,例如自动驾驶功能潜在风险与事故的数据分析与规律等

3. 负责自动驾驶领域的数据探索,从场景,评价,用户,运营等多个维度挖掘数据价值,发现数据和业务背后规律,应用于产品研发、用户运营、商业等各种领域

4、独立使用flask+vue+python(pandas、numpy、matplot、pyechart等)搭建数据中心的产品质量评估系统,完成多源数据融合分析、自动化评估、大数据分析统计、可视化展示等任务。

1. 计算机、数学或统计学相关专业硕士及以上学历;

2. 熟练掌握AI协助的计算法程序编写,有扎实的数据结构和算法基础;

3. 具备优秀的分析和解决问题的能力,良好的沟通协作能力;

4. 有大模型、机器学习、强化学习、信息检索、自然语言理解、推荐系统、计算广告学及算法博弈论相关领域研究和实践经验,在以上领域的国际会议(SIGIR、SIGKDD、ICML、NIPS、WSDM、WWW、AAAI、CIKM、ACL、RECSYS)或者期刊上发表过论文者更佳;

5. 参加过ACM或数据挖掘&机器学习类竞赛(天池大奖赛、Kaggle)并取得好名次者更佳;

6. 参与过机器学习开源项目并有突出贡献者更佳;

【课题说明】Agentic Search是以大模型为核心,具备自主感知、推理与行动能力的搜索新范式。它通过理解用户复杂意图,动态规划搜索路径,主动调用多种工具和数据源,持续优化结果推荐与交互体验。本课题旨在研究和构建面向美团App本地生活服务的Agentic Search系统,探索其在多轮对话、复杂任务分解、实时信息整合等场景下的关键技术与应用价值,推动本地生活智能搜索技术的创新升级。【建议研究方向】1.意图理解与任务分解:探索大模型在复杂用户需求下的多意图识别、任务分解、子任务规划能力,提升系统对复合型检索场景的适应性和响应能力。
2.多轮工具调用技术研究:赋予LLM长链路的多轮工具调用能力,打造基于强化学习等前沿技术的LLM后训练方案,提升多轮调用时的精确性及用户的实际交互体验。
3.增量学习训练技术探索:针对本地生活场景中数据不断更新的特点,运用增量学习技术,使 AI 搜索模型能够快速适应新数据。搜索结果可解释性提升:探索基于大模型内容深度理解与推理的可解释理由生成,增强用户对搜索结果的信任感和透明度。