上海3D视觉算法工程师
3D视觉算法工程师是负责研发和实现3D视觉算法的专业人士。他们在计算机视觉、图像处理和机器学习领域有深厚的专业知识。工作内容包括利用摄像头或激光雷达等设备获取环境中的三维信息,并通过算法处理和分析这些数据,实现物体识别、位姿估计、场景重建等功能。3D视觉算法工程师需要具备扎实的数学基础和编程技能,能够熟练运用C++、Python等编程语言进行算法实现和优化。此外,他们还需要不断关注行业技术的发展,积极探索新的算法和方法,为产品和系统提供更加准确和高效的视觉解决方案。这是一个涉及多领域知识的高度专业化职位,对工程师的能力和创新思维提出了很高的要求。
薪酬概览
平均月薪
¥28700
中位数 ¥27500 | 区间 ¥21600 - ¥35800
数据来源:谈职全网18份招聘数据;更新时间:2026年7月13日
月薪分布
61.1% 人群薪酬落在 15-30k

三大影响薪酬的核心维度
影响薪资的核心维度1:工作年限
影响薪资的核心维度2:学历背景
市场需求
6月新增岗位
32
对比上月:岗位新增22
数据由各大平台公开数据统计分析而来,仅供参考。
岗位需求趋势
不同经验岗位需求情况
| 工作年限 | 月度新增职位数 | 职位占比数 |
|---|---|---|
| 应届 | 14 | 60.9% |
| 1-3年 | 5 | 21.7% |
| 3-5年 | 2 | 8.7% |
| 5-10年 | 2 | 8.7% |
热招职位
我们诚邀深耕计算机视觉前沿算法领域、基础功底扎实、具备独立科研创新能力的算法工程师加入以世界模型三维重建为核心技术方向的算法团队。你将深度参与底层算法设计、基础视觉模型研发与技术创新工作,主导 / 全程参与需求定义、模型架构设计、算法工程实现、落地验证与迭代优化全链路研究工作。立足前沿技术解决高保真、快速重建的技术瓶颈与业务核心痛点,持续驱动产品技术体验与业务效能升级,与团队共同攻坚前沿技术难题,打造业内领先、具备学术竞争力与工程落地能力的技术解决方案。
1.参与多模态具身智能大模型的算法设计、开发和优化工作,包括但不限于模仿学习、强化学习、迁移学习、多模态融合等技术在具身智能中的应用;
2.参与具身智能AI应用架构模型定义,应用运维、监控模型定义和框架开发和批量交付能力构建;
3.参与具身基础操作大模型研发,模型训练,仿真测试环境构建及真机测试,与硬件架构师合作,共同设计和优化完整的软件/硬件解决方案,以提供优秀的系统性能;
4.参与模型异构GPU芯片的软硬件技术平台的设计和算子加速优化;
5.参与跟踪和研究具身智能领域的最新技术和发展趋势,探索新的技术和方法在具身大模型中的应用,推动技术创新。
1. 负责大模型相关测评工作,包括但不限于模型性能、精度、安全性、鲁棒性、易用性等维度的测试设计与执行,输出专业测评报告,为模型优化提供数据支撑。
2. 主导大模型测试交付全流程,制定测试计划、设计测试用例、搭建测试环境,执行测试用例、定位并跟踪问题,确保测试工作按时、按质完成,保障模型交付质量。
3. 梳理大模型测试流程,提炼测试重点与难点,优化测试方法、用例设计及测试工具,提升测试效率和测试覆盖率。
4. 配合算法、研发团队,对接测试需求,反馈测试过程中发现的问题,推动问题闭环,参与模型迭代优化的讨论与落地。
5. 整理测试文档,包括测试计划、测试用例、测试报告、问题清单等,确保测试过程可追溯、可复盘。
6. 关注大模型测试领域的新技术、新方法,结合业务场景落地到实际测试工作中,提升测试专业性。
负责测试策略与方案设计、数据集构建与管理
评估算法在各种条件下的表现,对算法指标进行定量评估和分析;设计并执行算法性能基准测试(如时延、内存占用、功耗等)
开发和维护自动化测试脚本、框架和工具链,提升测试效率和覆盖率
问题追踪、badcase分析与报告撰写,向团队和管理层汇报算法质量状态、风险和建议
1. 参与基于 VGGT / Dust3R 等视觉重建 backbone 的 3D 点云场景流与动态 4D 重建算法研发,探索多帧几何一致性、动态物体运动建模与时空特征融合。
2. 跟踪并复现 3D/4D 视觉前沿方法,如 TraceAnything、V-DPM、4RC、D4RT、3DGS、Neural Rendering、Feed-forward Reconstruction 等,参与方案设计与技术选型。
3. 搭建自动驾驶场景下的数据处理、模型训练、评测分析与可视化流程,推动算法在真实数据和闭环仿真场景中的快速落地。
负责语音合成(TTS)核心算法的研发、性能优化与落地实现,推动TTS技术在实际产品中的应用;
结合业务规划,跟进学术界、行业最新的研究趋势,将预研成果落地于实际产品,并主导相关技术方案的制定和实施;
负责TTS相关技术难题的攻关,提升合成语音的自然度、表现力和鲁棒性;
指导和带领初级工程师,提升团队整体技术水平。
1.负责语音合成(TTS)的算法研发、性能优化与落地实现;
2.结合业务规划,跟进学术界、行业最新的研究趋势,将预研成果落地于实际产品。
设计、开发和维护 TTS 前端 Text Normalization / Inverse Text Normalization 模块,确保高准确率的文本预处理。
利用 NeMo text-processing 框架进行规则引擎开发及模型训练,覆盖数字、时间、货币、度量单位等多种文本形态的规范化处理。
根据不同语言的书写与发音特点,制定多语言TN规则及数据处理Pipeline。
1、负责手机 Android 平台端侧大模型全流程工程落地,包含模型部署、效果调优、功耗优化,保障大模型在手机系统稳定运行;独立完成模型压缩、量化、推理加速等工程方案设计与落地
2、承担 NLP 及用户行为类算法研发迭代:文本向量化、语义模糊检索、意图槽位识别、文本分类摘要、用户行为预测、POI 识别等,主导从传统机器学习到大模型垂域微调的技术迭代演进
3、统筹下一代 AIOS 整体技术规划与核心算法设计,覆盖意图理解、智能推荐、多 Agent 任务编排、模型 Runtime、系统框架语义化等核心模块搭建
4、持续跟踪全球端侧 AI 前沿技术发展趋势,输出行业技术洞察、中长期技术路线规划报告;牵头跨部门项目统筹、进度推进、成果复盘与高层汇报
- 负责研发和优化视频生成相关算法,包括基于深度学习的图像到视频、文本到视频等模型。
- 探索最新的生成模型技术(如Diffusion Models、GAN、Transformer等)并结合业务需求进行创新。
- 设计视频生成的整体技术架构,保证模型训练、推理和部署的高效性与稳定性。
- 协同前端、后端工程团队完成视频生成系统的产品化落地。
- 分析视频生成效果,持续优化模型质量、生成速度和用户体验。
1. 结合最新NLP技术(LLM,多模态等),赋能公司内产品或探索新产品形态
2. 参与语音助手开发,包括但不限于数据收集、校验、模型训练、模型评测、工程开发等
3. 负责NLP技术在语音助手、OS场景相关算法中的应用和拓展
4. 负责分析、挖掘语音助手回流数据,输出洞察结论辅助产品迭代优化

