王明远 · 语音&视频&图形开发

中文·modern #人工智能 #技术专家
王明远
语音视频图形开发专家(AI方向)
188 8888 8888zhangsan@example.comzhangsan杭州
github.com/username
1988-12在职-看机会30K-50K
汉族中共党员广东深圳已婚

个人总结

王明远,语音视频图形开发专家(AI方向),约9年经验,专注从传统音视频编解码到深度学习驱动的图形渲染与语音合成,主导多款亿级用户产品的媒体引擎架构。核心成就:基于Tacotron2+WaveGlow搭建多语种语音合成引擎,支撑1.2亿日活,MOS达4.2;自研轻量级面部动画网络与3D渲染引擎,将推理耗时至8ms、帧率稳定60fps,适配90%移动设备。精通语音处理、视频编解码、实时通信、3D渲染及深度学习,兼备C++/Python移动端全栈优化能力,持续推动亿级产品体验与成本突破。

教育经历

浙江大学计算机科学与技术学院计算机科学与技术学士
2010.09 - 2014.06

专业技能

语音处理
9/10
精通
视频编解码
9/10
精通
实时通信
7/10
熟练
3D渲染
7/10
熟练
深度学习
9/10
精通
C++
9/10
精通
移动端开发
7/10
熟练
Python
7/10
熟练

荣誉奖项

发明专利《一种基于深度学习的语音合成方法》honor
2021

授权发明专利,应用于语音助手引擎。

公司年度技术创新奖honor
2022

在实时3D虚拟形象渲染系统中的贡献。

ACM Multimedia竞赛亚军honor
2019

视频超分辨率算法赛道亚军。

工作经历

主任工程师某AI创业公司
2021.06 - 至今
主任工程师|AI媒体技术部
  • 从零搭建基于深度学习(Tacotron2+WaveGlow)的多语种语音合成引擎,训练5000+小时数据,实时合成延迟<100ms,中、英、日、韩四语种MOS评分达4.2,支撑语音助手日活1.2亿用户。

  • 主导3D图形渲染引擎研发,结合自研轻量级面部动画网络,将单帧面部关键点推理耗时从25ms压缩至8ms,集成WebRTC传输层,远程虚拟形象渲染帧率稳定60fps,模型体积缩减70%,适配90%以上移动设备。

  • 融合NLP与情感语音合成,设计基于Transformer的韵律预测模块,驱动3D虚拟形象的表情与口型同步,实现多轮对话中8种情感动态切换,用户留存率提升18%,对话完成率提高22%。

  • 攻克低延迟实时通信瓶颈,优化WebRTC的jitter buffer与FEC策略,结合端侧深度学习降噪模块,将端到端音视频延迟控制在150ms以内,支撑10万级并发房间,卡顿率低于0.3%。

语音合成3D渲染深度学习自然语言处理WebRTC
高级软件开发工程师某互联网大厂
2018.04 - 2021.05
高级软件开发工程师|多媒体技术中心
  • 主导某互联网大厂实时通信系统的视频编解码模块重构,针对H.264/H.265标准优化编码参数与硬件加速策略,同等画质下码率降低32%,节省带宽成本超2000万元/年。

  • 基于FFmpeg与OpenGL实现端到端低延迟视频渲染管线,在移动端将解码到显示延迟从120ms压缩至35ms,支撑亿级日活用户的视频通话体验。

  • 设计并落地动态码率自适应算法,结合网络质量实时切换编码参数,弱网环境下视频卡顿率下降58%,用户通话时长提升14%。

  • 引入CUDA加速的H.265编码前处理模块,将4K视频实时编码计算开销降低40%,支持同机并发处理200路以上流媒体任务。

  • 作为技术专家评审并重构团队视频质量评估体系,建立基于PSNR/SSIM/VMAF的自动化回归测试,缺陷检出率提升至95%,关键问题平均修复周期缩短至2小时。

H.264/H.265视频编解码实时通信FFmpegOpenGL
软件工程师T-Corp
2016.01 - 2018.03
软件工程师|音视频平台部
  • 针对T-Corp移动端音频SDK性能瓶颈,重构基于NDK的跨平台音频处理层,AAC/MP3解码速度提升40%,内存占用降低25%,支撑3款日活超千万的短视频应用流畅播放。

  • 主导设计并实现移动端实时降噪算法,采用频域维纳滤波结合VAD技术,嘈杂环境下信噪比提升12dB,用户通话反馈满意度提高30%。

  • 开发动态CPU/GPU负载均衡方案以适配Android/iOS碎片化设备,使音频处理线程在低端机型上帧率稳定30fps,崩溃率从0.8%降至0.1%以下。

  • 优化音频渲染管线,引入零拷贝缓冲区与异步回调机制,端到端播放延迟从120ms压缩至45ms,通过多核并行化将DSP模块耗时降低55%。

  • 建立自动化音频质量测试框架,集成PSQM/PESQ客观指标与主观听感评分,覆盖200+真实设备场景,单轮回归测试时间从3小时缩短至20分钟。

音频处理AAC/MP3降噪Android/iOSNDK
初级开发工程师头部电商平台
2014.07 - 2015.12
初级开发工程师|基础研发部
  • 负责头部电商平台多媒体SDK中图像处理模块的迭代,使用C++重写核心图像缩放与颜色空间转换算法,处理耗时从平均12ms降至4ms,支撑双11期间日均超2亿张图片的实时处理。

  • 主导编写Python自动化单元测试套件,对SDK中23个关键API进行边界与压力测试,测试覆盖率从68%提升至94%,上线后图像相关缺陷率下降52%。

  • 针对Android低端机型内存不足问题,引入分块解码与动态缓存策略,使SDK在1GB RAM设备上的图片解码成功率从82%提升至99.7%,减少用户图片加载失败投诉。

  • 设计并实现图像EXIF信息提取与方向矫正模块,支持JPEG/PNG/WebP等8种主流格式,累计处理超5亿张用户上传图片,矫正准确率达99.9%。

  • 搭建基于Jenkins的持续集成流水线,集成C++单元测试与Python集成测试,将每次代码提交的回归测试周期从40分钟压缩至8分钟,提升团队迭代效率。

多媒体SDK图像处理C++Python单元测试

项目经历

技术负责人智能语音助手引擎
2020.03 - 2021.02
技术负责人
  • 主导设计并实现基于端到端深度学习的智能语音助手引擎(Transformer+Tacotron2+Jasper),将TTS与ASR模块统一为共享编码器架构,模型参数量压缩40%,推理延迟降低至120ms以内。

  • 引入自研流式语音合成方案,结合WaveRNN声码器与注意力对齐剪枝算法,首句合成耗时从1.2s降至320ms,支撑日均800万次实时语音交互请求。

  • 针对噪声环境下ASR准确率低的问题,设计多任务学习框架(联合CTC/Attention与语音增强分支),中文通用识别准确率从91.3%提升至96.1%,方言识别率提升8.2个百分点。

  • 构建包含20万小时带标注语音语料库的自动清洗与增强管道(VAD+降噪+频谱重采样),基于该数据训练的TTS模型MOS评分达4.52(5分制),优于主流商业API约0.3分。

  • 主导引擎在Android/iOS端侧部署的全链路优化:使用INT8量化与算子融合将模型体积压缩60%,端到端唤醒响应时间(语音输入到语义理解结果返回)控制在280ms以内,上线后用户满意度提升22%。

语音合成语音识别深度学习TTSASR
核心开发实时3D虚拟形象渲染系统
2022.01 - 2023.06
核心开发
  • 针对实时驱动3D虚拟形象的需求,设计并部署基于单目RGB摄像头的轻量级人体姿态估计模型(MobileNetV3+HRNet),在移动端实现30fps实时推理,驱动Unity中虚拟角色骨骼动画,端到端延迟低于50ms。

  • 主导研发基于GAN的动作生成与网格映射模块,将低维姿态关键点实时转换为高保真3D网格,支持多角色同屏渲染,在2560×1440分辨率下稳定60fps,内存占用仅320MB。

  • 自研姿态平滑与插值算法(融合卡尔曼滤波与LSTM时序模型),有效消除21关节点抖动,动作自然度主观评分提升35%,用户留存率提高12%。

  • 构建从摄像头采集到3D渲染的全链路流水线,优化Unity渲染管线(GPU实例化+遮挡剔除+延迟着色),同时渲染4个虚拟形象,帧率提升2.1倍,内存降低40%。

  • 设计基于姿态的自适应LOD系统,根据用户与虚拟形象距离动态切换4级模型精度,在保持视觉保真度前提下节省30%计算资源,系统覆盖200万+用户。

3D渲染姿态估计深度学习Unity实时渲染
算法工程师视频超分辨率算法研究
2019.01 - 2019.12
算法工程师
  • 针对视频超分辨率中时序闪烁与细节模糊问题,设计基于GAN的时空融合网络(STF-GAN),引入3D卷积与光流对齐模块,在TensorFlow下实现端到端训练;在Vid4和UDM10基准集上PSNR达28.3dB(+0.9dB)、SSIM 0.912(+0.025),推理速度30fps,支撑实时视频流处理。

  • 主导模型轻量化以降低移动端部署成本:采用知识蒸馏将教师网络压缩至学生网络,结合INT8量化与算子融合,模型体积从120MB降至28MB,在骁龙855设备上实现25fps实时超分,功耗降低40%,通过内部播放器灰度测试覆盖500万日活用户。

  • 联合编解码团队设计“传输-后处理”协同方案:将超分辨率模型集成到视频播放器的后处理管线,针对720p传输的1080p片源,主观画质MOS分从3.2提升至4.5;A/B测试显示用户观看时长平均增加12%,卡顿投诉率下降18%。

  • 创新性提出频域感知对抗损失(FPA-Loss),在判别器中加入FFT分支以约束高频细节一致性;盲测评测相比传统VDSR和EDSR减少伪影率63%,用户偏好度从56%升至78%。

  • 自建大规模视频超分数据集(含200万对720p→1080p样本),覆盖运动模糊、压缩损伤、低光照等8种退化类型;搭建自动化训练与评测流水线(PyTorch+MLflow),将单次模型迭代周期从3周缩短至1周,全年支持团队产出4个核心算法版本并全量上线。

超分辨率GAN视频处理TensorFlowPyTorch

示例数据,仅供参考