王明远 · Audio, Video & Graphics Developer
工作经历
从零搭建基于深度学习(Tacotron2+WaveGlow)的多语种语音合成引擎,训练5000+小时数据,实时合成延迟<100ms,中、英、日、韩四语种MOS评分达4.2,支撑语音助手日活1.2亿用户。
主导3D图形渲染引擎研发,结合自研轻量级面部动画网络,将单帧面部关键点推理耗时从25ms压缩至8ms,集成WebRTC传输层,远程虚拟形象渲染帧率稳定60fps,模型体积缩减70%,适配90%以上移动设备。
融合NLP与情感语音合成,设计基于Transformer的韵律预测模块,驱动3D虚拟形象的表情与口型同步,实现多轮对话中8种情感动态切换,用户留存率提升18%,对话完成率提高22%。
攻克低延迟实时通信瓶颈,优化WebRTC的jitter buffer与FEC策略,结合端侧深度学习降噪模块,将端到端音视频延迟控制在150ms以内,支撑10万级并发房间,卡顿率低于0.3%。
主导某互联网大厂实时通信系统的视频编解码模块重构,针对H.264/H.265标准优化编码参数与硬件加速策略,同等画质下码率降低32%,节省带宽成本超2000万元/年。
基于FFmpeg与OpenGL实现端到端低延迟视频渲染管线,在移动端将解码到显示延迟从120ms压缩至35ms,支撑亿级日活用户的视频通话体验。
设计并落地动态码率自适应算法,结合网络质量实时切换编码参数,弱网环境下视频卡顿率下降58%,用户通话时长提升14%。
引入CUDA加速的H.265编码前处理模块,将4K视频实时编码计算开销降低40%,支持同机并发处理200路以上流媒体任务。
作为技术专家评审并重构团队视频质量评估体系,建立基于PSNR/SSIM/VMAF的自动化回归测试,缺陷检出率提升至95%,关键问题平均修复周期缩短至2小时。
针对T-Corp移动端音频SDK性能瓶颈,重构基于NDK的跨平台音频处理层,AAC/MP3解码速度提升40%,内存占用降低25%,支撑3款日活超千万的短视频应用流畅播放。
主导设计并实现移动端实时降噪算法,采用频域维纳滤波结合VAD技术,嘈杂环境下信噪比提升12dB,用户通话反馈满意度提高30%。
开发动态CPU/GPU负载均衡方案以适配Android/iOS碎片化设备,使音频处理线程在低端机型上帧率稳定30fps,崩溃率从0.8%降至0.1%以下。
优化音频渲染管线,引入零拷贝缓冲区与异步回调机制,端到端播放延迟从120ms压缩至45ms,通过多核并行化将DSP模块耗时降低55%。
建立自动化音频质量测试框架,集成PSQM/PESQ客观指标与主观听感评分,覆盖200+真实设备场景,单轮回归测试时间从3小时缩短至20分钟。
负责头部电商平台多媒体SDK中图像处理模块的迭代,使用C++重写核心图像缩放与颜色空间转换算法,处理耗时从平均12ms降至4ms,支撑双11期间日均超2亿张图片的实时处理。
主导编写Python自动化单元测试套件,对SDK中23个关键API进行边界与压力测试,测试覆盖率从68%提升至94%,上线后图像相关缺陷率下降52%。
针对Android低端机型内存不足问题,引入分块解码与动态缓存策略,使SDK在1GB RAM设备上的图片解码成功率从82%提升至99.7%,减少用户图片加载失败投诉。
设计并实现图像EXIF信息提取与方向矫正模块,支持JPEG/PNG/WebP等8种主流格式,累计处理超5亿张用户上传图片,矫正准确率达99.9%。
搭建基于Jenkins的持续集成流水线,集成C++单元测试与Python集成测试,将每次代码提交的回归测试周期从40分钟压缩至8分钟,提升团队迭代效率。
项目经历
主导设计并实现基于端到端深度学习的智能语音助手引擎(Transformer+Tacotron2+Jasper),将TTS与ASR模块统一为共享编码器架构,模型参数量压缩40%,推理延迟降低至120ms以内。
引入自研流式语音合成方案,结合WaveRNN声码器与注意力对齐剪枝算法,首句合成耗时从1.2s降至320ms,支撑日均800万次实时语音交互请求。
针对噪声环境下ASR准确率低的问题,设计多任务学习框架(联合CTC/Attention与语音增强分支),中文通用识别准确率从91.3%提升至96.1%,方言识别率提升8.2个百分点。
构建包含20万小时带标注语音语料库的自动清洗与增强管道(VAD+降噪+频谱重采样),基于该数据训练的TTS模型MOS评分达4.52(5分制),优于主流商业API约0.3分。
主导引擎在Android/iOS端侧部署的全链路优化:使用INT8量化与算子融合将模型体积压缩60%,端到端唤醒响应时间(语音输入到语义理解结果返回)控制在280ms以内,上线后用户满意度提升22%。
针对实时驱动3D虚拟形象的需求,设计并部署基于单目RGB摄像头的轻量级人体姿态估计模型(MobileNetV3+HRNet),在移动端实现30fps实时推理,驱动Unity中虚拟角色骨骼动画,端到端延迟低于50ms。
主导研发基于GAN的动作生成与网格映射模块,将低维姿态关键点实时转换为高保真3D网格,支持多角色同屏渲染,在2560×1440分辨率下稳定60fps,内存占用仅320MB。
自研姿态平滑与插值算法(融合卡尔曼滤波与LSTM时序模型),有效消除21关节点抖动,动作自然度主观评分提升35%,用户留存率提高12%。
构建从摄像头采集到3D渲染的全链路流水线,优化Unity渲染管线(GPU实例化+遮挡剔除+延迟着色),同时渲染4个虚拟形象,帧率提升2.1倍,内存降低40%。
设计基于姿态的自适应LOD系统,根据用户与虚拟形象距离动态切换4级模型精度,在保持视觉保真度前提下节省30%计算资源,系统覆盖200万+用户。
针对视频超分辨率中时序闪烁与细节模糊问题,设计基于GAN的时空融合网络(STF-GAN),引入3D卷积与光流对齐模块,在TensorFlow下实现端到端训练;在Vid4和UDM10基准集上PSNR达28.3dB(+0.9dB)、SSIM 0.912(+0.025),推理速度30fps,支撑实时视频流处理。
主导模型轻量化以降低移动端部署成本:采用知识蒸馏将教师网络压缩至学生网络,结合INT8量化与算子融合,模型体积从120MB降至28MB,在骁龙855设备上实现25fps实时超分,功耗降低40%,通过内部播放器灰度测试覆盖500万日活用户。
联合编解码团队设计“传输-后处理”协同方案:将超分辨率模型集成到视频播放器的后处理管线,针对720p传输的1080p片源,主观画质MOS分从3.2提升至4.5;A/B测试显示用户观看时长平均增加12%,卡顿投诉率下降18%。
创新性提出频域感知对抗损失(FPA-Loss),在判别器中加入FFT分支以约束高频细节一致性;盲测评测相比传统VDSR和EDSR减少伪影率63%,用户偏好度从56%升至78%。
自建大规模视频超分数据集(含200万对720p→1080p样本),覆盖运动模糊、压缩损伤、低光照等8种退化类型;搭建自动化训练与评测流水线(PyTorch+MLflow),将单次模型迭代周期从3周缩短至1周,全年支持团队产出4个核心算法版本并全量上线。
Sample data, for reference only
Try a different style
Pick a style you like and create your resume in one click

















































