陈思远 · 音视频算法工程师
个人总结
拥有近8年音视频算法经验,陈思远从底层编解码优化起步,逐步成长为覆盖实时通信与AI增强的技术专家。他主导了多项关键突破:在音频领域,基于谱减法与自适应滤波实现ARM平台降噪与回声消除,稳态噪声抑制达18dB、ERLE提升至32dB;在视频方向,通过NEON、CUDA及感知编码优化,使H.264/HEVC编码速度提升40%以上、延迟压缩至58ms。近年来,他深化AI应用,基于GAN的超分算法将1080p升至4K并降低30%算力成本,同时利用LightGBM与动态FEC将30%丢包下卡顿率降低42%。此外,独立开发的跨平台实时音频引擎将端到端延迟降至38ms,支撑日均亿级通话,并带领团队完成沉浸式音视频SDK架构,月均通话时长增长180%。核心优势:底层音视频编解码优化(ARM NEON/CUDA/SIMD)、实时通信算法(降噪、回声消除、自适应码率、FEC)、AI增强(超分辨率、带宽预测、空间音频)。技术影响力:从算法原型到全链路落地,主导多个百万级用户产品,覆盖VoIP、直播、沉浸式场景,获年度技术创新奖。
工作经历
针对VoIP实时通信场景中的背景噪声与回声,基于谱减法与自适应维纳滤波,主导设计可裁剪的音频降噪模块,在ARM Cortex-A7平台上将稳态噪声抑制达18dB,算法延迟控制在8ms内,CPU占用率仅12%。
为解决双向通话时回声滤波器发散问题,设计结合双端检测与归一化最小均方(NLMS)的自适应回声消除方案,通过优化步长控制策略使终端侧ERLE达到32dB,并在Matlab中完成200+组噪声场景仿真验证,确保全双工通话质量。
针对移动设备算力受限,利用C++重写核心滤波器与FFT运算,使ARM架构下执行效率提升40%,集成到产品原型后,音频预处理方案在低端硬件上稳定运行,显著降低因性能不足导致的丢包和卡顿。
构建包含5种典型噪声场景(车辆、办公室、街道、餐厅、风噪)的测试声库,开发自动化评估脚本,以不同信噪比下的MOS分作为调优依据,使混响环境下主观听感评分从2.8提升至4.1(5分制),支撑产品在客户现场的落地验收。
面对移动端视频实时编码性能瓶颈,主导基于ARM NEON指令集的H.264编码器优化,重写运动估计与DCT变换模块,使编码速度提升42%,功耗降低18%,并在3款主流SoC上通过稳定性验证。
为解决4K视频HEVC实时转码高延迟,利用CUDA并行架构重构x265运动估计与模式决策逻辑,将编码延迟从180ms压缩至58ms,吞吐量提升2.6倍,支撑单台GPU服务器处理8路4K流。
针对直播场景H.265编码质量劣化,设计自适应量化参数(QP)调整算法,结合人眼视觉特性与场景切换检测,在相同码率下PSNR提升0.9dB,BD-Rate降低13%,集成到公司核心转码管线。
为满足多平台兼容需求,构建基于SIMD(x86 SSE/AVX)与ARM NEON的跨平台H.264解码加速库,解码吞吐量提升55%,内存占用减少30%,支持Android/iOS/Windows三端统一接口。
主导基于WebRTC框架的自适应码率算法,融合改进的Google拥塞控制(GCC)与自研带宽估计模型,在30%丢包率下视频通话卡顿率降低42%,平均码率波动幅度减少32%。
开发动态FEC冗余编码策略,根据实时网络时延与丢包率自动调整冗余比例,使端到端延迟稳定在150ms内,视频PSNR提升2.3dB,媒体传输成功率提高至99.5%。
使用C++实现核心拥塞控制模块,搭建Python自动化仿真测试平台,覆盖120+种网络拓扑场景,在20%丢包率下视频流畅度提升38%,带宽利用率提高25%。
设计基于LightGBM的带宽预测模型,结合网络特征与历史趋势提前调整码率,将码率切换频率降低60%,有效消除视觉抖动,主观MOS评分提升0.8分。
作为算法专家重构音视频传输管道,将自适应码率决策周期从500ms压缩至100ms,带领3人团队完成全链路集成,支撑日活用户增长至500万以上。
主导研发基于GAN的深度学习视频超分辨率算法,针对1080p输入提升至4K分辨率,PSNR提升3.2dB、SSIM提升0.08,覆盖韵达云直播平台日均500万+视频流。
使用TensorRT与ONNX Runtime对超分模型进行推理优化,GPU端单帧处理延迟从120ms降至28ms,满足实时推流需求,节省30%算力成本。
设计自适应画质增强管线,集成去噪、锐化与色彩校正模块,在弱光场景下信噪比提升6.5dB,用户主观评分(MOS)提高0.7分。
构建自动化数据集生成与模型迭代流程,利用退化仿真与GAN对抗训练,使超分模型在压缩伪影修复任务中BD-Rate降低12.5%。
作为技术负责人,带领3人小组完成从算法原型到线上服务的全链路落地,通过A/B测试验证画质提升带来用户停留时长增加8.2%。
主导设计下一代沉浸式音频系统架构,提出基于深度学习的三维空间音频渲染管线,在8ms块延迟下实现64通道双耳输出,用户临场感评分提升40%。
针对AV1实时编码在沉浸式视频场景的瓶颈,创新引入感知驱动码率分配与帧级并行优化,使4K/60fps编码耗时降低35%,同等码率下VMAF提升12%。
构建VP9自适应流媒体传输方案,融合实时网络波动预测与QoE多目标优化模型,在20%丢包环境下保持95%以上流畅播放率。
设计实时通信QoE闭环反馈系统,聚合音频空间化失真、视频帧率波动、端到端延迟等16项指标,异常定位耗时从分钟级压缩至5秒内。
领导跨职能团队完成新一代沉浸式音视频SDK架构设计,支持AV1/VP9/空间音频无缝协同,上线后业务端月均通话时长增长180%。
项目经历
在云帧科技期间,独立领导开发了跨平台实时音频处理引擎,针对Windows、Linux及macOS三端统一架构,引入Opus与G.711动态切换策略,使端到端编码-传输-解码总延迟从行业平均120ms降至38ms,支撑日均百万级实时通话场景。
基于C++14与SIMD指令集对G.711 μ-Law/A-Law编解码进行纯软件优化,单核处理32路音频流的CPU占用降低62%;针对Opus FEC参数自适应调优,在5%丢包率下语音MOS分提升0.7至4.2。
设计并实现引擎的零拷贝音频流水线,通过环形缓冲区与内存池技术减少内存分配开销,在低端ARM设备(如树莓派4)上仍能维持10ms帧长下99.98%的实时处理成功率。
自主研发基于卡尔曼滤波的网络抖动缓冲区,动态调整深度为20~80ms,结合Opus的PLC(丢包隐藏)算法,将听感卡顿率压制至0.15%以下,显著优于同期WebRTC默认策略。
封装统一音频I/O接口对接ALSA、CoreAudio、WASAPI,发布时附带Python/C API绑定,支持外部算法插件热加载,内部测试覆盖200+场景,核心模块代码复用率超90%。
引擎上线后应用于公司内部低延迟语音SDK,支撑日均1.5亿分钟实时通话,同时兼容VoLTE与传统SIP协议栈,获公司年度技术创新奖,并被后续三款产品直接采用。
作为技术负责人,在2021年6月至2022年2月期间主导搭建视频编解码自动化测试与优化平台,覆盖H.264/H.265及AV1编码器,通过集成RDO(率失真优化)参数调优与多目标码率控制算法,在超5万条测试序列中实现PSNR平均提升1.2 dB、SSIM提高0.03,编码效率提升20%。
设计并实现基于VMAF的自动化回归测试流程,结合10余种主观质量模型与编码复杂度监测,在保证主观评分不低于95分的前提下,将编码比特率降低15~18%,单序列测试周期从人工2天缩短至自动化2小时。
针对不同分辨率与运动场景,构建自适应码率控制模块,引入分层QP调整与场景切换检测,使动态场景下码率波动降低40%,直播流中峰值信噪比稳定性提高25%。
开发编码器性能仪表盘,实时回传PSNR、SSIM、VMAF及编码时长等20余项指标,促成团队快速定位编码劣化根因;平台上线后支撑6个产品线迭代,编码优化迭代速度提升3倍。
教育经历
专业技能
荣誉奖项
因主导实时通信自适应码率算法获得该奖项。
因分享沉浸式音频技术获得该奖项。
示例数据,仅供参考
换个风格试试
挑一个喜欢的风格,一键创建你的简历

















































