林星宇 · Audio, Video & Graphics Developer

中文·tech #人工智能 #实习
林星宇
语音&视频&图形开发工程师(AI方向)
186 6666 6666zhaoliu@example.comzhaoliu北京
github.com/username
2000-09离职-随时到岗12K-18K
汉族群众福建厦门未婚

个人总结

人工智能与多媒体技术交叉背景,专注语音合成、实时降噪、视频风格迁移与图形渲染的算法工程化,具备从模型训练到端侧推理部署的完整闭环能力。在语音方向,针对低资源 Tacotron2+WaveRNN 系统设计韵律感知剪枝与多阶段蒸馏,结合 INT8 量化与 ONNX Runtime 引擎重构,将推理实时率从 2.0 压缩至 0.08(25 倍加速),并在 ARMv8 端侧实现首帧 <80 ms、内存 <50 MB 的实时合成;同时为实时音视频平台设计 GRU 轻量降噪模型,深度集成 WebRTC,移动端 CPU 占用 <4%、延迟 <20 ms。在视频与图形方向,独立主导视频风格迁移全链路研发,通过光流正则与联合感知损失抑制时序抖动,结合 TensorRT 量化在移动端实现 480p 26 FPS 实时风格化,获部门最佳技术突破奖;另有 Vulkan 光追混合渲染与 PBR 材质原型开发经验。

工作经历

语音算法实习生某智能语音实验室
2024-06 - 2024-09
语音算法实习生|AI研发部
  • 针对低资源语音合成任务中 Tacotron2+WaveRNN 系统推理实时率高达 2.0 的瓶颈,提出韵律感知剪枝与多阶段蒸馏策略,将实时率降至 0.4,合成 MOS 保持在 4.03。

  • 通过 INT8 量化将 WaveRNN 导出为 ONNX 格式,并基于 ONNX Runtime C++ API 重构推理管线,端到端实时率进一步压缩至 0.08,实现 25 倍整体加速。

  • 封装流式 C++ 合成接口与环形缓冲调度,在 ARMv8 设备上达成首帧延迟 <80 ms、内存占用 <50 MB 的实时语音合成,满足低资源端侧部署要求。

语音合成Tacotron2WaveRNNONNXC++模型量化

项目经历

核心开发者实时语音降噪系统
2024-02 - 2024-05
核心开发者
  • 在某实时音视频平台(代号 A)实习期间,作为 AI 降噪模块核心开发者,基于 RNNoise 架构引入轻量 GRU 循环单元,利用 Python 搭建训练管线,在自采多场景噪声集上完成模型设计,将参数量控制在 0.6M 以内。

  • 采用 C++ 重构推理引擎并与 WebRTC AudioProcessing 模块深度集成,通过算子融合和线程绑核优化,使单帧推理耗时 <1.5 ms,端到端音频处理总延迟稳定在 18 ms,达成 <20 ms 的实时要求。

  • 设计可控噪声混合与房间冲激响应(RIR)增强策略,在 -5 dB 低信噪比非平稳噪声下,语音 PESQ 较传统方法提升 0.5,MOS 从 2.8 提升至 3.4。

  • 在 ARMv8 移动平台上使用 NEON 指令集加速推理,将降噪模块 CPU 占用率控制在 4% 以内,并通过超过 500 人次的内测通话验证,不影响视频流和交互流畅度。

语音降噪RNNoiseGRU实时推理PythonC++WebRTC
算法负责人视频风格迁移应用
2023-10 - 2024-01
算法负责人
  • 为解决逐帧独立风格化导致的视频时序抖动,引入双向光流估计与相邻帧一致性正则项,设计联合感知损失训练策略,在自建影视片段上将时序闪烁指数降低约 38%,同时保持风格化帧 LPIPS ≤0.18。

  • 基于 PyTorch 重构轻量级生成网络,通过通道剪枝与知识蒸馏将参数量压缩至原始版本的 14%,模型体积从 48 MB 缩减至 6.7 MB,PSNR 下降 <1.2 dB,质量损失轻微。

  • 应用 TensorRT 进行 INT8 量化与层融合加速,结合异步推理与帧间状态缓存,在代号“Polaris”的移动端原型设备上实现 480p 视频实时风格化,稳定帧率 26 FPS,端到端延迟 <40 ms。

  • 搭建视频预处理与多帧并行推理流水线,集成轻量光流模块共享相邻帧特征,将 10 秒短视频完整风格转换耗时从 187 秒缩短至 63 秒,显著提升交互体验。

  • 作为算法负责人,独立主导从论文选型、模型优化到移动端部署的全流程研发,协调 1 名实习生完成效果评测与演示应用构建,项目获部门创新演示会“最佳技术突破奖”,并沉淀出可复用的视频风格化 SDK 组件。

视频处理风格迁移光流感知损失PythonPyTorchTensorRT
图形模块开发者图形学渲染引擎原型
2023-06 - 2023-09
图形模块开发者
  • 基于 Vulkan Ray Tracing 管线和 C++ 构建混合渲染原型,实现动态直接光照与初步路径追踪,在 1440×900 分辨率下达成 24 fps 交互帧率。

  • 集成基于 GGX BRDF 的 PBR 材质系统,编写粗糙度-金属度工作流 GLSL 着色器,在 IBL 环境下准确还原绝缘体与导体材质差异。

  • 针对区域光阴影降噪问题,设计自适应重要性采样策略,在保持接触硬化阴影细节的同时减少约 40% 采样数,单帧阴影计算耗时控制在 1.8 ms 以内。

  • 通过底层加速结构(BLAS/TLAS)增量更新与着色器指令优化,将动态对象移动时的场景重建延迟压缩至 2.5 ms,支撑原型实时编辑与预览。

图形渲染光线追踪PBRGLSLOpenGLC++Vulkan

教育经历

清华大学计算机系计算机科学与技术本科GPA: 3.8/4.0
2021-09 - 2025-06
  • 主修课程:数据结构与算法、计算机组成原理、操作系统、计算机网络、机器学习

  • 毕业设计:《基于对比学习的代码漏洞检测方法研究》获评校级优秀毕业论文

  • 获奖:全国大学生计算机系统能力大赛操作系统设计赛一等奖

专业技能

语音合成
9/10
精通
实时语音降噪
7/10
熟练
模型推理优化与部署
9/10
精通
视频风格迁移
7/10
熟练
图形渲染与光线追踪
7/10
熟练
WebRTC 音视频处理
4/10
了解

荣誉奖项

全国大学生人工智能大赛语音赛道一等奖honor
2024

基于改进WaveRNN的轻量级语音合成方案获得评委一致认可。

国家奖学金honor
2023

综合成绩前2%,校优干及科研表现突出获得国家奖学金。

Sample data, for reference only