赵鹏阳
北京
15330050984
pengyang.zhao@foxmail.com
个人概述
清华大学电子工程系博士,具备近 3 年影像算法研发经验,聚焦
AIGC、图像复原与数据工程。曾主导/参与过文字图像复原、人像美颜、RAW
域生成式复原算法研发,具备 Diffusion 训练、LoRA 微调、基于 DPO
的生成模型偏好对齐、视觉表征模型应用、大规模自动化数据清洗与难例挖掘经验;探索长效
AI 协同方式,善于沉淀 AI
基建与自动化;具备从算法预研到算法落地与业务提效的完整经验。
教育经历
清华大学 - 博士 - 电子工程系
2017.09 - 2023.10
吉林大学 - 学士 - 信息工程
2013.09 - 2017.06
工作经历
高级算法工程师 - 荣耀终端有限责任公司
2023.10 - 至今 (~2年零9个月)
核心项目经历
基于生成式架构的文字场景图像复原系统
项目职责:针对现实复杂退化场景下的文字图像,主导从数据闭环、复原算法研发到落地的全流程。
- 生成式复原算法研发:主导从传统 Transformer 向 JiT + Flow Matching
生成式架构演进,引入像素级结构约束缓解文字笔画幻觉与结构失真;探索基于
CLIP 对比学习的汉字 embedding
方案。整体方案相较基线模型,主观盲测胜率接近
100%,文本识别准确率相对提升 12%、识别置信度提升
26%,成功支撑下一代旗舰机影像卖点特性。
- 数据闭环与数据工程:构建由 VLM
驱动的大规模自动化数据清洗与测评管线。微调 Qwen3-VL-8B
建立难例挖掘与价值过滤机制,对输入图像进行多维质量量化,实现对网络数据中高质量文字图像的自动化、高精度筛选与过滤。融合实采、渲染合成、网络数据与
T2I
生成数据等异构源,构建出百万级规模的高质量文字复原训练集,形成可持续迭代的数据闭环体系。
生成式人像精修与瑕疵感知算法预研
项目职责:面向相册后处理与云端修图场景,负责人像精修模型微调与精细化后处理。
- 生成式人像精修:基于约 3 万组专业人工及软件精修人像数据,对 FLUX.2
Klein 4B 进行 LoRA
微调;通过引入隐空间低频约束缓解色彩漂移问题;基于人工偏好数据开展 DPO
后训练,对齐人像精修偏好。
- 人脸瑕疵分割:基于约 3 万张数据训练多类别 U-Net
分割模型,采用软边界监督改善细小瑕疵的边界定位效果,结合类别权重及 Mask
后处理融合算法,为不同类型瑕疵的精细调整提供支持。
RAW 域 Diffusion 算法预研
项目职责:针对 RAW 域图像传统复原模型的画质上限,引入生成式方案,探索多帧输入条件下的模型结构设计与 RAW 域信息注入策略。
- 跨空间条件注入设计:针对 FLUX.1-dev 12B 隐空间与多帧 RAW
域的模态差异,通过引入 Bayer 数据流与 LoRA
微调显式约束底层结构,显著提升 RGB
域的图像重建质量。此外,结合对抗生成损失对模型进行单步蒸馏,将推理过程压缩至单步,实现生成速度的跨越式提升。
- Latent/Pixel 扩散方案架构选型:对比预研 Latent 与 Pixel
空间扩散两大路线,分析不同域下图像重建 loss
的有效性,探究“清晰度”与“保真度”两者在不同技术路线上的差异,为模型定型与演进奠定基础。
- 多帧时序建模:借鉴 Video Diffusion 的模型扩展方法,通过 inflation
方式将图像生成模型扩展至多帧结构,引入 temporal attention
建模跨帧依赖,探索其在多帧 RAW 复原中的应用及训练数据构建方法。
专业技能
- 生成式视觉算法:熟悉 Diffusion、DDPM、Flow Matching、JiT、LoRA /
PEFT 等技术/知识,了解 SD、FLUX、CogVideoX、HunyuanVideo、Wan
等开源模型。
- 多模态与后训练:具备 Qwen3-VL 微调、视觉表征模型应用及 DPO
偏好对齐实践;理解 Reward Modeling、PPO 等 RLHF 核心方法;持续跟踪 VLM
领域开源模型发展。
- 开发技能/工具:Python、PyTorch、Diffusers、PEFT、Git、Docker、Codex/CC
等。
- 英语能力:通过大学英语六级考试;具备良好的英语听说读写能力,能够快速浏览英文文献和书籍。
荣誉奖励
- 荣耀 2024 年度微光者、荣耀知识之星
- 国家奖学金、奇虎 360 奖学金、三星奖学金
- 校优秀学生干部、校优秀学生、校级国家奖学金标兵
论文
发表与参与论文 7 篇,研究方向聚焦生物识别与图像复原。
- P. Zhao, S. Zhao, L. Chen, W. Yang, and Q. Liao,
"Exploiting Multi-perspective Driven Hierarchical Content-Aware Network
for Finger Vein Verification," IEEE Trans. Circuits Syst. Video
Technol., vol. 32, no. 11, pp. 7938-7950, Nov. 2022.
- P. Zhao, S. Zhao, J.-H. Xue, W. Yang, and Q. Liao,
"The Neglected Background Cues Can Facilitate Finger Vein Recognition,"
Pattern Recognit., vol. 136, Art. no. 109199, Nov. 2022.
- P. Zhao, Z. Chen, J. Feng et al., "Single-Sample
Finger Vein Recognition via Competitive and Progressive Sparse
Representation," IEEE Trans. Biometrics, Behavior, Identity
Sci., vol. 5, no. 2, pp. 209-220, Apr. 2023.
- Y. Song, P. Zhao, W. Yang, J. Zhou, and Q. Liao,
"EIFNet: An Explicit and Implicit Feature Fusion Network for Finger Vein
Verification," IEEE Trans. Circuits Syst. Video Technol., vol.
33, no. 5, pp. 2520-2532, May 2023.
- Q. Bao, R. Zhu, B. Gang, P. Zhao, W. Yang, and M.
Qing, "Distilling Resolution-robust Identity Knowledge for
Texture-Enhanced Face Hallucination," in Proc. 30th ACM Int. Conf.
Multimedia, 2022.
- S. Zhao, J. Wen, L. Fei, B. Zhang, P. Zhao, and S.
Li, "Structure Suture Learning Based Robust Multi-View Palmprint
Recognition," IEEE Trans. Neural Netw. Learn. Syst., 2022.
- S. Zhao, J. Wu, B. Zhang, L. Fei, S. Li, and P.
Zhao, "Adaptive Graph Embedded Preserving Projection Learning
for Feature Extraction and Selection," IEEE Trans. Syst., Man,
Cybern., Syst., vol. 53, no. 2, pp. 1060-1073, Feb. 2023.