AI INFRASTRUCTURE · LLM SERVING · HPC

蔡雨洋

把推理链路拆到可验证的内核、数据路径与运行时。

东南大学控制工程硕士研究生,曾获华为优秀实习生。关注 LLM 推理系统、 高性能计算与数值系统,在真实硬件上连接 kernel、runtime 与通信路径。

M.Eng. 2027

01 / SELECTED SYSTEMS

代表系统工作

每个结果都保留系统约束、本人动作与测量口径。

Huawei · HPC / AI Infra · Outstanding Intern

SGLang × DeepSeek V3/R1 on Kunpeng 920F

独立实现 SME BF16 GEMM 的 Pack、Cache Blocking 与 2VL×2VL ZA/MOPA 微内核;进一步主导 W8A8 Decode 跨 SGLang→C++ Adapter→KuTACC 的复测归因,完成 MLA TP-8 重排验收,并协助 MoE 通信链路联调与性能复核。

M/N/K=4096/2048/4096 核心计算达 25.47 TFLOPS,约为峰值的 85%;端到端 profiling 同时定位 Pack / 内存分配占时 53%。

KuTACC work branch ↗

OpenBMB × Huawei Ascend Challenge · Long-term Top 3

vLLM-Omni Full-duplex Inference

主导精确前缀事务复用、Talker 图与状态生命周期重构,以及无需 Classifier-Free Guidance 的 Flow Student 蒸馏;将 ACL Graph 21→1,并把 20 层 Fused Infer Attention 更新下沉为 2 次 C++ 分组调用。

完整性能配置下,端到端 Mean RTF 由 0.4435 降至 0.0795(-82.1%,5.58×)。

Optimization repository ↗

TencentDB Agent Memory · Issue #120 Top 3

Prompt Cache & Project Memory Runtime

独立修复 Recall 请求/历史写回不一致导致的 prefix-cache 失效;继而推进零反馈 Memory Runtime,贯通执行轨迹、分层记忆与跨任务召回,按来源、类型和任务域约束写入。

DeepSeek V4 Pro cache hit 由 71.36% 提升至 99.53%;项目记忆实现、 测试索引与最终交付已固定到可复核 commit。

Project Memory delivery PR #4 ↗

CUDA / CuTe · NVIDIA B300

FlashKDA Physical-aware Agentic Kernel Search

主导构建传统 HMMA 与 Blackwell 原生 Tensor Core 双分支 Agent 搜索;以双层 IR 记录 程序状态、编译结果与回退证据,108 项测试通过。

将 TP8 小 Head 的工作块由 12 扩展至 96,关键配置较官方降时 9.37%–26.10%, output/state 位级一致。

Correctness gate · output/state bitwise identical

02 / EXPERIENCE

经历与教育

职责边界与项目结果分开呈现,避免把团队上下文写成个人成果。

华为|HPC / AI Infra 开源 · 优秀实习生

独立完成 SME BF16 Kernel;主导 W8A8 Decode 复测归因;完成 MLA TP-8 重排验收;协助 MoE Gather-Pack→IGEMM→Dispatch/Combine 联调与性能复核。

东南大学|控制工程(电子信息)硕士

研究方向:HPC + 人工智能;硕士生导师:孙长银教授(国家杰青)。

东南大学|自动化(机器人工程)本科

优秀毕业设计:RL + Transformer 约束决策。

03 / RESEARCH & OPEN SYSTEMS

研究与开源协作

把低秩、稀疏与社区协作放回具体算法、误差门和执行路径中。

陈晓明(中科院计算所)× 周振亚(华大九天) · SolverChallenge 国三 · ICCAD 2026 一作

随机块低秩稀疏计算

主导低秩因子直连 Schur 更新,避免中间稠密块;以固定布局 GEMM 与在线重压缩 控制秩增长。

10 个 benchmark 较 CKTSO 几何平均 1.46×

CPIPC 创“芯”大赛国一 · ISEDA 2025

LatentFit 共享低秩潜空间

主导以截断 SVD 按尾能量选秩,在共享低秩潜空间求解后回投影,并按 shape 路由 SVD/QR;rank 67(393×)仅表示维度压缩。

误差 0.358%,校验阶段提速 13.8×

SGLang-Omni / vLLM Meetup / 北大未名超算队 × LCPU

Open-source & Systems Community

参与 SGLang-Omni ASR/TTS PR/CI,并结合 MiniCPM-o/昇腾实践沉淀 Model×Hardware×Engine 接入方法与正确性、性能验收路径。