LLM Systems Research

Yuhan Deng

智能计算实验室 · 大语言模型高效推理

CURRENT FOCUS CUDA Kernels / FlashAttention / Model Quantization / AI Systems
RESEARCH STACK
01 CUDA Kernels 02 FlashAttention 03 Model Quantization 04 AI Systems
ABOUT MY RESEARCH

让大模型运行得更快,也更高效

我是 邓予涵,目前在上海大学攻读硕士学位,师从赵凯副教授

我的研究方向是LLM高效推理,主要关注CUDA算子加速、FlashAttention和模型量化。

我对高性能人工智能系统充满兴趣,希望通过软硬件协同优化,让大规模模型运行得更快、占用更少的显存。

如果你也在关注高性能人工智能系统,欢迎通过 GitHub 或邮件 18870788548@shu.edu.cn 与我交流。

SELECTED WORK

精选成果

近期代表性的研究与工程成果。

查看全部项目

最新文章