AI Infra 实习
主攻大模型推理工程,搭建 vLLM/KsanaLLM 对比环境,完成 Qwen2.5-7B 全流程推理与性能优化,通过调度与缓存革新实现跨机通讯量降低 98.3%。
98.3%跨机通讯量降低QWEN 2.5完整推理链路vLLM运行时剖析
不追逐噪声,记录能复现的工程信号。
01专注于AI算法与AI基础设施领域的工程实践与技术分享。
02在深度学习、模型推理优化、GPU算力调度等方向有丰富的实战经验,热衷于将复杂的技术原理拆解为可落地的工程方案。
03相信技术的价值在于传递,希望通过这个博客记录成长、分享经验,与更多技术同路人交流进步。
保留原始经历和指标,同时把背景、工作和结果拆开呈现。
主攻大模型推理工程,搭建 vLLM/KsanaLLM 对比环境,完成 Qwen2.5-7B 全流程推理与性能优化,通过调度与缓存革新实现跨机通讯量降低 98.3%。
构建异构多模态乳腺肿瘤诊断框架,实现 AUC-ROC 0.92,指标提升 8%/6%,成果投稿二区 SCI。Kaggle 竞赛优化 YOLOv10 轻量检测头,结合稀疏采样与 TTA/WBF 策略,推理耗时缩短 95%、定位稳定性提升 30%,跻身前 9%。
性能数字必须带环境、版本、负载与测量方法。
从指标变化追到系统原因,不停留在表象曲线。
明确结论适用范围,也明确尚未验证的部分。
可以在知乎查看持续更新,也可以通过 GitHub、微信、小红书或邮箱联系。