ZBX Blog

热爱生活,健康工作

vLLM-Ascend 原理

vLLM 昇腾 NPU 硬件插件:从 PagedAttention 到插件机制

vLLM-Ascend 是什么 vLLM-Ascend 是 vLLM 社区与华为昇腾团队联合维护的开源硬件插件,作用是把 vLLM 这套原生面向 CUDA 的推理引擎接到昇腾 NPU 上。它不 fork vLLM,也不改 vLLM 一行源码,只通过插件接口注入昇腾实现。用户侧装两个包即可运行: pip install vllm vllm-ascend 启动时 vLLM 扫描插件入口,...

MoE 原理介绍

Mixture of Experts 稀疏门控专家混合模型

MoE(Mixture of Experts) MoE 是一种稀疏激活的模型架构:把 Transformer 中的 FFN 层替换为多个并行的”专家”(Expert)网络,每个 token 只由一个门控网络(Router/Gate)选出 Top-K 个专家来处理。它实现了参数量与计算量的解耦——模型总参数可以做得非常大(如 DeepSeek-V3 671B),但每个 token 实际参与计...

MPI 并行编程学习

从 Hello World 到集合通信,兼谈与 HCCL 的对应

最近系统过了一遍 MPI,教材用的是 mpitutorial(mpitutorial.com 的源码仓库,有官方中文翻译)。这篇把学到的东西整理成一份可运行、可速查的笔记:先建立 SPMD 心智模型,过一遍点对点通信、死锁与动态接收,再逐个拆解集合通信,最后用一个完整的并行应用串起来,并和昇腾的 HCCL 做了对照。 一、教材与环境 mpitutorial 仓库由两部分组成:Jekyll...

大模型相关知识03

大模型相关知识03

HF模型权重拆解 模型配置文件 config.json: 存储模型架构的元数据,包括网络层数、隐藏层维度、注意力头数、词表大小、激活函数类型等参数。 模型权重文件:torch和hf权重文件 Pytorch格式pytorch_model.pth:用于保存模型权重参数的二进制文件,以字典形式保存,键为层的名称,值为对应的权重张量数据。 SafeT...

大模型推理框架01

大模型推理框架01

环境安装 # 编译器安装 sudo apt install gcc sudo apt install g++ # 第三方数学库Armadillo, 下载地址如下:https://arma.sourceforge.net/download.html sudo apt updatesudo apt install libopenblas-dev liblapack-dev libarpa...

vLLM source code study

vLLM source code study

PagedAttention 1. 核心类 PagedAttention class PagedAttention(nn.Module): def __init__(self, num_heads, head_size, scale, num_kv_heads=None, sliding_window=None): super().__init__() ...

vLLM paper study

vLLM paper study

vLLm解决什么问题? 1. 显存碎片化与低效的 KV Cache 管理的问题 传统 LLM 推理框架(如 HuggingFace Transformers)需要为每个请求预分配 连续的显存空间 来存储 Key-Value(KV)缓存,导致显存浪费和无法共享KV Cache。 QKV是什么? Query (Q):表示当前 token 的“询问”向量,用于与所有 token 的 ...

FlashAttention paper

FlashAttention paper

FlashAttention 传统Attention实现 FlashAttention实现 FlashAttention 如何分块计算 FlashAttention 的目标是:不生成完整的 N×N 矩阵,同时计算结果完全一致。 在FlashAttention中,分块操作是针对序列长度(N)进行的,而不是直接将整个N×N矩阵切成小块。具体来说: 输入矩阵的维度: ...

vLLM Production Stack

vLLM Production Stack 研究

vLLM 生产栈 的可观测性 Kube-Prometheus-Stack 和 Prometheus Adapter 部署说明 kube-prometheus-stack: 包含 Prometheus、Grafana 和 Alertmanager 提供 Kubernetes 集群的全面监控 包含预定义的仪表盘和告警规则 prometheus-adapter: 将...

大模型的评估方法

大模型的评估方法

huggingface开放 LLM 排行榜 Qwen/QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 Benchmark MMLU(Massive Multitask Language Understanding)(https://huggingface.co/datasets/cais/mmlu)...