ZBX Blog

热爱生活,健康工作

MoE 原理介绍

Mixture of Experts 稀疏门控专家混合模型

MoE(Mixture of Experts) MoE 是一种稀疏激活的模型架构:把 Transformer 中的 FFN 层替换为多个并行的”专家”(Expert)网络,每个 token 只由一个门控网络(Router/Gate)选出 Top-K 个专家来处理。它实现了参数量与计算量的解耦——模型总参数可以做得非常大(如 DeepSeek-V3 671B),但每个 token 实际参与计...

MPI 并行编程学习

从 Hello World 到集合通信,兼谈与 HCCL 的对应

最近系统过了一遍 MPI,教材用的是 mpitutorial(mpitutorial.com 的源码仓库,有官方中文翻译)。这篇把学到的东西整理成一份可运行、可速查的笔记:先建立 SPMD 心智模型,过一遍点对点通信、死锁与动态接收,再逐个拆解集合通信,最后用一个完整的并行应用串起来,并和昇腾的 HCCL 做了对照。 一、教材与环境 mpitutorial 仓库由两部分组成:Jekyll...

大模型相关知识03

大模型相关知识03

HF模型权重拆解 模型配置文件 config.json: 存储模型架构的元数据,包括网络层数、隐藏层维度、注意力头数、词表大小、激活函数类型等参数。 模型权重文件:torch和hf权重文件 Pytorch格式pytorch_model.pth:用于保存模型权重参数的二进制文件,以字典形式保存,键为层的名称,值为对应的权重张量数据。 SafeT...

vLLM source code study

vLLM source code study

PagedAttention 1. 核心类 PagedAttention class PagedAttention(nn.Module): def __init__(self, num_heads, head_size, scale, num_kv_heads=None, sliding_window=None): super().__init__() ...

vLLM paper study

vLLM paper study

vLLm解决什么问题? 1. 显存碎片化与低效的 KV Cache 管理的问题 传统 LLM 推理框架(如 HuggingFace Transformers)需要为每个请求预分配 连续的显存空间 来存储 Key-Value(KV)缓存,导致显存浪费和无法共享KV Cache。 QKV是什么? Query (Q):表示当前 token 的“询问”向量,用于与所有 token 的 ...

FlashAttention paper

FlashAttention paper

FlashAttention 传统Attention实现 FlashAttention实现 FlashAttention 如何分块计算 FlashAttention 的目标是:不生成完整的 N×N 矩阵,同时计算结果完全一致。 在FlashAttention中,分块操作是针对序列长度(N)进行的,而不是直接将整个N×N矩阵切成小块。具体来说: 输入矩阵的维度: ...

vLLM Production Stack

vLLM Production Stack 研究

vLLM 生产栈 的可观测性 Kube-Prometheus-Stack 和 Prometheus Adapter 部署说明 kube-prometheus-stack: 包含 Prometheus、Grafana 和 Alertmanager 提供 Kubernetes 集群的全面监控 包含预定义的仪表盘和告警规则 prometheus-adapter: 将...

大模型的评估方法

大模型的评估方法

huggingface开放 LLM 排行榜 Qwen/QwQ-32B-Preview DeepSeek-R1-Distill-Qwen-32B DeepSeek-R1 Benchmark MMLU(Massive Multitask Language Understanding)(https://huggingface.co/datasets/cais/mmlu)...

Dify调研

Dify调研

简要说明 Dify 是一款开源的大语言模型(LLM) 应用开发平台。它融合了后端即服务(Backend as Service)和 LLMOps 的理念,使开发者可以快速搭建生产级的生成式 AI 应用。即使你是非技术人员,也能参与到 AI 应用的定义和数据运营过程中。 Docker Compose 部署 进入 Dify 源代码的 Docker 目录 cd dif...

LLM微调

LLM微调

什么是微调Fine-tuning? 微调是指在预训练模型的基础上,使用特定任务(如文本分类、摘要生成)或领域(如法律、医学)的数据集对模型进行一步训练的过程。预训练模型通常在大规模、通用语料库上训练,学习了丰富的语言模型和知识。 微调的方法分类 (1) 全参数微调(Full Fine-tuning) 更新模型所有参数。 (2) 参数高效微调(Parameter-Efficient ...