AI Skills AI技能 3h ago Updated 1h ago 更新于 1小时前 49

What really happens when you click 'Send' on ChatGPT 点击 ChatGPT 的「发送」后到底发生了什么

LLM inference is fundamentally constrained by GPU memory (VRAM), not raw compute — model weights, KV cache, and runtime buffers all compete for limited VRAM Every request runs in two distinct phases with different hardware characteristics: prefill (compute-bound, processes all prompt tokens in parallel) and decode (memory-bandwidth-bound, generates one token at a time) Batching multiple requests improves GPU utilization, but the KV cache — which stores intermediate attention states — grows dynam LLM推理分为预填充(计算密集型)和解码(内存带宽密集型)两个截然不同的阶段,理解这一差异是优化AI基础设施的核心 GPU显存(VRAM)是LLM服务的核心瓶颈,模型权重与动态KV缓存共同消耗显存,直接限制并发用户数和序列长度 批处理(batching)和连续批处理可提升GPU利用率,但因请求成本差异大,需要LLM感知的智能路由而非传统负载均衡 从单GPU到千卡集群,完整栈包含API网关、负载均衡器、模型服务器、推理引擎、GPU调度器和Kubernetes集群

65
Hot 热度
78
Quality 质量
70
Impact 影响力

Analysis 深度分析

TL;DR

  • LLM推理分为预填充(计算密集型)和解码(内存带宽密集型)两个截然不同的阶段,理解这一差异是优化AI基础设施的核心
  • GPU显存(VRAM)是LLM服务的核心瓶颈,模型权重与动态KV缓存共同消耗显存,直接限制并发用户数和序列长度
  • 批处理(batching)和连续批处理可提升GPU利用率,但因请求成本差异大,需要LLM感知的智能路由而非传统负载均衡
  • 从单GPU到千卡集群,完整栈包含API网关、负载均衡器、模型服务器、推理引擎、GPU调度器和Kubernetes集群

为什么值得看

本文系统性地拆解了LLM推理基础设施的完整技术栈,从单个GPU的内存约束讲到Kubernetes集群调度,为AI工程师和架构师提供了从底层硬件到上层服务的端到端认知框架。理解预填充/解码阶段差异、KV缓存机制和批处理原理,是设计和优化生产级LLM服务的基础。

技术解析

  • 预填充与解码的硬件行为差异:预填充阶段并行处理所有prompt token,计算密集,可饱和GPU算术单元;解码阶段逐token生成,依赖之前所有token的KV缓存,内存带宽成为瓶颈。这一差异决定了延迟指标(TTFT由预填充驱动,TPOT/ITL由解码驱动)和优化方向。
  • KV缓存的内存消耗机制:Transformer注意力机制中,每个token的keys和values需在生成过程中重复使用,因此存储在KV缓存中避免重复计算。KV缓存是动态资源,随并发用户数和序列长度增长,通常比静态模型权重更消耗VRAM,是限制吞吐的关键因素。
  • vLLM推理引擎的核心优化:vLLM通过PagedAttention(将KV缓存分页管理,类似操作系统虚拟内存)、连续批处理(动态调度请求进出batch)、前缀缓存(共享相同prompt前缀的请求复用KV缓存)和量化等技术,显著提升GPU利用率和吞吐。
  • 四大资源维度:评估LLM推理基础设施需同时考量计算能力(算术吞吐量)、内存容量(VRAM大小)、内存带宽(HBM数据速率)和网络带宽(多GPU/多机通信)。单GPU场景前三者关键,分布式场景网络带宽成为新瓶颈。
  • 模型大小与显存估算:模型权重显存 ≈ 参数量 × 每参数字节数。例如70B参数模型在FP16下约需140GB显存,超出单卡容量时需模型分片(sharding),而流量高时需实例复制(replication),二者解决不同问题。

行业启示

  • 内存带宽正取代计算成为新瓶颈:随着模型规模增长和解码阶段内存带宽受限特性凸显,硬件设计需更重视HBM带宽和容量,而非单纯提升算力,这将推动推理专用芯片和内存优化技术的竞争。
  • 预填充/解码分离架构(Disaggregated Prefill/Decode)是规模化方向:由于两阶段硬件需求截然不同(计算 vs 带宽),将二者部署在不同机器上可分别优化,提升整体资源利用率和经济性。
  • LLM感知的基础设施工具链将成为核心竞争力:传统负载均衡和调度策略无法应对LLM请求的异构成本,需要专门的路由、缓存、批处理调度系统,这为vLLM、TGI等推理引擎和上层编排平台创造了差异化机会。

Disclaimer: The above content is generated by AI and is for reference only. 免责声明:以上内容由 AI 生成,仅供参考。

LLM 大模型 Inference 推理 GPU GPU Deployment 部署 Training 训练