AI基础设施文章
围绕GPU资源管理、GPU算力调度、大模型训练、大模型推理、模型服务和AI工作负载,整理适合继续阅读的文章。
-
推理引擎有哪些类型盘点:LLM推理框架分类与选型
盘点推理引擎有哪些类型,从LLM服务框架、传统模型运行时、端侧轻量框架和编译优化工具划分边界,说明vLLM、TGI、TensorRT-LLM、ONNX Runtime、Ollama、llama.cpp等方向的适用场景、限制条件、生产化缺口与分类选型方法。
-
大模型推理加速有哪些方法?
梳理大模型推理加速方法,覆盖模型压缩、量化、KV Cache、连续批处理、预测解码、编译优化和部署治理,说明各类方法的适用边界、验证重点、潜在副作用和组合方式,帮助团队从瓶颈定位进入持续优化,并按不同应用场景选择合适的加速路径和回退策略设计。
-
大模型推理引擎对比:vLLM、TensorRT-LLM、TGI怎么选
从大模型推理引擎对比角度拆解vLLM、TensorRT-LLM、TGI的能力侧重、集成难度、优化空间、生命周期成本和适用边界,帮助团队围绕业务画像、硬件条件、平台治理和POC证据设计可落地的选型方案,并在报告中保留不确定性、失败路径和复盘依据。
-
大模型部署工具对比:Ollama vs vLLM vs llama.cpp
中性对比Ollama、vLLM与llama.cpp的部署边界,避免把本地工具、服务框架和轻量运行时混为一谈。
-
LLM网关:模型路由、Token限流与安全治理
从治理视角讲清LLM网关如何管理模型路由、Token限流和安全策略,适合多应用共享模型服务。
-
LLM推理加速方法对比:量化、预测解码与Continuous Batching
对比量化、预测解码与Continuous Batching的适用边界,帮助判断LLM推理加速方法的选择顺序。
-
大模型推理加速优化方案:从模型压缩到推理引擎
从模型、引擎、服务、网关和观测五层梳理大模型推理加速优化方案,适合企业做端到端治理。
-
LLM推理框架选型:vLLM、TensorRT-LLM、TGI深度对比
推理框架不是越快越好,而是要和模型、GPU、业务并发一起匹配。本文对比 vLLM、TensorRT-LLM 和 TGI 的选型边界。
-
大模型推理服务中常用的监控指标:TTFT、TPOT、RPM、Token吞吐
围绕大模型推理服务监控指标梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
LLM推理优化技术:KV Cache、量化、预测解码
系统梳理LLM推理优化技术,解释KV Cache、量化、连续批处理、预测解码和调度策略的作用边界,并说明如何建立基线、逐项验证、观察副作用、保留回退路径,让优化动作真正进入可复现的工程闭环、质量评估和生产治理,避免把单点技巧误认为整体加速。
-
LLM推理原理:自回归生成与KV Cache机制
用工程视角解释LLM推理原理,说明自回归生成、预填充、解码阶段和KV Cache机制如何共同影响首token延迟、生成速度、吞吐、显存占用、长上下文能力和并发服务稳定性,并进一步连接Prompt设计、检索裁剪和平台调度,帮助读者理解推理优化的底层约束。
-
LLM部署本地大模型:从环境配置到推理服务上线
按环境配置、模型准备、运行时选择、API服务、观测和上线检查梳理LLM本地大模型部署路径。
-
大模型仓库:LLM模型存储、版本管理与分发
围绕大模型仓库梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
大模型服务平台选型指南:企业级AI应用落地7个关键决策点
围绕大模型服务平台选型梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
模型资产管理系统:模型发现、版本追踪与治理
围绕模型资产管理系统梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
模型推理框架有哪些?主流推理框架功能对比
回答模型推理框架有哪些,按LLM服务框架、通用运行时、端侧框架和编译优化方向梳理主流选择,比较vLLM、TGI、TensorRT-LLM、ONNX Runtime、TensorRT、Ollama、llama.cpp的功能差异、适用范围、生产化缺口和平台补齐方式。
-
AI网关核心技术:模型路由、Token监测、安全治理
拆解AI网关核心技术栈,解释模型路由、Token监测、安全治理和观测如何形成闭环。
-
AI推理引擎核心能力:吞吐、延迟、显存、成本四维评估
围绕AI推理引擎核心能力,建立吞吐、延迟、显存和成本四维评估框架,说明四类指标之间的取舍关系、证据来源、验收口径和业务优先级,帮助企业用真实业务流量、尾部体验、GPU指标和运维数据完成推理引擎选型判断,而不是只依赖单次压测结果和平均值结论。
-
企业AI推理框架验证:vLLM、TGI、TensorRT-LLM怎么测
从企业验证视角比较vLLM、TGI与TensorRT-LLM,梳理环境、指标、样本和上线条件。
-
AI推理框架选型:vLLM vs TGI vs TensorRT-LLM
聚焦AI推理框架选型,比较vLLM、TGI、TensorRT-LLM在开放模型服务、生态集成、深度优化、团队投入和平台治理上的边界条件,帮助企业从业务场景、硬件约束、上线阶段、维护成本和POC证据出发做中立决策,并保留后续复盘、替换和组合使用空间。