AI基础设施文章
围绕GPU资源管理、GPU算力调度、大模型训练、大模型推理、模型服务和AI工作负载,整理适合继续阅读的文章。
-
AI推理平台怎么选?5个核心能力维度
围绕AI推理平台怎么选梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
AI模型管理平台:模型仓库、版本控制与生命周期管理
围绕AI模型管理平台梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
AI模型仓库:模型存储、版本控制与权限管理
围绕AI模型仓库梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
AI模型服务监控指南:核心指标、告警与运维实践
围绕AI模型服务监控梳理生产化建设和选型评估要点,帮助团队把模型能力纳入可治理、可观测、可复盘的AI基础设施。
-
企业大模型部署全流程:硬件选型、框架选择、上线运维
以企业落地视角梳理大模型部署全流程,从需求、硬件、框架到上线运维和持续治理。
-
RAG应用开发:知识库与LLM检索增强
RAG应用开发的成败取决于知识库质量、权限边界和检索评估。文章用闭环视角拆解从文档治理到答案引用的关键环节,适合企业知识问答试点。
-
智能体LLM应用:从Copilot到自主Agent
智能体LLM应用不是越自主越好。文章按建议、执行、反馈和改写状态拆解从Copilot到自主Agent的边界,帮助企业谨慎规划权限和应用形态。
-
云原生机器学习平台:AML与K8s集成实践
云原生机器学习平台不能只做上层工作台,也不能只给算法团队一个K8s集群。文章拆解AML对象与K8s资源的映射关系,帮助团队打通训练到推理闭环。
-
国产GPU适配:昇腾、海光、寒武纪统一纳管方案
国产GPU适配不能停留在设备识别层面。文章用证据地图拆解硬件、驱动、运行时、框架、调度、观测和业务验收,帮助团队谨慎规划统一纳管范围。
-
机器学习工作流自动化:从开发到部署的完整闭环
机器学习工作流自动化的重点不是工具堆叠,而是让每次模型变化都能追踪来源、质量、发布状态和运行反馈。文章给出从开发到部署的闭环设计。
-
MaaS vs PaaS:模型服务与平台服务的边界在哪
MaaS vs PaaS不是替代关系。PaaS强调应用运行、交付和平台能力,MaaS强调模型目录、推理调用、用量计量和AI应用治理。企业需要看清两者的边界和组合方式。
-
MaaS平台有哪些核心功能?模型目录、统一API与用量分析解读
MaaS平台核心功能至少要覆盖模型目录、统一API、权限控制、推理托管、用量分析和运营审计。功能列表不是目的,关键是让模型能力能被安全复用、稳定调用和持续优化。
-
KV Cache是什么意思?大模型推理加速的核心技术
KV Cache是在大模型生成过程中复用历史注意力计算结果的缓存机制。它能降低重复计算,但会持续占用显存,因此企业推理平台要同时治理速度、并发、上下文长度和显存水位。
-
PagedAttention是什么?vLLM推理加速的技术原理
PagedAttention通过分页方式管理KV Cache,让大模型推理更高效地利用显存。它的价值不只是单次请求更快,而是在多请求、长上下文和动态批处理场景下降低缓存碎片和调度压力。
-
大模型推理两阶段:Prefill与Decode的区别与优化
大模型推理通常可拆成Prefill和Decode两个阶段。Prefill更像读入上下文,Decode负责逐Token生成。两阶段的瓶颈不同,优化手段也不同,不能只用平均响应时间判断。
-
MaaS厂商有哪些?主流平台能力维度与适用场景
MaaS厂商盘点不能写成无依据排名。企业更应该按模型供给、平台托管、私有化交付、生态集成和服务支持来比较主流平台,判断哪类供应商适合自己的数据、合规和运维边界。
-
AI网关是什么意思?大模型流量的统一治理枢纽
AI 网关不是普通 API 代理。它要把模型调用、身份权限、Token 用量、限流降级和审计观测收拢到一个可治理的入口。
-
AI网关技术盘点:统一API、Token限流与语义缓存
AI网关的关键技术不只是一层反向代理。统一API解决模型接入差异,Token限流控制成本和稳定性,语义缓存减少重复请求,审计和路由策略则让大模型应用进入可运营状态。
-
模型即服务(MaaS)是什么?企业AI应用的模型服务入口
模型即服务(MaaS)不是模型 API 的同义词。它要把调用入口、权限、用量和责任边界一起管起来,才能真的成为企业公共 AI 服务入口。
-
模型即服务模式的三种服务:API调用、平台托管与全栈交付
模型即服务模式常见有API调用、平台托管和全栈交付三类。三者不是价格档位差异,而是责任边界、数据控制、算力管理和运维深度不同,适合不同规模和合规要求的企业。