AI基础设施文章
围绕GPU资源管理、GPU算力调度、大模型训练、大模型推理、模型服务和AI工作负载,整理适合继续阅读的文章。
-
千问大模型本地部署:从环境配置到推理服务上线流程
不预设模型版本、硬件或命令,也能先把本地部署拆成环境、模型、服务和验证四个可复核阶段,减少上线时的返工与回滚风险。
-
大模型本地部署费用:硬件、软件、运维与合规的TCO模型
预算评审时,最容易漏掉的不是某一项硬件,而是模型规模、并发、保留周期、人员投入和合规证据没有写成共同假设。用一张变量表把成本拆开,才能比较不同本地部署路线。
-
算力运维解决方案:AI驱动的算力集群自动化运维实践
算力任务排队、资源不可见、日志分散和故障处置越过权限边界时,单纯增加监控并不能让运维自动化。需要先定义对象链和责任层级,再让AI参与摘要、建议和受控动作,并用POC证明每一步可观察、可审批、可回退。
-
企业算力底座建设:单集群到跨地域算力互联的4阶段路线
算力底座扩大后,真正难的是把资源、集群、网络、存储、身份、调度和恢复边界一起治理。先把单集群做成可观察、可隔离、可恢复的基本单元,再逐步引入多集群和跨地域协作,能减少过早设计复杂互联带来的返工。
-
算力运营调度平台:从资源管理到Token计费的全链路方案
算力平台从资源池走向运营,最容易混淆的是用量、Token、成本、价格和结算。把七类对象按责任边界拆开,再用同一条证据链逐级验证,才能知道平台能观测什么、企业还要补哪些运营与财务流程。
-
AI平台与异构算力调度平台核心能力:资源、任务与模型服务评估
企业选AI平台时,先要确认买的是模型与应用工作台、算力资源管理,还是队列与任务调度能力。把三者放进资源、任务、模型服务和平台承载四层,再按真实工作负载做POC,才能避免把设备插件名词当成完整产品或兼容承诺。
-
大模型算力平台怎么选?GPU集群、模型服务、成本三维评估
GPU集群能运行不代表平台适合生产。先按资源承载、模型服务和成本用量建立主评估轴,再检查队列、权限和观测,才能把POC结果转成采购判断。
-
信创ARM架构大模型部署:鲲鹏、昇腾与国产算力适配实践
信创ARM架构做大模型部署,真正要解决的是架构兼容、推理框架和性能验证。本文说明鲲鹏、昇腾和国产算力的适配思路。
-
LLM是什么意思?大语言模型原理与应用
LLM不是一个单纯的缩写,而是一类能理解上下文并生成内容的语言模型。本文用原理、场景和边界讲清楚它是什么。
-
LLM训练过程全解析:数据准备、预训练、微调、对齐
训练 LLM 不是一键完成,而是先准备数据,再分阶段训练和对齐。本文把流程拆开讲清楚。
-
私有化部署大模型要花多少钱?成本、硬件与预算口径
私有化部署大模型的成本,真正要算的是一次性投入和持续运营成本。本文拆解算力、团队、软件和调优四部分预算口径。
-
大模型本地部署硬件配置清单和要求有哪些?
大模型本地部署最容易卡在硬件配置。本文把CPU、GPU、内存、存储和网络拆成清单,帮助企业判断该配什么。
-
私有化部署企业内部大模型3步走:选型、部署、调优
企业内部大模型私有化部署,真正要过的是选型、部署和调优三关。本文把这三步拆开,说明每一步该看什么。
-
大模型在审计场景中的应用有哪些?
审计场景里的大模型,真正价值不在替代审计员,而在于把资料整理、规则问答和异常线索发现做得更快。本文讲清楚它能做什么、不能做什么。
-
大模型AI网关是什么?统一模型接入、成本管控与安全治理
大模型AI网关的价值,不在于“能接模型”,而在于把接入、成本和安全统一治理起来。本文说明它在企业里的作用。
-
大模型K8s部署框架对比:vLLM、KAITO、Triton怎么选
大模型上K8s,不同框架解决的问题不一样。本文把vLLM、KAITO和Triton拆开,看它们分别适合做什么。
-
大模型应用开发5步走:从原型到生产级应用
大模型应用开发从原型到生产,至少要过需求、设计、评测、部署和运营五关。本文把这五步拆开讲清楚。
-
LLM大模型是什么意思?从原理到落地的完整指南
把 LLM 的原理、能力和落地路径连起来看,才知道它为什么会成为企业AI底座。本文给出完整指南。
-
LLM推理引擎有哪些类型?LLM服务框架、GPU优化、端侧轻量分类盘点
推理引擎要按服务框架、GPU优化、端侧轻量和平台编排来理解,才不会把不同能力混在一起。本文做一版分类盘点。
-
大语言模型LLM入门:架构、训练、部署全解析
先把架构、训练、部署三件事分清,才能谈 LLM 怎么落地。本文给企业一个入门视角。