分类: 技术专题

关于技术类文章的分类。

78 篇文章

Kubernetes 资源分配指南:如何科学设置 CPU 与 Memory 的 Request & Limit
前言 在 Kubernetes (K8s) 集群中,服务 YAML 文件里的 resources 配置块往往是被开发者误解最深的区域。面对 requests 和 limits,许多人的做法是“凭感觉填”或者“抄隔壁项目的配置”。 但实际上,这短短几行 YAML 决定了你的微服务在面对突发流量时是安然度过、被无情限流(Throttling),还是直接…
第五章:分布式训练篇
知识回顾:大模型训练的显存与计算博弈 在正式探讨分布式训练之前,我们需要深刻理解大模型训练究竟遇到了怎样的工程阻力。在大语言模型时代,训练的核心难点已经演变成了一场对抗物理硬件极限的战役。 大模型训练背景介绍:两大效率瓶颈 计算效率挑战:大语言模型(如 LLaMA、Qwen 等)的训练高度依赖于海量的高质量训练数据(通常以万亿 Tokens 计)。…
第四章:低精度训练篇
前言 在掌握了基础的 HuggingFace API 和模型调用后,真正动手训练大模型时,你最先撞上的往往不是算法复杂度的墙,而是物理硬件的墙。下面我将为你详细拆解大模型训练的难点、计算与显存效率的底层逻辑,以及如何通过低精度技术和 HuggingFace 的下载加载机制来跨越这些障碍。 大模型训练的难点是什么?计算效率与显存效率 显存效率 (Me…
第二章:实战演练篇
前言 基于第一章:计入入门篇的学习,相信大家已经对HuggingFace训练模型基本流程已经了解了,下面我们基于几个场景来实战演练下~ 基于Transformers的NLP解决方案 在 Hugging Face 生态中,构建一个工业级的 NLP 解决方案绝非仅仅是“加载模型然后预测”这么简单。它是一套极其严密的工程流水线。下面详细列出标准的落地步骤…
第一章:基础入门篇
前言 在自学了《动手学深度学习》之后想要找一个成熟的框架来进行模型训练实操,利用Pytorch手动引用训练经典模型那样太慢,我们还是要学会站在巨人的肩膀上,最终找到了HuggingFace,但是网上的教程都很零散,没有成体系的教程,自己在学习过程中遇到了很多坑,慢慢的爬到山顶,自己清晰了整个脉络,于是把走过的路总结下,也算给后人留一个地图吧。 本教…
第三章:高效微调篇
前言 在第二章:实战演练篇,我们已经接触了各种各样的实战例子,在训练过程中或许大家因为设备性能、使用GPU卡的问题从而想要得到结果变得非常漫长,本篇就来给大家介绍下如何使用参数高效微调加快模型训练速度。 参数高效微调简介 什么是参数高效微调 在传统的深度学习中,针对下游任务进行微调通常采用全量微调 (Full Fine-Tuning),即更新模型网…
Argo自动化流水线方案
仓促编写,新鲜出炉,如有错误,欢迎大家指正~ 目标 早干完,早回家!不熬夜! 痛点 服务众多,上线发布巨慢无比 目前有五十个微服务,需要把这些全部上线才能构建完整系统。CPD项目引入serverless,完全实现后服务数量会成指数级增长。上线时一个个发布巨慢无比。 配置众多,不好管理 基于以上服务,每个至少有三个配置文件,就是总共约150个配置文件…
k8sgpt AI自动化运维部署使用文档
先看本地和operator的效果! 原理也可简单,就是通过k8sGPT把集群状态信息发送给大模型,由大模型进行诊断并给出具体操作由k8sGPT去执行。 前言 深夜被告警邮件叫醒,对着满屏飘红的 CrashLoopBackOff 和 ImagePullBackOff 发呆?又或者在成百上千行的 Kubernetes 事件日志里大海捞针,试图寻找那个导…